2026 年,几乎每个 AI 应用都要吃 PDF:产品手册进知识库、论文做 RAG、合同合规检索、Flutter/iOS 文档自动摘要。但 pdftotext 抽出来的往往是乱序碎片——双栏变单栏、表格变乱码、公式变「□□□」。
Docling、MinerU、LlamaParse、Marker 是当前开发者社区讨论最多的四家 PDF Parser。它们不是简单的「PDF 转 TXT」,而是带版面分析、表格结构化、OCR、Markdown 导出的完整管线,直接决定 RAG chunk 质量上限。
这篇按真实 RAG 工程体验给出 2026 年排名与选型矩阵,并附上在 Apple Silicon / Cloud Mac 上的部署要点。
一、问题背景:为什么 PDF 解析决定 RAG 上限
向量检索再强,也救不了喂进去的垃圾 chunk。常见翻车场景:
- 双栏论文:左栏末句和右栏首句被拼成一段,语义完全断裂
- 嵌套表格:财务报表现在变成「2024 营收 增长 15% 亚太 32%」一串词
- 扫描件合同:没有 OCR 层,检索结果为空
- 图表注释:图注与正文分离,Agent 引用时张冠李戴
2026 年的 PDF Parser 竞争焦点已从「能不能抽字」转向结构化输出质量:Markdown 是否保留标题层级、表格能否还原为 HTML/CSV、公式能否输出 LaTeX、多栏阅读顺序是否正确。
选型前先问三个问题
- 文档主要是英文技术手册还是中文论文/研报?
- 数据能否出域(决定本地 vs LlamaParse 云端)?
- 日处理量是几十页原型还是万页批处理?
二、核心概念:评估维度与管线架构
五个评估维度
- 版面还原(Layout):多栏、页眉页脚、浮动图注的阅读顺序
- 表格结构化(Tables):复杂合并单元格、跨页表格
- 公式与图表(STEM):LaTeX/MathML 输出、图注关联
- OCR 能力:扫描件、拍照 PDF、低质量影印
- 工程集成:CLI、Python SDK、Docker、与 LangChain/LlamaIndex 对接成本
典型解析管线
四家工具虽实现不同,但逻辑上大多遵循:
PDF 输入 → 版面检测 → 区域分类(正文/表/图/公式)
→ 逐区域 OCR / 文本抽取 → 阅读顺序排序
→ 结构化组装 → Markdown / JSON / HTML 输出
差异在于:Docling 偏企业多格式统一;MinerU 偏学术中文+公式;Marker 偏英文长文高速转 MD;LlamaParse 偏托管 API + LlamaIndex 一键接入。
三、2026 总排名
| 排名 | 工具 | 类型 | 最适合 |
|---|---|---|---|
| #1 | Docling | 开源 · IBM | 企业文档、多格式、结构化 JSON、合规本地部署 |
| #2 | MinerU | 开源 · OpenDataLab | 中文论文、公式密集、扫描件 OCR |
| #3 | Marker | 开源 | 英文书籍/长文批量转 Markdown |
| #4 | LlamaParse | 云端 API · LlamaIndex | 快速原型、复杂版式、免运维 |
排名逻辑:不只看单次 benchmark 分数,而是「明天开工建 RAG,哪套最省心、最可控、最省钱」。LlamaParse 解析质量常能排进前三,但闭源按页计费、数据出域,故综合排第四——适合特定场景,而非默认首选。
四、#1 Docling — 企业级开源首选
Docling 由 IBM Research 开源,2025–2026 年迅速成为 RAG 社区默认选项之一。核心优势:
- 多格式统一:PDF、DOCX、PPTX、HTML、图片同一套 API
- 结构化导出:Markdown、JSON(含 bbox、标签、表格结构)
- 表格与阅读顺序:TableFormer 模型,复杂表格还原优于朴素 OCR
- 集成友好:官方示例覆盖 LangChain、LlamaIndex、Haystack
- 本地/ air-gapped:适合金融、医疗等数据不出域场景
短板:中文排版与数学公式的极致表现不如 MinerU;首次运行需下载模型权重(约数 GB)。
适用人群
iOS/Flutter 团队把英文技术文档、API Reference、设计规范灌进内部知识库;需要 JSON 结构化输出做细粒度 chunk 的工程师。
五、#2 MinerU — 中文论文与公式王者
MinerU(原 Magic-PDF)来自 OpenDataLab / 上海 AI Lab 生态,在中文学术场景口碑极佳:
- 公式识别:输出 LaTeX,RAG 问答「式 (3) 含义」时不易丢信息
- 双栏/混排:中文期刊、学位论文阅读顺序准确率高
- 完整 OCR 管线:扫描 PDF、影印件可直接处理
- 图表提取:图片与 caption 分离存储,便于多模态 RAG
短板:依赖 PyTorch,GPU 加速体验明显好于纯 CPU;英文商业手册偶发页眉干扰;模型体积与 MinerU 2.x 配置项对新手略陡。
六、#3 Marker — 英文长文批量转 MD 利器
Marker 由 Vik Paruchuri 维护,定位清晰:把 PDF 快速变成干净的 Markdown。
- 速度快:针对书籍、论文、技术报告优化,批量转换效率高
- Markdown 质量:标题层级、列表、代码块保留较好
- 可扩展:支持 LLM 后处理(可选)润色断行与 hyphenation
- 纯本地:无 API Key,适合离线环境
短板:复杂中文表格与公式不如 MinerU;超复杂版式(杂志排版)偶需人工校对;项目迭代快,大版本升级注意 lock 依赖。
七、#4 LlamaParse — 托管 API 的开箱即用
LlamaParse 是 LlamaIndex 旗下的云端 PDF 解析服务:
- 零运维:上传 PDF,返回 Markdown/JSON,与 LlamaIndex
VectorStoreIndex无缝对接 - 复杂版式:多栏、嵌套表、图表注释处理成熟
- 多模态选项:可开启图表描述,供多模态 RAG 使用
- 按页计费:适合验证想法,不必先买 GPU
短板:数据出域、持续成本、供应商锁定;大批量时单页费用显著;离线/合规场景不可用。
八、四维对比矩阵
| 维度 | Docling | MinerU | Marker | LlamaParse |
|---|---|---|---|---|
| 开源/本地 | ✅ MIT | ✅ Apache 2.0 | ✅ GPL | ❌ 云端 |
| 中文论文 | 良好 | 优秀 | 一般 | 良好 |
| 英文手册 | 优秀 | 良好 | 优秀 | 优秀 |
| 表格还原 | 优秀 | 良好 | 良好 | 优秀 |
| 公式 LaTeX | 良好 | 优秀 | 一般 | 良好 |
| 扫描件 OCR | 良好 | 优秀 | 依赖配置 | 优秀 |
| 批量成本 | 低(算力) | 低(算力) | 低(算力) | 按页累加 |
| RAG 集成 | LangChain/LlamaIndex | 社区适配器 | 自行 pipeline | 原生 LlamaIndex |
九、实操:四工具快速上手
以下命令均在 macOS / Cloud Mac 终端验证思路(Python 3.10+ 推荐)。
Docling CLI
pip install docling
docling my-manual.pdf --to md --output ./out/
Python SDK 可拿到带 bbox 的 JSON,便于按标题层级切 chunk:
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("api-spec.pdf")
print(result.document.export_to_markdown())
MinerU
pip install mineru
mineru -p thesis.pdf -o ./output
输出目录通常含 markdown、images、中间 JSON。论文场景建议开启公式与表格检测选项(见官方 README 2.x 配置)。
Marker
pip install marker-pdf
marker_single book.pdf ./output --batch_multiplier 2
批量转换:marker /path/to/pdfs /path/to/output。M 系列 Mac 可调低 --max_pages 先抽样验证版式。
LlamaParse API
pip install llama-parse
export LLAMA_CLOUD_API_KEY="llx-..."
from llama_parse import LlamaParse
parser = LlamaParse(result_type="markdown")
docs = parser.load_data("complex-report.pdf")
与 LlamaIndex 联用:解析结果直接 VectorStoreIndex.from_documents(docs),适合半天内出 Demo。
十、Cloud Mac / Apple Silicon 场景
PDF 解析是CPU/GPU 密集 + 磁盘 I/O任务,和 Xcode 编译抢本机资源时尤其尴尬。典型分工:
- 本地 MacBook:调试 pipeline、单文件验证、LlamaParse API 调用(几乎零本地算力)
- Cloud Mac mini(M4):夜间批量跑 MinerU/Marker,百页级文档入库
- 带 GPU 的 Linux 云主机:MinerU 大规模 OCR 的性价比选项(非 macOS 场景)
在 Apple Silicon 上:
- Docling / Marker:M4 CPU 即可胜任多数英文技术 PDF;建议
brew install poppler补齐依赖 - MinerU:可用 MPS 后端加速部分模型;内存建议 16GB+,超长论文分批处理
- 存储:解析输出含大量 PNG 切图,挂载云盘或节点本地 SSD,避免塞满系统盘
推荐工作流
开发者在本地 Xcode 写 App → SSH 到 Cloud Mac 跑 cron 批处理新 PDF → 结构化 Markdown 同步到向量库(Qdrant / pgvector)→ App 内 RAG 只调 API。解析与构建物理隔离,互不卡顿。
十一、成本、性能与风险
成本估算(千页级文档库)
| 方案 | 一次性/月费 | 千页量级说明 |
|---|---|---|
| Docling / Marker 本地 | $0 许可 + 电费 | M4 Cloud Mac 跑 2–4 小时可完成,节点费约数美元 |
| MinerU + GPU | $0 许可 + GPU 时租 | 公式密集时 GPU 省 50%+ 时间 |
| LlamaParse | 按页 ~$0.003–0.01 | 千页约 $3–10,量大需议价 Enterprise |
性能要点
- 瓶颈:版面检测 > OCR > 纯文本抽取;扫描件最慢
- 并行:Marker/Docling 支持多进程;按文件并行而非单文件多线程
- 缓存:解析结果落盘复用,避免重复跑同一 PDF
风险与局限
- 没有银弹:杂志级复杂排版仍需人工抽检 5–10% 页
- 版本漂移:开源模型更新后输出格式可能变,chunk 策略需回归测试
- 版权与隐私:LlamaParse 上传即出域;企业合同禁止时只能本地方案
- 幻觉前置:解析错误会导致 RAG「一本正经胡说」——务必保留页码与 bbox 溯源
FAQ
2026 年最好的 PDF Parser 是哪个?
综合开源、版式与集成,Docling 第一;中文论文选 MinerU;英文长文批量选 Marker;免运维原型选 LlamaParse。
Docling 和 MinerU 怎么选?
Docling 适合企业多格式与英文技术文档;MinerU 适合中文学术、公式与扫描件。两者都可本地部署,数据不出域。
LlamaParse 值得付费吗?
快速验证 RAG、处理复杂版式、团队无人运维 GPU 时值得。大批量或合规敏感场景改自建。
能在 Apple Silicon 上跑吗?
可以。Docling/Marker CPU 即可;MinerU 建议 M4 + 16GB 内存,或用 Cloud Mac 批处理。
RAG 里 PDF 解析失败最常见原因?
扫描件缺 OCR、多栏顺序错乱、表格变纯文本。选型看 layout + 表格结构化,不只看抽字率。
总结
2026 年 PDF Parser 的选型逻辑很清晰:要可控选开源,要速度选 Marker,要中文论文选 MinerU,要省事选 LlamaParse,要企业均衡选 Docling。 没有全能冠军,只有与文档类型、合规和工程量匹配的方案。
上手三步:
- 拿 10 页代表性 PDF 做 A/B(含表格、公式、扫描各一类)
- 检查 Markdown 标题层级与表格是否可用,再定 chunk 策略
- 批量解析放 Cloud Mac,本地专注写代码
Agent 与 RAG 工具链可参考 2026 AI 编程工具排名;视频素材管线见 Video-use AI 视频工作流。
千页 PDF 别占满你本机:用 Cloud Mac 跑解析批处理
MinerU、Marker、Docling 批量任务可丢到独享 M4 Mac mini。夜间 cron 跑完,早上向量库已更新,本地 Xcode 编译不再卡顿。
相关阅读
- 2026 最好的 AI 编程工具排名:Claude、Cursor、GitHub Copilot、Codex、Gemini
- Video-use 使用教程:从脚本到成片的完整 AI 视频工作流
- 个人 AI Agent 架构三要素
- 远程 Mac 开发必备开源终端工具
功能与定价以各项目 GitHub 与 LlamaIndex 官网为准。最后更新:2026 年 8 月 5 日。