Vuncloud 博客
← 返回机房手记专栏

最好的 PDF Parser 排行榜(2026):Docling、MinerU、LlamaParse、Marker 对比

四强排名 · 版面还原 · 表格/公式 · RAG 集成 · 本地 vs 云端 · Cloud Mac 实测约 13 分钟阅读

开发者在 Mac 笔记本上处理 PDF 文档与 AI 解析管线,Docling MinerU RAG 场景

2026 年,几乎每个 AI 应用都要吃 PDF:产品手册进知识库、论文做 RAG、合同合规检索、Flutter/iOS 文档自动摘要。但 pdftotext 抽出来的往往是乱序碎片——双栏变单栏、表格变乱码、公式变「□□□」。

Docling、MinerU、LlamaParse、Marker 是当前开发者社区讨论最多的四家 PDF Parser。它们不是简单的「PDF 转 TXT」,而是带版面分析、表格结构化、OCR、Markdown 导出的完整管线,直接决定 RAG chunk 质量上限。

这篇按真实 RAG 工程体验给出 2026 年排名与选型矩阵,并附上在 Apple Silicon / Cloud Mac 上的部署要点。

#1 Docling
综合开源与企业文档最佳
4 强
Docling · MinerU · Marker · LlamaParse
3 类部署
本地开源 · 云端 API · Cloud Mac 批处理

一、问题背景:为什么 PDF 解析决定 RAG 上限

向量检索再强,也救不了喂进去的垃圾 chunk。常见翻车场景:

  • 双栏论文:左栏末句和右栏首句被拼成一段,语义完全断裂
  • 嵌套表格:财务报表现在变成「2024 营收 增长 15% 亚太 32%」一串词
  • 扫描件合同:没有 OCR 层,检索结果为空
  • 图表注释:图注与正文分离,Agent 引用时张冠李戴

2026 年的 PDF Parser 竞争焦点已从「能不能抽字」转向结构化输出质量:Markdown 是否保留标题层级、表格能否还原为 HTML/CSV、公式能否输出 LaTeX、多栏阅读顺序是否正确。

选型前先问三个问题

  • 文档主要是英文技术手册还是中文论文/研报
  • 数据能否出域(决定本地 vs LlamaParse 云端)?
  • 日处理量是几十页原型还是万页批处理

二、核心概念:评估维度与管线架构

五个评估维度

  1. 版面还原(Layout):多栏、页眉页脚、浮动图注的阅读顺序
  2. 表格结构化(Tables):复杂合并单元格、跨页表格
  3. 公式与图表(STEM):LaTeX/MathML 输出、图注关联
  4. OCR 能力:扫描件、拍照 PDF、低质量影印
  5. 工程集成:CLI、Python SDK、Docker、与 LangChain/LlamaIndex 对接成本

典型解析管线

四家工具虽实现不同,但逻辑上大多遵循:

PDF 输入 → 版面检测 → 区域分类(正文/表/图/公式)
        → 逐区域 OCR / 文本抽取 → 阅读顺序排序
        → 结构化组装 → Markdown / JSON / HTML 输出

差异在于:Docling 偏企业多格式统一;MinerU 偏学术中文+公式;Marker 偏英文长文高速转 MD;LlamaParse 偏托管 API + LlamaIndex 一键接入

桌面上散落的纸质文档与笔记本电脑,PDF 文档解析与 RAG 知识库入库场景
PDF Parser 的输出质量直接决定 RAG chunk 能否被正确检索与引用

三、2026 总排名

排名 工具 类型 最适合
#1 Docling 开源 · IBM 企业文档、多格式、结构化 JSON、合规本地部署
#2 MinerU 开源 · OpenDataLab 中文论文、公式密集、扫描件 OCR
#3 Marker 开源 英文书籍/长文批量转 Markdown
#4 LlamaParse 云端 API · LlamaIndex 快速原型、复杂版式、免运维

排名逻辑:不只看单次 benchmark 分数,而是「明天开工建 RAG,哪套最省心、最可控、最省钱」。LlamaParse 解析质量常能排进前三,但闭源按页计费、数据出域,故综合排第四——适合特定场景,而非默认首选。

四、#1 Docling — 企业级开源首选

Docling 由 IBM Research 开源,2025–2026 年迅速成为 RAG 社区默认选项之一。核心优势:

  • 多格式统一:PDF、DOCX、PPTX、HTML、图片同一套 API
  • 结构化导出:Markdown、JSON(含 bbox、标签、表格结构)
  • 表格与阅读顺序:TableFormer 模型,复杂表格还原优于朴素 OCR
  • 集成友好:官方示例覆盖 LangChain、LlamaIndex、Haystack
  • 本地/ air-gapped:适合金融、医疗等数据不出域场景

短板:中文排版与数学公式的极致表现不如 MinerU;首次运行需下载模型权重(约数 GB)。

适用人群

iOS/Flutter 团队把英文技术文档、API Reference、设计规范灌进内部知识库;需要 JSON 结构化输出做细粒度 chunk 的工程师。

五、#2 MinerU — 中文论文与公式王者

MinerU(原 Magic-PDF)来自 OpenDataLab / 上海 AI Lab 生态,在中文学术场景口碑极佳:

  • 公式识别:输出 LaTeX,RAG 问答「式 (3) 含义」时不易丢信息
  • 双栏/混排:中文期刊、学位论文阅读顺序准确率高
  • 完整 OCR 管线:扫描 PDF、影印件可直接处理
  • 图表提取:图片与 caption 分离存储,便于多模态 RAG

短板:依赖 PyTorch,GPU 加速体验明显好于纯 CPU;英文商业手册偶发页眉干扰;模型体积与 MinerU 2.x 配置项对新手略陡。

六、#3 Marker — 英文长文批量转 MD 利器

Marker 由 Vik Paruchuri 维护,定位清晰:把 PDF 快速变成干净的 Markdown

  • 速度快:针对书籍、论文、技术报告优化,批量转换效率高
  • Markdown 质量:标题层级、列表、代码块保留较好
  • 可扩展:支持 LLM 后处理(可选)润色断行与 hyphenation
  • 纯本地:无 API Key,适合离线环境

短板:复杂中文表格与公式不如 MinerU;超复杂版式(杂志排版)偶需人工校对;项目迭代快,大版本升级注意 lock 依赖。

七、#4 LlamaParse — 托管 API 的开箱即用

LlamaParse 是 LlamaIndex 旗下的云端 PDF 解析服务:

  • 零运维:上传 PDF,返回 Markdown/JSON,与 LlamaIndex VectorStoreIndex 无缝对接
  • 复杂版式:多栏、嵌套表、图表注释处理成熟
  • 多模态选项:可开启图表描述,供多模态 RAG 使用
  • 按页计费:适合验证想法,不必先买 GPU

短板:数据出域、持续成本、供应商锁定;大批量时单页费用显著;离线/合规场景不可用。

八、四维对比矩阵

维度 Docling MinerU Marker LlamaParse
开源/本地 ✅ MIT ✅ Apache 2.0 ✅ GPL ❌ 云端
中文论文 良好 优秀 一般 良好
英文手册 优秀 良好 优秀 优秀
表格还原 优秀 良好 良好 优秀
公式 LaTeX 良好 优秀 一般 良好
扫描件 OCR 良好 优秀 依赖配置 优秀
批量成本 低(算力) 低(算力) 低(算力) 按页累加
RAG 集成 LangChain/LlamaIndex 社区适配器 自行 pipeline 原生 LlamaIndex

九、实操:四工具快速上手

以下命令均在 macOS / Cloud Mac 终端验证思路(Python 3.10+ 推荐)。

Docling CLI

pip install docling
docling my-manual.pdf --to md --output ./out/

Python SDK 可拿到带 bbox 的 JSON,便于按标题层级切 chunk:

from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("api-spec.pdf")
print(result.document.export_to_markdown())

MinerU

pip install mineru
mineru -p thesis.pdf -o ./output

输出目录通常含 markdownimages、中间 JSON。论文场景建议开启公式与表格检测选项(见官方 README 2.x 配置)。

Marker

pip install marker-pdf
marker_single book.pdf ./output --batch_multiplier 2

批量转换:marker /path/to/pdfs /path/to/output。M 系列 Mac 可调低 --max_pages 先抽样验证版式。

LlamaParse API

pip install llama-parse
export LLAMA_CLOUD_API_KEY="llx-..."

from llama_parse import LlamaParse
parser = LlamaParse(result_type="markdown")
docs = parser.load_data("complex-report.pdf")

与 LlamaIndex 联用:解析结果直接 VectorStoreIndex.from_documents(docs),适合半天内出 Demo。

十、Cloud Mac / Apple Silicon 场景

PDF 解析是CPU/GPU 密集 + 磁盘 I/O任务,和 Xcode 编译抢本机资源时尤其尴尬。典型分工:

  • 本地 MacBook:调试 pipeline、单文件验证、LlamaParse API 调用(几乎零本地算力)
  • Cloud Mac mini(M4):夜间批量跑 MinerU/Marker,百页级文档入库
  • 带 GPU 的 Linux 云主机:MinerU 大规模 OCR 的性价比选项(非 macOS 场景)

在 Apple Silicon 上:

  • Docling / Marker:M4 CPU 即可胜任多数英文技术 PDF;建议 brew install poppler 补齐依赖
  • MinerU:可用 MPS 后端加速部分模型;内存建议 16GB+,超长论文分批处理
  • 存储:解析输出含大量 PNG 切图,挂载云盘或节点本地 SSD,避免塞满系统盘

推荐工作流

开发者在本地 Xcode 写 App → SSH 到 Cloud Mac 跑 cron 批处理新 PDF → 结构化 Markdown 同步到向量库(Qdrant / pgvector)→ App 内 RAG 只调 API。解析与构建物理隔离,互不卡顿。

十一、成本、性能与风险

成本估算(千页级文档库)

方案 一次性/月费 千页量级说明
Docling / Marker 本地 $0 许可 + 电费 M4 Cloud Mac 跑 2–4 小时可完成,节点费约数美元
MinerU + GPU $0 许可 + GPU 时租 公式密集时 GPU 省 50%+ 时间
LlamaParse 按页 ~$0.003–0.01 千页约 $3–10,量大需议价 Enterprise

性能要点

  • 瓶颈:版面检测 > OCR > 纯文本抽取;扫描件最慢
  • 并行:Marker/Docling 支持多进程;按文件并行而非单文件多线程
  • 缓存:解析结果落盘复用,避免重复跑同一 PDF

风险与局限

  • 没有银弹:杂志级复杂排版仍需人工抽检 5–10% 页
  • 版本漂移:开源模型更新后输出格式可能变,chunk 策略需回归测试
  • 版权与隐私:LlamaParse 上传即出域;企业合同禁止时只能本地方案
  • 幻觉前置:解析错误会导致 RAG「一本正经胡说」——务必保留页码与 bbox 溯源

FAQ

2026 年最好的 PDF Parser 是哪个?

综合开源、版式与集成,Docling 第一;中文论文选 MinerU;英文长文批量选 Marker;免运维原型选 LlamaParse

Docling 和 MinerU 怎么选?

Docling 适合企业多格式与英文技术文档;MinerU 适合中文学术、公式与扫描件。两者都可本地部署,数据不出域。

LlamaParse 值得付费吗?

快速验证 RAG、处理复杂版式、团队无人运维 GPU 时值得。大批量或合规敏感场景改自建。

能在 Apple Silicon 上跑吗?

可以。Docling/Marker CPU 即可;MinerU 建议 M4 + 16GB 内存,或用 Cloud Mac 批处理。

RAG 里 PDF 解析失败最常见原因?

扫描件缺 OCR、多栏顺序错乱、表格变纯文本。选型看 layout + 表格结构化,不只看抽字率。

总结

2026 年 PDF Parser 的选型逻辑很清晰:要可控选开源,要速度选 Marker,要中文论文选 MinerU,要省事选 LlamaParse,要企业均衡选 Docling。 没有全能冠军,只有与文档类型、合规和工程量匹配的方案。

上手三步:

  1. 拿 10 页代表性 PDF 做 A/B(含表格、公式、扫描各一类)
  2. 检查 Markdown 标题层级与表格是否可用,再定 chunk 策略
  3. 批量解析放 Cloud Mac,本地专注写代码

Agent 与 RAG 工具链可参考 2026 AI 编程工具排名;视频素材管线见 Video-use AI 视频工作流

千页 PDF 别占满你本机:用 Cloud Mac 跑解析批处理

MinerU、Marker、Docling 批量任务可丢到独享 M4 Mac mini。夜间 cron 跑完,早上向量库已更新,本地 Xcode 编译不再卡顿。

查看 Cloud Mac 套餐 · Docling GitHub

功能与定价以各项目 GitHub 与 LlamaIndex 官网为准。最后更新:2026 年 8 月 5 日。

机房手记 · RAG

PDF Parser 选型:Docling · MinerU · Marker · LlamaParse

版面还原 · 表格公式 · RAG 集成 · Cloud Mac 批处理

查看 Cloud Mac 套餐
限时优惠 点击查看套餐