2026 年,幾乎每個 AI 應用都要吃 PDF:產品手冊進知識庫、論文做 RAG、合約合規檢索、Flutter/iOS 文件自動摘要。但 pdftotext 抽出來的往往是亂序碎片——雙欄變單欄、表格變亂碼、公式變「□□□」。
Docling、MinerU、LlamaParse、Marker 是當前開發者社群討論最多的四家 PDF Parser。它們不是簡單的「PDF 轉 TXT」,而是帶版面分析、表格結構化、OCR、Markdown 匯出的完整管線,直接決定 RAG chunk 品質上限。
這篇按真實 RAG 工程體驗給出 2026 年排名與選型矩陣,並附上在 Apple Silicon / Cloud Mac 上的部署要點。
一、問題背景:為什麼 PDF 解析決定 RAG 上限
向量檢索再強,也救不了餵進去的垃圾 chunk。常見翻車場景:
- 雙欄論文:左欄末句和右欄首句被拼成一段,語意完全斷裂
- 嵌套表格:財務報表變成「2024 營收 成長 15% 亞太 32%」一串詞
- 掃描件合約:沒有 OCR 層,檢索結果為空
- 圖表註釋:圖註與正文分離,Agent 引用時張冠李戴
2026 年的 PDF Parser 競爭焦點已從「能不能抽字」轉向結構化輸出品質:Markdown 是否保留標題層級、表格能否還原為 HTML/CSV、公式能否輸出 LaTeX、多欄閱讀順序是否正確。
選型前先問三個問題
- 文件主要是英文技術手冊還是中文論文/研報?
- 資料能否出域(決定本機 vs LlamaParse 雲端)?
- 日處理量是幾十頁原型還是萬頁批次處理?
二、核心概念:評估維度與管線架構
五個評估維度
- 版面還原(Layout):多欄、頁首頁尾、浮動圖註的閱讀順序
- 表格結構化(Tables):複雜合併儲存格、跨頁表格
- 公式與圖表(STEM):LaTeX/MathML 輸出、圖註關聯
- OCR 能力:掃描件、拍照 PDF、低品質影印
- 工程整合:CLI、Python SDK、Docker、與 LangChain/LlamaIndex 對接成本
典型解析管線
四家工具雖實作不同,但邏輯上大多遵循:
PDF 輸入 → 版面檢測 → 區域分類(正文/表/圖/公式)
→ 逐區域 OCR / 文字抽取 → 閱讀順序排序
→ 結構化組裝 → Markdown / JSON / HTML 輸出
差異在於:Docling 偏企業多格式統一;MinerU 偏學術中文+公式;Marker 偏英文長文高速轉 MD;LlamaParse 偏託管 API + LlamaIndex 一鍵接入。
三、2026 總排名
| 排名 | 工具 | 類型 | 最適合 |
|---|---|---|---|
| #1 | Docling | 開源 · IBM | 企業文件、多格式、結構化 JSON、合規本機部署 |
| #2 | MinerU | 開源 · OpenDataLab | 中文論文、公式密集、掃描件 OCR |
| #3 | Marker | 開源 | 英文書籍/長文批次轉 Markdown |
| #4 | LlamaParse | 雲端 API · LlamaIndex | 快速原型、複雜版式、免運維 |
排名邏輯:不只看單次 benchmark 分數,而是「明天開工建 RAG,哪套最省心、最可控、最省錢」。LlamaParse 解析品質常能排進前三,但閉源按頁計費、資料出域,故綜合排第四——適合特定場景,而非預設首選。
四、#1 Docling — 企業級開源首選
Docling 由 IBM Research 開源,2025–2026 年迅速成為 RAG 社群預設選項之一。核心優勢:
- 多格式統一:PDF、DOCX、PPTX、HTML、圖片同一套 API
- 結構化匯出:Markdown、JSON(含 bbox、標籤、表格結構)
- 表格與閱讀順序:TableFormer 模型,複雜表格還原優於朴素 OCR
- 整合友善:官方範例涵蓋 LangChain、LlamaIndex、Haystack
- 本機 / air-gapped:適合金融、醫療等資料不出域場景
短板:中文排版與數學公式的極致表現不如 MinerU;首次執行需下載模型權重(約數 GB)。
適用人群
iOS/Flutter 團隊把英文技術文件、API Reference、設計規範灌進內部知識庫;需要 JSON 結構化輸出做細粒度 chunk 的工程師。
五、#2 MinerU — 中文論文與公式王者
MinerU(原 Magic-PDF)來自 OpenDataLab / 上海 AI Lab 生態,在中文學術場景口碑極佳:
- 公式識別:輸出 LaTeX,RAG 問答「式 (3) 含義」時不易丟資訊
- 雙欄/混排:中文期刊、學位論文閱讀順序準確率高
- 完整 OCR 管線:掃描 PDF、影印件可直接處理
- 圖表提取:圖片與 caption 分離儲存,便於多模態 RAG
短板:依賴 PyTorch,GPU 加速體驗明顯好於純 CPU;英文商業手冊偶發頁首干擾;模型體積與 MinerU 2.x 設定項對新手略陡。
六、#3 Marker — 英文長文批次轉 MD 利器
Marker 由 Vik Paruchuri 維護,定位清晰:把 PDF 快速變成乾淨的 Markdown。
- 速度快:針對書籍、論文、技術報告優化,批次轉換效率高
- Markdown 品質:標題層級、列表、程式碼區塊保留較好
- 可擴充:支援 LLM 後處理(可選)潤色斷行與 hyphenation
- 純本機:無 API Key,適合離線環境
短板:複雜中文表格與公式不如 MinerU;超複雜版式(雜誌排版)偶需人工校對;專案迭代快,大版本升級注意 lock 依賴。
七、#4 LlamaParse — 託管 API 的開箱即用
LlamaParse 是 LlamaIndex 旗下的雲端 PDF 解析服務:
- 零運維:上傳 PDF,回傳 Markdown/JSON,與 LlamaIndex
VectorStoreIndex無縫對接 - 複雜版式:多欄、嵌套表、圖表註釋處理成熟
- 多模態選項:可開啟圖表描述,供多模態 RAG 使用
- 按頁計費:適合驗證想法,不必先買 GPU
短板:資料出域、持續成本、供應商鎖定;大批量時單頁費用顯著;離線/合規場景不可用。
八、四維對比矩陣
| 維度 | Docling | MinerU | Marker | LlamaParse |
|---|---|---|---|---|
| 開源/本機 | ✅ MIT | ✅ Apache 2.0 | ✅ GPL | ❌ 雲端 |
| 中文論文 | 良好 | 優秀 | 一般 | 良好 |
| 英文手冊 | 優秀 | 良好 | 優秀 | 優秀 |
| 表格還原 | 優秀 | 良好 | 良好 | 優秀 |
| 公式 LaTeX | 良好 | 優秀 | 一般 | 良好 |
| 掃描件 OCR | 良好 | 優秀 | 依賴設定 | 優秀 |
| 批次成本 | 低(算力) | 低(算力) | 低(算力) | 按頁累加 |
| RAG 整合 | LangChain/LlamaIndex | 社群適配器 | 自行 pipeline | 原生 LlamaIndex |
九、實操:四工具快速上手
以下命令均在 macOS / Cloud Mac 終端驗證思路(Python 3.10+ 推薦)。
Docling CLI
pip install docling
docling my-manual.pdf --to md --output ./out/
Python SDK 可拿到帶 bbox 的 JSON,便於按標題層級切 chunk:
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("api-spec.pdf")
print(result.document.export_to_markdown())
MinerU
pip install mineru
mineru -p thesis.pdf -o ./output
輸出目錄通常含 markdown、images、中間 JSON。論文場景建議開啟公式與表格檢測選項(見官方 README 2.x 設定)。
Marker
pip install marker-pdf
marker_single book.pdf ./output --batch_multiplier 2
批次轉換:marker /path/to/pdfs /path/to/output。M 系列 Mac 可調低 --max_pages 先抽樣驗證版式。
LlamaParse API
pip install llama-parse
export LLAMA_CLOUD_API_KEY="llx-..."
from llama_parse import LlamaParse
parser = LlamaParse(result_type="markdown")
docs = parser.load_data("complex-report.pdf")
與 LlamaIndex 聯用:解析結果直接 VectorStoreIndex.from_documents(docs),適合半天內出 Demo。
十、Cloud Mac / Apple Silicon 場景
PDF 解析是CPU/GPU 密集 + 磁碟 I/O任務,和 Xcode 編譯搶本機資源時尤其尷尬。典型分工:
- 本機 MacBook:除錯 pipeline、單檔案驗證、LlamaParse API 呼叫(幾乎零本機算力)
- Cloud Mac mini(M4):夜間批次跑 MinerU/Marker,百頁級文件入庫
- 帶 GPU 的 Linux 雲主機:MinerU 大規模 OCR 的性價比選項(非 macOS 場景)
在 Apple Silicon 上:
- Docling / Marker:M4 CPU 即可勝任多數英文技術 PDF;建議
brew install poppler補齊依賴 - MinerU:可用 MPS 後端加速部分模型;記憶體建議 16GB+,超長論文分批處理
- 儲存:解析輸出含大量 PNG 切圖,掛載雲端硬碟或節點本機 SSD,避免塞滿系統碟
推薦工作流
開發者在本機 Xcode 寫 App → SSH 到 Cloud Mac 跑 cron 批次處理新 PDF → 結構化 Markdown 同步到向量庫(Qdrant / pgvector)→ App 內 RAG 只調 API。解析與建置物理隔離,互不卡頓。
十一、成本、效能與風險
成本估算(千頁級文件庫)
| 方案 | 一次性/月費 | 千頁量級說明 |
|---|---|---|
| Docling / Marker 本機 | $0 許可 + 電費 | M4 Cloud Mac 跑 2–4 小時可完成,節點費約數美元 |
| MinerU + GPU | $0 許可 + GPU 時租 | 公式密集時 GPU 省 50%+ 時間 |
| LlamaParse | 按頁 ~$0.003–0.01 | 千頁約 $3–10,量大需議價 Enterprise |
效能要點
- 瓶頸:版面檢測 > OCR > 純文字抽取;掃描件最慢
- 並行:Marker/Docling 支援多進程;按檔案並行而非單檔多執行緒
- 快取:解析結果落盤復用,避免重複跑同一 PDF
風險與侷限
- 沒有銀彈:雜誌級複雜排版仍需人工抽檢 5–10% 頁
- 版本漂移:開源模型更新後輸出格式可能變,chunk 策略需回歸測試
- 版權與隱私:LlamaParse 上傳即出域;企業合約禁止時只能本地方案
- 幻覺前置:解析錯誤會導致 RAG「一本正經胡說」——務必保留頁碼與 bbox 溯源
FAQ
2026 年最好的 PDF Parser 是哪個?
綜合開源、版式與整合,Docling 第一;中文論文選 MinerU;英文長文批次選 Marker;免運維原型選 LlamaParse。
Docling 和 MinerU 怎麼選?
Docling 適合企業多格式與英文技術文件;MinerU 適合中文學術、公式與掃描件。兩者都可本機部署,資料不出域。
LlamaParse 值得付費嗎?
快速驗證 RAG、處理複雜版式、團隊無人運維 GPU 時值得。大批量或合規敏感場景改自建。
能在 Apple Silicon 上跑嗎?
可以。Docling/Marker CPU 即可;MinerU 建議 M4 + 16GB 記憶體,或用 Cloud Mac 批次處理。
RAG 裡 PDF 解析失敗最常見原因?
掃描件缺 OCR、多欄順序錯亂、表格變純文字。選型看 layout + 表格結構化,不只看抽字率。
總結
2026 年 PDF Parser 的選型邏輯很清楚:要可控選開源,要速度選 Marker,要中文論文選 MinerU,要省事選 LlamaParse,要企業均衡選 Docling。 沒有全能冠軍,只有與文件類型、合規和工程量匹配的方案。
上手三步:
- 拿 10 頁代表性 PDF 做 A/B(含表格、公式、掃描各一類)
- 檢查 Markdown 標題層級與表格是否可用,再定 chunk 策略
- 批次解析放 Cloud Mac,本機專注寫程式
Agent 與 RAG 工具鏈可參考 2026 AI 編程工具排名;影片素材管線見 Video-use AI 影片工作流。
千頁 PDF 別佔滿你本機:用 Cloud Mac 跑解析批次處理
MinerU、Marker、Docling 批次任務可丟到獨享 M4 Mac mini。夜間 cron 跑完,早上向量庫已更新,本機 Xcode 編譯不再卡頓。
相關閱讀
- 2026 最好的 AI 編程工具排名:Claude、Cursor、GitHub Copilot、Codex、Gemini
- Video-use 使用教學:從腳本到成片的完整 AI 影片工作流
- 2026 開發者 AI 三層架構:AI Coding、Personal AI 與 Agent 編排完整指南
- 開源工具鏈集錦:2026 年遠端 Mac 開發必備的終端工具清單
功能與定價以各專案 GitHub 與 LlamaIndex 官網為準。最後更新:2026 年 8 月 5 日。