Vuncloud 部落格
← 返回機房手記專欄

最好的 PDF Parser 排行榜(2026):Docling、MinerU、LlamaParse、Marker 對比

四強排名 · 版面還原 · 表格/公式 · RAG 整合 · 本機 vs 雲端 · Cloud Mac 實測約 13 分鐘閱讀

開發者在 Mac 筆電上處理 PDF 文件與 AI 解析管線,Docling MinerU RAG 場景

2026 年,幾乎每個 AI 應用都要吃 PDF:產品手冊進知識庫、論文做 RAG、合約合規檢索、Flutter/iOS 文件自動摘要。但 pdftotext 抽出來的往往是亂序碎片——雙欄變單欄、表格變亂碼、公式變「□□□」。

Docling、MinerU、LlamaParse、Marker 是當前開發者社群討論最多的四家 PDF Parser。它們不是簡單的「PDF 轉 TXT」,而是帶版面分析、表格結構化、OCR、Markdown 匯出的完整管線,直接決定 RAG chunk 品質上限。

這篇按真實 RAG 工程體驗給出 2026 年排名與選型矩陣,並附上在 Apple Silicon / Cloud Mac 上的部署要點。

#1 Docling
綜合開源與企業文件最佳
4 強
Docling · MinerU · Marker · LlamaParse
3 類部署
本機開源 · 雲端 API · Cloud Mac 批次處理

一、問題背景:為什麼 PDF 解析決定 RAG 上限

向量檢索再強,也救不了餵進去的垃圾 chunk。常見翻車場景:

  • 雙欄論文:左欄末句和右欄首句被拼成一段,語意完全斷裂
  • 嵌套表格:財務報表變成「2024 營收 成長 15% 亞太 32%」一串詞
  • 掃描件合約:沒有 OCR 層,檢索結果為空
  • 圖表註釋:圖註與正文分離,Agent 引用時張冠李戴

2026 年的 PDF Parser 競爭焦點已從「能不能抽字」轉向結構化輸出品質:Markdown 是否保留標題層級、表格能否還原為 HTML/CSV、公式能否輸出 LaTeX、多欄閱讀順序是否正確。

選型前先問三個問題

  • 文件主要是英文技術手冊還是中文論文/研報
  • 資料能否出域(決定本機 vs LlamaParse 雲端)?
  • 日處理量是幾十頁原型還是萬頁批次處理

二、核心概念:評估維度與管線架構

五個評估維度

  1. 版面還原(Layout):多欄、頁首頁尾、浮動圖註的閱讀順序
  2. 表格結構化(Tables):複雜合併儲存格、跨頁表格
  3. 公式與圖表(STEM):LaTeX/MathML 輸出、圖註關聯
  4. OCR 能力:掃描件、拍照 PDF、低品質影印
  5. 工程整合:CLI、Python SDK、Docker、與 LangChain/LlamaIndex 對接成本

典型解析管線

四家工具雖實作不同,但邏輯上大多遵循:

PDF 輸入 → 版面檢測 → 區域分類(正文/表/圖/公式)
        → 逐區域 OCR / 文字抽取 → 閱讀順序排序
        → 結構化組裝 → Markdown / JSON / HTML 輸出

差異在於:Docling 偏企業多格式統一;MinerU 偏學術中文+公式;Marker 偏英文長文高速轉 MD;LlamaParse 偏託管 API + LlamaIndex 一鍵接入

桌面上散落的紙質文件與筆記型電腦,PDF 文件解析與 RAG 知識庫入庫場景
PDF Parser 的輸出品質直接決定 RAG chunk 能否被正確檢索與引用

三、2026 總排名

排名 工具 類型 最適合
#1 Docling 開源 · IBM 企業文件、多格式、結構化 JSON、合規本機部署
#2 MinerU 開源 · OpenDataLab 中文論文、公式密集、掃描件 OCR
#3 Marker 開源 英文書籍/長文批次轉 Markdown
#4 LlamaParse 雲端 API · LlamaIndex 快速原型、複雜版式、免運維

排名邏輯:不只看單次 benchmark 分數,而是「明天開工建 RAG,哪套最省心、最可控、最省錢」。LlamaParse 解析品質常能排進前三,但閉源按頁計費、資料出域,故綜合排第四——適合特定場景,而非預設首選。

四、#1 Docling — 企業級開源首選

Docling 由 IBM Research 開源,2025–2026 年迅速成為 RAG 社群預設選項之一。核心優勢:

  • 多格式統一:PDF、DOCX、PPTX、HTML、圖片同一套 API
  • 結構化匯出:Markdown、JSON(含 bbox、標籤、表格結構)
  • 表格與閱讀順序:TableFormer 模型,複雜表格還原優於朴素 OCR
  • 整合友善:官方範例涵蓋 LangChain、LlamaIndex、Haystack
  • 本機 / air-gapped:適合金融、醫療等資料不出域場景

短板:中文排版與數學公式的極致表現不如 MinerU;首次執行需下載模型權重(約數 GB)。

適用人群

iOS/Flutter 團隊把英文技術文件、API Reference、設計規範灌進內部知識庫;需要 JSON 結構化輸出做細粒度 chunk 的工程師。

五、#2 MinerU — 中文論文與公式王者

MinerU(原 Magic-PDF)來自 OpenDataLab / 上海 AI Lab 生態,在中文學術場景口碑極佳:

  • 公式識別:輸出 LaTeX,RAG 問答「式 (3) 含義」時不易丟資訊
  • 雙欄/混排:中文期刊、學位論文閱讀順序準確率高
  • 完整 OCR 管線:掃描 PDF、影印件可直接處理
  • 圖表提取:圖片與 caption 分離儲存,便於多模態 RAG

短板:依賴 PyTorch,GPU 加速體驗明顯好於純 CPU;英文商業手冊偶發頁首干擾;模型體積與 MinerU 2.x 設定項對新手略陡。

六、#3 Marker — 英文長文批次轉 MD 利器

Marker 由 Vik Paruchuri 維護,定位清晰:把 PDF 快速變成乾淨的 Markdown

  • 速度快:針對書籍、論文、技術報告優化,批次轉換效率高
  • Markdown 品質:標題層級、列表、程式碼區塊保留較好
  • 可擴充:支援 LLM 後處理(可選)潤色斷行與 hyphenation
  • 純本機:無 API Key,適合離線環境

短板:複雜中文表格與公式不如 MinerU;超複雜版式(雜誌排版)偶需人工校對;專案迭代快,大版本升級注意 lock 依賴。

七、#4 LlamaParse — 託管 API 的開箱即用

LlamaParse 是 LlamaIndex 旗下的雲端 PDF 解析服務:

  • 零運維:上傳 PDF,回傳 Markdown/JSON,與 LlamaIndex VectorStoreIndex 無縫對接
  • 複雜版式:多欄、嵌套表、圖表註釋處理成熟
  • 多模態選項:可開啟圖表描述,供多模態 RAG 使用
  • 按頁計費:適合驗證想法,不必先買 GPU

短板:資料出域、持續成本、供應商鎖定;大批量時單頁費用顯著;離線/合規場景不可用。

八、四維對比矩陣

維度 Docling MinerU Marker LlamaParse
開源/本機 ✅ MIT ✅ Apache 2.0 ✅ GPL ❌ 雲端
中文論文 良好 優秀 一般 良好
英文手冊 優秀 良好 優秀 優秀
表格還原 優秀 良好 良好 優秀
公式 LaTeX 良好 優秀 一般 良好
掃描件 OCR 良好 優秀 依賴設定 優秀
批次成本 低(算力) 低(算力) 低(算力) 按頁累加
RAG 整合 LangChain/LlamaIndex 社群適配器 自行 pipeline 原生 LlamaIndex

九、實操:四工具快速上手

以下命令均在 macOS / Cloud Mac 終端驗證思路(Python 3.10+ 推薦)。

Docling CLI

pip install docling
docling my-manual.pdf --to md --output ./out/

Python SDK 可拿到帶 bbox 的 JSON,便於按標題層級切 chunk:

from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("api-spec.pdf")
print(result.document.export_to_markdown())

MinerU

pip install mineru
mineru -p thesis.pdf -o ./output

輸出目錄通常含 markdownimages、中間 JSON。論文場景建議開啟公式與表格檢測選項(見官方 README 2.x 設定)。

Marker

pip install marker-pdf
marker_single book.pdf ./output --batch_multiplier 2

批次轉換:marker /path/to/pdfs /path/to/output。M 系列 Mac 可調低 --max_pages 先抽樣驗證版式。

LlamaParse API

pip install llama-parse
export LLAMA_CLOUD_API_KEY="llx-..."

from llama_parse import LlamaParse
parser = LlamaParse(result_type="markdown")
docs = parser.load_data("complex-report.pdf")

與 LlamaIndex 聯用:解析結果直接 VectorStoreIndex.from_documents(docs),適合半天內出 Demo。

十、Cloud Mac / Apple Silicon 場景

PDF 解析是CPU/GPU 密集 + 磁碟 I/O任務,和 Xcode 編譯搶本機資源時尤其尷尬。典型分工:

  • 本機 MacBook:除錯 pipeline、單檔案驗證、LlamaParse API 呼叫(幾乎零本機算力)
  • Cloud Mac mini(M4):夜間批次跑 MinerU/Marker,百頁級文件入庫
  • 帶 GPU 的 Linux 雲主機:MinerU 大規模 OCR 的性價比選項(非 macOS 場景)

在 Apple Silicon 上:

  • Docling / Marker:M4 CPU 即可勝任多數英文技術 PDF;建議 brew install poppler 補齊依賴
  • MinerU:可用 MPS 後端加速部分模型;記憶體建議 16GB+,超長論文分批處理
  • 儲存:解析輸出含大量 PNG 切圖,掛載雲端硬碟或節點本機 SSD,避免塞滿系統碟

推薦工作流

開發者在本機 Xcode 寫 App → SSH 到 Cloud Mac 跑 cron 批次處理新 PDF → 結構化 Markdown 同步到向量庫(Qdrant / pgvector)→ App 內 RAG 只調 API。解析與建置物理隔離,互不卡頓。

十一、成本、效能與風險

成本估算(千頁級文件庫)

方案 一次性/月費 千頁量級說明
Docling / Marker 本機 $0 許可 + 電費 M4 Cloud Mac 跑 2–4 小時可完成,節點費約數美元
MinerU + GPU $0 許可 + GPU 時租 公式密集時 GPU 省 50%+ 時間
LlamaParse 按頁 ~$0.003–0.01 千頁約 $3–10,量大需議價 Enterprise

效能要點

  • 瓶頸:版面檢測 > OCR > 純文字抽取;掃描件最慢
  • 並行:Marker/Docling 支援多進程;按檔案並行而非單檔多執行緒
  • 快取:解析結果落盤復用,避免重複跑同一 PDF

風險與侷限

  • 沒有銀彈:雜誌級複雜排版仍需人工抽檢 5–10% 頁
  • 版本漂移:開源模型更新後輸出格式可能變,chunk 策略需回歸測試
  • 版權與隱私:LlamaParse 上傳即出域;企業合約禁止時只能本地方案
  • 幻覺前置:解析錯誤會導致 RAG「一本正經胡說」——務必保留頁碼與 bbox 溯源

FAQ

2026 年最好的 PDF Parser 是哪個?

綜合開源、版式與整合,Docling 第一;中文論文選 MinerU;英文長文批次選 Marker;免運維原型選 LlamaParse

Docling 和 MinerU 怎麼選?

Docling 適合企業多格式與英文技術文件;MinerU 適合中文學術、公式與掃描件。兩者都可本機部署,資料不出域。

LlamaParse 值得付費嗎?

快速驗證 RAG、處理複雜版式、團隊無人運維 GPU 時值得。大批量或合規敏感場景改自建。

能在 Apple Silicon 上跑嗎?

可以。Docling/Marker CPU 即可;MinerU 建議 M4 + 16GB 記憶體,或用 Cloud Mac 批次處理。

RAG 裡 PDF 解析失敗最常見原因?

掃描件缺 OCR、多欄順序錯亂、表格變純文字。選型看 layout + 表格結構化,不只看抽字率。

總結

2026 年 PDF Parser 的選型邏輯很清楚:要可控選開源,要速度選 Marker,要中文論文選 MinerU,要省事選 LlamaParse,要企業均衡選 Docling。 沒有全能冠軍,只有與文件類型、合規和工程量匹配的方案。

上手三步:

  1. 拿 10 頁代表性 PDF 做 A/B(含表格、公式、掃描各一類)
  2. 檢查 Markdown 標題層級與表格是否可用,再定 chunk 策略
  3. 批次解析放 Cloud Mac,本機專注寫程式

Agent 與 RAG 工具鏈可參考 2026 AI 編程工具排名;影片素材管線見 Video-use AI 影片工作流

千頁 PDF 別佔滿你本機:用 Cloud Mac 跑解析批次處理

MinerU、Marker、Docling 批次任務可丟到獨享 M4 Mac mini。夜間 cron 跑完,早上向量庫已更新,本機 Xcode 編譯不再卡頓。

查看 Cloud Mac 方案 · Docling GitHub

功能與定價以各專案 GitHub 與 LlamaIndex 官網為準。最後更新:2026 年 8 月 5 日。

機房手記 · RAG

PDF Parser 選型:Docling · MinerU · Marker · LlamaParse

版面還原 · 表格公式 · RAG 整合 · Cloud Mac 批次處理

查看 Cloud Mac 方案
限時優惠 點擊查看方案