Vuncloud Blog
← Retour aux Notes dev

Classement des meilleurs analyseurs PDF en 2026 : Docling, MinerU, LlamaParse et Marker comparés

Top 4 · Fidélité de mise en page · Tableaux et formules · Intégration RAG · Local vs cloud · Pratique Cloud Mac~13 min de lecture

Développeur sur Mac traitant des PDF et une pipeline d'analyse IA — Docling MinerU scénario RAG

En 2026, presque chaque application IA consomme des PDF : manuels produit dans des bases de connaissances, articles pour le RAG, recherche de conformité contractuelle, résumés automatiques de docs Flutter/iOS. Mais ce que pdftotext extrait, ce sont souvent des fragments désordonnés — deux colonnes fusionnées en une, tableaux transformés en charabia, formules rendues en «□□□».

Docling, MinerU, LlamaParse et Marker sont les quatre analyseurs PDF dont les développeurs parlent le plus. Ce ne sont pas de simples convertisseurs « PDF → TXT », mais des pipelines complets avec analyse de mise en page, structuration de tableaux, OCR et export Markdown — et ils fixent directement le plafond de qualité de vos chunks RAG.

Cet article les classe selon une expérience RAG réelle en 2026, avec une matrice de choix et des notes de déploiement sur Apple Silicon / Cloud Mac.

#1 Docling
Meilleur open source global pour docs entreprise
Top 4
Docling · MinerU · Marker · LlamaParse
3 modes
Open source local · API cloud · Batch Cloud Mac

1. Pourquoi le parsing PDF fixe le plafond RAG

Quelle que soit la puissance de votre recherche vectorielle, elle ne sauvera pas des chunks de mauvaise qualité. Échecs fréquents :

  • Articles à deux colonnes : la dernière phrase de la colonne gauche collée à la première de la droite — sémantique complètement brisée
  • Tableaux imbriqués : un rapport financier devient « revenus 2024 croissance 15 % APAC 32 % » en une seule chaîne
  • Contrats scannés : pas de couche OCR, résultats de recherche vides
  • Légendes de figures : légendes séparées du corps du texte, les Agents citent la mauvaise source

En 2026, la compétition entre analyseurs PDF a basculé de « peut-on extraire du texte ? » vers la qualité de sortie structurée : le Markdown préserve-t-il la hiérarchie des titres, les tableaux s'exportent-ils en HTML/CSV, les formules deviennent-elles du LaTeX, l'ordre de lecture multi-colonnes est-il correct.

Trois questions avant de choisir

  • Vos docs sont-ils surtout des manuels techniques anglais ou des articles/rapports chinois ?
  • Les données peuvent-elles quitter votre périmètre (local vs cloud LlamaParse) ?
  • Le volume quotidien, c'est quelques dizaines de pages pour un prototype ou des milliers en lot ?

2. Concepts clés : dimensions d'évaluation et architecture pipeline

Cinq dimensions d'évaluation

  1. Fidélité de mise en page (Layout) : multi-colonnes, en-têtes/pieds de page, légendes flottantes, ordre de lecture
  2. Structuration des tableaux : cellules fusionnées, tableaux sur plusieurs pages
  3. Formules et figures (STEM) : sortie LaTeX/MathML, lien avec les légendes
  4. Capacité OCR : PDF scannés, captures photo, photocopies de mauvaise qualité
  5. Intégration technique : CLI, SDK Python, Docker, coût de câblage LangChain/LlamaIndex

Pipeline de parsing typique

Les quatre outils diffèrent en implémentation, mais suivent logiquement :

Entrée PDF → détection de mise en page → classification des zones (corps/tableau/figure/formule)
        → OCR / extraction texte par zone → tri de l'ordre de lecture
        → assemblage structuré → sortie Markdown / JSON / HTML

La répartition : Docling penche vers le multi-format entreprise unifié ; MinerU vers l'académique chinois + formules ; Marker vers la conversion rapide de longs textes anglais en MD ; LlamaParse vers l'API gérée + intégration LlamaIndex en un clic.

Documents papier et ordinateur portable sur un bureau — parsing PDF et ingestion base de connaissances RAG
La qualité de sortie du parseur PDF détermine si les chunks RAG peuvent être correctement récupérés et cités

3. Classement global 2026

Rang Outil Type Idéal pour
#1 Docling Open source · IBM Docs entreprise, multi-format, JSON structuré, déploiement local conforme
#2 MinerU Open source · OpenDataLab Articles chinois, formules denses, OCR de scans
#3 Marker Open source Livres anglais / longs docs en lot vers Markdown
#4 LlamaParse API cloud · LlamaIndex Prototypes rapides, mises en page complexes, zéro ops

Logique du classement : pas un seul score de benchmark, mais « si je démarre un projet RAG demain, quelle stack est la plus pratique, contrôlable et rentable ». LlamaParse parse souvent dans le top 3 en qualité, mais le modèle fermé, la facturation à la page et la sortie des données du périmètre le placent quatrième au global — excellent pour des cas précis, pas le choix par défaut.

4. #1 Docling — référence open source entreprise

Docling, open-sourcé par IBM Research, est devenu une option par défaut de la communauté RAG en 2025–2026. Atouts principaux :

  • Multi-format unifié : PDF, DOCX, PPTX, HTML, images via une seule API
  • Export structuré : Markdown, JSON (avec bbox, labels, structure de tableaux)
  • Tableaux et ordre de lecture : modèle TableFormer — tableaux complexes mieux qu'un OCR naïf
  • Intégration aisée : exemples officiels LangChain, LlamaIndex, Haystack
  • Local / air-gapped : finance, santé, scénarios de souveraineté des données

Limites : mise en page chinoise et formules mathématiques moins fortes que MinerU ; premier lancement télécharge les poids du modèle (plusieurs Go).

Public visé

Équipes iOS/Flutter qui ingèrent docs techniques anglais, références API, specs de design dans une base de connaissances interne ; ingénieurs qui ont besoin de JSON pour un chunking fin.

5. #2 MinerU — roi des articles chinois et des formules

MinerU (ex Magic-PDF) de l'écosystème OpenDataLab / Shanghai AI Lab a une excellente réputation en contexte académique chinois :

  • Reconnaissance de formules : sortie LaTeX — le Q&A RAG sur « sens de l'éq. (3) » perd moins d'information
  • Deux colonnes / mise en page mixte : ordre de lecture précis sur revues et thèses chinoises
  • Pipeline OCR complète : PDF scannés et photocopies traités directement
  • Extraction de figures : images et légendes stockées séparément pour le RAG multimodal

Limites : dépendance PyTorch — l'accélération GPU est nettement meilleure qu'en CPU seul ; bruit d'en-tête occasionnel sur manuels commerciaux anglais ; taille des modèles et config MinerU 2.x un peu raides pour les débutants.

6. #3 Marker — conversion en lot de longs textes anglais en Markdown

Marker, maintenu par Vik Paruchuri, a une mission claire : transformer les PDF en Markdown propre rapidement.

  • Vitesse : optimisé pour livres, articles, rapports techniques — conversion en lot efficace
  • Qualité Markdown : hiérarchie de titres, listes, blocs de code bien préservés
  • Extensible : post-traitement LLM optionnel pour césures et hyphenation
  • 100 % local : pas de clé API — compatible hors ligne

Limites : tableaux et formules chinois complexes en retrait sur MinerU ; mises en page type magazine parfois à valider manuellement ; itération rapide — verrouillez les dépendances aux grosses mises à jour.

7. #4 LlamaParse — API gérée, prête à l'emploi

LlamaParse est le service cloud d'analyse PDF de LlamaIndex :

  • Zéro ops : uploadez un PDF, récupérez Markdown/JSON, branchement direct sur VectorStoreIndex
  • Mises en page complexes : multi-colonnes, tableaux imbriqués, notes de figures bien gérés
  • Options multimodales : descriptions de figures optionnelles pour le RAG multimodal
  • Facturation à la page : validez une idée sans acheter de GPU d'abord

Limites : données hors périmètre, coût récurrent, verrouillage fournisseur ; frais par page qui s'accumulent à l'échelle ; indisponible hors ligne / conformité stricte.

8. Matrice de comparaison en quatre dimensions

Dimension Docling MinerU Marker LlamaParse
Open / local ✅ MIT ✅ Apache 2.0 ✅ GPL ❌ Cloud
Articles chinois Bon Excellent Moyen Bon
Manuels anglais Excellent Bon Excellent Excellent
Extraction tableaux Excellent Bon Bon Excellent
Formules LaTeX Bon Excellent Moyen Bon
OCR scans Bon Excellent Selon config Excellent
Coût en lot Faible (compute) Faible (compute) Faible (compute) À la page
Intégration RAG LangChain / LlamaIndex Adaptateurs communauté Pipeline custom LlamaIndex natif

9. Pratique : démarrage rapide des quatre outils

Commandes validées sur macOS / terminal Cloud Mac (Python 3.10+ recommandé).

Docling CLI

pip install docling
docling my-manual.pdf --to md --output ./out/

Le SDK Python renvoie du JSON avec bbox pour chunker par niveau de titre :

from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("api-spec.pdf")
print(result.document.export_to_markdown())

MinerU

pip install mineru
mineru -p thesis.pdf -o ./output

La sortie contient en général markdown, images et JSON intermédiaire. Pour les articles, activez détection de formules et tableaux (voir config README 2.x officielle).

Marker

pip install marker-pdf
marker_single book.pdf ./output --batch_multiplier 2

En lot : marker /path/to/pdfs /path/to/output. Sur Mac M-series, baissez d'abord --max_pages pour contrôler la mise en page.

API LlamaParse

pip install llama-parse
export LLAMA_CLOUD_API_KEY="llx-..."

from llama_parse import LlamaParse
parser = LlamaParse(result_type="markdown")
docs = parser.load_data("complex-report.pdf")

Avec LlamaIndex : VectorStoreIndex.from_documents(docs) — démo en une demi-journée.

10. Scénarios Cloud Mac / Apple Silicon

Le parsing PDF est une tâche intensive CPU/GPU + I/O disque — gênante quand elle rivalise avec les builds Xcode sur la même machine. Répartition typique :

  • MacBook local : debug pipeline, validation fichier unique, appels API LlamaParse (quasi zéro compute local)
  • Cloud Mac mini (M4) : lots MinerU/Marker de nuit pour corpus de centaines de pages
  • Cloud Linux GPU : rapport qualité/prix pour OCR MinerU à grande échelle (hors macOS)

Sur Apple Silicon :

  • Docling / Marker : CPU M4 suffit pour la plupart des PDF techniques anglais ; brew install poppler pour les dépendances
  • MinerU : backend MPS accélère certains modèles ; 16 Go+ RAM recommandés, découpez les très longs articles
  • Stockage : la sortie inclut beaucoup de crops PNG — stockage cloud monté ou SSD du nœud, pas le disque système

Workflow recommandé

Développez en local dans Xcode → SSH vers Cloud Mac et cron pour traiter les nouveaux PDF → synchronisez le Markdown structuré vers votre vector store (Qdrant / pgvector) → le RAG dans l'app n'appelle que l'API. Parsing et builds physiquement isolés — pas de ralentissement mutuel.

11. Coût, performance et risques

Estimation de coût (corpus ~1 000 pages)

Approche Unique / mensuel À ~1 000 pages
Docling / Marker local 0 $ licence + électricité Cloud Mac M4 ~2–4 h, frais nœud quelques dollars
MinerU + GPU 0 $ licence + GPU à l'heure GPU économise 50 %+ de temps sur docs riches en formules
LlamaParse ~0,003–0,01 $ / page ~3–10 $ pour 1 000 pages ; tarif entreprise à volume

Points performance

  • Goulot : détection de mise en page > OCR > extraction texte brute ; scans les plus lents
  • Parallélisme : Marker/Docling supportent le multiprocessing — parallélisez par fichier, pas par page dans un même fichier
  • Cache : persister la sortie du parse ; ne jamais retraiter le même PDF

Risques et limites

  • Pas de solution miracle : mises en page magazine — contrôle manuel sur 5–10 % des pages
  • Dérive de version : mises à jour des modèles open source peuvent changer la sortie — testez la stratégie de chunk
  • Copyright et confidentialité : upload LlamaParse = données hors périmètre ; contrats peuvent l'interdire
  • Hallucination en amont : erreur de parse → RAG confiant et faux — gardez numéros de page et bbox pour la traçabilité

FAQ

Quel est le meilleur analyseur PDF en 2026 ?

Pour l'open source, la mise en page et l'intégration : Docling en premier ; articles chinois MinerU ; longs textes anglais en lot Marker ; prototypes sans ops LlamaParse.

Comment choisir entre Docling et MinerU ?

Docling pour multi-format entreprise et docs techniques anglais ; MinerU pour académique chinois, formules et scans. Les deux se déploient en local — données on-prem.

LlamaParse vaut-il le coût ?

Oui pour validation RAG rapide, mises en page complexes et équipes sans ops GPU. Auto-hébergez pour gros volumes ou conformité stricte.

Tournent-ils sur Apple Silicon ?

Oui. Docling/Marker en CPU ; MinerU bénéficie de M4 + 16 Go RAM, ou Cloud Mac pour les lots.

Échecs de parse PDF les plus fréquents en RAG ?

Scans sans OCR, ordre multi-colonnes mélangé, tableaux aplatis en texte. Choisissez sur layout + structure de tableaux, pas le taux d'extraction brut.

Synthèse

Le choix d'analyseur PDF en 2026 est clair : contrôle → open source, vitesse → Marker, articles chinois → MinerU, simplicité → LlamaParse, équilibre entreprise → Docling. Pas de champion universel — seulement l'adéquation au type de document, à la conformité et à l'effort d'ingénierie.

Trois étapes pour démarrer :

  1. A/B sur dix pages représentatives (tableau, formule, scan chacun)
  2. Vérifier hiérarchie Markdown et tableaux exploitables avant de figer la stratégie de chunk
  3. Parsing en lot sur Cloud Mac ; machine locale réservée au code

Pour la toolchain Agent et RAG, voir le classement outils codage IA 2026 ; pour la pipeline vidéo, workflow vidéo IA Video-use.

Mille pages PDF — pas sur votre Mac : parsing en lot sur Cloud Mac

Déportez les jobs batch MinerU, Marker et Docling sur un Mac mini M4 dédié. Cron de nuit, base vectorielle à jour le matin — les builds Xcode locaux restent fluides.

Voir les forfaits Cloud Mac · Docling sur GitHub

Fonctionnalités et tarifs selon les dépôts GitHub respectifs et la documentation LlamaIndex. Dernière mise à jour : 6 août 2026.

Notes dev · RAG

Choix d'analyseur PDF : Docling · MinerU · Marker · LlamaParse

Fidélité de mise en page · Tableaux et formules · Intégration RAG · Batch Cloud Mac

Voir les forfaits Cloud Mac
Offre limitée Voir les forfaits