Vuncloud Блог
← Назад к полевым заметкам

Лучшие PDF Parser в 2026: рейтинг Docling, MinerU, LlamaParse и Marker

Топ-4 · Восстановление вёрстки · Таблицы и формулы · Интеграция RAG · Локально vs облако · Практика на Cloud Mac~13 мин чтения

Разработчик на Mac обрабатывает PDF и AI-пайплайн парсинга — сценарий Docling MinerU RAG

В 2026 году почти каждое AI-приложение «потребляет» PDF: продуктовые мануалы в базу знаний, статьи для RAG, поиск по договорам, автосаммари документации Flutter/iOS. Но то, что выдаёт pdftotext, — часто бессмысленные фрагменты: две колонки сливаются в одну, таблицы превращаются в кашу, формулы — в «□□□».

Docling, MinerU, LlamaParse и Marker — четыре PDF Parser, о которых разработчики говорят чаще всего. Это не простые конвертеры «PDF → TXT», а полноценные пайплайны с анализом вёрстки, структурированием таблиц, OCR и экспортом в Markdown — и именно они задают потолок качества ваших RAG-chunks.

Этот материал даёт рейтинг 2026 года и матрицу выбора по реальному RAG-опыту, плюс заметки по деплою на Apple Silicon и Cloud Mac.

#1 Docling
Лучший open source для корпоративных документов
Топ-4
Docling · MinerU · Marker · LlamaParse
3 режима
Локальный open source · Облачный API · Пакет на Cloud Mac

1. Почему парсинг PDF задаёт потолок RAG

Какой бы мощной ни была векторная выдача, она не спасёт плохие chunks. Типичные провалы:

  • Двухколоночные статьи: последнее предложение левой колонки склеивается с первым правой — смысл полностью рвётся
  • Вложенные таблицы: финансовый отчёт превращается в строку «выручка 2024 рост 15% APAC 32%»
  • Сканированные договоры: без OCR-слоя поиск пустой
  • Подписи к рисункам: caption отрывается от текста — Agent цитирует не то

В 2026 году конкуренция PDF Parser сместилась от вопроса «можно ли вытащить текст» к качеству структурированного вывода: сохраняет ли Markdown иерархию заголовков, экспортируются ли таблицы в HTML/CSV, становятся ли формулы LaTeX, корректен ли порядок чтения в многоколоночной вёрстке.

Три вопроса перед выбором

  • Документы в основном англоязычные техмануалы или китайские статьи/отчёты?
  • Могут ли данные покидать периметр (локально vs облако LlamaParse)?
  • Дневной объём — десятки страниц прототипа или тысячи в пакетном режиме?

2. Ключевые концепции: критерии оценки и архитектура пайплайна

Пять критериев оценки

  1. Восстановление вёрстки (Layout): многоколоночность, колонтитулы, порядок чтения подписей к рисункам
  2. Структурирование таблиц (Tables): сложные объединённые ячейки, таблицы через страницы
  3. Формулы и диаграммы (STEM): вывод LaTeX/MathML, связь с подписями
  4. OCR: сканы, фото-PDF, низкокачественные копии
  5. Инженерная интеграция: CLI, Python SDK, Docker, стоимость подключения к LangChain/LlamaIndex

Типичный пайплайн парсинга

Реализации различаются, но логика у четырёх инструментов схожа:

PDF → детекция вёрстки → классификация зон (текст/таблица/рисунок/формула)
    → OCR / извлечение текста по зонам → сортировка порядка чтения
    → структурная сборка → Markdown / JSON / HTML

Различия: Docling — единый корпоративный мультиформат; MinerU — академический китайский + формулы; Marker — быстрая массовая конвертация MD на английском; LlamaParse — управляемый API + нативная интеграция LlamaIndex.

Бумажные документы и ноутбук на столе — парсинг PDF и загрузка в RAG-базу знаний
Качество вывода PDF Parser напрямую определяет, смогут ли RAG-chunks корректно индексироваться и цитироваться

3. Общий рейтинг 2026

Место Инструмент Тип Лучше всего для
#1 Docling Open source · IBM Корпоративные документы, мультиформат, JSON, локальный compliance-деплой
#2 MinerU Open source · OpenDataLab Китайские статьи, плотные формулы, OCR сканов
#3 Marker Open source Англоязычные книги и длинные тексты — пакет в Markdown
#4 LlamaParse Облачный API · LlamaIndex Быстрый прототип, сложная вёрстка, без ops

Логика рейтинга: не один benchmark, а «с чего начать RAG завтра — что проще, контролируемее и дешевле». LlamaParse по качеству часто в топ-3, но закрытый, постраничный и с выносом данных — поэтому четвёртое место в общем зачёте; для отдельных сценариев он отличный выбор.

4. #1 Docling — корпоративный open source по умолчанию

Docling от IBM Research в 2025–2026 стал одним из дефолтов RAG-сообщества. Ключевые плюсы:

  • Единый мультиформат: PDF, DOCX, PPTX, HTML, изображения — один API
  • Структурированный экспорт: Markdown, JSON (bbox, метки, структура таблиц)
  • Таблицы и порядок чтения: модель TableFormer, сложные таблицы лучше наивного OCR
  • Интеграции: официальные примеры для LangChain, LlamaIndex, Haystack
  • Локально / air-gapped: финансы, медицина — данные не покидают периметр

Минусы: китайская вёрстка и математика уступают MinerU; первый запуск тянет веса моделей (несколько ГБ).

Кому подходит

Командам iOS/Flutter, заливающим англоязычную техдоку, API Reference и дизайн-гайды во внутреннюю базу; инженерам, которым нужен JSON для тонкой нарезки chunks.

5. #2 MinerU — король китайских статей и формул

MinerU (ранее Magic-PDF) из экосистемы OpenDataLab / Shanghai AI Lab — эталон для китайской академической среды:

  • Формулы: вывод LaTeX — вопросы «что означает формула (3)» не теряют контекст
  • Двухколоночная вёрстка: журналы и диссертации — высокая точность порядка чтения
  • Полный OCR-пайплайн: сканы и ксерокопии без предобработки
  • Извлечение рисунков: картинки и caption раздельно — удобно для мультимодального RAG

Минусы: PyTorch, GPU заметно ускоряет; на англоязычных коммерческих мануалах иногда мешают колонтитулы; MinerU 2.x с множеством опций — порог входа выше.

6. #3 Marker — пакетная конвертация длинных английских текстов в MD

Marker от Vik Paruchuri — чёткая цель: быстро получить чистый Markdown из PDF.

  • Скорость: книги, статьи, техотчёты — эффективный пакетный режим
  • Качество Markdown: заголовки, списки, code blocks сохраняются хорошо
  • Расширяемость: опциональная LLM-постобработка переносов и дефисов
  • Чисто локально: без API Key, подходит для offline

Минусы: сложные китайские таблицы и формулы слабее MinerU; журнальная вёрстка иногда требует ручной вычитки; быстрые major-релизы — фиксируйте зависимости.

7. #4 LlamaParse — managed API из коробки

LlamaParse — облачный сервис парсинга от LlamaIndex:

  • Нулевой ops: загрузили PDF — получили Markdown/JSON, стык с VectorStoreIndex без клея
  • Сложная вёрстка: многоколоночность, вложенные таблицы, подписи к рисункам
  • Мультимодальные опции: описания графиков для multimodal RAG
  • Постраничная оплата: прототип без покупки GPU

Минусы: данные уходят в облако, постоянные расходы, vendor lock-in; на больших объёмах цена за страницу ощутима; offline и строгий compliance — не вариант.

8. Матрица сравнения по четырём измерениям

Измерение Docling MinerU Marker LlamaParse
Open source / локально ✅ MIT ✅ Apache 2.0 ✅ GPL ❌ Облако
Китайские статьи Хорошо Отлично Средне Хорошо
Англоязычные мануалы Отлично Хорошо Отлично Отлично
Восстановление таблиц Отлично Хорошо Хорошо Отлично
Формулы LaTeX Хорошо Отлично Средне Хорошо
OCR сканов Хорошо Отлично Зависит от конфига Отлично
Стоимость пакетов Низкая (compute) Низкая (compute) Низкая (compute) Накопительная за страницу
Интеграция RAG LangChain/LlamaIndex Community adapters Свой pipeline Нативный LlamaIndex

9. Практика: быстрый старт четырёх инструментов

Команды проверены по логике на macOS / Cloud Mac (рекомендуется Python 3.10+).

Docling CLI

pip install docling
docling my-manual.pdf --to md --output ./out/

Через Python SDK можно получить JSON с bbox — удобно резать chunks по заголовкам:

from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("api-spec.pdf")
print(result.document.export_to_markdown())

MinerU

pip install mineru
mineru -p thesis.pdf -o ./output

В выходной папке обычно markdown, images и промежуточный JSON. Для статей включайте детекцию формул и таблиц (см. README 2.x).

Marker

pip install marker-pdf
marker_single book.pdf ./output --batch_multiplier 2

Пакетно: marker /path/to/pdfs /path/to/output. На M-серии сначала снизьте --max_pages для выборочной проверки вёрстки.

API LlamaParse

pip install llama-parse
export LLAMA_CLOUD_API_KEY="llx-..."

from llama_parse import LlamaParse
parser = LlamaParse(result_type="markdown")
docs = parser.load_data("complex-report.pdf")

С LlamaIndex: VectorStoreIndex.from_documents(docs) — демо за полдня.

10. Сценарии Cloud Mac / Apple Silicon

Парсинг PDF — нагрузка на CPU/GPU и диск; при параллельной сборке Xcode на ноутбуке это особенно заметно. Типичное разделение:

  • Локальный MacBook: отладка pipeline, одиночные файлы, вызовы LlamaParse API (почти без локального compute)
  • Cloud Mac mini (M4): ночной пакет MinerU/Marker на сотнях страниц
  • Linux с GPU: массовый OCR MinerU вне macOS — лучшая цена/скорость

На Apple Silicon:

  • Docling / Marker: M4 CPU хватает для большинства англоязычных PDF; brew install poppler для зависимостей
  • MinerU: MPS ускоряет часть моделей; RAM 16 ГБ+, длинные статьи — батчами
  • Хранилище: вывод с кучей PNG-срезов — облачный диск или SSD узла, не системный том

Рекомендуемый workflow

Локально пишете App в Xcode → по SSH на Cloud Mac cron обрабатывает новые PDF → Markdown синхронизируется в векторное хранилище (Qdrant / pgvector) → RAG в приложении только через API. Парсинг и сборка физически разделены — без взаимных тормозов.

11. Стоимость, производительность и риски

Оценка стоимости (библиотека ~1000 страниц)

Схема Разовые / месячные На ~1000 страниц
Docling / Marker локально $0 лицензия + электричество M4 Cloud Mac 2–4 ч, узел ~несколько долларов
MinerU + GPU $0 лицензия + аренда GPU При плотных формулах GPU экономит 50%+ времени
LlamaParse ~$0.003–0.01 за страницу 1000 стр. ~$3–10, крупные объёмы — Enterprise

Производительность

  • Узкие места: детекция вёрстки > OCR > чистое извлечение текста; сканы самые медленные
  • Параллелизм: Marker/Docling — мультипроцесс; параллельте файлы, не потоки внутри одного PDF
  • Кэш: сохраняйте результат на диск — не гоняйте один PDF повторно

Риски и ограничения

  • Нет серебряной пули: журнальная вёрстка — ручная выборочная проверка 5–10% страниц
  • Дрейф версий: обновление open-source моделей меняет вывод — регрессия chunk-стратегии
  • Авторское право и приватность: загрузка в LlamaParse = данные вне периметра
  • Галлюцинации «снизу»: ошибка парсинга → уверенный ложный RAG — храните номера страниц и bbox

FAQ

Какой PDF Parser лучший в 2026 году?

По open source, вёрстке и интеграции — Docling на первом месте; китайские статьи — MinerU; длинные английские тексты пакетом — Marker; прототип без ops — LlamaParse.

Как выбрать между Docling и MinerU?

Docling — корпоративный мультиформат и англоязычная техдокументация; MinerU — китайская академия, формулы и сканы. Оба — локально, данные on-prem.

Стоит ли платить за LlamaParse?

Да для быстрой проверки RAG, сложной вёрстки и команды без GPU-ops. На больших объёмах или при жёстком compliance — self-hosted.

Работает ли на Apple Silicon?

Да. Docling/Marker на CPU; MinerU — M4 + 16 ГБ RAM или пакеты на Cloud Mac.

Частые причины сбоя парсинга в RAG?

Сканы без OCR, перемешанный многоколоночный порядок, таблицы в plain text. Смотрите layout + структуру таблиц, не только «процент извлечённых символов».

Итоги

Логика выбора PDF Parser в 2026 проста: контроль — open source, скорость — Marker, китайские статьи — MinerU, простота — LlamaParse, корпоративный баланс — Docling. Универсального чемпиона нет — есть соответствие типу документов, compliance и объёму инженерии.

Три шага для старта:

  1. A/B на 10 репрезентативных страницах (таблица, формула, скан — по одному типу)
  2. Проверьте иерархию Markdown и пригодность таблиц — затем фиксируйте chunk-стратегию
  3. Пакетный парсинг — на Cloud Mac, локально оставьте написание кода

Цепочку Agent и RAG см. в рейтинге AI-инструментов программирования 2026; видеопайплайн — в воркфлоу Video-use AI.

Тысяча страниц PDF — не на вашем Mac: пакетный парсинг на Cloud Mac

Пакетные задачи MinerU, Marker и Docling — на выделенный Mac mini M4. Ночной cron, утром обновлённая векторная база — локальные сборки Xcode остаются плавными.

Тарифы Cloud Mac · Docling на GitHub

Функции и цены — по актуальным репозиториям GitHub и документации LlamaIndex. Обновлено: 5 августа 2026.

Полевые заметки · RAG

Выбор PDF Parser: Docling · MinerU · Marker · LlamaParse

Восстановление вёрстки · Таблицы и формулы · Интеграция RAG · Пакет на Cloud Mac

Тарифы Cloud Mac
Спецпредложение Смотреть тарифы