В 2026 году почти каждое AI-приложение «потребляет» PDF: продуктовые мануалы в базу знаний, статьи для RAG, поиск по договорам, автосаммари документации Flutter/iOS. Но то, что выдаёт pdftotext, — часто бессмысленные фрагменты: две колонки сливаются в одну, таблицы превращаются в кашу, формулы — в «□□□».
Docling, MinerU, LlamaParse и Marker — четыре PDF Parser, о которых разработчики говорят чаще всего. Это не простые конвертеры «PDF → TXT», а полноценные пайплайны с анализом вёрстки, структурированием таблиц, OCR и экспортом в Markdown — и именно они задают потолок качества ваших RAG-chunks.
Этот материал даёт рейтинг 2026 года и матрицу выбора по реальному RAG-опыту, плюс заметки по деплою на Apple Silicon и Cloud Mac.
1. Почему парсинг PDF задаёт потолок RAG
Какой бы мощной ни была векторная выдача, она не спасёт плохие chunks. Типичные провалы:
- Двухколоночные статьи: последнее предложение левой колонки склеивается с первым правой — смысл полностью рвётся
- Вложенные таблицы: финансовый отчёт превращается в строку «выручка 2024 рост 15% APAC 32%»
- Сканированные договоры: без OCR-слоя поиск пустой
- Подписи к рисункам: caption отрывается от текста — Agent цитирует не то
В 2026 году конкуренция PDF Parser сместилась от вопроса «можно ли вытащить текст» к качеству структурированного вывода: сохраняет ли Markdown иерархию заголовков, экспортируются ли таблицы в HTML/CSV, становятся ли формулы LaTeX, корректен ли порядок чтения в многоколоночной вёрстке.
Три вопроса перед выбором
- Документы в основном англоязычные техмануалы или китайские статьи/отчёты?
- Могут ли данные покидать периметр (локально vs облако LlamaParse)?
- Дневной объём — десятки страниц прототипа или тысячи в пакетном режиме?
2. Ключевые концепции: критерии оценки и архитектура пайплайна
Пять критериев оценки
- Восстановление вёрстки (Layout): многоколоночность, колонтитулы, порядок чтения подписей к рисункам
- Структурирование таблиц (Tables): сложные объединённые ячейки, таблицы через страницы
- Формулы и диаграммы (STEM): вывод LaTeX/MathML, связь с подписями
- OCR: сканы, фото-PDF, низкокачественные копии
- Инженерная интеграция: CLI, Python SDK, Docker, стоимость подключения к LangChain/LlamaIndex
Типичный пайплайн парсинга
Реализации различаются, но логика у четырёх инструментов схожа:
PDF → детекция вёрстки → классификация зон (текст/таблица/рисунок/формула)
→ OCR / извлечение текста по зонам → сортировка порядка чтения
→ структурная сборка → Markdown / JSON / HTML
Различия: Docling — единый корпоративный мультиформат; MinerU — академический китайский + формулы; Marker — быстрая массовая конвертация MD на английском; LlamaParse — управляемый API + нативная интеграция LlamaIndex.
3. Общий рейтинг 2026
| Место | Инструмент | Тип | Лучше всего для |
|---|---|---|---|
| #1 | Docling | Open source · IBM | Корпоративные документы, мультиформат, JSON, локальный compliance-деплой |
| #2 | MinerU | Open source · OpenDataLab | Китайские статьи, плотные формулы, OCR сканов |
| #3 | Marker | Open source | Англоязычные книги и длинные тексты — пакет в Markdown |
| #4 | LlamaParse | Облачный API · LlamaIndex | Быстрый прототип, сложная вёрстка, без ops |
Логика рейтинга: не один benchmark, а «с чего начать RAG завтра — что проще, контролируемее и дешевле». LlamaParse по качеству часто в топ-3, но закрытый, постраничный и с выносом данных — поэтому четвёртое место в общем зачёте; для отдельных сценариев он отличный выбор.
4. #1 Docling — корпоративный open source по умолчанию
Docling от IBM Research в 2025–2026 стал одним из дефолтов RAG-сообщества. Ключевые плюсы:
- Единый мультиформат: PDF, DOCX, PPTX, HTML, изображения — один API
- Структурированный экспорт: Markdown, JSON (bbox, метки, структура таблиц)
- Таблицы и порядок чтения: модель TableFormer, сложные таблицы лучше наивного OCR
- Интеграции: официальные примеры для LangChain, LlamaIndex, Haystack
- Локально / air-gapped: финансы, медицина — данные не покидают периметр
Минусы: китайская вёрстка и математика уступают MinerU; первый запуск тянет веса моделей (несколько ГБ).
Кому подходит
Командам iOS/Flutter, заливающим англоязычную техдоку, API Reference и дизайн-гайды во внутреннюю базу; инженерам, которым нужен JSON для тонкой нарезки chunks.
5. #2 MinerU — король китайских статей и формул
MinerU (ранее Magic-PDF) из экосистемы OpenDataLab / Shanghai AI Lab — эталон для китайской академической среды:
- Формулы: вывод LaTeX — вопросы «что означает формула (3)» не теряют контекст
- Двухколоночная вёрстка: журналы и диссертации — высокая точность порядка чтения
- Полный OCR-пайплайн: сканы и ксерокопии без предобработки
- Извлечение рисунков: картинки и caption раздельно — удобно для мультимодального RAG
Минусы: PyTorch, GPU заметно ускоряет; на англоязычных коммерческих мануалах иногда мешают колонтитулы; MinerU 2.x с множеством опций — порог входа выше.
6. #3 Marker — пакетная конвертация длинных английских текстов в MD
Marker от Vik Paruchuri — чёткая цель: быстро получить чистый Markdown из PDF.
- Скорость: книги, статьи, техотчёты — эффективный пакетный режим
- Качество Markdown: заголовки, списки, code blocks сохраняются хорошо
- Расширяемость: опциональная LLM-постобработка переносов и дефисов
- Чисто локально: без API Key, подходит для offline
Минусы: сложные китайские таблицы и формулы слабее MinerU; журнальная вёрстка иногда требует ручной вычитки; быстрые major-релизы — фиксируйте зависимости.
7. #4 LlamaParse — managed API из коробки
LlamaParse — облачный сервис парсинга от LlamaIndex:
- Нулевой ops: загрузили PDF — получили Markdown/JSON, стык с
VectorStoreIndexбез клея - Сложная вёрстка: многоколоночность, вложенные таблицы, подписи к рисункам
- Мультимодальные опции: описания графиков для multimodal RAG
- Постраничная оплата: прототип без покупки GPU
Минусы: данные уходят в облако, постоянные расходы, vendor lock-in; на больших объёмах цена за страницу ощутима; offline и строгий compliance — не вариант.
8. Матрица сравнения по четырём измерениям
| Измерение | Docling | MinerU | Marker | LlamaParse |
|---|---|---|---|---|
| Open source / локально | ✅ MIT | ✅ Apache 2.0 | ✅ GPL | ❌ Облако |
| Китайские статьи | Хорошо | Отлично | Средне | Хорошо |
| Англоязычные мануалы | Отлично | Хорошо | Отлично | Отлично |
| Восстановление таблиц | Отлично | Хорошо | Хорошо | Отлично |
| Формулы LaTeX | Хорошо | Отлично | Средне | Хорошо |
| OCR сканов | Хорошо | Отлично | Зависит от конфига | Отлично |
| Стоимость пакетов | Низкая (compute) | Низкая (compute) | Низкая (compute) | Накопительная за страницу |
| Интеграция RAG | LangChain/LlamaIndex | Community adapters | Свой pipeline | Нативный LlamaIndex |
9. Практика: быстрый старт четырёх инструментов
Команды проверены по логике на macOS / Cloud Mac (рекомендуется Python 3.10+).
Docling CLI
pip install docling
docling my-manual.pdf --to md --output ./out/
Через Python SDK можно получить JSON с bbox — удобно резать chunks по заголовкам:
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("api-spec.pdf")
print(result.document.export_to_markdown())
MinerU
pip install mineru
mineru -p thesis.pdf -o ./output
В выходной папке обычно markdown, images и промежуточный JSON. Для статей включайте детекцию формул и таблиц (см. README 2.x).
Marker
pip install marker-pdf
marker_single book.pdf ./output --batch_multiplier 2
Пакетно: marker /path/to/pdfs /path/to/output. На M-серии сначала снизьте --max_pages для выборочной проверки вёрстки.
API LlamaParse
pip install llama-parse
export LLAMA_CLOUD_API_KEY="llx-..."
from llama_parse import LlamaParse
parser = LlamaParse(result_type="markdown")
docs = parser.load_data("complex-report.pdf")
С LlamaIndex: VectorStoreIndex.from_documents(docs) — демо за полдня.
10. Сценарии Cloud Mac / Apple Silicon
Парсинг PDF — нагрузка на CPU/GPU и диск; при параллельной сборке Xcode на ноутбуке это особенно заметно. Типичное разделение:
- Локальный MacBook: отладка pipeline, одиночные файлы, вызовы LlamaParse API (почти без локального compute)
- Cloud Mac mini (M4): ночной пакет MinerU/Marker на сотнях страниц
- Linux с GPU: массовый OCR MinerU вне macOS — лучшая цена/скорость
На Apple Silicon:
- Docling / Marker: M4 CPU хватает для большинства англоязычных PDF;
brew install popplerдля зависимостей - MinerU: MPS ускоряет часть моделей; RAM 16 ГБ+, длинные статьи — батчами
- Хранилище: вывод с кучей PNG-срезов — облачный диск или SSD узла, не системный том
Рекомендуемый workflow
Локально пишете App в Xcode → по SSH на Cloud Mac cron обрабатывает новые PDF → Markdown синхронизируется в векторное хранилище (Qdrant / pgvector) → RAG в приложении только через API. Парсинг и сборка физически разделены — без взаимных тормозов.
11. Стоимость, производительность и риски
Оценка стоимости (библиотека ~1000 страниц)
| Схема | Разовые / месячные | На ~1000 страниц |
|---|---|---|
| Docling / Marker локально | $0 лицензия + электричество | M4 Cloud Mac 2–4 ч, узел ~несколько долларов |
| MinerU + GPU | $0 лицензия + аренда GPU | При плотных формулах GPU экономит 50%+ времени |
| LlamaParse | ~$0.003–0.01 за страницу | 1000 стр. ~$3–10, крупные объёмы — Enterprise |
Производительность
- Узкие места: детекция вёрстки > OCR > чистое извлечение текста; сканы самые медленные
- Параллелизм: Marker/Docling — мультипроцесс; параллельте файлы, не потоки внутри одного PDF
- Кэш: сохраняйте результат на диск — не гоняйте один PDF повторно
Риски и ограничения
- Нет серебряной пули: журнальная вёрстка — ручная выборочная проверка 5–10% страниц
- Дрейф версий: обновление open-source моделей меняет вывод — регрессия chunk-стратегии
- Авторское право и приватность: загрузка в LlamaParse = данные вне периметра
- Галлюцинации «снизу»: ошибка парсинга → уверенный ложный RAG — храните номера страниц и bbox
FAQ
Какой PDF Parser лучший в 2026 году?
По open source, вёрстке и интеграции — Docling на первом месте; китайские статьи — MinerU; длинные английские тексты пакетом — Marker; прототип без ops — LlamaParse.
Как выбрать между Docling и MinerU?
Docling — корпоративный мультиформат и англоязычная техдокументация; MinerU — китайская академия, формулы и сканы. Оба — локально, данные on-prem.
Стоит ли платить за LlamaParse?
Да для быстрой проверки RAG, сложной вёрстки и команды без GPU-ops. На больших объёмах или при жёстком compliance — self-hosted.
Работает ли на Apple Silicon?
Да. Docling/Marker на CPU; MinerU — M4 + 16 ГБ RAM или пакеты на Cloud Mac.
Частые причины сбоя парсинга в RAG?
Сканы без OCR, перемешанный многоколоночный порядок, таблицы в plain text. Смотрите layout + структуру таблиц, не только «процент извлечённых символов».
Итоги
Логика выбора PDF Parser в 2026 проста: контроль — open source, скорость — Marker, китайские статьи — MinerU, простота — LlamaParse, корпоративный баланс — Docling. Универсального чемпиона нет — есть соответствие типу документов, compliance и объёму инженерии.
Три шага для старта:
- A/B на 10 репрезентативных страницах (таблица, формула, скан — по одному типу)
- Проверьте иерархию Markdown и пригодность таблиц — затем фиксируйте chunk-стратегию
- Пакетный парсинг — на Cloud Mac, локально оставьте написание кода
Цепочку Agent и RAG см. в рейтинге AI-инструментов программирования 2026; видеопайплайн — в воркфлоу Video-use AI.
Тысяча страниц PDF — не на вашем Mac: пакетный парсинг на Cloud Mac
Пакетные задачи MinerU, Marker и Docling — на выделенный Mac mini M4. Ночной cron, утром обновлённая векторная база — локальные сборки Xcode остаются плавными.
Читать также
- Лучшие AI-инструменты для программирования в 2026: Claude, Cursor, GitHub Copilot, Codex, Gemini
- Руководство по Video-use: полный AI-воркфлоу видео от сценария до готового ролика
- Триада архитектуры персонального AI Agent
- Open-source терминальные инструменты для удалённой разработки на Mac
Функции и цены — по актуальным репозиториям GitHub и документации LlamaIndex. Обновлено: 5 августа 2026.