2026년에는 거의 모든 AI 앱이 PDF를 소비합니다. 제품 매뉴얼을 지식 베이스에 넣고, 논문으로 RAG를 만들고, 계약서로 규정 검색을 하고, Flutter/iOS 문서를 자동 요약합니다. 하지만 pdftotext로 뽑은 결과는 흔히 순서가 뒤섞인 조각입니다 — 2단이 1단으로, 표가 깨진 문자로, 수식이 「□□□」로 바뀝니다.
Docling, MinerU, LlamaParse, Marker는 개발자 커뮤니티에서 가장 많이 논의되는 PDF Parser 네 가지입니다. 단순한 「PDF → TXT」가 아니라 레이아웃 분석, 표 구조화, OCR, Markdown보내기를 포함한 전체 파이프라인이며, RAG chunk 품질의 상한을 직접 결정합니다.
이 글은 실제 RAG 엔지니어링 경험을 바탕으로 2026년 순위와 선정 매트릭스를 정리하고, Apple Silicon / Cloud Mac 배포 포인트를 덧붙입니다.
1. 문제 배경: PDF 파싱이 RAG 상한을 결정하는 이유
벡터 검색이 아무리 뛰어나도 엉망인 chunk를 넣으면 구할 수 없습니다. 흔한 실패 시나리오:
- 2단 논문: 왼쪽 단 끝 문장과 오른쪽 단 첫 문장이 한 문단으로 합쳐져 의미가 완전히 끊깁니다
- 중첩 표: 재무 보고서가 「2024 매출 성장 15% 아시아 32%」 같은 단어 나열로 변합니다
- 스캔 계약서: OCR 계층이 없으면 검색 결과가 비어 있습니다
- 차트 주석: 그림 설명과 본문이 분리되어 Agent가 엉뚱한 출처를 인용합니다
2026년 PDF Parser 경쟁의 초점은 「글자를 뽑을 수 있는가」에서 구조화 출력 품질로 옮겨갔습니다. Markdown이 제목 계층을 유지하는지, 표를 HTML/CSV로 복원할 수 있는지, 수식을 LaTeX로 낼 수 있는지, 다단 읽기 순서가 맞는지가 핵심입니다.
선정 전 세 가지 질문
- 문서가 주로 영어 기술 매뉴얼인가, 중국어 논문/리포트인가?
- 데이터가 외부로 나갈 수 있는가(로컬 vs LlamaParse 클라우드)?
- 일일 처리량이 수십 페이지 프로토타입인가 만 페이지 일괄 처리인가?
2. 핵심 개념: 평가 차원과 파이프라인 구조
5가지 평가 차원
- 레이아웃 복원(Layout): 다단, 머리글/바닥글, 떠 있는 그림 주석의 읽기 순서
- 표 구조화(Tables): 복잡한 병합 셀, 페이지를 넘는 표
- 수식·차트(STEM): LaTeX/MathML 출력, 그림 주석 연결
- OCR 능력: 스캔본, 사진 PDF, 저품질 복사본
- 엔지니어링 연동: CLI, Python SDK, Docker, LangChain/LlamaIndex 연결 비용
일반적인 파싱 파이프라인
네 도구의 구현은 다르지만 논리적으로는 대부분 다음을 따릅니다:
PDF 입력 → 레이아웃 검출 → 영역 분류(본문/표/그림/수식)
→ 영역별 OCR / 텍스트 추출 → 읽기 순서 정렬
→ 구조화 조립 → Markdown / JSON / HTML 출력
차이점: Docling은 기업용 다중 포맷 통합, MinerU는 중국어 학술+수식, Marker는 영어 장문 고속 MD 변환, LlamaParse는 관리형 API + LlamaIndex 원클릭 연동에 치중합니다.
3. 2026년 종합 순위
| 순위 | 도구 | 유형 | 최적 용도 |
|---|---|---|---|
| #1 | Docling | 오픈소스 · IBM | 기업 문서, 다중 포맷, 구조화 JSON, 규정 준수 로컬 배포 |
| #2 | MinerU | 오픈소스 · OpenDataLab | 중국어 논문, 수식 집약, 스캔본 OCR |
| #3 | Marker | 오픈소스 | 영어 서적/장문 Markdown 일괄 변환 |
| #4 | LlamaParse | 클라우드 API · LlamaIndex | 빠른 프로토타입, 복잡 레이아웃, 무운영 |
순위 논리: 단일 벤치마크 점수만 보지 않습니다. 「내일 RAG를 시작할 때 어떤 스택이 가장 덜 번거롭고, 제어 가능하고, 비용 효율적인가」를 기준으로 합니다. LlamaParse 파싱 품질은 상위권에 들 수 있지만, 폐쇄형·페이지 과금·데이터 외부 반출 때문에 종합 4위 — 특정 시나리오에 맞고 기본값은 아닙니다.
4. #1 Docling — 기업급 오픈소스 1순위
Docling은 IBM Research가 오픈소스로 공개했으며, 2025–2026년 RAG 커뮤니티의 기본 선택지 중 하나로 자리 잡았습니다. 핵심 강점:
- 다중 포맷 통합: PDF, DOCX, PPTX, HTML, 이미지를 동일 API로 처리
- 구조화보내기: Markdown, JSON(bbox, 태그, 표 구조 포함)
- 표·읽기 순서: TableFormer 모델로 복잡 표 복원이 단순 OCR보다 우수
- 연동 친화: LangChain, LlamaIndex, Haystack 공식 예제
- 로컬 / air-gapped: 금융·의료 등 데이터 외부 반출 불가 시나리오에 적합
단점: 중국어 레이아웃·수학 수식의 극한 성능은 MinerU보다 떨어집니다. 최초 실행 시 모델 가중치 다운로드(수 GB)가 필요합니다.
적합 대상
iOS/Flutter 팀이 영어 기술 문서, API Reference, 디자인 스펙을 내부 지식 베이스에 넣을 때; JSON 구조화 출력으로 세밀한 chunk가 필요한 엔지니어.
5. #2 MinerU — 중국어 논문·수식 강자
MinerU(이전 Magic-PDF)는 OpenDataLab / Shanghai AI Lab 생태계에서 나왔으며 중국어 학술 시나리오에서 평판이 매우 높습니다:
- 수식 인식: LaTeX 출력, RAG에서 「식 (3)의 의미」 질의 시 정보 손실이 적음
- 2단/혼합 레이아웃: 중국어 저널·학위 논문 읽기 순서 정확도 높음
- 완전 OCR 파이프라인: 스캔 PDF, 복사본 직접 처리
- 차트 추출: 이미지와 caption 분리 저장, 멀티모달 RAG에 유리
단점: PyTorch 의존, GPU 가속 체감이 CPU보다 뚜렷함. 영어 비즈니스 매뉴얼에서 머리글 간혹 방해. MinerU 2.x 모델 크기·설정 항목이 초보에게는 가파름.
6. #3 Marker — 영어 장문 Markdown 일괄 변환
Marker는 Vik Paruchuri가 유지하며, 목표가 명확합니다: PDF를 빠르게 깨끗한 Markdown으로.
- 속도: 서적, 논문, 기술 보고서에 최적화, 일괄 변환 효율 높음
- Markdown 품질: 제목 계층, 목록, 코드 블록 보존 우수
- 확장성: 선택적 LLM 후처리로 줄바꿈·하이픈 정리
- 순수 로컬: API Key 불필요, 오프라인 환경 적합
단점: 복잡한 중국어 표·수식은 MinerU보다 약함. 초복잡 레이아웃(잡지식)은 수동 검수 필요. 프로젝트 변화가 빠르므로 메이저 업그레이드 시 의존성 lock 권장.
7. #4 LlamaParse — 관리형 API 즉시 사용
LlamaParse는 LlamaIndex의 클라우드 PDF 파싱 서비스입니다:
- 무운영: PDF 업로드 → Markdown/JSON 반환, LlamaIndex
VectorStoreIndex와 매끄럽게 연결 - 복잡 레이아웃: 다단, 중첩 표, 차트 주석 처리가 안정적
- 멀티모달 옵션: 차트 설명 생성으로 멀티모달 RAG 가능
- 페이지 과금: 아이디어 검증에 적합, GPU를 먼저 사지 않아도 됨
단점: 데이터 외부 반출, 지속 비용, 벤더 종속. 대량 처리 시 페이지 단가 누적. 오프라인/규정 시나리오 불가.
8. 4차원 비교 매트릭스
| 차원 | Docling | MinerU | Marker | LlamaParse |
|---|---|---|---|---|
| 오픈소스/로컬 | ✅ MIT | ✅ Apache 2.0 | ✅ GPL | ❌ 클라우드 |
| 중국어 논문 | 양호 | 우수 | 보통 | 양호 |
| 영어 매뉴얼 | 우수 | 양호 | 우수 | 우수 |
| 표 복원 | 우수 | 양호 | 양호 | 우수 |
| 수식 LaTeX | 양호 | 우수 | 보통 | 양호 |
| 스캔본 OCR | 양호 | 우수 | 설정 의존 | 우수 |
| 일괄 비용 | 낮음(연산) | 낮음(연산) | 낮음(연산) | 페이지 누적 |
| RAG 연동 | LangChain/LlamaIndex | 커뮤니티 어댑터 | 자체 pipeline | 네이티브 LlamaIndex |
9. 실습: 네 도구 빠른 시작
아래 명령은 macOS / Cloud Mac 터미널에서 검증한 흐름입니다(Python 3.10+ 권장).
Docling CLI
pip install docling
docling my-manual.pdf --to md --output ./out/
Python SDK로 bbox 포함 JSON을 받아 제목 계층으로 chunk 분할:
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("api-spec.pdf")
print(result.document.export_to_markdown())
MinerU
pip install mineru
mineru -p thesis.pdf -o ./output
출력 디렉터리에 보통 markdown, images, 중간 JSON이 포함됩니다. 논문 시나리오는 수식·표 검출 옵션을 켜세요(공식 README 2.x 설정 참고).
Marker
pip install marker-pdf
marker_single book.pdf ./output --batch_multiplier 2
일괄 변환: marker /path/to/pdfs /path/to/output. M 시리즈 Mac에서는 --max_pages로 먼저 샘플 검증을 권장합니다.
LlamaParse API
pip install llama-parse
export LLAMA_CLOUD_API_KEY="llx-..."
from llama_parse import LlamaParse
parser = LlamaParse(result_type="markdown")
docs = parser.load_data("complex-report.pdf")
LlamaIndex 연동: 파싱 결과를 VectorStoreIndex.from_documents(docs)에 직접 넣어 반나절 안 Demo 가능.
10. Cloud Mac / Apple Silicon 시나리오
PDF 파싱은 CPU/GPU 집약 + 디스크 I/O 작업이라 Xcode 빌드와 로컬 리소스를 두고 경쟁할 때 특히 불편합니다. 일반적인 분업:
- 로컬 MacBook: pipeline 디버깅, 단일 파일 검증, LlamaParse API 호출(로컬 연산 거의 없음)
- Cloud Mac mini(M4): 야간 MinerU/Marker 일괄 처리, 수백 페이지 문서 적재
- GPU Linux 클라우드: MinerU 대규모 OCR 비용 효율 옵션(macOS 외 시나리오)
Apple Silicon에서:
- Docling / Marker: M4 CPU로 대부분의 영어 기술 PDF 처리 가능;
brew install poppler로 의존성 보완 권장 - MinerU: MPS 백엔드로 일부 모델 가속; 메모리 16GB+ 권장, 초장문 논문은 분할 처리
- 스토리지: 파싱 출력에 PNG 조각이 많음 — 클라우드 드라이브 또는 노드 로컬 SSD 마운트, 시스템 디스크 가득 차지 않게
권장 워크플로
로컬에서 Xcode로 앱 개발 → SSH로 Cloud Mac에 접속해 cron으로 새 PDF 일괄 처리 → 구조화 Markdown을 벡터 DB(Qdrant / pgvector)에 동기화 → 앱 내 RAG는 API만 호출. 파싱과 빌드를 물리적으로 분리하여 서로 끊지 않습니다.
11. 비용, 성능, 리스크
비용 추정(천 페이지 문서 라이브러리)
| 방안 | 일회/월 비용 | 천 페이지 규모 설명 |
|---|---|---|
| Docling / Marker 로컬 | $0 라이선스 + 전기 | M4 Cloud Mac 2–4시간 처리, 노드 비용 수 달러 수준 |
| MinerU + GPU | $0 라이선스 + GPU 시세 | 수식 집약 시 GPU로 50%+ 시간 절감 |
| LlamaParse | 페이지당 ~$0.003–0.01 | 천 페이지 약 $3–10, 대량은 Enterprise 협상 |
성능 포인트
- 병목: 레이아웃 검출 > OCR > 순수 텍스트 추출; 스캔본이 가장 느림
- 병렬: Marker/Docling 멀티프로세스 지원; 단일 파일 멀티스레드보다 파일 단위 병렬
- 캐시: 파싱 결과를 디스크에 저장·재사용, 동일 PDF 반복 실행 방지
리스크와 한계
- 만능은 없음: 잡지급 복잡 레이아웃은 5–10% 페이지 수동 검수 필요
- 버전 드리프트: 오픈소스 모델 업데이트 후 출력 형식 변동, chunk 전략 회귀 테스트 필요
- 저작권·프라이버시: LlamaParse 업로드 = 데이터 외부 반출; 기업 계약상 금지 시 로컬만 가능
- 환각 전단: 파싱 오류는 RAG 「그럴듯한 헛소리」의 원인 — 페이지 번호·bbox 출처 보존 필수
FAQ
2026년 최고의 PDF Parser는?
오픈소스·레이아웃·연동을 종합하면 Docling 1위; 중국어 논문은 MinerU; 영어 장문 일괄은 Marker; 무운영 프로토타입은 LlamaParse.
Docling과 MinerU 선택?
Docling은 기업 다중 포맷·영어 기술 문서; MinerU는 중국어 학술·수식·스캔본. 둘 모두 로컬 배포로 데이터 외부 반출 없음.
LlamaParse 유료 가치?
RAG 빠른 검증, 복잡 레이아웃, GPU 무운영 팀에 가치 있음. 대량·규정 시나리오는 자체 구축.
Apple Silicon에서 실행?
가능. Docling/Marker는 CPU만으로; MinerU는 M4 + 16GB 또는 Cloud Mac 일괄 처리 권장.
RAG에서 PDF 파싱 실패 흔한 원인?
스캔본 OCR 누락, 다단 순서 오류, 표가 순수 텍스트로 뭉개짐. 선정 시 layout + 표 구조화를 보며, 글자 추출률만 보지 마세요.
요약
2026년 PDF Parser 선정 논리는 명확합니다: 제어가 필요하면 오픈소스, 속도는 Marker, 중국어 논문은 MinerU, 편의는 LlamaParse, 기업 균형은 Docling. 만능 챔피언은 없고, 문서 유형·규정·공학량에 맞는 조합만 있습니다.
시작 3단계:
- 대표 PDF 10페이지 A/B(표·수식·스캔 각 1종)
- Markdown 제목 계층·표 가용성 확인 후 chunk 전략 확정
- 일괄 파싱은 Cloud Mac, 로컬은 코드 작성에 집중
Agent·RAG 툴체인은 2026 AI 코딩 도구 순위를, 영상 소재 파이프라인은 Video-use AI 비디오 워크플로를 참고하세요.
천 페이지 PDF, 로컬을 꽉 채우지 마세요: Cloud Mac으로 일괄 파싱
MinerU, Marker, Docling 일괄 작업은 전용 M4 Mac mini에 넘기세요. 야간 cron이 끝나면 아침에 벡터 DB가 갱신되고, 로컬 Xcode 빌드는 멈추지 않습니다.
관련 읽기
- 2026년 최고의 AI 코딩 도구 순위: Claude, Cursor, GitHub Copilot, Codex, Gemini
- Video-use 사용 튜토리얼: 스크립트에서 완성 영상까지의 완전한 AI 비디오 워크플로
- 개인 AI Agent 아키텍처 3요소
- 원격 Mac 개발 필수 오픈소스 터미널 도구
기능·요금은 각 프로젝트 GitHub 및 LlamaIndex 공식 사이트를 따릅니다. 최종 업데이트: 2026년 8월 6일.