Vuncloud 블로그
← 개발 노트로 돌아가기

2026년 최고의 PDF Parser 순위: Docling, MinerU, LlamaParse, Marker 비교

4강 순위 · 레이아웃 복원 · 표/수식 · RAG 연동 · 로컬 vs 클라우드 · Cloud Mac 실측약 13분 읽기

Mac 노트북에서 PDF 문서와 AI 파싱 파이프라인을 처리하는 개발자 — Docling MinerU RAG 시나리오

2026년에는 거의 모든 AI 앱이 PDF를 소비합니다. 제품 매뉴얼을 지식 베이스에 넣고, 논문으로 RAG를 만들고, 계약서로 규정 검색을 하고, Flutter/iOS 문서를 자동 요약합니다. 하지만 pdftotext로 뽑은 결과는 흔히 순서가 뒤섞인 조각입니다 — 2단이 1단으로, 표가 깨진 문자로, 수식이 「□□□」로 바뀝니다.

Docling, MinerU, LlamaParse, Marker는 개발자 커뮤니티에서 가장 많이 논의되는 PDF Parser 네 가지입니다. 단순한 「PDF → TXT」가 아니라 레이아웃 분석, 표 구조화, OCR, Markdown보내기를 포함한 전체 파이프라인이며, RAG chunk 품질의 상한을 직접 결정합니다.

이 글은 실제 RAG 엔지니어링 경험을 바탕으로 2026년 순위와 선정 매트릭스를 정리하고, Apple Silicon / Cloud Mac 배포 포인트를 덧붙입니다.

#1 Docling
오픈소스·기업 문서 종합 1위
4강
Docling · MinerU · Marker · LlamaParse
3가지 배포
로컬 오픈소스 · 클라우드 API · Cloud Mac 일괄 처리

1. 문제 배경: PDF 파싱이 RAG 상한을 결정하는 이유

벡터 검색이 아무리 뛰어나도 엉망인 chunk를 넣으면 구할 수 없습니다. 흔한 실패 시나리오:

  • 2단 논문: 왼쪽 단 끝 문장과 오른쪽 단 첫 문장이 한 문단으로 합쳐져 의미가 완전히 끊깁니다
  • 중첩 표: 재무 보고서가 「2024 매출 성장 15% 아시아 32%」 같은 단어 나열로 변합니다
  • 스캔 계약서: OCR 계층이 없으면 검색 결과가 비어 있습니다
  • 차트 주석: 그림 설명과 본문이 분리되어 Agent가 엉뚱한 출처를 인용합니다

2026년 PDF Parser 경쟁의 초점은 「글자를 뽑을 수 있는가」에서 구조화 출력 품질로 옮겨갔습니다. Markdown이 제목 계층을 유지하는지, 표를 HTML/CSV로 복원할 수 있는지, 수식을 LaTeX로 낼 수 있는지, 다단 읽기 순서가 맞는지가 핵심입니다.

선정 전 세 가지 질문

  • 문서가 주로 영어 기술 매뉴얼인가, 중국어 논문/리포트인가?
  • 데이터가 외부로 나갈 수 있는가(로컬 vs LlamaParse 클라우드)?
  • 일일 처리량이 수십 페이지 프로토타입인가 만 페이지 일괄 처리인가?

2. 핵심 개념: 평가 차원과 파이프라인 구조

5가지 평가 차원

  1. 레이아웃 복원(Layout): 다단, 머리글/바닥글, 떠 있는 그림 주석의 읽기 순서
  2. 표 구조화(Tables): 복잡한 병합 셀, 페이지를 넘는 표
  3. 수식·차트(STEM): LaTeX/MathML 출력, 그림 주석 연결
  4. OCR 능력: 스캔본, 사진 PDF, 저품질 복사본
  5. 엔지니어링 연동: CLI, Python SDK, Docker, LangChain/LlamaIndex 연결 비용

일반적인 파싱 파이프라인

네 도구의 구현은 다르지만 논리적으로는 대부분 다음을 따릅니다:

PDF 입력 → 레이아웃 검출 → 영역 분류(본문/표/그림/수식)
        → 영역별 OCR / 텍스트 추출 → 읽기 순서 정렬
        → 구조화 조립 → Markdown / JSON / HTML 출력

차이점: Docling은 기업용 다중 포맷 통합, MinerU는 중국어 학술+수식, Marker는 영어 장문 고속 MD 변환, LlamaParse는 관리형 API + LlamaIndex 원클릭 연동에 치중합니다.

책상 위 서류와 노트북 — PDF 문서 파싱과 RAG 지식 베이스 적재 시나리오
PDF Parser 출력 품질이 RAG chunk의 검색·인용 정확도를 직접 결정합니다

3. 2026년 종합 순위

순위 도구 유형 최적 용도
#1 Docling 오픈소스 · IBM 기업 문서, 다중 포맷, 구조화 JSON, 규정 준수 로컬 배포
#2 MinerU 오픈소스 · OpenDataLab 중국어 논문, 수식 집약, 스캔본 OCR
#3 Marker 오픈소스 영어 서적/장문 Markdown 일괄 변환
#4 LlamaParse 클라우드 API · LlamaIndex 빠른 프로토타입, 복잡 레이아웃, 무운영

순위 논리: 단일 벤치마크 점수만 보지 않습니다. 「내일 RAG를 시작할 때 어떤 스택이 가장 덜 번거롭고, 제어 가능하고, 비용 효율적인가」를 기준으로 합니다. LlamaParse 파싱 품질은 상위권에 들 수 있지만, 폐쇄형·페이지 과금·데이터 외부 반출 때문에 종합 4위 — 특정 시나리오에 맞고 기본값은 아닙니다.

4. #1 Docling — 기업급 오픈소스 1순위

Docling은 IBM Research가 오픈소스로 공개했으며, 2025–2026년 RAG 커뮤니티의 기본 선택지 중 하나로 자리 잡았습니다. 핵심 강점:

  • 다중 포맷 통합: PDF, DOCX, PPTX, HTML, 이미지를 동일 API로 처리
  • 구조화보내기: Markdown, JSON(bbox, 태그, 표 구조 포함)
  • 표·읽기 순서: TableFormer 모델로 복잡 표 복원이 단순 OCR보다 우수
  • 연동 친화: LangChain, LlamaIndex, Haystack 공식 예제
  • 로컬 / air-gapped: 금융·의료 등 데이터 외부 반출 불가 시나리오에 적합

단점: 중국어 레이아웃·수학 수식의 극한 성능은 MinerU보다 떨어집니다. 최초 실행 시 모델 가중치 다운로드(수 GB)가 필요합니다.

적합 대상

iOS/Flutter 팀이 영어 기술 문서, API Reference, 디자인 스펙을 내부 지식 베이스에 넣을 때; JSON 구조화 출력으로 세밀한 chunk가 필요한 엔지니어.

5. #2 MinerU — 중국어 논문·수식 강자

MinerU(이전 Magic-PDF)는 OpenDataLab / Shanghai AI Lab 생태계에서 나왔으며 중국어 학술 시나리오에서 평판이 매우 높습니다:

  • 수식 인식: LaTeX 출력, RAG에서 「식 (3)의 의미」 질의 시 정보 손실이 적음
  • 2단/혼합 레이아웃: 중국어 저널·학위 논문 읽기 순서 정확도 높음
  • 완전 OCR 파이프라인: 스캔 PDF, 복사본 직접 처리
  • 차트 추출: 이미지와 caption 분리 저장, 멀티모달 RAG에 유리

단점: PyTorch 의존, GPU 가속 체감이 CPU보다 뚜렷함. 영어 비즈니스 매뉴얼에서 머리글 간혹 방해. MinerU 2.x 모델 크기·설정 항목이 초보에게는 가파름.

6. #3 Marker — 영어 장문 Markdown 일괄 변환

Marker는 Vik Paruchuri가 유지하며, 목표가 명확합니다: PDF를 빠르게 깨끗한 Markdown으로.

  • 속도: 서적, 논문, 기술 보고서에 최적화, 일괄 변환 효율 높음
  • Markdown 품질: 제목 계층, 목록, 코드 블록 보존 우수
  • 확장성: 선택적 LLM 후처리로 줄바꿈·하이픈 정리
  • 순수 로컬: API Key 불필요, 오프라인 환경 적합

단점: 복잡한 중국어 표·수식은 MinerU보다 약함. 초복잡 레이아웃(잡지식)은 수동 검수 필요. 프로젝트 변화가 빠르므로 메이저 업그레이드 시 의존성 lock 권장.

7. #4 LlamaParse — 관리형 API 즉시 사용

LlamaParse는 LlamaIndex의 클라우드 PDF 파싱 서비스입니다:

  • 무운영: PDF 업로드 → Markdown/JSON 반환, LlamaIndex VectorStoreIndex와 매끄럽게 연결
  • 복잡 레이아웃: 다단, 중첩 표, 차트 주석 처리가 안정적
  • 멀티모달 옵션: 차트 설명 생성으로 멀티모달 RAG 가능
  • 페이지 과금: 아이디어 검증에 적합, GPU를 먼저 사지 않아도 됨

단점: 데이터 외부 반출, 지속 비용, 벤더 종속. 대량 처리 시 페이지 단가 누적. 오프라인/규정 시나리오 불가.

8. 4차원 비교 매트릭스

차원 Docling MinerU Marker LlamaParse
오픈소스/로컬 ✅ MIT ✅ Apache 2.0 ✅ GPL ❌ 클라우드
중국어 논문 양호 우수 보통 양호
영어 매뉴얼 우수 양호 우수 우수
표 복원 우수 양호 양호 우수
수식 LaTeX 양호 우수 보통 양호
스캔본 OCR 양호 우수 설정 의존 우수
일괄 비용 낮음(연산) 낮음(연산) 낮음(연산) 페이지 누적
RAG 연동 LangChain/LlamaIndex 커뮤니티 어댑터 자체 pipeline 네이티브 LlamaIndex

9. 실습: 네 도구 빠른 시작

아래 명령은 macOS / Cloud Mac 터미널에서 검증한 흐름입니다(Python 3.10+ 권장).

Docling CLI

pip install docling
docling my-manual.pdf --to md --output ./out/

Python SDK로 bbox 포함 JSON을 받아 제목 계층으로 chunk 분할:

from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("api-spec.pdf")
print(result.document.export_to_markdown())

MinerU

pip install mineru
mineru -p thesis.pdf -o ./output

출력 디렉터리에 보통 markdown, images, 중간 JSON이 포함됩니다. 논문 시나리오는 수식·표 검출 옵션을 켜세요(공식 README 2.x 설정 참고).

Marker

pip install marker-pdf
marker_single book.pdf ./output --batch_multiplier 2

일괄 변환: marker /path/to/pdfs /path/to/output. M 시리즈 Mac에서는 --max_pages로 먼저 샘플 검증을 권장합니다.

LlamaParse API

pip install llama-parse
export LLAMA_CLOUD_API_KEY="llx-..."

from llama_parse import LlamaParse
parser = LlamaParse(result_type="markdown")
docs = parser.load_data("complex-report.pdf")

LlamaIndex 연동: 파싱 결과를 VectorStoreIndex.from_documents(docs)에 직접 넣어 반나절 안 Demo 가능.

10. Cloud Mac / Apple Silicon 시나리오

PDF 파싱은 CPU/GPU 집약 + 디스크 I/O 작업이라 Xcode 빌드와 로컬 리소스를 두고 경쟁할 때 특히 불편합니다. 일반적인 분업:

  • 로컬 MacBook: pipeline 디버깅, 단일 파일 검증, LlamaParse API 호출(로컬 연산 거의 없음)
  • Cloud Mac mini(M4): 야간 MinerU/Marker 일괄 처리, 수백 페이지 문서 적재
  • GPU Linux 클라우드: MinerU 대규모 OCR 비용 효율 옵션(macOS 외 시나리오)

Apple Silicon에서:

  • Docling / Marker: M4 CPU로 대부분의 영어 기술 PDF 처리 가능; brew install poppler로 의존성 보완 권장
  • MinerU: MPS 백엔드로 일부 모델 가속; 메모리 16GB+ 권장, 초장문 논문은 분할 처리
  • 스토리지: 파싱 출력에 PNG 조각이 많음 — 클라우드 드라이브 또는 노드 로컬 SSD 마운트, 시스템 디스크 가득 차지 않게

권장 워크플로

로컬에서 Xcode로 앱 개발 → SSH로 Cloud Mac에 접속해 cron으로 새 PDF 일괄 처리 → 구조화 Markdown을 벡터 DB(Qdrant / pgvector)에 동기화 → 앱 내 RAG는 API만 호출. 파싱과 빌드를 물리적으로 분리하여 서로 끊지 않습니다.

11. 비용, 성능, 리스크

비용 추정(천 페이지 문서 라이브러리)

방안 일회/월 비용 천 페이지 규모 설명
Docling / Marker 로컬 $0 라이선스 + 전기 M4 Cloud Mac 2–4시간 처리, 노드 비용 수 달러 수준
MinerU + GPU $0 라이선스 + GPU 시세 수식 집약 시 GPU로 50%+ 시간 절감
LlamaParse 페이지당 ~$0.003–0.01 천 페이지 약 $3–10, 대량은 Enterprise 협상

성능 포인트

  • 병목: 레이아웃 검출 > OCR > 순수 텍스트 추출; 스캔본이 가장 느림
  • 병렬: Marker/Docling 멀티프로세스 지원; 단일 파일 멀티스레드보다 파일 단위 병렬
  • 캐시: 파싱 결과를 디스크에 저장·재사용, 동일 PDF 반복 실행 방지

리스크와 한계

  • 만능은 없음: 잡지급 복잡 레이아웃은 5–10% 페이지 수동 검수 필요
  • 버전 드리프트: 오픈소스 모델 업데이트 후 출력 형식 변동, chunk 전략 회귀 테스트 필요
  • 저작권·프라이버시: LlamaParse 업로드 = 데이터 외부 반출; 기업 계약상 금지 시 로컬만 가능
  • 환각 전단: 파싱 오류는 RAG 「그럴듯한 헛소리」의 원인 — 페이지 번호·bbox 출처 보존 필수

FAQ

2026년 최고의 PDF Parser는?

오픈소스·레이아웃·연동을 종합하면 Docling 1위; 중국어 논문은 MinerU; 영어 장문 일괄은 Marker; 무운영 프로토타입은 LlamaParse.

Docling과 MinerU 선택?

Docling은 기업 다중 포맷·영어 기술 문서; MinerU는 중국어 학술·수식·스캔본. 둘 모두 로컬 배포로 데이터 외부 반출 없음.

LlamaParse 유료 가치?

RAG 빠른 검증, 복잡 레이아웃, GPU 무운영 팀에 가치 있음. 대량·규정 시나리오는 자체 구축.

Apple Silicon에서 실행?

가능. Docling/Marker는 CPU만으로; MinerU는 M4 + 16GB 또는 Cloud Mac 일괄 처리 권장.

RAG에서 PDF 파싱 실패 흔한 원인?

스캔본 OCR 누락, 다단 순서 오류, 표가 순수 텍스트로 뭉개짐. 선정 시 layout + 표 구조화를 보며, 글자 추출률만 보지 마세요.

요약

2026년 PDF Parser 선정 논리는 명확합니다: 제어가 필요하면 오픈소스, 속도는 Marker, 중국어 논문은 MinerU, 편의는 LlamaParse, 기업 균형은 Docling. 만능 챔피언은 없고, 문서 유형·규정·공학량에 맞는 조합만 있습니다.

시작 3단계:

  1. 대표 PDF 10페이지 A/B(표·수식·스캔 각 1종)
  2. Markdown 제목 계층·표 가용성 확인 후 chunk 전략 확정
  3. 일괄 파싱은 Cloud Mac, 로컬은 코드 작성에 집중

Agent·RAG 툴체인은 2026 AI 코딩 도구 순위를, 영상 소재 파이프라인은 Video-use AI 비디오 워크플로를 참고하세요.

천 페이지 PDF, 로컬을 꽉 채우지 마세요: Cloud Mac으로 일괄 파싱

MinerU, Marker, Docling 일괄 작업은 전용 M4 Mac mini에 넘기세요. 야간 cron이 끝나면 아침에 벡터 DB가 갱신되고, 로컬 Xcode 빌드는 멈추지 않습니다.

Cloud Mac 요금제 보기 · Docling GitHub

기능·요금은 각 프로젝트 GitHub 및 LlamaIndex 공식 사이트를 따릅니다. 최종 업데이트: 2026년 8월 6일.

개발 노트 · RAG

PDF Parser 선정: Docling · MinerU · Marker · LlamaParse

레이아웃 복원 · 표·수식 · RAG 연동 · Cloud Mac 일괄 처리

Cloud Mac 요금제 보기
한정 특가 요금제 보기