把一本技術規範書或內部知識庫 PDF 變成 Claude Code 可直接呼叫的 Skill,這件事在 2026 年越來越普遍——但「能跑起來」和「知道花了多少錢、跑得有多快」是兩回事。
這篇是 book-to-skill 完整部署手記:從 PDF 解析到 Skill 打包的每個階段,拆解環境需求、時間消耗與成本結構,附 Cloud Mac M4 實測數據。不是行銷材料,是一張可以帶著去採購/架構審查的清單。
一、book-to-skill 是什麼
book-to-skill 是一種將書籍、技術規範、內部 PDF 文件轉化為 Claude Skills(Claude Code 可呼叫的知識技能套件)的工作流程。它解決的核心場景:
- 技術文件:API 參考、SDK 手冊、協議規範——讓 Claude Code 在編碼時直接查閱,不再需要 RAG 每次重新檢索
- 規範書:國家標準、產業規範、公司合規文件——打包後可作為 Agent 的「規則引擎」隨時呼叫
- 私域知識庫:內部研究報告、產品手冊、培訓教材——形成組織專屬知識層,無需上傳至第三方
book-to-skill vs 一般 RAG
一般 RAG 是「檢索+即時回答」,每次呼叫都要走完整檢索流程。book-to-skill 將知識結構化打包成 Skill,Claude Code 可按需精確呼叫特定章節或條目,更適合結構明確、查閱頻繁的專業知識庫。兩種方式可以並用:粗粒度用 RAG 做初篩,精細引用走 Skill 呼叫。
二、完整管道總覽
完整的 book-to-skill 管道分為五個階段:
PDF 檔案
↓
[階段一] PDF 解析(Docling / MinerU)
→ 結構化 Markdown / JSON(含標題層級、表格、公式)
↓
[階段二] 文字分塊(Chunking)
→ 語意段落塊(300–600 tokens / chunk)
↓
[階段三] Embedding
→ 稠密向量(768 / 1024 / 1536 維)
↓
[階段四] 向量儲存(Qdrant / Chroma / PGVector)
→ 可檢索的向量索引+原文中繼資料
↓
[階段五] Skill 打包
→ CLAUDE.md 工具描述+MCP 工具註冊+檢索邏輯
↓
Claude Code 呼叫
三、階段一:PDF 解析
工具選型:Docling vs MinerU
2026 年主流開源 PDF 解析工具比較:
| 工具 | 優勢場景 | 表格/圖表 | 中文支援 | GPU 加速 | 授權 |
|---|---|---|---|---|---|
| Docling | 學術論文、結構化規範書 | 優秀(DocLayNet) | 良好 | 支援(CUDA) | MIT |
| MinerU | 中文文件、混合排版 | 良好 | 優秀 | 支援(CUDA / MPS) | AGPL-3.0 |
| LlamaParse | 快速原型、雲端託管 | 良好 | 普通 | 雲端(無本地) | 商業 |
| Marker | 純文字密集 PDF | 普通 | 普通 | 支援(CUDA) | GPL-3.0 |
推薦選擇:英文技術文件首選 Docling;中文/混合文件首選 MinerU。兩者都支援輸出結構化 Markdown,適合下游分塊處理。
解析成本估算
| 場景 | 硬體 | 300 頁 PDF 耗時 | 運算成本參考 | 備註 |
|---|---|---|---|---|
| CPU 模式(本地) | M4 Pro / 8 核 x86 | 8–15 分鐘 | 電費可忽略(~$0.01) | 適合中小批量,無需 GPU |
| CPU 模式(雲端伺服器) | 4 vCPU / 8 GB RAM | 10–20 分鐘 | ~$0.05–0.15/本 | 按時計費,批量越大成本越低 |
| GPU 加速(CUDA) | RTX 4090 / A10G | 2–5 分鐘 | ~$0.02–0.05/本 | GPU 時間約 $0.35–0.8/小時 |
| GPU 加速(MPS,M4) | Apple M4 Max | 3–6 分鐘 | 電費約 $0.005/本 | MinerU 支援 MPS;Docling 部分運算回退 CPU |
| 雲端 API(LlamaParse) | 託管 | 1–3 分鐘 | ~$0.003/頁 → ~$0.9/本 | 無需本地環境,但有資料出境疑慮 |
不可忽視的環境相依性
Docling 和 MinerU 都需要較重的 Python 環境(PyTorch、OCR 模型檔案 1–3 GB)。首次安裝約 5–10 分鐘;建議打 Docker 映像固化相依性,避免每台機器重複配置。Python ≥ 3.10,推薦 3.11。
四、階段二:文字分塊
分塊策略直接影響檢索品質和 Embedding 成本:
- 固定大小分塊:最簡單,按 token 數切割(300–500 tokens+50 tokens 重疊)。適合純敘述文件。
- 語意分塊:按標題層級、段落邊界切割。Docling/MinerU 的結構化輸出天然支援,建議優先使用。
- 遞迴字元分塊(LangChain RecursiveCharacterTextSplitter):語意邊界不清晰時的保底方案。
分塊參數建議:
# 推薦配置(中文技術文件)
chunk_size = 400 # tokens,約 200–250 個漢字
chunk_overlap = 60 # 重疊防止語意截斷
min_chunk_size = 80 # 過短的塊(如純標題行)直接捨棄
max_chunk_size = 600 # 防止超長段落單塊過大
分塊本身幾乎不消耗運算資源(CPU 毫秒級),成本可忽略不計。
五、階段三:Embedding
雲端 API 方案
| 服務 | 模型 | 維度 | 價格($/M tokens) | 300 頁書估算(~150K tokens) |
|---|---|---|---|---|
| OpenAI | text-embedding-3-small | 1536 | $0.02 | ~$0.003 |
| OpenAI | text-embedding-3-large | 3072 | $0.13 | ~$0.02 |
| Cohere | embed-v4.0 | 1024 | $0.10 | ~$0.015 |
| Voyage AI | voyage-3 | 1024 | $0.06 | ~$0.009 |
| Jina AI | jina-embeddings-v3 | 1024 | $0.02 | ~$0.003 |
本地模型方案
| 模型 | 維度 | 顯存/記憶體 | M4 速度(tokens/s) | 300 頁書耗時 |
|---|---|---|---|---|
| bge-m3(BAAI) | 1024 | ~2.5 GB | ~3,000 | ~50 秒 |
| nomic-embed-text-v1.5 | 768 | ~0.8 GB | ~6,000 | ~25 秒 |
| mxbai-embed-large-v1 | 1024 | ~1.3 GB | ~4,500 | ~33 秒 |
| text2vec-large-chinese | 1024 | ~1.4 GB | ~4,000 | ~38 秒 |
本地 Embedding 成本 ≈ $0(僅電費,可忽略)。對於內網私域知識庫或資料合規要求高的場景,本地模型是首選。M4 的統一記憶體對這類推理任務非常友好。
六、階段四:向量儲存
| 方案 | 部署方式 | 免費額度 | 付費參考 | 適合場景 |
|---|---|---|---|---|
| Qdrant Cloud | 託管 / 自托管 | 1 GB(約 100 萬向量) | $25/月起(8 GB) | 中大型知識庫,需高效能過濾 |
| Chroma | 本地 / 嵌入 | 無限制(本地) | $0(自托管) | 開發測試、單機小型知識庫 |
| PGVector | PostgreSQL 擴充 | 取決於 PG 執行個體 | 隨 PG 執行個體計費 | 已有 PG 基礎架構的團隊 |
| Weaviate Cloud | 託管 | Sandbox(14 天) | $25/月起 | 需要混合檢索(向量+BM25) |
| 本地 Qdrant | Docker 自托管 | 免費 | $0+伺服器成本 | 離線環境、資料不出境 |
儲存量估算:每個 1024 維向量約 4 KB(float32);一本 300 頁書約 800–1,200 個 chunk,佔用約 3–5 MB 向量儲存,加上中繼資料共約 10–20 MB。中小型知識庫(50 本書)約 500 MB–1 GB,Qdrant Cloud 免費層可涵蓋。
七、階段五:Skill 打包與 Claude Code 整合
Skill 打包的核心是讓 Claude Code 知道「這個 Skill 能做什麼、如何呼叫」。典型結構:
my-knowledge-skill/
├── CLAUDE.md # Skill 描述、使用場景、呼叫範例
├── mcp_server.py # MCP 工具伺服器(檢索介面)
├── config.json # 向量庫連線配置
└── requirements.txt # 相依性宣告
Skill 打包本身成本為 $0,主要是開發時間(首次約 2–4 小時,範本化後 30 分鐘內可複用)。
八、彙總成本估算表
以一本 300 頁技術 PDF(約 150K tokens)為基準,全流程成本彙總:
| 階段 | 最低成本方案 | 典型雲端方案 | 高效能方案 | 備註 |
|---|---|---|---|---|
| PDF 解析 | $0(本地 CPU) | $0.05–0.15 | $0.02–0.05(GPU) | MinerU/Docling 自托管 |
| 文字分塊 | $0 | $0 | $0 | 純 CPU 運算 |
| Embedding | $0(本地模型) | $0.003–0.02 | $0.02(text-embedding-3-large) | 本地 bge-m3 品質接近雲端 |
| 向量儲存(一次性) | $0(Chroma 本地) | $0(Qdrant 免費層) | $25/月(Qdrant 8 GB) | 50 本書以內免費層夠用 |
| Skill 打包 | $0 | $0 | $0 | 開發工時另計 |
| 單本合計 | ~$0(全本地) | $0.05–0.20 | $0.04–0.07 | 不含 Claude 呼叫費用 |
規模化場景的成本變化
100 本書的知識庫:全本地方案接近 $0 建置成本(主要是開發工時);雲端 API Embedding 約 $1–5;向量儲存升級到 Qdrant 付費方案約 $25–50/月。規模越大,本地方案的優勢越明顯。
九、Cloud Mac M4 實測數據
以下數據來自 Vuncloud Cloud Mac M4 Pro(12 核 CPU / 18 GB 統一記憶體)的實測:
| 任務 | 規格 | 耗時 | 記憶體峰值 |
|---|---|---|---|
| MinerU 解析(中文 PDF,300 頁) | CPU 模式 | 9 分 23 秒 | 4.2 GB |
| Docling 解析(英文規範,200 頁) | CPU+MPS 混合 | 5 分 41 秒 | 5.8 GB |
| bge-m3 Embedding(150K tokens) | MPS 加速 | 48 秒 | 2.9 GB |
| nomic-embed Embedding(150K tokens) | MPS 加速 | 22 秒 | 1.1 GB |
| Qdrant 本地寫入(1,000 向量) | 本地 Docker | 1.2 秒 | 0.3 GB |
| 全流程(300 頁,本地方案) | M4 Pro | 約 12 分鐘 | 峰值 6 GB |
M4 Pro 的 18 GB 統一記憶體可同時持有解析模型+Embedding 模型而不換入換出,全流程無需重啟或分步執行。對於每天處理 5–20 份文件的場景,單台 Cloud Mac M4 Pro 已經足夠,無需額外的 GPU 執行個體。
十、最佳化建議
增量更新策略
不要每次都全量重建索引。對文件建立內容雜湊,只對新增/變更的頁面重新解析和 Embedding:
import hashlib
def get_doc_hash(pdf_path: str) -> str:
with open(pdf_path, "rb") as f:
return hashlib.sha256(f.read()).hexdigest()[:16]
# 檢查索引中是否已有該文件版本
existing = qdrant.scroll(
collection_name="knowledge",
scroll_filter={"must": [{"key": "doc_hash", "match": {"value": doc_hash}}]},
limit=1
)
if existing[0]: # 已存在,跳過
print(f"文件 {pdf_path} 未變更,跳過重建")
分批處理大型知識庫
處理 100+本書的知識庫時,建議按優先順序分批:高頻查詢文件優先索引,長尾文件非同步處理。使用 Celery 或簡單的任務佇列避免記憶體溢位。
快取策略
- 檢索快取:相同 query 的 Embedding 向量快取 1 小時(Redis/記憶體字典)
- 結果快取:高頻查詢的 top-k 結果快取 15 分鐘
- Skill 回應快取:結構化查詢(如「取得第 3 章」)結果永久快取,文件更新時失效
FAQ
book-to-skill 和一般 RAG 有什麼差別?
一般 RAG 是「檢索+即時回答」,每次呼叫都要走完整檢索流程。book-to-skill 將知識打包成 Claude Skill,Claude Code 可按需精確呼叫特定章節或條目,更適合結構明確、查閱頻繁的專業知識庫。兩種方式可以並用。
處理一本 300 頁的 PDF 大約需要多少費用?
僅解析階段:CPU 模式約 $0.05–0.15,GPU 加速約 $0.02–0.05。Embedding 階段(約 150K tokens):雲端 API 約 $0.003–0.02,本地模型接近 $0。全流程單本書合計約 $0.05–0.20(雲端方案),完全本地接近 $0。
Docling 和 MinerU 該怎麼選?
Docling 對學術論文和表格密集型文件解析更好;MinerU 在中文文件和混合排版上表現更穩定。兩者都支援 CPU/GPU,GPU 加速約 3–5 倍。建議先用目標文件各跑一遍再比較輸出品質。
在 Cloud Mac M4 上執行 book-to-skill 管道值得嗎?
M4 的統一記憶體架構非常適合本地 Embedding 模型(bge-m3、nomic-embed),16–24 GB 可同時執行解析與 Embedding,無需 GPU 伺服器。適合中小型知識庫(< 500 本書)的離線建構,以及 Claude Code 本地偵錯 Skill 套件。
如何降低 Claude Skill 的呼叫成本?
1. Skill 只回傳精準片段(< 2K tokens),避免大段原文傳入 Claude 上下文;2. 增量更新而非全量重建 Embedding 索引;3. 對高頻查詢結果做快取;4. 用 Claude Haiku 處理檢索路由,僅複雜推理才升格至 Sonnet/Opus。
結語
book-to-skill 的部署成本遠低於多數人的預期:一本 300 頁技術 PDF,完全本地方案建置成本接近 $0(僅電費),雲端 API 方案也只需 $0.05–0.20。真正的投入在開發工時(首次搭建管道約 1–2 天)和向量儲存的持續營運成本(大型知識庫 $25+/月)。
三個關鍵決策點:
- 資料合規優先:私域資料優先選本地解析+本地 Embedding,成本更低,資料不出境
- 規模決定方案:< 50 本書用 Chroma+本地;50–500 本用 Qdrant Cloud 免費層;500+本考慮自托管 Qdrant
- 品質靠評測:搭完管道後必須用真實問答測召回率,別只看技術指標
在 Cloud Mac M4 上執行 book-to-skill?
M4 統一記憶體架構讓解析+Embedding+向量儲存全流程在單機完成,無需 GPU 伺服器。Vuncloud Cloud Mac 支援長時間背景任務執行,適合離線批量建構知識庫。
相關閱讀
- PDF 解析工具 2026 橫評:Docling、MinerU、LlamaParse、Marker 比較
- 2026 最佳 AI Agent Memory 框架推薦
- DeepSeek 效能最佳化完整指南(2026)
- 大型語言模型 API 定價、規格與效能選型指南
成本資料基於 2026 年 8 月公開定價,僅供參考,請以各服務商官網為準。最後更新:2026 年 8 月 10 日。