Vuncloud 部落格
← 返回機房手記專欄

book-to-skill 部署成本:PDF 轉 Claude Skill 環境與估算

PDF 解析 · Embedding · 向量儲存 · Skill 打包 · 逐階段成本估算約 12 分鐘閱讀

book-to-skill:將書籍與 PDF 文件轉化為 Claude Code 可呼叫的知識技能套件

把一本技術規範書或內部知識庫 PDF 變成 Claude Code 可直接呼叫的 Skill,這件事在 2026 年越來越普遍——但「能跑起來」和「知道花了多少錢、跑得有多快」是兩回事。

這篇是 book-to-skill 完整部署手記:從 PDF 解析到 Skill 打包的每個階段,拆解環境需求、時間消耗與成本結構,附 Cloud Mac M4 實測數據。不是行銷材料,是一張可以帶著去採購/架構審查的清單。

5 階段
解析 · 分塊 · Embedding · 向量儲存 · Skill 打包
$0.05–0.20
典型單本書全流程成本
M4 實測
Cloud Mac 本地管道參考數據

一、book-to-skill 是什麼

book-to-skill 是一種將書籍、技術規範、內部 PDF 文件轉化為 Claude Skills(Claude Code 可呼叫的知識技能套件)的工作流程。它解決的核心場景:

  • 技術文件:API 參考、SDK 手冊、協議規範——讓 Claude Code 在編碼時直接查閱,不再需要 RAG 每次重新檢索
  • 規範書:國家標準、產業規範、公司合規文件——打包後可作為 Agent 的「規則引擎」隨時呼叫
  • 私域知識庫:內部研究報告、產品手冊、培訓教材——形成組織專屬知識層,無需上傳至第三方

book-to-skill vs 一般 RAG

一般 RAG 是「檢索+即時回答」,每次呼叫都要走完整檢索流程。book-to-skill 將知識結構化打包成 Skill,Claude Code 可按需精確呼叫特定章節或條目,更適合結構明確、查閱頻繁的專業知識庫。兩種方式可以並用:粗粒度用 RAG 做初篩,精細引用走 Skill 呼叫。

二、完整管道總覽

完整的 book-to-skill 管道分為五個階段:

PDF 檔案
  ↓
[階段一] PDF 解析(Docling / MinerU)
  → 結構化 Markdown / JSON(含標題層級、表格、公式)
  ↓
[階段二] 文字分塊(Chunking)
  → 語意段落塊(300–600 tokens / chunk)
  ↓
[階段三] Embedding
  → 稠密向量(768 / 1024 / 1536 維)
  ↓
[階段四] 向量儲存(Qdrant / Chroma / PGVector)
  → 可檢索的向量索引+原文中繼資料
  ↓
[階段五] Skill 打包
  → CLAUDE.md 工具描述+MCP 工具註冊+檢索邏輯
  ↓
Claude Code 呼叫

三、階段一:PDF 解析

工具選型:Docling vs MinerU

2026 年主流開源 PDF 解析工具比較:

工具 優勢場景 表格/圖表 中文支援 GPU 加速 授權
Docling 學術論文、結構化規範書 優秀(DocLayNet) 良好 支援(CUDA) MIT
MinerU 中文文件、混合排版 良好 優秀 支援(CUDA / MPS) AGPL-3.0
LlamaParse 快速原型、雲端託管 良好 普通 雲端(無本地) 商業
Marker 純文字密集 PDF 普通 普通 支援(CUDA) GPL-3.0

推薦選擇:英文技術文件首選 Docling;中文/混合文件首選 MinerU。兩者都支援輸出結構化 Markdown,適合下游分塊處理。

解析成本估算

場景 硬體 300 頁 PDF 耗時 運算成本參考 備註
CPU 模式(本地) M4 Pro / 8 核 x86 8–15 分鐘 電費可忽略(~$0.01) 適合中小批量,無需 GPU
CPU 模式(雲端伺服器) 4 vCPU / 8 GB RAM 10–20 分鐘 ~$0.05–0.15/本 按時計費,批量越大成本越低
GPU 加速(CUDA) RTX 4090 / A10G 2–5 分鐘 ~$0.02–0.05/本 GPU 時間約 $0.35–0.8/小時
GPU 加速(MPS,M4) Apple M4 Max 3–6 分鐘 電費約 $0.005/本 MinerU 支援 MPS;Docling 部分運算回退 CPU
雲端 API(LlamaParse) 託管 1–3 分鐘 ~$0.003/頁 → ~$0.9/本 無需本地環境,但有資料出境疑慮

不可忽視的環境相依性

Docling 和 MinerU 都需要較重的 Python 環境(PyTorch、OCR 模型檔案 1–3 GB)。首次安裝約 5–10 分鐘;建議打 Docker 映像固化相依性,避免每台機器重複配置。Python ≥ 3.10,推薦 3.11。

四、階段二:文字分塊

分塊策略直接影響檢索品質和 Embedding 成本:

  • 固定大小分塊:最簡單,按 token 數切割(300–500 tokens+50 tokens 重疊)。適合純敘述文件。
  • 語意分塊:按標題層級、段落邊界切割。Docling/MinerU 的結構化輸出天然支援,建議優先使用。
  • 遞迴字元分塊(LangChain RecursiveCharacterTextSplitter):語意邊界不清晰時的保底方案。

分塊參數建議

# 推薦配置(中文技術文件)
chunk_size = 400        # tokens,約 200–250 個漢字
chunk_overlap = 60      # 重疊防止語意截斷
min_chunk_size = 80     # 過短的塊(如純標題行)直接捨棄
max_chunk_size = 600    # 防止超長段落單塊過大

分塊本身幾乎不消耗運算資源(CPU 毫秒級),成本可忽略不計。

五、階段三:Embedding

雲端 API 方案

服務 模型 維度 價格($/M tokens) 300 頁書估算(~150K tokens)
OpenAI text-embedding-3-small 1536 $0.02 ~$0.003
OpenAI text-embedding-3-large 3072 $0.13 ~$0.02
Cohere embed-v4.0 1024 $0.10 ~$0.015
Voyage AI voyage-3 1024 $0.06 ~$0.009
Jina AI jina-embeddings-v3 1024 $0.02 ~$0.003

本地模型方案

模型 維度 顯存/記憶體 M4 速度(tokens/s) 300 頁書耗時
bge-m3(BAAI) 1024 ~2.5 GB ~3,000 ~50 秒
nomic-embed-text-v1.5 768 ~0.8 GB ~6,000 ~25 秒
mxbai-embed-large-v1 1024 ~1.3 GB ~4,500 ~33 秒
text2vec-large-chinese 1024 ~1.4 GB ~4,000 ~38 秒

本地 Embedding 成本 ≈ $0(僅電費,可忽略)。對於內網私域知識庫或資料合規要求高的場景,本地模型是首選。M4 的統一記憶體對這類推理任務非常友好。

知識管理:書架上的專業文獻與數位知識圖譜
book-to-skill 的核心價值:將靜態文件轉化為動態可呼叫的知識層

六、階段四:向量儲存

方案 部署方式 免費額度 付費參考 適合場景
Qdrant Cloud 託管 / 自托管 1 GB(約 100 萬向量) $25/月起(8 GB) 中大型知識庫,需高效能過濾
Chroma 本地 / 嵌入 無限制(本地) $0(自托管) 開發測試、單機小型知識庫
PGVector PostgreSQL 擴充 取決於 PG 執行個體 隨 PG 執行個體計費 已有 PG 基礎架構的團隊
Weaviate Cloud 託管 Sandbox(14 天) $25/月起 需要混合檢索(向量+BM25)
本地 Qdrant Docker 自托管 免費 $0+伺服器成本 離線環境、資料不出境

儲存量估算:每個 1024 維向量約 4 KB(float32);一本 300 頁書約 800–1,200 個 chunk,佔用約 3–5 MB 向量儲存,加上中繼資料共約 10–20 MB。中小型知識庫(50 本書)約 500 MB–1 GB,Qdrant Cloud 免費層可涵蓋。

七、階段五:Skill 打包與 Claude Code 整合

Skill 打包的核心是讓 Claude Code 知道「這個 Skill 能做什麼、如何呼叫」。典型結構:

my-knowledge-skill/
├── CLAUDE.md          # Skill 描述、使用場景、呼叫範例
├── mcp_server.py      # MCP 工具伺服器(檢索介面)
├── config.json        # 向量庫連線配置
└── requirements.txt   # 相依性宣告

Skill 打包本身成本為 $0,主要是開發時間(首次約 2–4 小時,範本化後 30 分鐘內可複用)。

八、彙總成本估算表

一本 300 頁技術 PDF(約 150K tokens)為基準,全流程成本彙總:

階段 最低成本方案 典型雲端方案 高效能方案 備註
PDF 解析 $0(本地 CPU) $0.05–0.15 $0.02–0.05(GPU) MinerU/Docling 自托管
文字分塊 $0 $0 $0 純 CPU 運算
Embedding $0(本地模型) $0.003–0.02 $0.02(text-embedding-3-large) 本地 bge-m3 品質接近雲端
向量儲存(一次性) $0(Chroma 本地) $0(Qdrant 免費層) $25/月(Qdrant 8 GB) 50 本書以內免費層夠用
Skill 打包 $0 $0 $0 開發工時另計
單本合計 ~$0(全本地) $0.05–0.20 $0.04–0.07 不含 Claude 呼叫費用

規模化場景的成本變化

100 本書的知識庫:全本地方案接近 $0 建置成本(主要是開發工時);雲端 API Embedding 約 $1–5;向量儲存升級到 Qdrant 付費方案約 $25–50/月。規模越大,本地方案的優勢越明顯。

九、Cloud Mac M4 實測數據

以下數據來自 Vuncloud Cloud Mac M4 Pro(12 核 CPU / 18 GB 統一記憶體)的實測:

任務 規格 耗時 記憶體峰值
MinerU 解析(中文 PDF,300 頁) CPU 模式 9 分 23 秒 4.2 GB
Docling 解析(英文規範,200 頁) CPU+MPS 混合 5 分 41 秒 5.8 GB
bge-m3 Embedding(150K tokens) MPS 加速 48 秒 2.9 GB
nomic-embed Embedding(150K tokens) MPS 加速 22 秒 1.1 GB
Qdrant 本地寫入(1,000 向量) 本地 Docker 1.2 秒 0.3 GB
全流程(300 頁,本地方案) M4 Pro 約 12 分鐘 峰值 6 GB

M4 Pro 的 18 GB 統一記憶體可同時持有解析模型+Embedding 模型而不換入換出,全流程無需重啟或分步執行。對於每天處理 5–20 份文件的場景,單台 Cloud Mac M4 Pro 已經足夠,無需額外的 GPU 執行個體。

十、最佳化建議

增量更新策略

不要每次都全量重建索引。對文件建立內容雜湊,只對新增/變更的頁面重新解析和 Embedding:

import hashlib

def get_doc_hash(pdf_path: str) -> str:
    with open(pdf_path, "rb") as f:
        return hashlib.sha256(f.read()).hexdigest()[:16]

# 檢查索引中是否已有該文件版本
existing = qdrant.scroll(
    collection_name="knowledge",
    scroll_filter={"must": [{"key": "doc_hash", "match": {"value": doc_hash}}]},
    limit=1
)
if existing[0]:  # 已存在,跳過
    print(f"文件 {pdf_path} 未變更,跳過重建")

分批處理大型知識庫

處理 100+本書的知識庫時,建議按優先順序分批:高頻查詢文件優先索引,長尾文件非同步處理。使用 Celery 或簡單的任務佇列避免記憶體溢位。

快取策略

  • 檢索快取:相同 query 的 Embedding 向量快取 1 小時(Redis/記憶體字典)
  • 結果快取:高頻查詢的 top-k 結果快取 15 分鐘
  • Skill 回應快取:結構化查詢(如「取得第 3 章」)結果永久快取,文件更新時失效

FAQ

book-to-skill 和一般 RAG 有什麼差別?

一般 RAG 是「檢索+即時回答」,每次呼叫都要走完整檢索流程。book-to-skill 將知識打包成 Claude Skill,Claude Code 可按需精確呼叫特定章節或條目,更適合結構明確、查閱頻繁的專業知識庫。兩種方式可以並用。

處理一本 300 頁的 PDF 大約需要多少費用?

僅解析階段:CPU 模式約 $0.05–0.15,GPU 加速約 $0.02–0.05。Embedding 階段(約 150K tokens):雲端 API 約 $0.003–0.02,本地模型接近 $0。全流程單本書合計約 $0.05–0.20(雲端方案),完全本地接近 $0。

Docling 和 MinerU 該怎麼選?

Docling 對學術論文和表格密集型文件解析更好;MinerU 在中文文件和混合排版上表現更穩定。兩者都支援 CPU/GPU,GPU 加速約 3–5 倍。建議先用目標文件各跑一遍再比較輸出品質。

在 Cloud Mac M4 上執行 book-to-skill 管道值得嗎?

M4 的統一記憶體架構非常適合本地 Embedding 模型(bge-m3、nomic-embed),16–24 GB 可同時執行解析與 Embedding,無需 GPU 伺服器。適合中小型知識庫(< 500 本書)的離線建構,以及 Claude Code 本地偵錯 Skill 套件。

如何降低 Claude Skill 的呼叫成本?

1. Skill 只回傳精準片段(< 2K tokens),避免大段原文傳入 Claude 上下文;2. 增量更新而非全量重建 Embedding 索引;3. 對高頻查詢結果做快取;4. 用 Claude Haiku 處理檢索路由,僅複雜推理才升格至 Sonnet/Opus。

結語

book-to-skill 的部署成本遠低於多數人的預期:一本 300 頁技術 PDF,完全本地方案建置成本接近 $0(僅電費),雲端 API 方案也只需 $0.05–0.20。真正的投入在開發工時(首次搭建管道約 1–2 天)和向量儲存的持續營運成本(大型知識庫 $25+/月)。

三個關鍵決策點:

  1. 資料合規優先:私域資料優先選本地解析+本地 Embedding,成本更低,資料不出境
  2. 規模決定方案:< 50 本書用 Chroma+本地;50–500 本用 Qdrant Cloud 免費層;500+本考慮自托管 Qdrant
  3. 品質靠評測:搭完管道後必須用真實問答測召回率,別只看技術指標

在 Cloud Mac M4 上執行 book-to-skill?

M4 統一記憶體架構讓解析+Embedding+向量儲存全流程在單機完成,無需 GPU 伺服器。Vuncloud Cloud Mac 支援長時間背景任務執行,適合離線批量建構知識庫。

查看 Cloud Mac 方案 · PDF 解析工具橫評

成本資料基於 2026 年 8 月公開定價,僅供參考,請以各服務商官網為準。最後更新:2026 年 8 月 10 日。

機房手記 · RAG

PDF 解析 · Embedding · 向量儲存 · Skill 打包

Docling · MinerU · Qdrant · Claude Code · Cloud Mac M4

查看 Cloud Mac 方案
限時優惠 點擊查看方案