Vuncloud Блог
← Вернуться в колонку «Заметки датацентра»

Стоимость развёртывания book-to-skill: PDF в Claude Skill — среда и оценка затрат

Парсинг PDF · Эмбеддинг · Векторное хранилище · Упаковка Skill · Пошаговая оценка затрат~12 мин чтения

book-to-skill: преобразование книг и PDF-документов в пакеты навыков знаний, вызываемые Claude Code

Превращение технического справочника или внутренней PDF-базы знаний в Skill, напрямую вызываемый Claude Code, становится всё более распространённым в 2026 году — но между «оно как-то работает» и «я знаю, сколько это стоит и насколько быстро» — огромная разница.

Перед вами полное руководство по развёртыванию book-to-skill: от парсинга PDF до упаковки Skill — анализ требований к среде, временны́х затрат и структуры расходов на каждом этапе, с реальными данными бенчмарков Cloud Mac M4. Не маркетинговый материал, а чеклист для закупок и архитектурного ревью.

5 этапов
Парсинг · Чанкинг · Эмбеддинг · Векторное хранилище · Упаковка Skill
$0,10–0,50
Типичная стоимость полного пайплайна на книгу
Бенчмарк M4
Референсные данные локального пайплайна Cloud Mac

1. Что такое book-to-skill?

book-to-skill — это рабочий процесс преобразования книг, технических спецификаций и внутренних PDF-документов в Claude Skills (пакеты навыков знаний, вызываемые Claude Code). Основные сценарии:

  • Техническая документация: API-справочники, руководства по SDK, спецификации протоколов — Claude Code может обращаться к ним напрямую при написании кода, без повторного RAG-поиска
  • Спецификации: национальные стандарты, отраслевые нормы, документы по соответствию требованиям — упакованные как «движок правил» для агентов, доступный в любое время
  • Частные базы знаний: внутренние исследовательские отчёты, руководства по продуктам, учебные материалы — эксклюзивный слой знаний организации без загрузки на сторонние сервисы

book-to-skill vs обычный RAG

Обычный RAG работает по принципу «поиск + ответ в реальном времени» и при каждом вызове проходит полную цепочку retrieval. book-to-skill структурированно упаковывает знания в Skill, позволяя Claude Code при необходимости точно обращаться к конкретным главам или записям. Лучше подходит для структурированных и часто запрашиваемых профессиональных баз знаний. Оба подхода можно комбинировать: RAG для грубой первичной фильтрации, Skill для точных обращений.

2. Обзор полного пайплайна

Полный пайплайн book-to-skill состоит из пяти этапов:

PDF-файл
  ↓
[Этап 1] Парсинг PDF (Docling / MinerU)
  → Структурированный Markdown / JSON (с иерархией заголовков, таблицами, формулами)
  ↓
[Этап 2] Разбиение на чанки (Chunking)
  → Семантические блоки абзацев (300–600 токенов / чанк)
  ↓
[Этап 3] Эмбеддинг
  → Плотные векторы (768 / 1024 / 1536 измерений)
  ↓
[Этап 4] Векторное хранилище (Qdrant / Chroma / PGVector)
  → Поисковый векторный индекс + исходные метаданные
  ↓
[Этап 5] Упаковка Skill
  → Описание инструмента CLAUDE.md + регистрация MCP-инструмента + логика retrieval
  ↓
Вызов Claude Code

3. Этап 1: Парсинг PDF

Выбор инструмента: Docling vs MinerU

Сравнение ведущих открытых PDF-парсеров 2026 года:

Инструмент Сильные стороны Таблицы/Графики Поддержка CJK GPU-ускорение Лицензия
Docling Научные статьи, структурированные спецификации Отлично (DocLayNet) Хорошо Да (CUDA) MIT
MinerU Документы CJK, смешанные макеты Хорошо Отлично Да (CUDA / MPS) AGPL-3.0
LlamaParse Быстрое прототипирование, облачный хостинг Хорошо Умеренно Облако (нет локально) Коммерческая
Marker PDF с плотным текстом Умеренно Умеренно Да (CUDA) GPL-3.0

Рекомендация: для англоязычной технической документации — Docling; для документов на CJK и смешанных макетов — MinerU.

Оценка стоимости парсинга

Сценарий Оборудование Время обработки (300 стр.) Стоимость вычислений (ориентир) Примечания
Режим CPU (локально) M4 Pro / 8-ядерный x86 8–15 мин Электричество незначительно (~$0,01) Для малых/средних пакетов, без GPU
Режим CPU (облачный сервер) 4 vCPU / 8 ГБ RAM 10–20 мин ~$0,05–0,15/книга Почасовая тарификация, стоимость снижается с масштабом
GPU-ускорение (CUDA) RTX 4090 / A10G 2–5 мин ~$0,02–0,05/книга Время GPU около $0,35–0,80/час
GPU-ускорение (MPS, M4) Apple M4 Max 3–6 мин Электричество ~$0,005/книга MinerU поддерживает MPS; часть ops Docling откатывается на CPU
Облачный API (LlamaParse) Хостинг 1–3 мин ~$0,003/стр → ~$0,90/книга Нет локальной среды, но данные уходят за рубеж

Не игнорируйте зависимости среды парсинга

Docling и MinerU требуют тяжёлой Python-среды (PyTorch, файлы OCR-моделей 1–3 ГБ). Первоначальная установка ~5–10 мин; рекомендуется создать Docker-образ для фиксации зависимостей. Python ≥ 3.10, рекомендуется 3.11.

4. Этап 2: Разбиение на чанки

Стратегия чанкинга напрямую влияет на качество retrieval и стоимость эмбеддинга:

  • Фиксированный размер чанков: самый простой вариант, нарезка по количеству токенов (300–500 токенов + перекрытие 50 токенов). Для чисто повествовательных документов.
  • Семантический чанкинг: нарезка по иерархии заголовков и границам абзацев. Структурированный вывод Docling/MinerU нативно поддерживает это — рекомендуется использовать в первую очередь.
  • Рекурсивное посимвольное разбиение (LangChain RecursiveCharacterTextSplitter): запасной вариант при нечётких семантических границах.

Рекомендуемые параметры чанкинга:

# Рекомендуемая конфигурация (техническая документация)
chunk_size = 400        # токены
chunk_overlap = 60      # перекрытие для предотвращения семантического обрыва
min_chunk_size = 80     # отбрасывать слишком короткие блоки (чистые заголовки)
max_chunk_size = 600    # ограничивать слишком длинные абзацы

Чанкинг сам по себе почти не потребляет вычислительных ресурсов (CPU, миллисекунды), стоимость пренебрежимо мала.

5. Этап 3: Эмбеддинг

Облачный API

Сервис Модель Размерность Цена ($/млн токенов) Оценка для книги 300 стр. (~150K токенов)
OpenAI text-embedding-3-small 1536 $0,02 ~$0,003
OpenAI text-embedding-3-large 3072 $0,13 ~$0,02
Cohere embed-v4.0 1024 $0,10 ~$0,015
Voyage AI voyage-3 1024 $0,06 ~$0,009
Jina AI jina-embeddings-v3 1024 $0,02 ~$0,003

Локальная модель

Модель Размерность Потребность в памяти Скорость M4 (токены/с) Время обработки (300 стр.)
bge-m3 (BAAI) 1024 ~2,5 ГБ ~3 000 ~50 с
nomic-embed-text-v1.5 768 ~0,8 ГБ ~6 000 ~25 с
mxbai-embed-large-v1 1024 ~1,3 ГБ ~4 500 ~33 с
text2vec-large-chinese 1024 ~1,4 ГБ ~4 000 ~38 с

Стоимость локального эмбеддинга ≈ $0 (только электричество, пренебрежимо). Для частных баз знаний во внутренней сети или сценариев с высокими требованиями к соответствию нормативам локальная модель — первый выбор.

База знаний и управление документами: специализированная литература и цифровой граф знаний
Ключевая ценность book-to-skill: превращение статических документов в динамически вызываемый слой знаний

6. Этап 4: Векторное хранилище

Решение Развёртывание Бесплатная квота Платное (ориентир) Подходит для
Qdrant Cloud Хостинг / Self-hosted 1 ГБ (около 1M векторов) $25/мес (8 ГБ) Средние/большие базы, высокопроизводительная фильтрация
Chroma Локально / Встроенный Без ограничений (локально) $0 (self-hosted) Разработка/тестирование, небольшие локальные базы
PGVector Расширение PostgreSQL Зависит от инстанса PG Тарифицируется вместе с PG Команды с существующей инфраструктурой PG
Weaviate Cloud Хостинг Sandbox (14 дней) $25/мес Требуется гибридный поиск (вектор + BM25)
Локальный Qdrant Docker self-hosted Бесплатно $0 + стоимость сервера Офлайн-среда, данные остаются локально

Оценка объёма хранилища: один вектор 1024 измерений ~4 КБ (float32); книга из 300 страниц даёт около 800–1200 чанков, хранилище ~3–5 МБ, с метаданными ~10–20 МБ. Небольшая база (50 книг) ~500 МБ–1 ГБ, бесплатного тира Qdrant Cloud достаточно.

7. Этап 5: Упаковка Skill и интеграция с Claude Code

Суть упаковки Skill — сообщить Claude Code «что умеет этот Skill и как его вызвать». Типичная структура:

my-knowledge-skill/
├── CLAUDE.md          # Описание Skill, сценарии использования, примеры вызова
├── mcp_server.py      # MCP-инструмент сервер (интерфейс retrieval)
├── config.json        # Конфигурация подключения к векторной БД
└── requirements.txt   # Объявление зависимостей

Пример CLAUDE.md (сокращённая версия):

# TechSpec Knowledge Skill

## Назначение
Запрос технических спецификаций компании (версия v3.2), включая стандарты проектирования API, руководство по стилю кода, чеклист проверки безопасности.

## Инструменты
- `search_spec(query: str, top_k: int = 3)` — семантический поиск, возвращает наиболее релевантные абзацы и раздел источника
- `get_section(section_id: str)` — точно получает полный текст указанного раздела

## Примеры использования
- «Запросить стандарты версионирования REST API»
- «Получить требования к проверке безопасности главы 3»

Стоимость упаковки Skill: $0. Основные вложения — время разработки (первый раз ~2–4 часа, после шаблонизации ~30 мин для повторного использования).

8. Сводная таблица затрат

Базис: один технический PDF из 300 страниц (~150K токенов), полный пайплайн:

Этап Минимальная стоимость Типичный облачный Высокопроизводительный Примечания
Парсинг PDF $0 (локальный CPU) $0,05–0,15 $0,02–0,05 (GPU) MinerU/Docling self-hosted
Разбиение на чанки $0 $0 $0 Чистые вычисления CPU
Эмбеддинг $0 (локальная модель) $0,003–0,02 $0,02 (text-embedding-3-large) Локальный bge-m3 близок к облачному качеству
Векторное хранилище (единоразово) $0 (Chroma локально) $0 (Qdrant Free) $25/мес (Qdrant 8 ГБ) До 50 книг бесплатного тира достаточно
Упаковка Skill $0 $0 $0 Трудозатраты отдельно
Итого на книгу ~$0 (полностью локально) $0,05–0,20 $0,04–0,07 Стоимость вызовов Claude не включена

Стоимость вызовов Claude Skill (по фактическому использованию): каждый retrieval-вызов передаёт ~500–2000 токенов контекста в Claude; при использовании Claude Sonnet 4.5 — около $0,003–0,006 за вызов. Для частых запросов используйте Haiku для маршрутизации, на Sonnet/Opus переходите только для сложного рассуждения.

Изменение затрат при масштабировании

База из 100 книг: полностью локальное решение — затраты на создание почти $0; облачный API эмбеддинга ~$1–5; векторное хранилище Qdrant платный тир ~$25–50/мес. Чем больше масштаб, тем очевиднее преимущества локального решения.

9. Данные бенчмарков Cloud Mac M4

Данные получены на Vuncloud Cloud Mac M4 Pro (12-ядерный CPU / 18 ГБ единой памяти):

Задача Конфигурация Время Пик памяти
Парсинг MinerU (PDF на CJK, 300 стр.) Режим CPU 9 мин 23 с 4,2 ГБ
Парсинг Docling (английская спецификация, 200 стр.) Смешанный CPU + MPS 5 мин 41 с 5,8 ГБ
Эмбеддинг bge-m3 (150K токенов) Ускорение MPS 48 с 2,9 ГБ
Эмбеддинг nomic-embed (150K токенов) Ускорение MPS 22 с 1,1 ГБ
Локальная запись Qdrant (1 000 векторов) Локальный Docker 1,2 с 0,3 ГБ
Полный пайплайн (300 стр., локально) M4 Pro ~12 мин Пик 6 ГБ

18 ГБ единой памяти M4 Pro позволяют одновременно держать в памяти модель парсинга и модель эмбеддинга без подкачки. Для сценариев обработки 5–20 документов в день одного Cloud Mac M4 Pro достаточно.

10. Рекомендации по оптимизации

Стратегия инкрементальных обновлений

Не пересоздавайте весь индекс при каждом изменении. Вычисляйте хэш содержимого документа, перепарсивайте и переэмбеддируйте только новые/изменённые страницы:

import hashlib

def get_doc_hash(pdf_path: str) -> str:
    with open(pdf_path, "rb") as f:
        return hashlib.sha256(f.read()).hexdigest()[:16]

existing = qdrant.scroll(
    collection_name="knowledge",
    scroll_filter={"must": [{"key": "doc_hash", "match": {"value": doc_hash}}]},
    limit=1
)
if existing[0]:
    print(f"Документ {pdf_path} не изменился, пересоздание пропущено")

Пакетная обработка больших баз знаний

При обработке 100+ книг: разделить по приоритету на пакеты, сначала индексировать часто запрашиваемые документы, остальные — асинхронно. Использовать Celery или простую очередь задач для предотвращения переполнения памяти.

Стратегия кэширования

  • Кэш retrieval: вектор эмбеддинга одинакового запроса кэшировать 1 час (Redis / словарь в памяти)
  • Кэш результатов: результаты top-k частых запросов кэшировать 15 минут
  • Кэш ответов Skill: структурированные запросы (напр., «получить главу 3») кэшировать постоянно, инвалидировать при обновлении документа

Повышение качества Skill

  • Для важных документов использовать двойной векторный индекс: плотные векторы (семантика) + разреженные векторы (BM25) — гибридный поиск
  • Добавлять к каждому чанку контекст родительского узла (паттерн Parent Document Retriever)
  • Регулярно проводить оценку качества retrieval: подготовить 20–50 стандартных пар Q&A, тестировать recall top-3

FAQ

В чём разница между book-to-skill и обычным RAG?

Обычный RAG: «поиск + ответ в реальном времени», цепочка retrieval проходится при каждом вызове. book-to-skill: знания упакованы в Skill для точного доступа. Оба подхода можно комбинировать.

Сколько стоит обработка PDF из 300 страниц?

Только парсинг: CPU ~$0,05–0,15, GPU ~$0,02–0,05. Эмбеддинг (~150K токенов): облачный API ~$0,003–0,02, локально ~$0. Полный пайплайн: облако ~$0,05–0,20, полностью локально ~$0.

Docling или MinerU — что выбрать?

Docling — для научных статей и документов с таблицами; MinerU — для документов на CJK и смешанных макетов. Оба поддерживают CPU/GPU, GPU ~3–5× быстрее. Протестируйте оба на целевых документах, затем решите.

Стоит ли Cloud Mac M4 для пайплайна book-to-skill?

Единая память M4 очень удобна для локальных моделей эмбеддинга. 16–24 ГБ достаточно для одновременного парсинга и эмбеддинга без GPU-сервера. Идеально для средних баз (< 500 книг) и локальной отладки.

Как снизить расходы на вызовы Claude Skill?

1. Возвращать только точные фрагменты (< 2K токенов). 2. Инкрементальные обновления вместо полного пересоздания. 3. Локальное кэширование частых запросов. 4. Haiku для маршрутизации, Sonnet/Opus только для сложного рассуждения.

Заключение

Стоимость развёртывания book-to-skill значительно ниже, чем ожидают многие: один технический PDF из 300 страниц в полностью локальном варианте обходится почти в $0 (только электричество), облачный API — всего $0,05–0,20. Настоящие вложения — это время разработки (первый пайплайн ~1–2 дня) и текущие расходы на векторное хранилище (большие базы $25+/мес).

Три ключевых решения:

  1. Соответствие нормативам в приоритете: внутренние данные → локальный парсинг + локальный эмбеддинг.
  2. Масштаб определяет решение: < 50 книг: Chroma + локально; 50–500 книг: Qdrant Cloud Free; 500+ книг: self-hosted Qdrant.
  3. Качество через тестирование: после создания пайплайна обязательно проверьте recall с реальными парами Q&A.

Запустить book-to-skill на Cloud Mac M4?

Единая память M4 позволяет выполнить парсинг + эмбеддинг + векторное хранилище на одной машине. Vuncloud Cloud Mac поддерживает длительные фоновые задачи для офлайн-построения баз знаний.

Посмотреть тарифы Cloud Mac · Сравнение PDF-парсеров

Данные о стоимости основаны на публичных ценах августа 2026 года, только для ориентира. Проверяйте актуальные цены на официальных сайтах поставщиков. Последнее обновление: 10 августа 2026 года.

Заметки датацентра · RAG

Парсинг PDF · Эмбеддинг · Векторное хранилище · Упаковка Skill

Docling · MinerU · Qdrant · Claude Code · Cloud Mac M4

Посмотреть тарифы Cloud Mac
Ограниченное предложение Посмотреть тарифы