Превращение технического справочника или внутренней PDF-базы знаний в Skill, напрямую вызываемый Claude Code, становится всё более распространённым в 2026 году — но между «оно как-то работает» и «я знаю, сколько это стоит и насколько быстро» — огромная разница.
Перед вами полное руководство по развёртыванию book-to-skill: от парсинга PDF до упаковки Skill — анализ требований к среде, временны́х затрат и структуры расходов на каждом этапе, с реальными данными бенчмарков Cloud Mac M4. Не маркетинговый материал, а чеклист для закупок и архитектурного ревью.
1. Что такое book-to-skill?
book-to-skill — это рабочий процесс преобразования книг, технических спецификаций и внутренних PDF-документов в Claude Skills (пакеты навыков знаний, вызываемые Claude Code). Основные сценарии:
- Техническая документация: API-справочники, руководства по SDK, спецификации протоколов — Claude Code может обращаться к ним напрямую при написании кода, без повторного RAG-поиска
- Спецификации: национальные стандарты, отраслевые нормы, документы по соответствию требованиям — упакованные как «движок правил» для агентов, доступный в любое время
- Частные базы знаний: внутренние исследовательские отчёты, руководства по продуктам, учебные материалы — эксклюзивный слой знаний организации без загрузки на сторонние сервисы
book-to-skill vs обычный RAG
Обычный RAG работает по принципу «поиск + ответ в реальном времени» и при каждом вызове проходит полную цепочку retrieval. book-to-skill структурированно упаковывает знания в Skill, позволяя Claude Code при необходимости точно обращаться к конкретным главам или записям. Лучше подходит для структурированных и часто запрашиваемых профессиональных баз знаний. Оба подхода можно комбинировать: RAG для грубой первичной фильтрации, Skill для точных обращений.
2. Обзор полного пайплайна
Полный пайплайн book-to-skill состоит из пяти этапов:
PDF-файл
↓
[Этап 1] Парсинг PDF (Docling / MinerU)
→ Структурированный Markdown / JSON (с иерархией заголовков, таблицами, формулами)
↓
[Этап 2] Разбиение на чанки (Chunking)
→ Семантические блоки абзацев (300–600 токенов / чанк)
↓
[Этап 3] Эмбеддинг
→ Плотные векторы (768 / 1024 / 1536 измерений)
↓
[Этап 4] Векторное хранилище (Qdrant / Chroma / PGVector)
→ Поисковый векторный индекс + исходные метаданные
↓
[Этап 5] Упаковка Skill
→ Описание инструмента CLAUDE.md + регистрация MCP-инструмента + логика retrieval
↓
Вызов Claude Code
3. Этап 1: Парсинг PDF
Выбор инструмента: Docling vs MinerU
Сравнение ведущих открытых PDF-парсеров 2026 года:
| Инструмент | Сильные стороны | Таблицы/Графики | Поддержка CJK | GPU-ускорение | Лицензия |
|---|---|---|---|---|---|
| Docling | Научные статьи, структурированные спецификации | Отлично (DocLayNet) | Хорошо | Да (CUDA) | MIT |
| MinerU | Документы CJK, смешанные макеты | Хорошо | Отлично | Да (CUDA / MPS) | AGPL-3.0 |
| LlamaParse | Быстрое прототипирование, облачный хостинг | Хорошо | Умеренно | Облако (нет локально) | Коммерческая |
| Marker | PDF с плотным текстом | Умеренно | Умеренно | Да (CUDA) | GPL-3.0 |
Рекомендация: для англоязычной технической документации — Docling; для документов на CJK и смешанных макетов — MinerU.
Оценка стоимости парсинга
| Сценарий | Оборудование | Время обработки (300 стр.) | Стоимость вычислений (ориентир) | Примечания |
|---|---|---|---|---|
| Режим CPU (локально) | M4 Pro / 8-ядерный x86 | 8–15 мин | Электричество незначительно (~$0,01) | Для малых/средних пакетов, без GPU |
| Режим CPU (облачный сервер) | 4 vCPU / 8 ГБ RAM | 10–20 мин | ~$0,05–0,15/книга | Почасовая тарификация, стоимость снижается с масштабом |
| GPU-ускорение (CUDA) | RTX 4090 / A10G | 2–5 мин | ~$0,02–0,05/книга | Время GPU около $0,35–0,80/час |
| GPU-ускорение (MPS, M4) | Apple M4 Max | 3–6 мин | Электричество ~$0,005/книга | MinerU поддерживает MPS; часть ops Docling откатывается на CPU |
| Облачный API (LlamaParse) | Хостинг | 1–3 мин | ~$0,003/стр → ~$0,90/книга | Нет локальной среды, но данные уходят за рубеж |
Не игнорируйте зависимости среды парсинга
Docling и MinerU требуют тяжёлой Python-среды (PyTorch, файлы OCR-моделей 1–3 ГБ). Первоначальная установка ~5–10 мин; рекомендуется создать Docker-образ для фиксации зависимостей. Python ≥ 3.10, рекомендуется 3.11.
4. Этап 2: Разбиение на чанки
Стратегия чанкинга напрямую влияет на качество retrieval и стоимость эмбеддинга:
- Фиксированный размер чанков: самый простой вариант, нарезка по количеству токенов (300–500 токенов + перекрытие 50 токенов). Для чисто повествовательных документов.
- Семантический чанкинг: нарезка по иерархии заголовков и границам абзацев. Структурированный вывод Docling/MinerU нативно поддерживает это — рекомендуется использовать в первую очередь.
- Рекурсивное посимвольное разбиение (LangChain RecursiveCharacterTextSplitter): запасной вариант при нечётких семантических границах.
Рекомендуемые параметры чанкинга:
# Рекомендуемая конфигурация (техническая документация)
chunk_size = 400 # токены
chunk_overlap = 60 # перекрытие для предотвращения семантического обрыва
min_chunk_size = 80 # отбрасывать слишком короткие блоки (чистые заголовки)
max_chunk_size = 600 # ограничивать слишком длинные абзацы
Чанкинг сам по себе почти не потребляет вычислительных ресурсов (CPU, миллисекунды), стоимость пренебрежимо мала.
5. Этап 3: Эмбеддинг
Облачный API
| Сервис | Модель | Размерность | Цена ($/млн токенов) | Оценка для книги 300 стр. (~150K токенов) |
|---|---|---|---|---|
| OpenAI | text-embedding-3-small | 1536 | $0,02 | ~$0,003 |
| OpenAI | text-embedding-3-large | 3072 | $0,13 | ~$0,02 |
| Cohere | embed-v4.0 | 1024 | $0,10 | ~$0,015 |
| Voyage AI | voyage-3 | 1024 | $0,06 | ~$0,009 |
| Jina AI | jina-embeddings-v3 | 1024 | $0,02 | ~$0,003 |
Локальная модель
| Модель | Размерность | Потребность в памяти | Скорость M4 (токены/с) | Время обработки (300 стр.) |
|---|---|---|---|---|
| bge-m3 (BAAI) | 1024 | ~2,5 ГБ | ~3 000 | ~50 с |
| nomic-embed-text-v1.5 | 768 | ~0,8 ГБ | ~6 000 | ~25 с |
| mxbai-embed-large-v1 | 1024 | ~1,3 ГБ | ~4 500 | ~33 с |
| text2vec-large-chinese | 1024 | ~1,4 ГБ | ~4 000 | ~38 с |
Стоимость локального эмбеддинга ≈ $0 (только электричество, пренебрежимо). Для частных баз знаний во внутренней сети или сценариев с высокими требованиями к соответствию нормативам локальная модель — первый выбор.
6. Этап 4: Векторное хранилище
| Решение | Развёртывание | Бесплатная квота | Платное (ориентир) | Подходит для |
|---|---|---|---|---|
| Qdrant Cloud | Хостинг / Self-hosted | 1 ГБ (около 1M векторов) | $25/мес (8 ГБ) | Средние/большие базы, высокопроизводительная фильтрация |
| Chroma | Локально / Встроенный | Без ограничений (локально) | $0 (self-hosted) | Разработка/тестирование, небольшие локальные базы |
| PGVector | Расширение PostgreSQL | Зависит от инстанса PG | Тарифицируется вместе с PG | Команды с существующей инфраструктурой PG |
| Weaviate Cloud | Хостинг | Sandbox (14 дней) | $25/мес | Требуется гибридный поиск (вектор + BM25) |
| Локальный Qdrant | Docker self-hosted | Бесплатно | $0 + стоимость сервера | Офлайн-среда, данные остаются локально |
Оценка объёма хранилища: один вектор 1024 измерений ~4 КБ (float32); книга из 300 страниц даёт около 800–1200 чанков, хранилище ~3–5 МБ, с метаданными ~10–20 МБ. Небольшая база (50 книг) ~500 МБ–1 ГБ, бесплатного тира Qdrant Cloud достаточно.
7. Этап 5: Упаковка Skill и интеграция с Claude Code
Суть упаковки Skill — сообщить Claude Code «что умеет этот Skill и как его вызвать». Типичная структура:
my-knowledge-skill/
├── CLAUDE.md # Описание Skill, сценарии использования, примеры вызова
├── mcp_server.py # MCP-инструмент сервер (интерфейс retrieval)
├── config.json # Конфигурация подключения к векторной БД
└── requirements.txt # Объявление зависимостей
Пример CLAUDE.md (сокращённая версия):
# TechSpec Knowledge Skill
## Назначение
Запрос технических спецификаций компании (версия v3.2), включая стандарты проектирования API, руководство по стилю кода, чеклист проверки безопасности.
## Инструменты
- `search_spec(query: str, top_k: int = 3)` — семантический поиск, возвращает наиболее релевантные абзацы и раздел источника
- `get_section(section_id: str)` — точно получает полный текст указанного раздела
## Примеры использования
- «Запросить стандарты версионирования REST API»
- «Получить требования к проверке безопасности главы 3»
Стоимость упаковки Skill: $0. Основные вложения — время разработки (первый раз ~2–4 часа, после шаблонизации ~30 мин для повторного использования).
8. Сводная таблица затрат
Базис: один технический PDF из 300 страниц (~150K токенов), полный пайплайн:
| Этап | Минимальная стоимость | Типичный облачный | Высокопроизводительный | Примечания |
|---|---|---|---|---|
| Парсинг PDF | $0 (локальный CPU) | $0,05–0,15 | $0,02–0,05 (GPU) | MinerU/Docling self-hosted |
| Разбиение на чанки | $0 | $0 | $0 | Чистые вычисления CPU |
| Эмбеддинг | $0 (локальная модель) | $0,003–0,02 | $0,02 (text-embedding-3-large) | Локальный bge-m3 близок к облачному качеству |
| Векторное хранилище (единоразово) | $0 (Chroma локально) | $0 (Qdrant Free) | $25/мес (Qdrant 8 ГБ) | До 50 книг бесплатного тира достаточно |
| Упаковка Skill | $0 | $0 | $0 | Трудозатраты отдельно |
| Итого на книгу | ~$0 (полностью локально) | $0,05–0,20 | $0,04–0,07 | Стоимость вызовов Claude не включена |
Стоимость вызовов Claude Skill (по фактическому использованию): каждый retrieval-вызов передаёт ~500–2000 токенов контекста в Claude; при использовании Claude Sonnet 4.5 — около $0,003–0,006 за вызов. Для частых запросов используйте Haiku для маршрутизации, на Sonnet/Opus переходите только для сложного рассуждения.
Изменение затрат при масштабировании
База из 100 книг: полностью локальное решение — затраты на создание почти $0; облачный API эмбеддинга ~$1–5; векторное хранилище Qdrant платный тир ~$25–50/мес. Чем больше масштаб, тем очевиднее преимущества локального решения.
9. Данные бенчмарков Cloud Mac M4
Данные получены на Vuncloud Cloud Mac M4 Pro (12-ядерный CPU / 18 ГБ единой памяти):
| Задача | Конфигурация | Время | Пик памяти |
|---|---|---|---|
| Парсинг MinerU (PDF на CJK, 300 стр.) | Режим CPU | 9 мин 23 с | 4,2 ГБ |
| Парсинг Docling (английская спецификация, 200 стр.) | Смешанный CPU + MPS | 5 мин 41 с | 5,8 ГБ |
| Эмбеддинг bge-m3 (150K токенов) | Ускорение MPS | 48 с | 2,9 ГБ |
| Эмбеддинг nomic-embed (150K токенов) | Ускорение MPS | 22 с | 1,1 ГБ |
| Локальная запись Qdrant (1 000 векторов) | Локальный Docker | 1,2 с | 0,3 ГБ |
| Полный пайплайн (300 стр., локально) | M4 Pro | ~12 мин | Пик 6 ГБ |
18 ГБ единой памяти M4 Pro позволяют одновременно держать в памяти модель парсинга и модель эмбеддинга без подкачки. Для сценариев обработки 5–20 документов в день одного Cloud Mac M4 Pro достаточно.
10. Рекомендации по оптимизации
Стратегия инкрементальных обновлений
Не пересоздавайте весь индекс при каждом изменении. Вычисляйте хэш содержимого документа, перепарсивайте и переэмбеддируйте только новые/изменённые страницы:
import hashlib
def get_doc_hash(pdf_path: str) -> str:
with open(pdf_path, "rb") as f:
return hashlib.sha256(f.read()).hexdigest()[:16]
existing = qdrant.scroll(
collection_name="knowledge",
scroll_filter={"must": [{"key": "doc_hash", "match": {"value": doc_hash}}]},
limit=1
)
if existing[0]:
print(f"Документ {pdf_path} не изменился, пересоздание пропущено")
Пакетная обработка больших баз знаний
При обработке 100+ книг: разделить по приоритету на пакеты, сначала индексировать часто запрашиваемые документы, остальные — асинхронно. Использовать Celery или простую очередь задач для предотвращения переполнения памяти.
Стратегия кэширования
- Кэш retrieval: вектор эмбеддинга одинакового запроса кэшировать 1 час (Redis / словарь в памяти)
- Кэш результатов: результаты top-k частых запросов кэшировать 15 минут
- Кэш ответов Skill: структурированные запросы (напр., «получить главу 3») кэшировать постоянно, инвалидировать при обновлении документа
Повышение качества Skill
- Для важных документов использовать двойной векторный индекс: плотные векторы (семантика) + разреженные векторы (BM25) — гибридный поиск
- Добавлять к каждому чанку контекст родительского узла (паттерн Parent Document Retriever)
- Регулярно проводить оценку качества retrieval: подготовить 20–50 стандартных пар Q&A, тестировать recall top-3
FAQ
В чём разница между book-to-skill и обычным RAG?
Обычный RAG: «поиск + ответ в реальном времени», цепочка retrieval проходится при каждом вызове. book-to-skill: знания упакованы в Skill для точного доступа. Оба подхода можно комбинировать.
Сколько стоит обработка PDF из 300 страниц?
Только парсинг: CPU ~$0,05–0,15, GPU ~$0,02–0,05. Эмбеддинг (~150K токенов): облачный API ~$0,003–0,02, локально ~$0. Полный пайплайн: облако ~$0,05–0,20, полностью локально ~$0.
Docling или MinerU — что выбрать?
Docling — для научных статей и документов с таблицами; MinerU — для документов на CJK и смешанных макетов. Оба поддерживают CPU/GPU, GPU ~3–5× быстрее. Протестируйте оба на целевых документах, затем решите.
Стоит ли Cloud Mac M4 для пайплайна book-to-skill?
Единая память M4 очень удобна для локальных моделей эмбеддинга. 16–24 ГБ достаточно для одновременного парсинга и эмбеддинга без GPU-сервера. Идеально для средних баз (< 500 книг) и локальной отладки.
Как снизить расходы на вызовы Claude Skill?
1. Возвращать только точные фрагменты (< 2K токенов). 2. Инкрементальные обновления вместо полного пересоздания. 3. Локальное кэширование частых запросов. 4. Haiku для маршрутизации, Sonnet/Opus только для сложного рассуждения.
Заключение
Стоимость развёртывания book-to-skill значительно ниже, чем ожидают многие: один технический PDF из 300 страниц в полностью локальном варианте обходится почти в $0 (только электричество), облачный API — всего $0,05–0,20. Настоящие вложения — это время разработки (первый пайплайн ~1–2 дня) и текущие расходы на векторное хранилище (большие базы $25+/мес).
Три ключевых решения:
- Соответствие нормативам в приоритете: внутренние данные → локальный парсинг + локальный эмбеддинг.
- Масштаб определяет решение: < 50 книг: Chroma + локально; 50–500 книг: Qdrant Cloud Free; 500+ книг: self-hosted Qdrant.
- Качество через тестирование: после создания пайплайна обязательно проверьте recall с реальными парами Q&A.
Запустить book-to-skill на Cloud Mac M4?
Единая память M4 позволяет выполнить парсинг + эмбеддинг + векторное хранилище на одной машине. Vuncloud Cloud Mac поддерживает длительные фоновые задачи для офлайн-построения баз знаний.
Похожие материалы
- Сравнение PDF-парсеров 2026: Docling, MinerU, LlamaParse, Marker
- Лучшие фреймворки AI Agent Memory 2026
- Полное руководство по оптимизации производительности DeepSeek 2026
- Руководство по ценам, характеристикам и производительности LLM API
Данные о стоимости основаны на публичных ценах августа 2026 года, только для ориентира. Проверяйте актуальные цены на официальных сайтах поставщиков. Последнее обновление: 10 августа 2026 года.