Vuncloud Блог
← Назад к полевым заметкам

Руководство по Video-use: полный AI-воркфлоу видео от сценария до готового ролика

Open-source монтаж Agent · Пословная транскрипция ElevenLabs · Рендер FFmpeg · Цикл самооценки · Развёртывание на Cloud Mac~12 мин чтения

Разработчик на MacBook использует AI Agent для обработки сценария и исходников видео — сценарий воркфлоу Video-use

В 2026 году AI-видео разветвляется на два принципиально разных пути: один — Sora, Veo и подобные модели генерируют картинку из текста; другой — Agent монтирует уже снятый материал в готовый ролик. Второй путь практичнее для talking head, туториалов, интервью и роликов к релизу продукта: съёмка ваша, а AI убирает слова-паразиты, выравнивает ритм, вшивает субтитры, делает цветокоррекцию и экспорт.

Video-use идёт по второму пути: открытый набор навыков Agent для монтажа от команды browser-use. Сложите исходные дубли в папку, скажите Claude Code «смонтируй релизный ролик» — и дождитесь edit/final.mp4. Без GUI-таймлайна: логика монтажа живёт в скриптах helpers/ и правилах SKILL.md.

Этот материал проведёт вас по полному воркфлоу от сценария до готового ролика: концепция → установка → практика → Cloud Mac → стоимость и риски.

100% open source
MIT · browser-use/video-use
~12 КБ
takes_packed.md вместо покадровой подачи в модель
5 шагов
Транскрипция → Упаковка → Рассуждение → Рендер → Самооценка

1. Контекст: зачем нужен монтаж через Agent

Главная боль indie-разработчиков и контент-команд — не «не умеем снимать», а черновой монтаж отнимает часы: убрать «эээ/ммм», склеить дубли, выровнять субтитры, унифицировать цвет, проверить склейки на щелчки. Даже опытный пользователь Premiere тратит 1–2 часа на 10-минутный talking head.

Классическая автоматизация (макросы, скрипты) ломается при смене формата контента — правила жёсткие. Video-use делегирует решения о монтаже LLM, но ограничивает его структурированным текстом и зрением по запросу, чтобы модель не гадала по кадрам вслепую. Принцип тот же, что у browser-use: Agent получает структурированный DOM, а не скриншоты.

Подходящие форматы контента

Talking head, скринкасты туториалов, интервью, travel vlog, ролики к релизу — в документации подчёркивается нулевой пресет: нет предположения «это talking head или монтаж». Agent сначала инвентаризирует материалы, спрашивает стратегию, затем выполняет.

2. Ключевые концепции: два слоя чтения и конвейер

Ключевая идея Video-use: LLM никогда не «смотрит» видео — он его «читает». Два информационных слоя обеспечивают точность монтажа по границам слов.

Слой 1 — аудиотранскрипция (всегда загружена)

Каждый исходный файл один раз отправляется в ElevenLabs Scribe, который выдаёт:

  • Пословные таймкоды: начало и конец каждого слова
  • Диаризацию спикеров: различение S0, S1 в интервью с несколькими гостями
  • Аудиособытия: метки вроде (laughter), (applause), (sigh)

Все дубли упаковываются в один файл takes_packed.md объёмом ~12 КБ — основной вид для чтения Agent, формат примерно такой:

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

Для сравнения: наивный подход «30 000 кадров × 1 500 токенов = 45 млн токенов шума». Текстовая поверхность стоит практически ничего.

Слой 2 — визуальный композит (по запросу)

Когда точка склейки неоднозначна — оставить паузу или нет, какой дубль выбрать, не обрезаны ли субтитры — Agent вызывает timeline_view и генерирует PNG-композит плёнки + волны + меток слов. Только в точках решения, без покадрового анализа всего ролика.

Пятиступенчатый конвейер

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

Поток следует схеме Ask → Confirm → Execute → Self-Eval → Persist: сначала предложить стратегию и дождаться подтверждения, затем выполнить; после рендера — самооценка на каждой границе склейки, при необходимости автоисправление и перерендер (до 3 раундов).

Контент-команда обсуждает стратегию монтажа видео — планирование AI Agent воркфлоу
Перед монтажом Agent инвентаризирует материалы, предлагает стратегию и ждёт подтверждения — человек в контуре, а не чёрный ящик

3. Установка и подготовка окружения

Video-use работает с Claude Code, Codex, Hermes, OpenClaw и любым Agent с Shell. Ниже пример для macOS + Claude Code.

Вариант A: одноразовый setup-prompt (рекомендуется)

Вставьте в сессию Agent — он прочитает install.md, клонирует репозиторий, поставит зависимости, зарегистрирует skill и запросит API-ключ ElevenLabs:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

Вариант B: ручная установка

# 1. Клонирование и симлинк в каталог skills Agent
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use     # Codex

# 2. Зависимости
cd ~/Developer/video-use
uv sync                         # или: pip install -e .
brew install ffmpeg             # обязательно
brew install yt-dlp             # опционально, для загрузки онлайн-материалов

# 3. API-ключ ElevenLabs
cp .env.example .env
# Отредактируйте .env: ELEVENLABS_API_KEY=sk_...

Не спешите транскрибировать сразу после установки

Официальная рекомендация: после setup не запускайте транскрипцию сами. Дождитесь папки с материалами, затем пусть Agent идёт по SKILL.md. Ранняя транскрипция тратит квоту Scribe и лишена полного контекста стратегии.

4. Практика: от материалов до final.mp4

4.1 Инвентаризация и подтверждение стратегии

Сложите исходные дубли (.mp4, .mov и т.д.) в одну папку, например ~/Videos/launch-takes/. Запустите Agent из этой директории:

cd ~/Videos/launch-takes
claude    # или codex, openclaw и т.д.

В сессии напишите, например:

Смонтируй из этих материалов релизный ролик: убери слова-паразиты и паузы, добавь субтитры по 2 слова заглавными, тёплая кинематографическая цветокоррекция.

Agent:

  1. Подсчитает исходники: количество, общую длительность, спикеров
  2. Предложит стратегию монтажа (удаление filler, логика выбора дублей, стиль субтитров, пресет цвета)
  3. Дождётся вашего подтверждения перед выполнением — жёсткое правило

4.2 Транскрипция и takes_packed

После подтверждения стратегии Agent вызывает Scribe для каждого файла, строит пословную стенограмму и упаковывает в takes_packed.md. Теперь он «читает» весь текст и планирует EDL (Edit Decision List).

Можно вмешаться по ходу, например:

  • «Фрагмент 18–22 секунды в C0103 оставь — там ключевое демо»
  • «У гостя S1 оставь только Q&A, всё приветствие в начале вырежи»
  • «На метках laughter держи 0,5 секунды перед склейкой»

4.3 EDL и рендер FFmpeg

Agent строит EDL по стенограмме и запускает FFmpeg через скрипты в helpers/:

  • Удаление filler: umm, uh, ложные заходы, тишина между дублями
  • 30 мс fade in/out аудио: на каждой склейке против щелчков
  • Автоцветокоррекция: warm cinematic, neutral punch или своя цепочка ffmpeg
  • Вшитые субтитры: по умолчанию чанки по 2 слова UPPERCASE, стиль настраивается

Весь вывод попадает в <videos_dir>/edit/ — каталог skill остаётся чистым. Итоговый файл обычно edit/final.mp4.

4.4 Цикл самооценки

После рендера Agent на каждой границе склейки запускает timeline_view и проверяет готовый ролик на:

  • Скачки картинки (смещение головы, мерцание фона)
  • Щелчки аудио или недостаточный fade-in
  • Обрезанные или наложенные субтитры

При проблемах корректируется EDL и выполняется перерендер — до 3 раундов. Превью, которое вы видите, уже прошло самооценку — главное отличие от «экспортировал и только тогда увидел плохую склейку».

5. Обзор продвинутых возможностей

Возможность Описание Зависимость
Удаление filler Точность по границам слов: ээ/мм, ложные заходы, тишина между дублями ElevenLabs Scribe
Автоцветокоррекция Сегментированные цепочки ffmpeg; поддержка пользовательских LUT FFmpeg
Вшитые субтитры По умолчанию чанки 2 слова UPPERCASE; стиль полностью настраивается скрипты helpers
Наложение motion graphics Параллельные sub-Agent генерируют анимацию HyperFrames / Remotion / Manim / PIL
Память сессии project.md сохраняет состояние — продолжить на следующей неделе локальные файлы
Онлайн-материалы yt-dlp подтягивает референс или B-roll yt-dlp (опционально)

Наложение motion graphics — заметное нововведение 2026: каждая анимация генерируется отдельным sub-Agent параллельно (HyperFrames, Remotion, Manim или PIL). Главный Agent лишь оркестрирует таймлайн и композит — удобно для схем, карточек данных или брендовой заставки в туториалах.

6. Сценарии на Cloud Mac / Apple Silicon

Video-use по сути — «Python + FFmpeg + Shell Agent» — естественно ложится на облачные macOS-ноды, особенно для таких команд:

Сценарий 1: пакетная обработка материалов удалённо

Съёмочная группа снимает локально и заливает в облако; Claude Code по SSH заходит на Cloud Mac и гоняет полный конвейер на ноде. Аппаратное ускорение FFmpeg на M4 обычно укладывает 10-минутный 4K talking head в несколько минут. На локальном ноутбуке вы получаете лишь уведомление о final.mp4.

Сценарий 2: параллельно с iOS-конвейером

Многие indie на одном Mac и Xcode крутят, и релизные ролики монтируют. Вынесите Video-use на отдельную ноду Cloud Mac — FFmpeg не забивает CPU и не тормозит Simulator. Один Agent может обслуживать очереди «собрать TestFlight» и «смонтировать демо App».

Сценарий 3: always-on бот монтажа

В паре с Browser Use Box или своим VPS + OpenClaw: ссылку на материалы в Telegram → нода сама транскрибирует и монтирует → отдаёт готовый ролик. Подходит для еженедельных выпусков, нарезки курсов и других регулярных объёмов.

Минимальная конфигурация Cloud Mac

  • Чип: Mac mini M4 (лучшее соотношение FFmpeg + Python)
  • Хранилище: ≥ 100 ГБ под материалы или монтирование S3 / облачного диска
  • Сеть: upload влияет на передачу исходников; APAC-ноды удобнее для авторов в Восточной Азии
  • Секреты: ELEVENLABS_API_KEY в .env, не коммитить в Git

7. Стоимость, производительность и риски

Оценка стоимости (10 мин talking head, один спикер, 3 дубля)

Статья Оценка Примечание
ElevenLabs Scribe $0,5–1,5 Оплата за минуты аудио; 3 дубля ≈ 15–20 мин исходника
Сессия Claude Code $1–3 Обсуждение стратегии + EDL + 1–2 раунда самооценки
Нода Cloud Mac Почасово Один черновой монтаж обычно < 1 ч вычислений
Итого $2–5 + нода против 1–2 ч ручного чернового монтажа

Производительность

  • Транскрипция: упирается в сеть; битрейт исходника почти не важен
  • Рендер: M4 силён на 4K многодорожечном + цветокоррекции; 1080p single-track talking head быстрый
  • Motion graphics: параллельные sub-Agent Remotion / Manim — самый долгий опциональный этап

Риски и ограничения

  • Не волшебство: сложный мультикамерный нарратив и тонкий ритм монтажа всё равно требуют финальной проверки человеком
  • Качество Scribe: сильный акцент и громкая фоновая музыка портят границы слов — нужна ручная правка
  • Зависимость от API: при outage ElevenLabs транскрипция недоступна; заранее кэшируйте takes_packed.md
  • Субъективный вкус: 12 жёстких правил гарантируют техническую корректность; «красиво ли» по цвету и ритму — за вами

FAQ

Что такое Video-use и чем он отличается от классических программ монтажа?

Open-source skill для монтажа через Agent: материалы в папке, задача в диалоге, Agent читает стенограмму + зрение по запросу, FFmpeg отдаёт готовый ролик. В отличие от ручного NLE-таймлайна, решения принимает LLM по правилам — вы подтверждаете стратегию.

Какие зависимости нужны?

Python, FFmpeg, API-ключ ElevenLabs, Agent с Shell (Claude Code / Codex / OpenClaw и т.д.). Motion graphics опционально — Remotion, Manim, HyperFrames.

Почему LLM не «смотрит» видео напрямую?

Покадровая подача слишком дорога. Video-use использует ~12 КБ стенограммы как основной вид и генерирует timeline PNG только в неоднозначных точках — как browser-use отдаёт DOM вместо скриншотов.

Подходит ли для Cloud Mac?

Да. Транскрипция и рендер — вычислительные задачи; удалённый Agent по SSH пакетно обрабатывает без присмотра и снимает конкуренцию FFmpeg с локальной сборкой Xcode.

Сколько стоит один монтаж?

~$2–5 за 10-минутный talking head (транскрипция + токены Agent) + время ноды. Лучше всего для регулярных выпусков, нарезки уроков и похожих повторяющихся сценариев.

Итог

Video-use возвращает AI-видео от «генерации фантастических кадров» к «эффективному монтажу реального материала»: пословная транскрипция управляет склейками, зрение по запросу помогает в решениях, FFmpeg гарантирует качество вывода, цикл самооценки сокращает переделки. Для iOS-разработчиков, indie-авторов и небольших команд это воспроизводимый, расширяемый, готовый к облаку Agent-воркфлоу.

Три шага для старта:

  1. Установить skill + FFmpeg + ключ ElevenLabs
  2. Материалы в папку; подтвердить стратегию до выполнения
  3. Тяжёлую работу на Cloud Mac; локально забирать final.mp4

Выбор Agent-инструментов — в рейтинге AI-инструментов для программирования 2026; удалённая оркестрация OpenClaw — в руководстве по установке OpenClaw на удалённый Mac.

Не дайте FFmpeg забить ноутбук — гоняйте конвейер Video-use на Cloud Mac

Транскрипцию, цветокоррекцию и многодорожечный композит вынесите на выделенный Mac mini M4. Claude Code по SSH — без присмотра; локальный Xcode Simulator остаётся отзывчивым.

Тарифы Cloud Mac · Video-use на GitHub

Функции и цены — по официальному репозиторию video-use и сайту ElevenLabs. Обновлено: 5 августа 2026 г.

Полевые заметки · AI-видео

Video-use: монтаж Agent от сценария до готового ролика

Транскрипция ElevenLabs · Рендер FFmpeg · Цикл самооценки · Cloud Mac

Тарифы Cloud Mac
Спецпредложение Смотреть тарифы