В 2026 году AI-видео разветвляется на два принципиально разных пути: один — Sora, Veo и подобные модели генерируют картинку из текста; другой — Agent монтирует уже снятый материал в готовый ролик. Второй путь практичнее для talking head, туториалов, интервью и роликов к релизу продукта: съёмка ваша, а AI убирает слова-паразиты, выравнивает ритм, вшивает субтитры, делает цветокоррекцию и экспорт.
Video-use идёт по второму пути: открытый набор навыков Agent для монтажа от команды browser-use. Сложите исходные дубли в папку, скажите Claude Code «смонтируй релизный ролик» — и дождитесь edit/final.mp4. Без GUI-таймлайна: логика монтажа живёт в скриптах helpers/ и правилах SKILL.md.
Этот материал проведёт вас по полному воркфлоу от сценария до готового ролика: концепция → установка → практика → Cloud Mac → стоимость и риски.
1. Контекст: зачем нужен монтаж через Agent
Главная боль indie-разработчиков и контент-команд — не «не умеем снимать», а черновой монтаж отнимает часы: убрать «эээ/ммм», склеить дубли, выровнять субтитры, унифицировать цвет, проверить склейки на щелчки. Даже опытный пользователь Premiere тратит 1–2 часа на 10-минутный talking head.
Классическая автоматизация (макросы, скрипты) ломается при смене формата контента — правила жёсткие. Video-use делегирует решения о монтаже LLM, но ограничивает его структурированным текстом и зрением по запросу, чтобы модель не гадала по кадрам вслепую. Принцип тот же, что у browser-use: Agent получает структурированный DOM, а не скриншоты.
Подходящие форматы контента
Talking head, скринкасты туториалов, интервью, travel vlog, ролики к релизу — в документации подчёркивается нулевой пресет: нет предположения «это talking head или монтаж». Agent сначала инвентаризирует материалы, спрашивает стратегию, затем выполняет.
2. Ключевые концепции: два слоя чтения и конвейер
Ключевая идея Video-use: LLM никогда не «смотрит» видео — он его «читает». Два информационных слоя обеспечивают точность монтажа по границам слов.
Слой 1 — аудиотранскрипция (всегда загружена)
Каждый исходный файл один раз отправляется в ElevenLabs Scribe, который выдаёт:
- Пословные таймкоды: начало и конец каждого слова
- Диаризацию спикеров: различение S0, S1 в интервью с несколькими гостями
- Аудиособытия: метки вроде
(laughter),(applause),(sigh)
Все дубли упаковываются в один файл takes_packed.md объёмом ~12 КБ — основной вид для чтения Agent, формат примерно такой:
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
Для сравнения: наивный подход «30 000 кадров × 1 500 токенов = 45 млн токенов шума». Текстовая поверхность стоит практически ничего.
Слой 2 — визуальный композит (по запросу)
Когда точка склейки неоднозначна — оставить паузу или нет, какой дубль выбрать, не обрезаны ли субтитры — Agent вызывает timeline_view и генерирует PNG-композит плёнки + волны + меток слов. Только в точках решения, без покадрового анализа всего ролика.
Пятиступенчатый конвейер
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
Поток следует схеме Ask → Confirm → Execute → Self-Eval → Persist: сначала предложить стратегию и дождаться подтверждения, затем выполнить; после рендера — самооценка на каждой границе склейки, при необходимости автоисправление и перерендер (до 3 раундов).
3. Установка и подготовка окружения
Video-use работает с Claude Code, Codex, Hermes, OpenClaw и любым Agent с Shell. Ниже пример для macOS + Claude Code.
Вариант A: одноразовый setup-prompt (рекомендуется)
Вставьте в сессию Agent — он прочитает install.md, клонирует репозиторий, поставит зависимости, зарегистрирует skill и запросит API-ключ ElevenLabs:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
Вариант B: ручная установка
# 1. Клонирование и симлинк в каталог skills Agent
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Зависимости
cd ~/Developer/video-use
uv sync # или: pip install -e .
brew install ffmpeg # обязательно
brew install yt-dlp # опционально, для загрузки онлайн-материалов
# 3. API-ключ ElevenLabs
cp .env.example .env
# Отредактируйте .env: ELEVENLABS_API_KEY=sk_...
Не спешите транскрибировать сразу после установки
Официальная рекомендация: после setup не запускайте транскрипцию сами. Дождитесь папки с материалами, затем пусть Agent идёт по SKILL.md. Ранняя транскрипция тратит квоту Scribe и лишена полного контекста стратегии.
4. Практика: от материалов до final.mp4
4.1 Инвентаризация и подтверждение стратегии
Сложите исходные дубли (.mp4, .mov и т.д.) в одну папку, например ~/Videos/launch-takes/. Запустите Agent из этой директории:
cd ~/Videos/launch-takes
claude # или codex, openclaw и т.д.
В сессии напишите, например:
Смонтируй из этих материалов релизный ролик: убери слова-паразиты и паузы, добавь субтитры по 2 слова заглавными, тёплая кинематографическая цветокоррекция.
Agent:
- Подсчитает исходники: количество, общую длительность, спикеров
- Предложит стратегию монтажа (удаление filler, логика выбора дублей, стиль субтитров, пресет цвета)
- Дождётся вашего подтверждения перед выполнением — жёсткое правило
4.2 Транскрипция и takes_packed
После подтверждения стратегии Agent вызывает Scribe для каждого файла, строит пословную стенограмму и упаковывает в takes_packed.md. Теперь он «читает» весь текст и планирует EDL (Edit Decision List).
Можно вмешаться по ходу, например:
- «Фрагмент 18–22 секунды в C0103 оставь — там ключевое демо»
- «У гостя S1 оставь только Q&A, всё приветствие в начале вырежи»
- «На метках laughter держи 0,5 секунды перед склейкой»
4.3 EDL и рендер FFmpeg
Agent строит EDL по стенограмме и запускает FFmpeg через скрипты в helpers/:
- Удаление filler:
umm,uh, ложные заходы, тишина между дублями - 30 мс fade in/out аудио: на каждой склейке против щелчков
- Автоцветокоррекция: warm cinematic, neutral punch или своя цепочка ffmpeg
- Вшитые субтитры: по умолчанию чанки по 2 слова UPPERCASE, стиль настраивается
Весь вывод попадает в <videos_dir>/edit/ — каталог skill остаётся чистым. Итоговый файл обычно edit/final.mp4.
4.4 Цикл самооценки
После рендера Agent на каждой границе склейки запускает timeline_view и проверяет готовый ролик на:
- Скачки картинки (смещение головы, мерцание фона)
- Щелчки аудио или недостаточный fade-in
- Обрезанные или наложенные субтитры
При проблемах корректируется EDL и выполняется перерендер — до 3 раундов. Превью, которое вы видите, уже прошло самооценку — главное отличие от «экспортировал и только тогда увидел плохую склейку».
5. Обзор продвинутых возможностей
| Возможность | Описание | Зависимость |
|---|---|---|
| Удаление filler | Точность по границам слов: ээ/мм, ложные заходы, тишина между дублями | ElevenLabs Scribe |
| Автоцветокоррекция | Сегментированные цепочки ffmpeg; поддержка пользовательских LUT | FFmpeg |
| Вшитые субтитры | По умолчанию чанки 2 слова UPPERCASE; стиль полностью настраивается | скрипты helpers |
| Наложение motion graphics | Параллельные sub-Agent генерируют анимацию | HyperFrames / Remotion / Manim / PIL |
| Память сессии | project.md сохраняет состояние — продолжить на следующей неделе |
локальные файлы |
| Онлайн-материалы | yt-dlp подтягивает референс или B-roll | yt-dlp (опционально) |
Наложение motion graphics — заметное нововведение 2026: каждая анимация генерируется отдельным sub-Agent параллельно (HyperFrames, Remotion, Manim или PIL). Главный Agent лишь оркестрирует таймлайн и композит — удобно для схем, карточек данных или брендовой заставки в туториалах.
6. Сценарии на Cloud Mac / Apple Silicon
Video-use по сути — «Python + FFmpeg + Shell Agent» — естественно ложится на облачные macOS-ноды, особенно для таких команд:
Сценарий 1: пакетная обработка материалов удалённо
Съёмочная группа снимает локально и заливает в облако; Claude Code по SSH заходит на Cloud Mac и гоняет полный конвейер на ноде. Аппаратное ускорение FFmpeg на M4 обычно укладывает 10-минутный 4K talking head в несколько минут. На локальном ноутбуке вы получаете лишь уведомление о final.mp4.
Сценарий 2: параллельно с iOS-конвейером
Многие indie на одном Mac и Xcode крутят, и релизные ролики монтируют. Вынесите Video-use на отдельную ноду Cloud Mac — FFmpeg не забивает CPU и не тормозит Simulator. Один Agent может обслуживать очереди «собрать TestFlight» и «смонтировать демо App».
Сценарий 3: always-on бот монтажа
В паре с Browser Use Box или своим VPS + OpenClaw: ссылку на материалы в Telegram → нода сама транскрибирует и монтирует → отдаёт готовый ролик. Подходит для еженедельных выпусков, нарезки курсов и других регулярных объёмов.
Минимальная конфигурация Cloud Mac
- Чип: Mac mini M4 (лучшее соотношение FFmpeg + Python)
- Хранилище: ≥ 100 ГБ под материалы или монтирование S3 / облачного диска
- Сеть: upload влияет на передачу исходников; APAC-ноды удобнее для авторов в Восточной Азии
- Секреты:
ELEVENLABS_API_KEYв.env, не коммитить в Git
7. Стоимость, производительность и риски
Оценка стоимости (10 мин talking head, один спикер, 3 дубля)
| Статья | Оценка | Примечание |
|---|---|---|
| ElevenLabs Scribe | $0,5–1,5 | Оплата за минуты аудио; 3 дубля ≈ 15–20 мин исходника |
| Сессия Claude Code | $1–3 | Обсуждение стратегии + EDL + 1–2 раунда самооценки |
| Нода Cloud Mac | Почасово | Один черновой монтаж обычно < 1 ч вычислений |
| Итого | $2–5 + нода | против 1–2 ч ручного чернового монтажа |
Производительность
- Транскрипция: упирается в сеть; битрейт исходника почти не важен
- Рендер: M4 силён на 4K многодорожечном + цветокоррекции; 1080p single-track talking head быстрый
- Motion graphics: параллельные sub-Agent Remotion / Manim — самый долгий опциональный этап
Риски и ограничения
- Не волшебство: сложный мультикамерный нарратив и тонкий ритм монтажа всё равно требуют финальной проверки человеком
- Качество Scribe: сильный акцент и громкая фоновая музыка портят границы слов — нужна ручная правка
- Зависимость от API: при outage ElevenLabs транскрипция недоступна; заранее кэшируйте
takes_packed.md - Субъективный вкус: 12 жёстких правил гарантируют техническую корректность; «красиво ли» по цвету и ритму — за вами
FAQ
Что такое Video-use и чем он отличается от классических программ монтажа?
Open-source skill для монтажа через Agent: материалы в папке, задача в диалоге, Agent читает стенограмму + зрение по запросу, FFmpeg отдаёт готовый ролик. В отличие от ручного NLE-таймлайна, решения принимает LLM по правилам — вы подтверждаете стратегию.
Какие зависимости нужны?
Python, FFmpeg, API-ключ ElevenLabs, Agent с Shell (Claude Code / Codex / OpenClaw и т.д.). Motion graphics опционально — Remotion, Manim, HyperFrames.
Почему LLM не «смотрит» видео напрямую?
Покадровая подача слишком дорога. Video-use использует ~12 КБ стенограммы как основной вид и генерирует timeline PNG только в неоднозначных точках — как browser-use отдаёт DOM вместо скриншотов.
Подходит ли для Cloud Mac?
Да. Транскрипция и рендер — вычислительные задачи; удалённый Agent по SSH пакетно обрабатывает без присмотра и снимает конкуренцию FFmpeg с локальной сборкой Xcode.
Сколько стоит один монтаж?
~$2–5 за 10-минутный talking head (транскрипция + токены Agent) + время ноды. Лучше всего для регулярных выпусков, нарезки уроков и похожих повторяющихся сценариев.
Итог
Video-use возвращает AI-видео от «генерации фантастических кадров» к «эффективному монтажу реального материала»: пословная транскрипция управляет склейками, зрение по запросу помогает в решениях, FFmpeg гарантирует качество вывода, цикл самооценки сокращает переделки. Для iOS-разработчиков, indie-авторов и небольших команд это воспроизводимый, расширяемый, готовый к облаку Agent-воркфлоу.
Три шага для старта:
- Установить skill + FFmpeg + ключ ElevenLabs
- Материалы в папку; подтвердить стратегию до выполнения
- Тяжёлую работу на Cloud Mac; локально забирать final.mp4
Выбор Agent-инструментов — в рейтинге AI-инструментов для программирования 2026; удалённая оркестрация OpenClaw — в руководстве по установке OpenClaw на удалённый Mac.
Не дайте FFmpeg забить ноутбук — гоняйте конвейер Video-use на Cloud Mac
Транскрипцию, цветокоррекцию и многодорожечный композит вынесите на выделенный Mac mini M4. Claude Code по SSH — без присмотра; локальный Xcode Simulator остаётся отзывчивым.
Читайте также
- Лучшие AI-инструменты для программирования в 2026: Claude, Cursor, GitHub Copilot, Codex, Gemini
- Установка OpenClaw на удалённый Mac: SSH/VNC и FAQ по устранению сбоев
- Триада архитектуры персонального AI Agent
- Open-source терминальные инструменты для удалённой разработки на Mac
Функции и цены — по официальному репозиторию video-use и сайту ElevenLabs. Обновлено: 5 августа 2026 г.