Vuncloud 博客
← 返回机房手记专栏

Video-use 使用教程:从脚本到成片的完整 AI 视频工作流

开源 Agent 剪辑 · ElevenLabs 词级转写 · FFmpeg 渲染 · 自评循环 · Cloud Mac 部署约 12 分钟阅读

开发者在 Mac 笔记本上使用 AI Agent 处理视频剪辑脚本与素材,Video-use 工作流场景

2026 年 AI 视频有两条截然不同的路线:一条用 Sora、Veo 从文字生成画面;另一条用 Agent 把已有素材剪成成片。后者对口播、教程、访谈、产品发布片更实用——素材是你拍的,AI 负责去废话、对齐节奏、烧字幕、调色和导出。

Video-use 正是走第二条路:browser-use 团队开源的 Agent 视频剪辑技能包。把原始 take 丢进文件夹,跟 Claude Code 说一句「剪成发布片」,等它产出 edit/final.mp4。全程无时间线 GUI,剪辑逻辑写在 helpers/ 脚本和 SKILL.md 规则里。

这篇从原理 → 安装 → 实操 → Cloud Mac 部署 → 成本风险,带你跑通从脚本到成片的完整工作流。

100% 开源
MIT · browser-use/video-use
~12KB
takes_packed.md 替代逐帧喂模型
5 步管线
转写 → 打包 → 推理 → 渲染 → 自评

一、问题背景:为什么需要 Agent 剪辑

独立开发者和内容团队最常见的痛点不是「不会拍」,而是粗剪耗时:删「嗯啊」、合并多条 take、对齐字幕、统一色调、检查切点有没有爆音。Premiere 熟练工也要 1–2 小时处理 10 分钟口播。

传统自动化(宏、脚本)的问题是:规则写死,换内容类型就失效。Video-use 把「剪辑决策」交给 LLM,但用结构化文本 + 按需视觉约束它,避免让模型瞎猜画面。设计原则和 browser-use 给 Agent 结构化 DOM 而非截图一脉相承。

适用内容类型

口播、教程录屏、访谈、旅行 vlog、产品发布——官方强调零预设:不假设你是 talking head 还是 montage,Agent 先清点素材、问你策略,再动手。

二、核心概念:两层阅读面与管线

Video-use 的核心理念:LLM 从不「看视频」,而是「读」视频。 通过两层信息完成词边界精度的剪辑。

Layer 1 — 音频转写(始终加载)

每个源文件调用一次 ElevenLabs Scribe,得到:

  • 词级时间戳:精确到每个单词的起止
  • 说话人分离:多嘉宾访谈可区分 S0、S1
  • 音频事件(laughter)(applause)(sigh) 等标记

所有 take 打包进单个约 12KB 的 takes_packed.md——这是 Agent 的主阅读视图,格式类似:

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

对比朴素方案「30,000 帧 × 1,500 token = 4500 万 token 噪声」,文本面成本几乎可以忽略。

Layer 2 — 视觉复合(按需调用)

当切点有歧义——停顿该不该留、两条 take 选哪条、字幕是否被裁切——Agent 调用 timeline_view,生成胶片条 + 波形 + 词标签的 PNG 合成图。只在决策点调用,不做全片逐帧分析。

五步管线

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

流程遵循 Ask → Confirm → Execute → Self-Eval → Persist:先提案策略等人确认,再执行;渲染后在每个切点边界自评,有问题自动修复重渲(最多 3 轮)。

内容团队协作讨论视频剪辑策略,AI Agent 视频工作流策划场景
Agent 剪辑前会先清点素材、提出策略并等待确认——人机协作而非黑盒全自动

三、安装与环境准备

Video-use 支持 Claude Code、Codex、Hermes、OpenClaw 等任何能跑 Shell 的 Agent。下面以 macOS + Claude Code 为例。

方式 A:一键 Setup Prompt(推荐)

把以下内容粘贴进 Agent 会话,它会读 install.md 完成克隆、依赖、技能注册,并向你索要 ElevenLabs API Key:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

方式 B:手动安装

# 1. 克隆并软链到 Agent skills 目录
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use     # Codex

# 2. 安装依赖
cd ~/Developer/video-use
uv sync                         # 或: pip install -e .
brew install ffmpeg             # 必需
brew install yt-dlp             # 可选,下载在线素材

# 3. 配置 ElevenLabs API Key
cp .env.example .env
# 编辑 .env:ELEVENLABS_API_KEY=sk_...

安装后先别急着转写

官方建议:安装完成后不要自行转写,等素材文件夹就位后再让 Agent 按 SKILL.md 流程走。过早转写会浪费 Scribe 配额,且缺少完整策略上下文。

四、实操:从素材到 final.mp4

4.1 清点素材与策略确认

把原始 take(.mp4.mov 等)放进同一目录,例如 ~/Videos/launch-takes/。进入该目录启动 Agent:

cd ~/Videos/launch-takes
claude    # 或 codex、openclaw 等

在会话中说:

把这些素材剪成产品发布片,去掉废话和停顿,加 2 词一组的大写字幕,暖色电影感调色。

Agent 会:

  1. 清点源文件数量、总时长、说话人
  2. 提出剪辑策略(删 filler、take 选择逻辑、字幕样式、调色预设)
  3. 等待你确认后再执行——这是硬性规则之一

4.2 转写与 takes_packed

确认策略后,Agent 对每个源文件调用 Scribe,生成词级转写并打包为 takes_packed.md。此时它已能「读」完整口播内容,开始规划 EDL(Edit Decision List)。

你可以中途介入,例如:

  • 「C0103 的 18–22 秒那段保留,是重点 demo」
  • 「S1 嘉宾只保留问答部分,开场寒暄全删」
  • 「 laughter 标记处留 0.5 秒再切」

4.3 EDL 与 FFmpeg 渲染

Agent 根据文字稿生成 EDL,调用 helpers/ 里的脚本驱动 FFmpeg:

  • 切 fillerummuh、假起音、take 间死区
  • 30ms 音频淡入淡出:每个切点避免爆音
  • 自动调色:warm cinematic、neutral punch 或自定义 ffmpeg 链
  • 烧录字幕:默认 2 词一组 UPPERCASE,可完全自定义样式

所有输出落在 <videos_dir>/edit/,技能目录本身保持干净。最终文件通常是 edit/final.mp4

4.4 自评循环

渲染完成后,Agent 对每个切点边界运行 timeline_view 检查成片,捕捉:

  • 画面跳变(头部位置突变、背景闪烁)
  • 音频 pop 或淡入不足
  • 字幕被裁切或重叠

发现问题会自动调整 EDL 重渲,最多 3 轮。你看到的预览已通过自评——这是和传统「导出才发现切坏了」最大的体验差异。

五、进阶能力一览

能力 说明 依赖
Filler 删除 词边界精度删嗯啊、假起音、take 间静音 ElevenLabs Scribe
自动调色 分段 ffmpeg 调色链,支持自定义 LUT FFmpeg
字幕烧录 默认 2 词 UPPERCASE chunk,样式可改 helpers 脚本
动画叠加 并行子 Agent 生成 motion graphics HyperFrames / Remotion / Manim / PIL
会话记忆 project.md 持久化,下周接着剪 本地文件
在线素材 yt-dlp 拉取参考或 B-roll yt-dlp(可选)

动画叠加是 2026 版新增亮点:每个动画由独立子 Agent 并行生成(HyperFrames、Remotion、Manim 或 PIL),主 Agent 只负责编排时间线和合成,适合教程里插入示意图、数据卡、品牌片头。

六、与 Cloud Mac / Apple Silicon 的关联场景

Video-use 本质是「Python + FFmpeg + Agent Shell」——天然适合 macOS 云节点,尤其适合以下几类团队:

场景 1:远程素材批处理

拍摄团队在本地拍完,素材上传云盘;Claude Code SSH 登录 Cloud Mac,在节点上跑完整管线。M4 芯片 FFmpeg 硬件加速,10 分钟 4K 口播渲染通常几分钟内完成。你本地笔记本只收 final.mp4 通知。

场景 2:与 iOS 开发流水线并联

很多独立开发者同一台 Mac 既跑 Xcode 又剪发布片。把 Video-use 放到独立 Cloud Mac 节点,避免 FFmpeg 占满 CPU 导致模拟器卡顿。Agent 可同时服务「编译 TestFlight」和「剪 App 演示视频」两条任务队列。

场景 3:Always-on 剪辑 Bot

配合 Browser Use Box 或自建 VPS + OpenClaw,Telegram 丢素材链接 → 节点自动转写剪辑 → 回传成片。适合周更口播、课程切片等固定产能场景。

Cloud Mac 最小配置建议

  • 芯片:M4 Mac mini(FFmpeg + Python 性价比最佳)
  • 存储:素材目录建议 ≥ 100GB,或挂载 S3 / 云盘
  • 网络:上行带宽影响素材上传;亚太节点对国内创作者更友好
  • 密钥ELEVENLABS_API_KEY.env,勿提交 Git

七、成本、性能与风险

成本估算(10 分钟单人口播,3 条 take)

项目 估算 备注
ElevenLabs Scribe $0.5–1.5 按音频分钟计费,3 条 take 约 15–20 分钟源素材
Claude Code 会话 $1–3 策略讨论 + EDL 推理 + 1–2 轮自评
Cloud Mac 节点 按小时 单次粗剪通常 < 1 小时算力
合计 $2–5 + 节点费 对比人工粗剪 1–2 小时

性能要点

  • 转写:网络 I/O 为主,与源文件码率关系不大
  • 渲染:4K 多轨 + 调色链时 M4 优势明显;1080p 口播单轨很快
  • 动画叠加:Remotion / Manim 子 Agent 并行,是最耗时的可选环节

风险与局限

  • 不是魔法:多机位复杂叙事、精细节奏蒙太奇仍需人工终审
  • Scribe 质量:重口音、强背景音乐会影响词边界,需人工标注纠错
  • API 依赖:ElevenLabs outage 时无法转写;可提前缓存 takes_packed.md
  • 审美主观:12 条硬规则保证技术正确,调色和节奏「好不好看」仍要人拍板

FAQ

Video-use 是什么?和传统剪辑软件有什么区别?

开源 Agent 视频剪辑技能包:素材进文件夹,对话描述需求,Agent 读转写文本 + 按需视觉,FFmpeg 出片。与传统 NLE 的手动时间线不同,决策由 LLM 按规则完成,人确认策略即可。

需要哪些依赖?

Python、FFmpeg、ElevenLabs API Key、能跑 Shell 的 Agent(Claude Code / Codex / OpenClaw 等)。动画叠加可选 Remotion、Manim、HyperFrames。

为什么 LLM 不直接「看视频」?

逐帧成本极高。Video-use 用 ~12KB 文字稿作主视图,仅在歧义切点生成 timeline PNG——和 browser-use 用 DOM 代替截图同一思路。

适合在 Cloud Mac 上跑吗?

非常适合。转写、渲染都是算力任务;SSH 远程 Agent 可无人值守批处理,与 Xcode 构建争抢本地 CPU 的问题一并解决。

一次剪辑大概多少费用?

10 分钟口播约 $2–5(转写 + Agent token)+ 云节点时长。适合周更、教程切片等重复性场景。

总结

Video-use 把 AI 视频从「生成奇幻画面」拉回「高效剪现实素材」:词级转写驱动剪辑、按需视觉辅助决策、FFmpeg 保证输出质量、自评循环减少返工。对 iOS 开发者、独立创作者和小团队,它是一条可复现、可扩展、可上云的 Agent 工作流。

上手三步记牢:

  1. 装技能 + FFmpeg + ElevenLabs Key
  2. 素材进文件夹,先确认策略再执行
  3. 重活放 Cloud Mac,本地只收 final.mp4

Agent 工具选型可参考 2026 AI 编程工具排名;OpenClaw 远程编排见 OpenClaw 远程 Mac 安装指南

FFmpeg 渲染别占满你本机:用 Cloud Mac 跑 Video-use 管线

转写、调色、多轨合成可以丢到独享 M4 Mac mini。Claude Code SSH 进去无人值守,本地 Xcode 模拟器不再卡顿。

查看 Cloud Mac 套餐 · Video-use GitHub

功能与定价以 video-use 官方仓库 与 ElevenLabs 官网为准。最后更新:2026 年 8 月 5 日。

机房手记 · AI 视频

Video-use:Agent 剪辑从脚本到成片

ElevenLabs 转写 · FFmpeg 渲染 · 自评循环 · Cloud Mac 部署

查看 Cloud Mac 套餐
限时优惠 点击查看套餐