2026 年 AI 视频有两条截然不同的路线:一条用 Sora、Veo 从文字生成画面;另一条用 Agent 把已有素材剪成成片。后者对口播、教程、访谈、产品发布片更实用——素材是你拍的,AI 负责去废话、对齐节奏、烧字幕、调色和导出。
Video-use 正是走第二条路:browser-use 团队开源的 Agent 视频剪辑技能包。把原始 take 丢进文件夹,跟 Claude Code 说一句「剪成发布片」,等它产出 edit/final.mp4。全程无时间线 GUI,剪辑逻辑写在 helpers/ 脚本和 SKILL.md 规则里。
这篇从原理 → 安装 → 实操 → Cloud Mac 部署 → 成本风险,带你跑通从脚本到成片的完整工作流。
一、问题背景:为什么需要 Agent 剪辑
独立开发者和内容团队最常见的痛点不是「不会拍」,而是粗剪耗时:删「嗯啊」、合并多条 take、对齐字幕、统一色调、检查切点有没有爆音。Premiere 熟练工也要 1–2 小时处理 10 分钟口播。
传统自动化(宏、脚本)的问题是:规则写死,换内容类型就失效。Video-use 把「剪辑决策」交给 LLM,但用结构化文本 + 按需视觉约束它,避免让模型瞎猜画面。设计原则和 browser-use 给 Agent 结构化 DOM 而非截图一脉相承。
适用内容类型
口播、教程录屏、访谈、旅行 vlog、产品发布——官方强调零预设:不假设你是 talking head 还是 montage,Agent 先清点素材、问你策略,再动手。
二、核心概念:两层阅读面与管线
Video-use 的核心理念:LLM 从不「看视频」,而是「读」视频。 通过两层信息完成词边界精度的剪辑。
Layer 1 — 音频转写(始终加载)
每个源文件调用一次 ElevenLabs Scribe,得到:
- 词级时间戳:精确到每个单词的起止
- 说话人分离:多嘉宾访谈可区分 S0、S1
- 音频事件:
(laughter)、(applause)、(sigh)等标记
所有 take 打包进单个约 12KB 的 takes_packed.md——这是 Agent 的主阅读视图,格式类似:
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
对比朴素方案「30,000 帧 × 1,500 token = 4500 万 token 噪声」,文本面成本几乎可以忽略。
Layer 2 — 视觉复合(按需调用)
当切点有歧义——停顿该不该留、两条 take 选哪条、字幕是否被裁切——Agent 调用 timeline_view,生成胶片条 + 波形 + 词标签的 PNG 合成图。只在决策点调用,不做全片逐帧分析。
五步管线
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
流程遵循 Ask → Confirm → Execute → Self-Eval → Persist:先提案策略等人确认,再执行;渲染后在每个切点边界自评,有问题自动修复重渲(最多 3 轮)。
三、安装与环境准备
Video-use 支持 Claude Code、Codex、Hermes、OpenClaw 等任何能跑 Shell 的 Agent。下面以 macOS + Claude Code 为例。
方式 A:一键 Setup Prompt(推荐)
把以下内容粘贴进 Agent 会话,它会读 install.md 完成克隆、依赖、技能注册,并向你索要 ElevenLabs API Key:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
方式 B:手动安装
# 1. 克隆并软链到 Agent skills 目录
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. 安装依赖
cd ~/Developer/video-use
uv sync # 或: pip install -e .
brew install ffmpeg # 必需
brew install yt-dlp # 可选,下载在线素材
# 3. 配置 ElevenLabs API Key
cp .env.example .env
# 编辑 .env:ELEVENLABS_API_KEY=sk_...
安装后先别急着转写
官方建议:安装完成后不要自行转写,等素材文件夹就位后再让 Agent 按 SKILL.md 流程走。过早转写会浪费 Scribe 配额,且缺少完整策略上下文。
四、实操:从素材到 final.mp4
4.1 清点素材与策略确认
把原始 take(.mp4、.mov 等)放进同一目录,例如 ~/Videos/launch-takes/。进入该目录启动 Agent:
cd ~/Videos/launch-takes
claude # 或 codex、openclaw 等
在会话中说:
把这些素材剪成产品发布片,去掉废话和停顿,加 2 词一组的大写字幕,暖色电影感调色。
Agent 会:
- 清点源文件数量、总时长、说话人
- 提出剪辑策略(删 filler、take 选择逻辑、字幕样式、调色预设)
- 等待你确认后再执行——这是硬性规则之一
4.2 转写与 takes_packed
确认策略后,Agent 对每个源文件调用 Scribe,生成词级转写并打包为 takes_packed.md。此时它已能「读」完整口播内容,开始规划 EDL(Edit Decision List)。
你可以中途介入,例如:
- 「C0103 的 18–22 秒那段保留,是重点 demo」
- 「S1 嘉宾只保留问答部分,开场寒暄全删」
- 「 laughter 标记处留 0.5 秒再切」
4.3 EDL 与 FFmpeg 渲染
Agent 根据文字稿生成 EDL,调用 helpers/ 里的脚本驱动 FFmpeg:
- 切 filler:
umm、uh、假起音、take 间死区 - 30ms 音频淡入淡出:每个切点避免爆音
- 自动调色:warm cinematic、neutral punch 或自定义 ffmpeg 链
- 烧录字幕:默认 2 词一组 UPPERCASE,可完全自定义样式
所有输出落在 <videos_dir>/edit/,技能目录本身保持干净。最终文件通常是 edit/final.mp4。
4.4 自评循环
渲染完成后,Agent 对每个切点边界运行 timeline_view 检查成片,捕捉:
- 画面跳变(头部位置突变、背景闪烁)
- 音频 pop 或淡入不足
- 字幕被裁切或重叠
发现问题会自动调整 EDL 重渲,最多 3 轮。你看到的预览已通过自评——这是和传统「导出才发现切坏了」最大的体验差异。
五、进阶能力一览
| 能力 | 说明 | 依赖 |
|---|---|---|
| Filler 删除 | 词边界精度删嗯啊、假起音、take 间静音 | ElevenLabs Scribe |
| 自动调色 | 分段 ffmpeg 调色链,支持自定义 LUT | FFmpeg |
| 字幕烧录 | 默认 2 词 UPPERCASE chunk,样式可改 | helpers 脚本 |
| 动画叠加 | 并行子 Agent 生成 motion graphics | HyperFrames / Remotion / Manim / PIL |
| 会话记忆 | project.md 持久化,下周接着剪 |
本地文件 |
| 在线素材 | yt-dlp 拉取参考或 B-roll | yt-dlp(可选) |
动画叠加是 2026 版新增亮点:每个动画由独立子 Agent 并行生成(HyperFrames、Remotion、Manim 或 PIL),主 Agent 只负责编排时间线和合成,适合教程里插入示意图、数据卡、品牌片头。
六、与 Cloud Mac / Apple Silicon 的关联场景
Video-use 本质是「Python + FFmpeg + Agent Shell」——天然适合 macOS 云节点,尤其适合以下几类团队:
场景 1:远程素材批处理
拍摄团队在本地拍完,素材上传云盘;Claude Code SSH 登录 Cloud Mac,在节点上跑完整管线。M4 芯片 FFmpeg 硬件加速,10 分钟 4K 口播渲染通常几分钟内完成。你本地笔记本只收 final.mp4 通知。
场景 2:与 iOS 开发流水线并联
很多独立开发者同一台 Mac 既跑 Xcode 又剪发布片。把 Video-use 放到独立 Cloud Mac 节点,避免 FFmpeg 占满 CPU 导致模拟器卡顿。Agent 可同时服务「编译 TestFlight」和「剪 App 演示视频」两条任务队列。
场景 3:Always-on 剪辑 Bot
配合 Browser Use Box 或自建 VPS + OpenClaw,Telegram 丢素材链接 → 节点自动转写剪辑 → 回传成片。适合周更口播、课程切片等固定产能场景。
Cloud Mac 最小配置建议
- 芯片:M4 Mac mini(FFmpeg + Python 性价比最佳)
- 存储:素材目录建议 ≥ 100GB,或挂载 S3 / 云盘
- 网络:上行带宽影响素材上传;亚太节点对国内创作者更友好
- 密钥:
ELEVENLABS_API_KEY放.env,勿提交 Git
七、成本、性能与风险
成本估算(10 分钟单人口播,3 条 take)
| 项目 | 估算 | 备注 |
|---|---|---|
| ElevenLabs Scribe | $0.5–1.5 | 按音频分钟计费,3 条 take 约 15–20 分钟源素材 |
| Claude Code 会话 | $1–3 | 策略讨论 + EDL 推理 + 1–2 轮自评 |
| Cloud Mac 节点 | 按小时 | 单次粗剪通常 < 1 小时算力 |
| 合计 | $2–5 + 节点费 | 对比人工粗剪 1–2 小时 |
性能要点
- 转写:网络 I/O 为主,与源文件码率关系不大
- 渲染:4K 多轨 + 调色链时 M4 优势明显;1080p 口播单轨很快
- 动画叠加:Remotion / Manim 子 Agent 并行,是最耗时的可选环节
风险与局限
- 不是魔法:多机位复杂叙事、精细节奏蒙太奇仍需人工终审
- Scribe 质量:重口音、强背景音乐会影响词边界,需人工标注纠错
- API 依赖:ElevenLabs outage 时无法转写;可提前缓存
takes_packed.md - 审美主观:12 条硬规则保证技术正确,调色和节奏「好不好看」仍要人拍板
FAQ
Video-use 是什么?和传统剪辑软件有什么区别?
开源 Agent 视频剪辑技能包:素材进文件夹,对话描述需求,Agent 读转写文本 + 按需视觉,FFmpeg 出片。与传统 NLE 的手动时间线不同,决策由 LLM 按规则完成,人确认策略即可。
需要哪些依赖?
Python、FFmpeg、ElevenLabs API Key、能跑 Shell 的 Agent(Claude Code / Codex / OpenClaw 等)。动画叠加可选 Remotion、Manim、HyperFrames。
为什么 LLM 不直接「看视频」?
逐帧成本极高。Video-use 用 ~12KB 文字稿作主视图,仅在歧义切点生成 timeline PNG——和 browser-use 用 DOM 代替截图同一思路。
适合在 Cloud Mac 上跑吗?
非常适合。转写、渲染都是算力任务;SSH 远程 Agent 可无人值守批处理,与 Xcode 构建争抢本地 CPU 的问题一并解决。
一次剪辑大概多少费用?
10 分钟口播约 $2–5(转写 + Agent token)+ 云节点时长。适合周更、教程切片等重复性场景。
总结
Video-use 把 AI 视频从「生成奇幻画面」拉回「高效剪现实素材」:词级转写驱动剪辑、按需视觉辅助决策、FFmpeg 保证输出质量、自评循环减少返工。对 iOS 开发者、独立创作者和小团队,它是一条可复现、可扩展、可上云的 Agent 工作流。
上手三步记牢:
- 装技能 + FFmpeg + ElevenLabs Key
- 素材进文件夹,先确认策略再执行
- 重活放 Cloud Mac,本地只收 final.mp4
Agent 工具选型可参考 2026 AI 编程工具排名;OpenClaw 远程编排见 OpenClaw 远程 Mac 安装指南。
FFmpeg 渲染别占满你本机:用 Cloud Mac 跑 Video-use 管线
转写、调色、多轨合成可以丢到独享 M4 Mac mini。Claude Code SSH 进去无人值守,本地 Xcode 模拟器不再卡顿。
相关阅读
- 2026 最好的 AI 编程工具排名:Claude、Cursor、GitHub Copilot、Codex、Gemini
- OpenClaw 远程 Mac 安装与 SSH/VNC 排障 FAQ
- 个人 AI Agent 架构三要素
- 远程 Mac 开发必备开源终端工具
功能与定价以 video-use 官方仓库 与 ElevenLabs 官网为准。最后更新:2026 年 8 月 5 日。