2026 年 AI 影片有兩條截然不同的路線:一條用 Sora、Veo 從文字生成畫面;另一條用 Agent 把已有素材剪成成片。後者對口播、教學、訪談、產品發布片更實用——素材是你拍的,AI 負責去廢話、對齊節奏、燒字幕、調色和匯出。
Video-use 正是走第二條路:browser-use 團隊開源的 Agent 影片剪輯技能包。把原始 take 丟進資料夾,跟 Claude Code 說一句「剪成發布片」,等它產出 edit/final.mp4。全程無時間軸 GUI,剪輯邏輯寫在 helpers/ 腳本和 SKILL.md 規則裡。
這篇從原理 → 安裝 → 實操 → Cloud Mac 部署 → 成本風險,帶你跑通從腳本到成片的完整工作流。
一、問題背景:為什麼需要 Agent 剪輯
獨立開發者和內容團隊最常見的痛點不是「不會拍」,而是粗剪耗時:刪「嗯啊」、合併多條 take、對齊字幕、統一色調、檢查切點有沒有爆音。Premiere 熟練工也要 1–2 小時處理 10 分鐘口播。
傳統自動化(巨集、腳本)的問題是:規則寫死,換內容類型就失效。Video-use 把「剪輯決策」交給 LLM,但用結構化文字 + 按需視覺約束它,避免讓模型瞎猜畫面。設計原則和 browser-use 給 Agent 結構化 DOM 而非截圖一脈相承。
適用內容類型
口播、教學錄屏、訪談、旅行 vlog、產品發布——官方強調零預設:不假設你是 talking head 還是 montage,Agent 先清點素材、問你策略,再動手。
二、核心概念:兩層閱讀面與管線
Video-use 的核心理念:LLM 從不「看影片」,而是「讀」影片。 透過兩層資訊完成詞邊界精度的剪輯。
Layer 1 — 音訊轉寫(始終載入)
每個源檔案呼叫一次 ElevenLabs Scribe,得到:
- 詞級時間戳:精確到每個單字的起止
- 說話人分離:多嘉賓訪談可區分 S0、S1
- 音訊事件:
(laughter)、(applause)、(sigh)等標記
所有 take 打包進單個約 12KB 的 takes_packed.md——這是 Agent 的主閱讀視圖,格式類似:
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
對比朴素方案「30,000 幀 × 1,500 token = 4500 萬 token 雜訊」,文字面成本幾乎可以忽略。
Layer 2 — 視覺複合(按需呼叫)
當切點有歧義——停頓該不該留、兩條 take 選哪條、字幕是否被裁切——Agent 呼叫 timeline_view,生成膠片條 + 波形 + 詞標籤的 PNG 合成圖。只在決策點呼叫,不做全片逐幀分析。
五步管線
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
流程遵循 Ask → Confirm → Execute → Self-Eval → Persist:先提案策略等人確認,再執行;渲染後在每個切點邊界自評,有問題自動修復重渲(最多 3 輪)。
三、安裝與環境準備
Video-use 支援 Claude Code、Codex、Hermes、OpenClaw 等任何能跑 Shell 的 Agent。下面以 macOS + Claude Code 為例。
方式 A:一鍵 Setup Prompt(推薦)
把以下內容貼進 Agent 會話,它會讀 install.md 完成克隆、依賴、技能註冊,並向你索要 ElevenLabs API Key:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
方式 B:手動安裝
# 1. 克隆並軟連結到 Agent skills 目錄
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. 安裝依賴
cd ~/Developer/video-use
uv sync # 或: pip install -e .
brew install ffmpeg # 必需
brew install yt-dlp # 可選,下載線上素材
# 3. 配置 ElevenLabs API Key
cp .env.example .env
# 編輯 .env:ELEVENLABS_API_KEY=sk_...
安裝後先別急著轉寫
官方建議:安裝完成後不要自行轉寫,等素材資料夾就位後再讓 Agent 按 SKILL.md 流程走。過早轉寫會浪費 Scribe 配額,且缺少完整策略上下文。
四、實操:從素材到 final.mp4
4.1 清點素材與策略確認
把原始 take(.mp4、.mov 等)放進同一目錄,例如 ~/Videos/launch-takes/。進入該目錄啟動 Agent:
cd ~/Videos/launch-takes
claude # 或 codex、openclaw 等
在會話中說:
把這些素材剪成產品發布片,去掉廢話和停頓,加 2 詞一組的大寫字幕,暖色電影感調色。
Agent 會:
- 清點源檔案數量、總時長、說話人
- 提出剪輯策略(刪 filler、take 選擇邏輯、字幕樣式、調色預設)
- 等待你確認後再執行——這是硬性規則之一
4.2 轉寫與 takes_packed
確認策略後,Agent 對每個源檔案呼叫 Scribe,生成詞級轉寫並打包為 takes_packed.md。此時它已能「讀」完整口播內容,開始規劃 EDL(Edit Decision List)。
你可以中途介入,例如:
- 「C0103 的 18–22 秒那段保留,是重點 demo」
- 「S1 嘉賓只保留問答部分,開場寒暄全刪」
- 「laughter 標記處留 0.5 秒再切」
4.3 EDL 與 FFmpeg 渲染
Agent 根據文字稿生成 EDL,呼叫 helpers/ 裡的腳本驅動 FFmpeg:
- 切 filler:
umm、uh、假起音、take 間死區 - 30ms 音訊淡入淡出:每個切點避免爆音
- 自動調色:warm cinematic、neutral punch 或自訂 ffmpeg 鏈
- 燒錄字幕:預設 2 詞一組 UPPERCASE,可完全自訂樣式
所有輸出落在 <videos_dir>/edit/,技能目錄本身保持乾淨。最終檔案通常是 edit/final.mp4。
4.4 自評循環
渲染完成後,Agent 對每個切點邊界執行 timeline_view 檢查成片,捕捉:
- 畫面跳變(頭部位置突變、背景閃爍)
- 音訊 pop 或淡入不足
- 字幕被裁切或重疊
發現問題會自動調整 EDL 重渲,最多 3 輪。你看到的預覽已通過自評——這是和傳統「匯出才發現切壞了」最大的體驗差異。
五、進階能力一覽
| 能力 | 說明 | 依賴 |
|---|---|---|
| Filler 刪除 | 詞邊界精度刪嗯啊、假起音、take 間靜音 | ElevenLabs Scribe |
| 自動調色 | 分段 ffmpeg 調色鏈,支援自訂 LUT | FFmpeg |
| 字幕燒錄 | 預設 2 詞 UPPERCASE chunk,樣式可改 | helpers 腳本 |
| 動畫疊加 | 並行子 Agent 生成 motion graphics | HyperFrames / Remotion / Manim / PIL |
| 會話記憶 | project.md 持久化,下週接著剪 |
本機檔案 |
| 線上素材 | yt-dlp 拉取參考或 B-roll | yt-dlp(可選) |
動畫疊加是 2026 版新增亮點:每個動畫由獨立子 Agent 並行生成(HyperFrames、Remotion、Manim 或 PIL),主 Agent 只負責編排時間軸和合成,適合教學裡插入示意圖、資料卡、品牌片頭。
六、與 Cloud Mac / Apple Silicon 的關聯場景
Video-use 本質是「Python + FFmpeg + Agent Shell」——天然適合 macOS 雲節點,尤其適合以下幾類團隊:
場景 1:遠端素材批次處理
拍攝團隊在本機拍完,素材上傳雲端硬碟;Claude Code SSH 登入 Cloud Mac,在節點上跑完整管線。M4 晶片 FFmpeg 硬體加速,10 分鐘 4K 口播渲染通常幾分鐘內完成。你本機筆記本只收 final.mp4 通知。
場景 2:與 iOS 開發流水線並聯
很多獨立開發者同一台 Mac 既跑 Xcode 又剪發布片。把 Video-use 放到獨立 Cloud Mac 節點,避免 FFmpeg 佔滿 CPU 導致模擬器卡頓。Agent 可同時服務「編譯 TestFlight」和「剪 App 演示影片」兩條任務佇列。
場景 3:Always-on 剪輯 Bot
配合 Browser Use Box 或自建 VPS + OpenClaw,Telegram 丟素材連結 → 節點自動轉寫剪輯 → 回傳成片。適合週更口播、課程切片等固定產能場景。
Cloud Mac 最小配置建議
- 晶片:M4 Mac mini(FFmpeg + Python 性價比最佳)
- 儲存:素材目錄建議 ≥ 100GB,或掛載 S3 / 雲端硬碟
- 網路:上行頻寬影響素材上傳;亞太節點對台港創作者更友好
- 金鑰:
ELEVENLABS_API_KEY放.env,勿提交 Git
七、成本、效能與風險
成本估算(10 分鐘單人口播,3 條 take)
| 項目 | 估算 | 備註 |
|---|---|---|
| ElevenLabs Scribe | $0.5–1.5 | 按音訊分鐘計費,3 條 take 約 15–20 分鐘源素材 |
| Claude Code 會話 | $1–3 | 策略討論 + EDL 推理 + 1–2 輪自評 |
| Cloud Mac 節點 | 按小時 | 單次粗剪通常 < 1 小時算力 |
| 合計 | $2–5 + 節點費 | 對比人工粗剪 1–2 小時 |
效能要點
- 轉寫:網路 I/O 為主,與源檔案碼率關係不大
- 渲染:4K 多軌 + 調色鏈時 M4 優勢明顯;1080p 口播單軌很快
- 動畫疊加:Remotion / Manim 子 Agent 並行,是最耗時的可選環節
風險與侷限
- 不是魔法:多機位複雜敘事、精細節奏蒙太奇仍需人工終審
- Scribe 品質:重口音、強背景音樂會影響詞邊界,需人工標註糾錯
- API 依賴:ElevenLabs outage 時無法轉寫;可提前快取
takes_packed.md - 審美主觀:12 條硬規則保證技術正確,調色和節奏「好不好看」仍要人拍板
FAQ
Video-use 是什麼?和傳統剪輯軟體有什麼區別?
開源 Agent 影片剪輯技能包:素材進資料夾,對話描述需求,Agent 讀轉寫文字 + 按需視覺,FFmpeg 出片。與傳統 NLE 的手動時間軸不同,決策由 LLM 按規則完成,人確認策略即可。
需要哪些依賴?
Python、FFmpeg、ElevenLabs API Key、能跑 Shell 的 Agent(Claude Code / Codex / OpenClaw 等)。動畫疊加可選 Remotion、Manim、HyperFrames。
為什麼 LLM 不直接「看影片」?
逐幀成本極高。Video-use 用 ~12KB 文字稿作主視圖,僅在歧義切點生成 timeline PNG——和 browser-use 用 DOM 代替截圖同一思路。
適合在 Cloud Mac 上跑嗎?
非常適合。轉寫、渲染都是算力任務;SSH 遠端 Agent 可無人值守批次處理,與 Xcode 建置搶佔本機 CPU 的問題一併解決。
一次剪輯大概多少費用?
10 分鐘口播約 $2–5(轉寫 + Agent token)+ 雲節點時長。適合週更、教學切片等重複性場景。
總結
Video-use 把 AI 影片從「生成奇幻畫面」拉回「高效剪現實素材」:詞級轉寫驅動剪輯、按需視覺輔助決策、FFmpeg 保證輸出品質、自評循環減少返工。對 iOS 開發者、獨立創作者和小團隊,它是一條可複現、可擴展、可上雲的 Agent 工作流。
上手三步記牢:
- 裝技能 + FFmpeg + ElevenLabs Key
- 素材進資料夾,先確認策略再執行
- 重活放 Cloud Mac,本機只收 final.mp4
Agent 工具選型可參考 2026 AI 編程工具排名;OpenClaw 遠端編排見 OpenClaw 遠端 Mac 安裝指南。
FFmpeg 渲染別佔滿你本機:用 Cloud Mac 跑 Video-use 管線
轉寫、調色、多軌合成可以丟到獨享 M4 Mac mini。Claude Code SSH 進去無人值守,本機 Xcode 模擬器不再卡頓。
相關閱讀
- 2026 最好的 AI 編程工具排名:Claude、Cursor、GitHub Copilot、Codex、Gemini
- OpenClaw 遠端 Mac 安裝與 SSH/VNC 排障 FAQ
- 個人 AI Agent 架構三要素
- 遠端 Mac 開發必備開源終端工具
功能與定價以 video-use 官方倉庫 與 ElevenLabs 官網為準。最後更新:2026 年 8 月 5 日。