Vuncloud 部落格
← 返回機房手記專欄

Video-use 使用教學:從腳本到成片的完整 AI 影片工作流

開源 Agent 剪輯 · ElevenLabs 詞級轉寫 · FFmpeg 渲染 · 自評循環 · Cloud Mac 部署約 12 分鐘閱讀

開發者在 Mac 筆記本上使用 AI Agent 處理影片剪輯腳本與素材,Video-use 工作流場景

2026 年 AI 影片有兩條截然不同的路線:一條用 Sora、Veo 從文字生成畫面;另一條用 Agent 把已有素材剪成成片。後者對口播、教學、訪談、產品發布片更實用——素材是你拍的,AI 負責去廢話、對齊節奏、燒字幕、調色和匯出。

Video-use 正是走第二條路:browser-use 團隊開源的 Agent 影片剪輯技能包。把原始 take 丟進資料夾,跟 Claude Code 說一句「剪成發布片」,等它產出 edit/final.mp4。全程無時間軸 GUI,剪輯邏輯寫在 helpers/ 腳本和 SKILL.md 規則裡。

這篇從原理 → 安裝 → 實操 → Cloud Mac 部署 → 成本風險,帶你跑通從腳本到成片的完整工作流。

100% 開源
MIT · browser-use/video-use
~12KB
takes_packed.md 替代逐幀餵模型
5 步管線
轉寫 → 打包 → 推理 → 渲染 → 自評

一、問題背景:為什麼需要 Agent 剪輯

獨立開發者和內容團隊最常見的痛點不是「不會拍」,而是粗剪耗時:刪「嗯啊」、合併多條 take、對齊字幕、統一色調、檢查切點有沒有爆音。Premiere 熟練工也要 1–2 小時處理 10 分鐘口播。

傳統自動化(巨集、腳本)的問題是:規則寫死,換內容類型就失效。Video-use 把「剪輯決策」交給 LLM,但用結構化文字 + 按需視覺約束它,避免讓模型瞎猜畫面。設計原則和 browser-use 給 Agent 結構化 DOM 而非截圖一脈相承。

適用內容類型

口播、教學錄屏、訪談、旅行 vlog、產品發布——官方強調零預設:不假設你是 talking head 還是 montage,Agent 先清點素材、問你策略,再動手。

二、核心概念:兩層閱讀面與管線

Video-use 的核心理念:LLM 從不「看影片」,而是「讀」影片。 透過兩層資訊完成詞邊界精度的剪輯。

Layer 1 — 音訊轉寫(始終載入)

每個源檔案呼叫一次 ElevenLabs Scribe,得到:

  • 詞級時間戳:精確到每個單字的起止
  • 說話人分離:多嘉賓訪談可區分 S0、S1
  • 音訊事件(laughter)(applause)(sigh) 等標記

所有 take 打包進單個約 12KB 的 takes_packed.md——這是 Agent 的主閱讀視圖,格式類似:

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

對比朴素方案「30,000 幀 × 1,500 token = 4500 萬 token 雜訊」,文字面成本幾乎可以忽略。

Layer 2 — 視覺複合(按需呼叫)

當切點有歧義——停頓該不該留、兩條 take 選哪條、字幕是否被裁切——Agent 呼叫 timeline_view,生成膠片條 + 波形 + 詞標籤的 PNG 合成圖。只在決策點呼叫,不做全片逐幀分析。

五步管線

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

流程遵循 Ask → Confirm → Execute → Self-Eval → Persist:先提案策略等人確認,再執行;渲染後在每個切點邊界自評,有問題自動修復重渲(最多 3 輪)。

內容團隊協作討論影片剪輯策略,AI Agent 影片工作流策劃場景
Agent 剪輯前會先清點素材、提出策略並等待確認——人機協作而非黑盒全自動

三、安裝與環境準備

Video-use 支援 Claude Code、Codex、Hermes、OpenClaw 等任何能跑 Shell 的 Agent。下面以 macOS + Claude Code 為例。

方式 A:一鍵 Setup Prompt(推薦)

把以下內容貼進 Agent 會話,它會讀 install.md 完成克隆、依賴、技能註冊,並向你索要 ElevenLabs API Key:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

方式 B:手動安裝

# 1. 克隆並軟連結到 Agent skills 目錄
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use     # Codex

# 2. 安裝依賴
cd ~/Developer/video-use
uv sync                         # 或: pip install -e .
brew install ffmpeg             # 必需
brew install yt-dlp             # 可選,下載線上素材

# 3. 配置 ElevenLabs API Key
cp .env.example .env
# 編輯 .env:ELEVENLABS_API_KEY=sk_...

安裝後先別急著轉寫

官方建議:安裝完成後不要自行轉寫,等素材資料夾就位後再讓 Agent 按 SKILL.md 流程走。過早轉寫會浪費 Scribe 配額,且缺少完整策略上下文。

四、實操:從素材到 final.mp4

4.1 清點素材與策略確認

把原始 take(.mp4.mov 等)放進同一目錄,例如 ~/Videos/launch-takes/。進入該目錄啟動 Agent:

cd ~/Videos/launch-takes
claude    # 或 codex、openclaw 等

在會話中說:

把這些素材剪成產品發布片,去掉廢話和停頓,加 2 詞一組的大寫字幕,暖色電影感調色。

Agent 會:

  1. 清點源檔案數量、總時長、說話人
  2. 提出剪輯策略(刪 filler、take 選擇邏輯、字幕樣式、調色預設)
  3. 等待你確認後再執行——這是硬性規則之一

4.2 轉寫與 takes_packed

確認策略後,Agent 對每個源檔案呼叫 Scribe,生成詞級轉寫並打包為 takes_packed.md。此時它已能「讀」完整口播內容,開始規劃 EDL(Edit Decision List)。

你可以中途介入,例如:

  • 「C0103 的 18–22 秒那段保留,是重點 demo」
  • 「S1 嘉賓只保留問答部分,開場寒暄全刪」
  • 「laughter 標記處留 0.5 秒再切」

4.3 EDL 與 FFmpeg 渲染

Agent 根據文字稿生成 EDL,呼叫 helpers/ 裡的腳本驅動 FFmpeg:

  • 切 fillerummuh、假起音、take 間死區
  • 30ms 音訊淡入淡出:每個切點避免爆音
  • 自動調色:warm cinematic、neutral punch 或自訂 ffmpeg 鏈
  • 燒錄字幕:預設 2 詞一組 UPPERCASE,可完全自訂樣式

所有輸出落在 <videos_dir>/edit/,技能目錄本身保持乾淨。最終檔案通常是 edit/final.mp4

4.4 自評循環

渲染完成後,Agent 對每個切點邊界執行 timeline_view 檢查成片,捕捉:

  • 畫面跳變(頭部位置突變、背景閃爍)
  • 音訊 pop 或淡入不足
  • 字幕被裁切或重疊

發現問題會自動調整 EDL 重渲,最多 3 輪。你看到的預覽已通過自評——這是和傳統「匯出才發現切壞了」最大的體驗差異。

五、進階能力一覽

能力 說明 依賴
Filler 刪除 詞邊界精度刪嗯啊、假起音、take 間靜音 ElevenLabs Scribe
自動調色 分段 ffmpeg 調色鏈,支援自訂 LUT FFmpeg
字幕燒錄 預設 2 詞 UPPERCASE chunk,樣式可改 helpers 腳本
動畫疊加 並行子 Agent 生成 motion graphics HyperFrames / Remotion / Manim / PIL
會話記憶 project.md 持久化,下週接著剪 本機檔案
線上素材 yt-dlp 拉取參考或 B-roll yt-dlp(可選)

動畫疊加是 2026 版新增亮點:每個動畫由獨立子 Agent 並行生成(HyperFrames、Remotion、Manim 或 PIL),主 Agent 只負責編排時間軸和合成,適合教學裡插入示意圖、資料卡、品牌片頭。

六、與 Cloud Mac / Apple Silicon 的關聯場景

Video-use 本質是「Python + FFmpeg + Agent Shell」——天然適合 macOS 雲節點,尤其適合以下幾類團隊:

場景 1:遠端素材批次處理

拍攝團隊在本機拍完,素材上傳雲端硬碟;Claude Code SSH 登入 Cloud Mac,在節點上跑完整管線。M4 晶片 FFmpeg 硬體加速,10 分鐘 4K 口播渲染通常幾分鐘內完成。你本機筆記本只收 final.mp4 通知。

場景 2:與 iOS 開發流水線並聯

很多獨立開發者同一台 Mac 既跑 Xcode 又剪發布片。把 Video-use 放到獨立 Cloud Mac 節點,避免 FFmpeg 佔滿 CPU 導致模擬器卡頓。Agent 可同時服務「編譯 TestFlight」和「剪 App 演示影片」兩條任務佇列。

場景 3:Always-on 剪輯 Bot

配合 Browser Use Box 或自建 VPS + OpenClaw,Telegram 丟素材連結 → 節點自動轉寫剪輯 → 回傳成片。適合週更口播、課程切片等固定產能場景。

Cloud Mac 最小配置建議

  • 晶片:M4 Mac mini(FFmpeg + Python 性價比最佳)
  • 儲存:素材目錄建議 ≥ 100GB,或掛載 S3 / 雲端硬碟
  • 網路:上行頻寬影響素材上傳;亞太節點對台港創作者更友好
  • 金鑰ELEVENLABS_API_KEY.env,勿提交 Git

七、成本、效能與風險

成本估算(10 分鐘單人口播,3 條 take)

項目 估算 備註
ElevenLabs Scribe $0.5–1.5 按音訊分鐘計費,3 條 take 約 15–20 分鐘源素材
Claude Code 會話 $1–3 策略討論 + EDL 推理 + 1–2 輪自評
Cloud Mac 節點 按小時 單次粗剪通常 < 1 小時算力
合計 $2–5 + 節點費 對比人工粗剪 1–2 小時

效能要點

  • 轉寫:網路 I/O 為主,與源檔案碼率關係不大
  • 渲染:4K 多軌 + 調色鏈時 M4 優勢明顯;1080p 口播單軌很快
  • 動畫疊加:Remotion / Manim 子 Agent 並行,是最耗時的可選環節

風險與侷限

  • 不是魔法:多機位複雜敘事、精細節奏蒙太奇仍需人工終審
  • Scribe 品質:重口音、強背景音樂會影響詞邊界,需人工標註糾錯
  • API 依賴:ElevenLabs outage 時無法轉寫;可提前快取 takes_packed.md
  • 審美主觀:12 條硬規則保證技術正確,調色和節奏「好不好看」仍要人拍板

FAQ

Video-use 是什麼?和傳統剪輯軟體有什麼區別?

開源 Agent 影片剪輯技能包:素材進資料夾,對話描述需求,Agent 讀轉寫文字 + 按需視覺,FFmpeg 出片。與傳統 NLE 的手動時間軸不同,決策由 LLM 按規則完成,人確認策略即可。

需要哪些依賴?

Python、FFmpeg、ElevenLabs API Key、能跑 Shell 的 Agent(Claude Code / Codex / OpenClaw 等)。動畫疊加可選 Remotion、Manim、HyperFrames。

為什麼 LLM 不直接「看影片」?

逐幀成本極高。Video-use 用 ~12KB 文字稿作主視圖,僅在歧義切點生成 timeline PNG——和 browser-use 用 DOM 代替截圖同一思路。

適合在 Cloud Mac 上跑嗎?

非常適合。轉寫、渲染都是算力任務;SSH 遠端 Agent 可無人值守批次處理,與 Xcode 建置搶佔本機 CPU 的問題一併解決。

一次剪輯大概多少費用?

10 分鐘口播約 $2–5(轉寫 + Agent token)+ 雲節點時長。適合週更、教學切片等重複性場景。

總結

Video-use 把 AI 影片從「生成奇幻畫面」拉回「高效剪現實素材」:詞級轉寫驅動剪輯、按需視覺輔助決策、FFmpeg 保證輸出品質、自評循環減少返工。對 iOS 開發者、獨立創作者和小團隊,它是一條可複現、可擴展、可上雲的 Agent 工作流。

上手三步記牢:

  1. 裝技能 + FFmpeg + ElevenLabs Key
  2. 素材進資料夾,先確認策略再執行
  3. 重活放 Cloud Mac,本機只收 final.mp4

Agent 工具選型可參考 2026 AI 編程工具排名;OpenClaw 遠端編排見 OpenClaw 遠端 Mac 安裝指南

FFmpeg 渲染別佔滿你本機:用 Cloud Mac 跑 Video-use 管線

轉寫、調色、多軌合成可以丟到獨享 M4 Mac mini。Claude Code SSH 進去無人值守,本機 Xcode 模擬器不再卡頓。

查看 Cloud Mac 方案 · Video-use GitHub

功能與定價以 video-use 官方倉庫 與 ElevenLabs 官網為準。最後更新:2026 年 8 月 5 日。

機房手記 · AI 影片

Video-use:Agent 剪輯從腳本到成片

ElevenLabs 轉寫 · FFmpeg 渲染 · 自評循環 · Cloud Mac 部署

查看 Cloud Mac 方案
限時優惠 點擊查看方案