Vuncloud 블로그
← 개발 노트로 돌아가기

Video-use 사용 튜토리얼: 스크립트에서 완성 영상까지의 완전한 AI 비디오 워크플로

오픈소스 Agent 편집 · ElevenLabs 단어 단위 전사 · FFmpeg 렌더링 · 자기 평가 루프 · Cloud Mac 배포약 12분 읽기

Mac 노트북에서 AI Agent로 영상 편집 스크립트와 소재를 처리하는 개발자—Video-use 워크플로 장면

2026년 AI 영상에는 완전히 다른 두 갈래가 있습니다. 하나는 Sora, Veo처럼 텍스트에서 화면을 생성하는 길이고, 다른 하나는 Agent가 기존 소재를 편집해 완성본으로 만드는 길입니다. 후자는 토킹헤드, 튜토리얼, 인터뷰, 제품 발표 영상에 더 실용적입니다—촬영한 소재는 그대로 두고, AI가 필러 삭제, 리듬 맞추기, 자막 번인, 색보정, 보내기를 담당합니다.

Video-use는 바로 후자의 길을 택합니다: browser-use 팀이 공개한 Agent 영상 편집 스킬 패키지입니다. 원본 테이크를 폴더에 넣고 Claude Code에 「발표용으로 편집해 줘」라고 말하면 edit/final.mp4가 나올 때까지 기다리면 됩니다. 타임라인 GUI는 없고, 편집 로직은 helpers/ 스크립트와 SKILL.md 규칙에 담겨 있습니다.

이 글에서는 원리 → 설치 → 실습 → Cloud Mac 배포 → 비용·리스크 순으로, 스크립트에서 완성 영상까지의 워크플로를 끝까지 안내합니다.

100% 오픈소스
MIT · browser-use/video-use
~12KB
takes_packed.md로 프레임 단위 입력 대체
5단계 파이프라인
전사 → 패킹 → 추론 → 렌더링 → 자기 평가

1. 문제 배경: Agent 편집이 필요한 이유

인디 개발자와 콘텐츠 팀이 가장 흔히 겪는 고통은 「촬영을 못 한다」가 아니라 러프컷에 시간이 너무 든다는 점입니다. 「음」「어」 삭제, 여러 테이크 병합, 자막 맞추기, 톤 통일, 컷 지점 클릭음 점검—Premiere에 익숙한 사람도 10분 토킹헤드에 1–2시간은 씁니다.

기존 자동화(매크로, 스크립트)의 한계는 규칙이 고정돼 콘텐츠 유형이 바뀌면 바로 무너진다는 것입니다. Video-use는 「편집 결정」을 LLM에 맡기되, 구조화 텍스트 + 필요 시 시각 정보로 제약해 모델이 화면을 추측하지 않게 합니다. 설계 원칙은 browser-use가 Agent에게 스크린샷 대신 구조화 DOM을 주는 것과 같은 계열입니다.

적합한 콘텐츠 유형

토킹헤드, 튜토리얼 녹화, 인터뷰, 여행 브이로그, 제품 발표—공식 문서는 사전 가정 없음을 강조합니다. 토킹헤드인지 몽타주인지 가정하지 않고, Agent가 먼저 소재를 정리한 뒤 전략을 물어보고 실행합니다.

2. 핵심 개념: 이중 읽기면과 파이프라인

Video-use의 핵심: LLM은 영상을 「보지」 않고 「읽는다」. 두 겹의 정보로 단어 경계 정밀도의 편집을 달성합니다.

Layer 1 — 오디오 전사(항상 로드)

각 소스 파일마다 ElevenLabs Scribe를 한 번 호출해 다음을 얻습니다:

  • 단어 단위 타임스탬프: 각 단어의 시작·종료 시각
  • 화자 분리: 다인 인터뷰에서 S0, S1 구분
  • 오디오 이벤트: (laughter), (applause), (sigh) 등 태그

모든 테이크를 약 12KB짜리 단일 takes_packed.md에 패킹합니다—이것이 Agent의 주 읽기 뷰이며, 형식은 대략 다음과 같습니다:

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

「30,000프레임 × 1,500토큰 = 4,500만 토큰 노이즈」 같은 단순 방식과 비교하면 텍스트 면의 비용은 사실상 무시할 수 있습니다.

Layer 2 — 시각 합성(필요 시 호출)

컷 지점이 애매할 때—침묵을 남길지, 두 테이크 중 어느 것을 쓸지, 자막이 잘리는지—Agent는 timeline_view를 호출해 필름스트립 + 파형 + 단어 라벨이 합쳐진 PNG를 생성합니다. 결정 지점에서만 호출하며, 전체 프레임을 분석하지 않습니다.

5단계 파이프라인

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

흐름은 Ask → Confirm → Execute → Self-Eval → Persist를 따릅니다: 먼저 전략을 제안하고 확인을 받은 뒤 실행하고, 렌더 후 각 컷 경계에서 자기 평가를 수행하며 문제가 있으면 자동 수정·재렌더(최대 3회)합니다.

콘텐츠 팀이 영상 편집 전략을 논의하는 장면—AI Agent 비디오 워크플로 기획
Agent는 편집 전에 소재를 정리하고 전략을 제안한 뒤 확인을 기다립니다—블랙박스 자동화가 아닌 인간-AI 협업

3. 설치와 환경 준비

Video-use는 Claude Code, Codex, Hermes, OpenClaw 등 Shell을 실행할 수 있는 Agent와 함께 쓸 수 있습니다. 아래는 macOS + Claude Code 예시입니다.

방법 A: 원클릭 Setup Prompt(권장)

다음 내용을 Agent 세션에 붙여 넣으면 install.md를 읽고 클론, 의존성, 스킬 등록을 마친 뒤 ElevenLabs API Key를 요청합니다:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

방법 B: 수동 설치

# 1. 클론 후 Agent skills 디렉터리에 심볼릭 링크
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use     # Codex

# 2. 의존성 설치
cd ~/Developer/video-use
uv sync                         # 또는: pip install -e .
brew install ffmpeg             # 필수
brew install yt-dlp             # 선택, 온라인 소재 다운로드

# 3. ElevenLabs API Key 설정
cp .env.example .env
# .env 편집: ELEVENLABS_API_KEY=sk_...

설치 직후 전사부터 하지 마세요

공식 권장: 설치가 끝나면 스스로 전사하지 말고 소재 폴더가 준비된 뒤 Agent가 SKILL.md 흐름대로 진행하게 하세요. 너무 일찍 전사하면 Scribe 할당량을 낭비하고 전략 맥락도 부족합니다.

4. 실습: 소재에서 final.mp4까지

4.1 소재 정리와 전략 확인

원본 테이크(.mp4, .mov 등)를 같은 디렉터리에 넣습니다. 예: ~/Videos/launch-takes/. 해당 디렉터리에서 Agent를 시작합니다:

cd ~/Videos/launch-takes
claude    # 또는 codex, openclaw 등

세션에서 이렇게 말합니다:

이 소재를 제품 발표 영상으로 편집해 줘. 군더더기와 침묵은 빼고, 2단어씩 대문자 자막을 넣고, 따뜻한 시네마틱 톤으로 색보정해 줘.

Agent는 다음을 수행합니다:

  1. 소스 파일 수, 총 길이, 화자 파악
  2. 편집 전략 제안(필러 삭제, 테이크 선택 로직, 자막 스타일, 색 프리셋)
  3. 확인을 받은 뒤 실행—이것이 하드 규칙 중 하나입니다

4.2 전사와 takes_packed

전략 확인 후 Agent는 각 소스에 Scribe를 호출해 단어 단위 전사를 만들고 takes_packed.md로 패킹합니다. 이 시점부터 전체 대본을 「읽을」 수 있어 EDL(Edit Decision List)을 계획합니다.

중간에 이렇게 개입할 수 있습니다:

  • 「C0103의 18–22초 구간은 남겨 줘, 핵심 데모야」
  • 「S1 게스트는 Q&A만 남기고 인사말은 전부 삭제」
  • 「laughter 태그 지점은 0.5초 남기고 컷」

4.3 EDL과 FFmpeg 렌더링

Agent는 대본을 바탕으로 EDL을 만들고 helpers/ 스크립트로 FFmpeg를 구동합니다:

  • 필러 제거: umm, uh, 허수, 테이크 사이 공백
  • 30ms 오디오 페이드: 각 컷에서 클릭음 방지
  • 자동 색보정: warm cinematic, neutral punch 또는 커스텀 ffmpeg 체인
  • 자막 번인: 기본 2단어 UPPERCASE 청크, 스타일 완전 커스터마이즈 가능

모든 출력은 <videos_dir>/edit/에 두며 스킬 디렉터리는 깨끗하게 유지합니다. 최종 파일은 보통 edit/final.mp4입니다.

4.4 자기 평가 루프

렌더가 끝나면 Agent는 각 컷 경계에서 timeline_view로 완성본을 점검합니다:

  • 화면 점프(머리 위치 급변, 배경 깜빡임)
  • 오디오 pop 또는 페이드 부족
  • 자막 잘림·겹침

문제가 있으면 EDL을 조정해 재렌더하며, 최대 3회입니다. 미리보기는 이미 자기 평가를 거친 상태—기존 「보내고 나서 컷이 깨진 걸 발견」하는 경험과 가장 큰 차이입니다.

5. 고급 기능 한눈에

기능 설명 의존성
필러 삭제 단어 경계 정밀도로 음·어, 허수, 테이크 사이 침묵 제거 ElevenLabs Scribe
자동 색보정 구간별 ffmpeg 색보정 체인, 커스텀 LUT 지원 FFmpeg
자막 번인 기본 2단어 UPPERCASE 청크, 스타일 변경 가능 helpers 스크립트
모션 그래픽 오버레이 병렬 서브 Agent로 모션 그래픽 생성 HyperFrames / Remotion / Manim / PIL
세션 메모리 project.md로 지속 저장, 다음 주 이어서 편집 로컬 파일
온라인 소재 yt-dlp로 참고 영상·B-roll 가져오기 yt-dlp(선택)

모션 그래픽 오버레이는 2026판 하이라이트입니다. 각 애니메이션을 독립 서브 Agent가 병렬 생성(HyperFrames, Remotion, Manim 또는 PIL)하고, 메인 Agent는 타임라인 배치와 합성만 담당합니다. 튜토리얼에 도식, 데이터 카드, 브랜드 인트로를 넣기에 적합합니다.

6. Cloud Mac / Apple Silicon 연계 시나리오

Video-use는 본질적으로 「Python + FFmpeg + Agent Shell」—macOS 클라우드 노드에 잘 맞습니다. 특히 다음 팀에 유용합니다:

시나리오 1: 원격 소재 배치 처리

촬영팀은 로컬에서 촬영하고 소재를 클라우드에 업로드합니다. Claude Code가 SSH로 Cloud Mac에 로그인해 노드에서 전체 파이프라인을 실행합니다. M4 칩의 FFmpeg 하드웨어 가속으로 10분 4K 토킹헤드는 보통 몇 분 안에 끝납니다. 로컬 노트북은 final.mp4 알림만 받으면 됩니다.

시나리오 2: iOS 개발 파이프라인과 병렬

많은 인디 개발자가 한 대의 Mac에서 Xcode와 발표 영상 편집을 동시에 합니다. Video-use를 별도 Cloud Mac 노드에 두면 FFmpeg가 CPU를 다 쓰지 않아 시뮬레이터가 버벅이지 않습니다. Agent는 「TestFlight 빌드」와 「앱 데모 영상 편집」 두 작업 큐를 동시에 서비스할 수 있습니다.

시나리오 3: Always-on 편집 봇

Browser Use Box 또는 자체 VPS + OpenClaw와 결합하면 Telegram에 소재 링크를 던지면 노드가 자동 전사·편집 후 완성본을 돌려줍니다. 주간 토킹헤드, 강의 클립 등 고정 생산량에 맞습니다.

Cloud Mac 최소 구성 권장

  • : M4 Mac mini(FFmpeg + Python 가성비 최적)
  • 스토리지: 소재 디렉터리 ≥ 100GB 또는 S3·클라우드 드라이브 마운트
  • 네트워크: 업로드 속도가 소재 전송에 영향; 아시아·태평양 노드는 한국 크리에이터에 유리
  • : ELEVENLABS_API_KEY.env에 두고 Git에 커밋하지 마세요

7. 비용, 성능, 리스크

비용 추정(10분 단독 토킹헤드, 3테이크)

항목 추정 비고
ElevenLabs Scribe $0.5–1.5 오디오 분당 과금, 3테이크 약 15–20분 원본
Claude Code 세션 $1–3 전략 논의 + EDL 추론 + 1–2회 자기 평가
Cloud Mac 노드 시간당 러프컷 1회 보통 1시간 미만
합계 $2–5 + 노드 비용 수작업 러프컷 1–2시간 대비

성능 포인트

  • 전사: 네트워크 I/O 위주, 소스 비트레이트와 큰 상관 없음
  • 렌더링: 4K 멀티트랙 + 색보정 체인에서 M4 이점 큼; 1080p 단일 트랙 토킹헤드는 매우 빠름
  • 모션 오버레이: Remotion / Manim 서브 Agent 병렬이 가장 오래 걸리는 선택 단계

리스크와 한계

  • 만능은 아님: 멀티캠 복잡 서사, 정밀 몽타주 리듬은 여전히 사람 최종 검수 필요
  • Scribe 품질: 강한 억양·배경음악은 단어 경계에 영향; 수동 교정 필요할 수 있음
  • API 의존: ElevenLabs 장애 시 전사 불가; takes_packed.md를 미리 캐시해 두면 안전
  • 미적 주관: 12개 하드 규칙은 기술적 정확성을 보장하지만 색감·리듬 「예쁨」은 사람이 결정

FAQ

Video-use란 무엇이며 기존 편집 소프트웨어와 어떻게 다른가요?

오픈소스 Agent 영상 편집 스킬 패키지입니다. 소재를 폴더에 넣고 대화로 요구사항을 전달하면 Agent가 전사 텍스트와 필요 시 시각 정보를 읽고 FFmpeg로 출력합니다. 기존 NLE의 수동 타임라인과 달리 결정은 LLM이 규칙에 따라 수행하고, 사람은 전략만 확인합니다.

어떤 의존성이 필요한가요?

Python, FFmpeg, ElevenLabs API Key, Shell을 실행할 Agent(Claude Code / Codex / OpenClaw 등). 모션 오버레이는 Remotion, Manim, HyperFrames를 선택적으로 씁니다.

LLM은 왜 영상을 직접 「보지」 않나요?

프레임 단위 비용이 너무 큽니다. Video-use는 ~12KB 대본을 주 뷰로 쓰고 애매한 컷에서만 timeline PNG를 생성합니다—browser-use가 스크린샷 대신 DOM을 쓰는 것과 같은 사고방식입니다.

Cloud Mac에서 실행하기에 적합한가요?

매우 적합합니다. 전사·렌더링은 연산 작업이고 SSH 원격 Agent로 무인 배치 처리가 가능해 로컬 Xcode 빌드와 CPU 경쟁 문제를 함께 줄일 수 있습니다.

한 번 편집 비용은 얼마나 드나요?

10분 토킹헤드 기준 약 $2–5(전사 + Agent 토큰) + 클라우드 노드 시간. 주간 연재, 튜토리얼 클립 등 반복 시나리오에 맞습니다.

요약

Video-use는 AI 영상을 「환상적 화면 생성」에서 「현실 소재를 빠르게 편집」하는 쪽으로 끌어옵니다: 단어 단위 전사가 편집을 주도하고, 필요 시 시각 정보가 결정을 돕고, FFmpeg가 출력 품질을 보장하며, 자기 평가 루프가 재작업을 줄입니다. iOS 개발자, 인디 크리에이터, 소규모 팀에게 재현 가능하고 확장 가능하며 클라우드에 올릴 수 있는 Agent 워크플로입니다.

시작은 세 단계만 기억하세요:

  1. 스킬 + FFmpeg + ElevenLabs Key 설치
  2. 소재를 폴더에 넣고, 실행 전 전략 확인
  3. 무거운 작업은 Cloud Mac에, 로컬은 final.mp4만 수신

Agent 도구 선택은 2026 AI 코딩 도구 순위를, OpenClaw 원격 오케스트레이션은 OpenClaw 원격 Mac 설치 가이드를 참고하세요.

FFmpeg 렌더링이 로컬 PC를 잡아먹지 않게: Cloud Mac에서 Video-use 파이프라인 실행

전사, 색보정, 멀티트랙 합성은 전용 M4 Mac mini에 맡기세요. Claude Code로 SSH 접속하면 무인 실행되고 로컬 Xcode 시뮬레이터는 여유롭게 유지됩니다.

Cloud Mac 요금제 보기 · Video-use GitHub

기능과 요금은 video-use 공식 저장소와 ElevenLabs 공식 사이트 기준입니다. 최종 업데이트: 2026년 8월 6일.

개발 노트 · AI 영상

Video-use: 스크립트에서 완성 영상까지 Agent 편집

ElevenLabs 전사 · FFmpeg 렌더링 · 자기 평가 루프 · Cloud Mac 배포

Cloud Mac 플랜 보기
한정 혜택 플랜 보기