Vuncloud Blog
← Retour aux Notes dev

Tutoriel Video-use : workflow vidéo IA complet du script au montage final

Montage Agent open source · Transcription ElevenLabs au niveau du mot · Rendu FFmpeg · Boucle d'auto-évaluation · Déploiement Cloud Mac~12 min de lecture

Développeur sur Mac portable utilisant un Agent IA pour traiter scripts de montage vidéo et rushs — scène workflow Video-use

En 2026, la vidéo IA se divise en deux voies très différentes : l'une utilise Sora, Veo et modèles similaires pour générer des images à partir de texte ; l'autre emploie des Agents pour monter du matériel existant en pièce finie. La seconde voie est plus pratique pour les face caméra, tutoriels, interviews et bandes-annonces de lancement — vous filmez le contenu, et l'IA s'occupe de supprimer les hésitations, aligner le rythme, incruster les sous-titres, étalonner les couleurs et exporter.

Video-use emprunte cette seconde voie : un pack de compétences open source de montage vidéo Agent, publié par l'équipe browser-use. Déposez vos prises brutes dans un dossier, dites à Claude Code « monte-moi une bande-annonce de lancement », et attendez edit/final.mp4. Pas d'interface timeline — la logique de montage vit dans les scripts helpers/ et les règles SKILL.md.

Ce guide vous accompagne du script au montage final : concepts → installation → pratique → déploiement Cloud Mac → coûts et risques.

100 % open source
MIT · browser-use/video-use
~12 Ko
takes_packed.md remplace l'envoi image par image au modèle
Pipeline en 5 étapes
Transcrire → Empaqueter → Raisonner → Rendre → Auto-évaluer

1. Contexte : pourquoi le montage Agent compte

Le point de friction le plus fréquent pour les développeurs indépendants et les équipes contenu n'est pas « je ne sais pas filmer », mais le temps de montage brut : supprimer les « euh », fusionner plusieurs prises, aligner les sous-titres, uniformiser la colorimétrie, vérifier que les coupes ne créent pas de pops audio. Même un habitué de Premiere met 1 à 2 heures sur un face caméra de 10 minutes.

L'automatisation classique (macros, scripts) échoue parce que les règles sont rigides — changez le type de contenu, et tout casse. Video-use délègue les décisions de montage à un LLM, mais le contraint avec du texte structuré + vision à la demande, pour éviter que le modèle devine à l'aveugle sur les images. Le design reprend la logique de browser-use : donner à l'Agent un DOM structuré plutôt que des captures d'écran.

Types de contenu adaptés

Face caméra, enregistrements d'écran tutoriels, interviews, vlogs voyage, lancements produit — la documentation officielle insiste sur zéro préréglage : pas d'hypothèse sur face caméra ou montage. L'Agent inventorie d'abord le matériel, vous demande votre stratégie, puis exécute.

2. Concepts clés : deux couches de lecture et le pipeline

L'idée centrale de Video-use : le LLM ne « regarde » jamais la vidéo — il la « lit ». Deux couches d'information permettent un montage précis au niveau des mots.

Couche 1 — transcription audio (toujours chargée)

Chaque fichier source est envoyé une fois à ElevenLabs Scribe, qui fournit :

  • Horodatage au niveau du mot : début et fin de chaque mot
  • Diarisation des locuteurs : distinguer S0, S1 dans les interviews multi-invités
  • Événements audio : marqueurs comme (laughter), (applause), (sigh)

Toutes les prises sont regroupées dans un seul takes_packed.md d'environ 12 Ko — la vue de lecture principale de l'Agent, au format :

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

À comparer à l'approche naïve « 30 000 images × 1 500 tokens = 45 millions de tokens de bruit » : le coût de la couche texte est quasi négligeable.

Couche 2 — composite visuel (appel à la demande)

Quand un point de coupe est ambigu — faut-il garder la pause, quelle prise choisir, les sous-titres sont-ils rognés — l'Agent appelle timeline_view pour générer un PNG composite pellicule + forme d'onde + étiquettes de mots. Appel uniquement aux points de décision, pas d'analyse frame par frame sur tout le film.

Pipeline en cinq étapes

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

Le flux suit Ask → Confirm → Execute → Self-Eval → Persist : proposer une stratégie et attendre votre validation avant d'exécuter ; après le rendu, auto-évaluation à chaque frontière de coupe, correction et nouveau rendu si besoin (3 tours maximum).

Équipe contenu en réunion pour définir la stratégie de montage vidéo — planification workflow Agent IA
Avant de monter, l'Agent inventorie le matériel, propose une stratégie et attend votre confirmation — collaboration homme-machine, pas boîte noire

3. Installation et préparation de l'environnement

Video-use fonctionne avec Claude Code, Codex, Hermes, OpenClaw ou tout Agent capable d'exécuter du Shell. Ci-dessous : macOS + Claude Code.

Méthode A : prompt Setup en une commande (recommandé)

Collez le texte suivant dans une session Agent ; il lira install.md pour cloner le dépôt, installer les dépendances, enregistrer la compétence et vous demander la clé API ElevenLabs :

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

Méthode B : installation manuelle

# 1. Cloner et lier vers le dossier skills de l'Agent
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use     # Codex

# 2. Installer les dépendances
cd ~/Developer/video-use
uv sync                         # ou : pip install -e .
brew install ffmpeg             # obligatoire
brew install yt-dlp             # optionnel, téléchargement de rushs en ligne

# 3. Configurer la clé API ElevenLabs
cp .env.example .env
# Éditer .env : ELEVENLABS_API_KEY=sk_...

Ne transcrivez pas tout de suite après l'installation

La doc officielle recommande de ne pas lancer la transcription seul après l'installation : attendez que le dossier de rushs soit prêt, puis laissez l'Agent suivre le flux SKILL.md. Une transcription trop tôt gaspille le quota Scribe et manque le contexte stratégique complet.

4. Pratique : des rushs à final.mp4

4.1 Inventorier les rushs et valider la stratégie

Placez les prises brutes (.mp4, .mov, etc.) dans un même répertoire, par exemple ~/Videos/launch-takes/. Lancez l'Agent depuis ce dossier :

cd ~/Videos/launch-takes
claude    # ou codex, openclaw, etc.

Dans la session, dites par exemple :

Monte ces rushs en bande-annonce de lancement : supprime les hésitations et les pauses, ajoute des sous-titres en majuscules par groupes de 2 mots, étalonnage chaud type cinéma.

L'Agent va :

  1. Inventorier le nombre de fichiers sources, la durée totale et les locuteurs
  2. Proposer une stratégie de montage (suppression des fillers, logique de choix des prises, style de sous-titres, preset colorimétrique)
  3. Attendre votre confirmation avant d'exécuter — c'est l'une des règles strictes

4.2 Transcription et takes_packed

Après validation de la stratégie, l'Agent appelle Scribe sur chaque fichier source, génère la transcription au niveau du mot et la regroupe dans takes_packed.md. Il peut alors « lire » l'intégralité du script et planifier l'EDL (Edit Decision List).

Vous pouvez intervenir en cours de route, par exemple :

  • « Garde les secondes 18–22 de C0103, c'est la démo clé »
  • « Pour l'invité S1, ne garde que la partie Q&R, supprime les salutations d'ouverture »
  • « Aux marqueurs laughter, laisse 0,5 seconde avant de couper »

4.3 EDL et rendu FFmpeg

L'Agent génère l'EDL à partir de la transcription et pilote FFmpeg via les scripts helpers/ :

  • Suppression des fillers : umm, uh, faux départs, silences entre prises
  • Fondus audio de 30 ms : à chaque coupe, pour éviter les pops
  • Étalonnage automatique : warm cinematic, neutral punch ou chaîne ffmpeg personnalisée
  • Incrustation des sous-titres : par défaut groupes de 2 mots en MAJUSCULES, style entièrement personnalisable

Toutes les sorties vont dans <videos_dir>/edit/ ; le dossier de la compétence reste propre. Le fichier final est en général edit/final.mp4.

4.4 Boucle d'auto-évaluation

Après le rendu, l'Agent exécute timeline_view à chaque frontière de coupe pour contrôler le résultat et détecter :

  • Sauts d'image (position de tête, scintillement d'arrière-plan)
  • Pops audio ou fondus insuffisants
  • Sous-titres rognés ou chevauchés

En cas de problème, l'EDL est ajusté et un nouveau rendu est lancé (3 tours max). L'aperçu que vous voyez a déjà passé l'auto-évaluation — c'est la plus grande différence avec l'export classique « on découvre la coupe ratée après coup ».

5. Fonctionnalités avancées

Fonctionnalité Description Dépendance
Suppression des fillers Suppression précise au niveau des mots : hésitations, faux départs, silences entre prises ElevenLabs Scribe
Étalonnage automatique Chaîne ffmpeg par segment, LUT personnalisée possible FFmpeg
Incrustation sous-titres Par défaut chunks de 2 mots en MAJUSCULES, style modifiable Scripts helpers
Superpositions animées Sous-Agents parallèles pour motion graphics HyperFrames / Remotion / Manim / PIL
Mémoire de session project.md persistant, reprise la semaine suivante Fichiers locaux
Rushs en ligne yt-dlp pour références ou B-roll yt-dlp (optionnel)

Les superpositions animées sont un point fort de la version 2026 : chaque animation est générée par un sous-Agent parallèle (HyperFrames, Remotion, Manim ou PIL), l'Agent principal n'orchestre que la timeline et la composition — idéal pour insérer schémas, cartes de données ou générique de marque dans un tutoriel.

6. Scénarios Cloud Mac / Apple Silicon

Video-use, c'est essentiellement « Python + FFmpeg + Shell Agent » — naturellement adapté aux nœuds macOS cloud, notamment pour :

Scénario 1 : traitement batch de rushs à distance

L'équipe tourne en local, les rushs montent sur le cloud ; Claude Code se connecte en SSH au Cloud Mac et exécute tout le pipeline sur le nœud. Sur puce M4, l'accélération matérielle FFmpeg rend un face caméra 4K de 10 minutes en quelques minutes. Votre portable ne reçoit qu'une notification final.mp4.

Scénario 2 : parallèle avec la chaîne de dev iOS

Beaucoup d'indépendants utilisent le même Mac pour Xcode et le montage de lancement. Déplacez Video-use sur un nœud Cloud Mac dédié pour éviter que FFmpeg sature le CPU et fasse ramer le simulateur. L'Agent peut servir deux files : « compiler TestFlight » et « monter la démo App ».

Scénario 3 : bot de montage always-on

Avec Browser Use Box ou un VPS + OpenClaw maison : lien rush sur Telegram → le nœud transcrit et monte → renvoie le fichier fini. Adapté aux face caméra hebdomadaires, découpage de cours, etc.

Configuration Cloud Mac minimale recommandée

  • Puce : Mac mini M4 (meilleur rapport prix/perf pour FFmpeg + Python)
  • Stockage : dossier rushs ≥ 100 Go, ou montage S3 / cloud
  • Réseau : bande passante montante pour l'upload des rushs ; nœud Asie-Pacifique souvent plus pratique pour les créateurs en Chine
  • Clés : ELEVENLABS_API_KEY dans .env, ne pas committer dans Git

7. Coûts, performances et risques

Estimation des coûts (face caméra 10 min, 1 locuteur, 3 prises)

Poste Estimation Remarque
ElevenLabs Scribe 0,50–1,50 $ Facturation à la minute audio, 3 prises ≈ 15–20 min de source
Session Claude Code 1–3 $ Discussion stratégie + raisonnement EDL + 1–2 tours d'auto-évaluation
Nœud Cloud Mac À l'heure Un montage brut tient souvent en < 1 h de calcul
Total 2–5 $ + nœud À comparer à 1–2 h de montage brut manuel

Points de performance

  • Transcription : surtout I/O réseau, peu liée au débit source
  • Rendu : M4 avantageux en 4K multi-pistes + chaîne colorimétrique ; 1080p face caméra mono-piste, très rapide
  • Superpositions animées : sous-Agents Remotion / Manim en parallèle, étape optionnelle la plus longue

Risques et limites

  • Pas de magie : récits multi-caméras complexes, montage au rythme fin demandent encore une relecture humaine
  • Qualité Scribe : fort accent, musique de fond marquée dégradent les frontières de mots — corrections manuelles possibles
  • Dépendance API : panne ElevenLabs bloque la transcription ; vous pouvez mettre en cache takes_packed.md
  • Subjectivité esthétique : 12 règles strictes garantissent la correction technique ; couleur et rythme « beaux » restent à valider par vous

FAQ

Qu'est-ce que Video-use ? En quoi diffère-t-il des logiciels de montage classiques ?

Pack open source de montage vidéo Agent : rushs dans un dossier, besoins décrits en conversation, l'Agent lit transcription + vision à la demande, FFmpeg produit le fichier. Contrairement aux NLE manuels, les décisions viennent du LLM selon les règles — vous validez la stratégie.

Quelles dépendances sont nécessaires ?

Python, FFmpeg, clé API ElevenLabs, Agent Shell (Claude Code / Codex / OpenClaw, etc.). Superpositions animées optionnelles : Remotion, Manim, HyperFrames.

Pourquoi le LLM ne « regarde » pas directement la vidéo ?

Coût frame par frame prohibitif. Video-use utilise ~12 Ko de transcription comme vue principale, PNG timeline uniquement aux coupes ambiguës — même logique que browser-use avec le DOM plutôt que des captures.

Convient-il à Cloud Mac ?

Oui. Transcription et rendu sont gourmands en calcul ; Agent SSH en remote pour batch sans surveillance, sans rivaliser avec les builds Xcode sur la machine locale.

Combien coûte un montage ?

Face caméra 10 min : environ 2–5 $ (transcription + tokens Agent) + durée du nœud cloud. Adapté aux workflows récurrents : hebdo, découpage tutoriels.

Conclusion

Video-use ramène la vidéo IA de la « génération d'images fantastiques » vers le « montage efficace de rushs réels » : transcription au niveau du mot, vision aux points de décision, FFmpeg pour la qualité de sortie, boucle d'auto-évaluation pour limiter les retours. Pour développeurs iOS, créateurs indépendants et petites équipes, c'est un workflow Agent reproductible, extensible et déployable dans le cloud.

Trois étapes pour démarrer :

  1. Installer la compétence + FFmpeg + clé ElevenLabs
  2. Rushs dans un dossier, valider la stratégie avant exécution
  3. Gros calcul sur Cloud Mac, récupérer final.mp4 en local

Pour le choix d'outils Agent, voir classement outils codage IA 2026 ; pour l'orchestration OpenClaw à distance, guide d'installation OpenClaw sur Mac distant.

Ne laissez pas FFmpeg saturer votre machine : exécutez Video-use sur Cloud Mac

Transcription, étalonnage et composition multi-pistes peuvent tourner sur un Mac mini M4 dédié. Claude Code en SSH, traitement sans surveillance — le simulateur Xcode ne rame plus.

Voir les forfaits Cloud Mac · Video-use sur GitHub

Fonctionnalités et tarifs selon le dépôt officiel video-use et le site ElevenLabs. Dernière mise à jour : 6 août 2026.

Notes dev · Vidéo IA

Video-use : du script au montage final avec un Agent

Transcription ElevenLabs · Rendu FFmpeg · Auto-évaluation · Cloud Mac

Voir les forfaits Cloud Mac
Offre limitée Voir les forfaits