KoraCut

Techniques, spéciaux & IAF13-11

Doublage / traduction vidéo par IA

Traduction d'une vidéo existante dans une autre langue grâce à l'IA : transcription, traduction, voix de synthèse ou clonée (souvent la voix d'origine), et éventuellement resynchronisation des lèvres.

Comprendre

Objectif
Rendre un contenu existant accessible à d'autres publics (français ↔ anglais, wolof, arabe, portugais, diaspora) sans retourner la vidéo : témoignages, formations, pubs, interviews, contenus de créateurs.
Plateformes
YouTube (pistes audio multilingues), Facebook, Instagram, TikTok, LinkedIn, plateformes de formation, WhatsApp.
Ratio
Identique à la vidéo source : 16:9 (1920×1080), 9:16 (1080×1920) ou 1:1 ; pas de recadrage.
Durée
Identique à la source ; idéal pour des vidéos de 30 s à 10 min (les longues vidéos multiplient les corrections) ; la version traduite peut varier de ±5 %.
Difficulté
Équipe
Min : 1 opérateur (outil de doublage + relecture) · Idéal : chef de projet + traducteur/relecteur natif par langue + opérateur IA + monteur/mixeur + validation de la personne dont la voix est clonée.
Délai
Préparation des sources 0,5 j + génération 1-3 h + relecture linguistique et corrections 0,5-1 j par langue + mixage/export 0,5 j.

Raconter

L'accroche et l'intro

  • Conserver l'accroche d'origine mais l'adapter culturellement (expression, exemple, référence locale) plutôt que la traduire mot à mot.
  • Vérifier que la première phrase tient dans le même temps (les 3 premières secondes restent décisives).
  • Remplacer les textes à l'écran de l'intro par leur version traduite (titres incrustés).
  • Ajouter si pertinent un court carton « Version doublée par IA » ou le signaler dans la description.

La structure

  • Étape 1 : récupérer la source maître + si possible les pistes séparées (voix seule, musique et effets = M&E).
  • Étape 2 : transcription automatique, puis correction humaine du texte source (noms, chiffres, termes techniques).
  • Étape 3 : traduction + adaptation (longueur, ton, glossaire client) relue par un natif.
  • Étape 4 : génération de la voix (clonée ou de synthèse), ajustement du timing phrase par phrase, synchro labiale si visage en gros plan.
  • Étape 5 : mixage avec la M&E, sous-titres, textes à l'écran traduits, contrôle qualité complet par un natif.

Le ton et le style

  • Garder l'émotion, le rythme et le registre de l'orateur d'origine (familier, institutionnel, commercial).
  • Adaptation plutôt que traduction littérale : le français est ≈ 15-25 % plus long que l'anglais ; reformuler pour tenir dans le temps.
  • Glossaire de marque : noms de produits, slogans et termes clés qui ne se traduisent pas.
  • Respect culturel : salutations, références religieuses, humour à adapter à la cible (Sénégal, diaspora, Afrique anglophone).

L'habillage et les textes

  • Traduire et remplacer tous les textes incrustés (titres, lower-thirds, chiffres, CTA) : repartir du projet de montage d'origine si possible.
  • Lower-thirds : garder les noms propres, traduire les fonctions.
  • Si les textes sont incrustés dans l'image sans projet source : masquer et recréer, ou ajouter un sous-titre explicatif.
  • Mention « Voix doublée par IA » en petit (24-28 px) ou dans la description selon la politique du client et des plateformes.

La fin et l'appel à l'action

  • Traduire et adapter le CTA : numéro local, lien vers la page dans la bonne langue.
  • Écran de fin avec textes traduits et durée identique à l'original.
  • Pour YouTube multilingue, rappeler que d'autres langues sont disponibles (menu audio).
  • Mention crédits : traduction, voix IA, relecture.

Tourner

Le matériel

  • Entrée de gamme : outils tout-en-un (CapCut traduction vidéo, HeyGen Video Translate, fonction de doublage automatique de YouTube quand elle est disponible).
  • Pro : ElevenLabs Dubbing Studio (édition phrase par phrase, voix clonée), Rask AI, HeyGen (synchro labiale), outils de lip-sync dédiés ; séparation des pistes (voix/musique) avec Ultimate Vocal Remover, Demucs, iZotope RX ou la séparation de voix de DaVinci Resolve Studio.
  • Transcription : Whisper (local), Premiere « Texte », Resolve « Transcription » ; édition des sous-titres : Subtitle Edit.
  • Montage/mixage : Premiere Pro, DaVinci Resolve (Fairlight), casque fermé de contrôle.
  • Voix humaine de secours : micro condensateur + comédien natif pour les langues mal supportées (wolof, pulaar, sérère).

Plans et cadrage

  • Pas de nouveau tournage ; repérer les plans où la bouche est visible en gros plan (lip-sync nécessaire) et ceux en voix off/B-roll (doublage simple).
  • Plans de face, bien éclairés, visage non masqué : meilleure qualité de synchronisation labiale.
  • Plans à plusieurs locuteurs : identifier chaque voix (diarisation) et vérifier l'attribution des voix.
  • Si besoin, remplacer un plan à lèvres très visibles par du B-roll pour éviter une synchro imparfaite.
  • Pour les futurs tournages destinés à être doublés : cadrer plus large et prévoir plus de B-roll.

La lumière

  • Pas d'éclairage à prévoir ; la qualité de la lumière d'origine conditionne la synchro labiale (visage sombre ou contre-jour = résultats médiocres).
  • Corriger l'exposition du visage avant le traitement lip-sync si nécessaire.
  • Pour les futurs contenus à doubler : lumière frontale douce 5600K, visage bien éclairé, pas d'ombres sur la bouche.
  • Éviter de traiter en lip-sync les plans nocturnes ou très bruités.

La prise de son

  • Idéal : récupérer la voix isolée (piste micro cravate) et la M&E du montage d'origine.
  • Sinon, séparer la voix de la musique/ambiance par IA et vérifier les artefacts.
  • Qualité source : voix propre (sans écho, crêtes -12 à -6 dB) = clone vocal plus fidèle.
  • Voix humaine de remplacement : enregistrement en cabine ou pièce traitée, 48 kHz / 24 bits, en regardant l'image pour caler le rythme.

La mise en scène

  • Consentement : accord écrit de chaque personne dont la voix est clonée (et le visage modifié en lip-sync), précisant langues, usages, durée et droit de retrait.
  • Ne jamais cloner la voix d'un tiers (célébrité, personnalité politique, religieuse) ni lui faire dire ce qu'il n'a pas dit ; au Sénégal, la voix est une donnée personnelle (loi n° 2008-12, CDP).
  • Faire valider la traduction par la personne ou le client : ce sont ses propos, dans une autre langue.
  • Droits : vérifier que la licence de la musique d'origine couvre les nouvelles versions et territoires.
  • Transparence : signaler le doublage IA (description, étiquette de la plateforme pour les contenus réalistes modifiés, obligation de transparence de l'AI Act pour une diffusion dans l'UE).

Astuces de tournage

  • Corriger le texte source avant traduction : une erreur de transcription se retrouve dans toutes les langues.
  • Ajuster le timing phrase par phrase : vitesse de voix entre 0,9× et 1,15× maximum (au-delà, la voix devient artificielle) ; sinon reformuler plus court.
  • Prononciation : dictionnaire de prononciation ou orthographe phonétique pour les noms (Mbacké, Kaolack, Thiaroye) et les sigles.
  • Tester d'abord 30 s dans chaque langue avant de lancer la vidéo complète.
  • Langues nationales (wolof, pulaar, sérère) : qualité variable ou non prise en charge ; privilégier voix humaine native + lip-sync, ou sous-titres.

Monter

Les pistes de la timeline

  • 6 à 8 pistes par version linguistique.
  • V1 : vidéo source (ou version lip-sync) ; V2 : plans de remplacement (B-roll) ; V3 : textes et lower-thirds traduits ; V4 : mention IA, logo, écran de fin.
  • A1 : voix doublée (langue cible) ; A2 : M&E (musique + effets + ambiance) ; A3 : voix originale en fond (-20 dB) si style « voice-over » documentaire ; A4 : SFX complémentaires.
  • Une séquence par langue (FR, EN, WO…) dupliquée depuis le montage maître, nommée clairement.

Le rythme et les coupes

  • Garder le montage d'origine ; adapter seulement quand la voix traduite dépasse (rallonger un plan de B-roll de 5-15 images, ou raccourcir le texte).
  • Caler le début de chaque phrase doublée sur le mouvement des lèvres d'origine (± 2 images).
  • Respecter les respirations et silences de l'orateur (ne pas combler tous les blancs).
  • Vérifier les coupes J/L d'origine : la voix traduite ne doit pas déborder sur le plan suivant de façon incohérente.

Transitions et effets

  • Pas de nouvelles transitions : conserver celles de la version originale.
  • Lip-sync IA uniquement sur les plans où la bouche est bien visible ; contrôler à 100 % les déformations (dents, barbe, profil).
  • Recréer les animations de texte avec les textes traduits (longueur différente : ajuster tailles et durées).
  • En cas de défaut de synchro, préférer un recadrage ou un B-roll plutôt qu'un visage déformé.

Le sound design

  • Réutiliser les SFX d'origine via la M&E ; recréer ceux perdus lors de la séparation voix/musique.
  • Égaliser la voix doublée pour qu'elle sonne dans la même pièce que l'original (EQ, réverbération courte adaptée).
  • Ajouter du room tone sous la voix de synthèse pour éviter l'effet « voix collée ».
  • Vérifier les respirations et bruits de bouche : ni absents (voix robotique), ni exagérés.

La musique

  • Reprendre la musique d'origine depuis la M&E ou le projet source (même tempo, mêmes coupes).
  • Ducking identique à l'original : -20 à -24 dB sous la voix doublée.
  • Si la musique ne peut pas être séparée proprement, la remplacer par une musique sous licence de même tempo et ambiance.
  • Vérifier les droits de la musique pour les nouveaux territoires et plateformes.

Les sous-titres

  • Sous-titres dans la langue du doublage (accessibilité) + fichier SRT séparé par langue.
  • Réseaux : sous-titres dynamiques 60-80 px en vertical ; YouTube/formation : classiques 2 lignes, 42-48 px, 42 caractères par ligne max.
  • Option bilingue : doublage en français + sous-titres wolof (ou l'inverse) pour toucher deux publics.
  • Relecture native obligatoire (accents, ponctuation, orthographe wolof standardisée).

L'étalonnage

  • Pas de nouvel étalonnage : repartir de la version étalonnée finale.
  • Vérifier que les plans traités en lip-sync n'ont pas changé de couleur ou de netteté ; corriger pour raccorder.
  • Ajouter un grain léger identique sur les plans lip-sync si leur texture paraît trop lisse.
  • Contrôler la netteté des visages après upscale éventuel.

Exporter et publier

Mixage et export

  • Voix doublée -14 LUFS intégré (réseaux/YouTube), -23 LUFS (TV), true peak -1 dBTP ; même équilibre voix/musique que l'original.
  • Export vidéo identique à la source (ex. 1920×1080 25 ips H.264 10-12 Mbps) ; YouTube : téléverser les pistes audio doublées (WAV/AAC) comme pistes multilingues quand la fonction est disponible.
  • Livrables par langue : MP4 final, piste voix seule, SRT, versions verticales.
  • Archiver les textes validés, voix utilisées et consentements par langue.

Titre et miniature

  • Traduire et adapter le titre et la miniature pour chaque langue (mots-clés recherchés localement).
  • Miniature : textes incrustés traduits, même visuel.
  • Description traduite + mention « Version doublée par IA » + liens vers les autres langues.
  • YouTube : ajouter titres et descriptions traduits dans les paramètres de la vidéo.

La publication

  • Une chaîne/page avec pistes multilingues, ou des comptes par langue si les publics sont très différents.
  • Tenir compte des fuseaux : diaspora en Europe (UTC+1/+2) et en Amérique du Nord (UTC-4/-7).
  • Activer l'étiquette de contenu modifié ou synthétique quand la voix ou le visage sont altérés de façon réaliste.
  • Commencer par les 3-5 vidéos les plus performantes de la chaîne : meilleur retour sur investissement.

Les erreurs à éviter

  • Cloner une voix sans consentement écrit ou faire dire autre chose que l'original.
  • Traduction non relue par un natif : contresens, termes ridicules, noms mal prononcés.
  • Voix accélérée pour tenir dans le temps : débit robotique et incompréhensible.
  • Textes à l'écran restés dans la langue d'origine.
  • Lip-sync forcé sur des plans de profil ou sombres : visages déformés.
  • Musique et ambiance perdues ou abîmées par une mauvaise séparation des pistes.

Dans KoraCut

Ce type est dans la fenêtre Nouveau projet.

Ouvre KoraCut, fais ⌘N et choisis « Doublage / traduction vidéo par IA ». L'application règle le format, les images par seconde, les pistes nommées et le niveau sonore de l'export. Tu n'as plus qu'à importer tes rushs.

Retour à la familleTout le guide

En développement

KoraCut est en développement

L'application arrive. Amadou Ba y travaille tous les jours et le site suit. Laisse ton adresse pour être prévenu à la sortie.