Techniques, spéciaux & IAF13-11
Doublage / traduction vidéo par IA
Traduction d'une vidéo existante dans une autre langue grâce à l'IA : transcription, traduction, voix de synthèse ou clonée (souvent la voix d'origine), et éventuellement resynchronisation des lèvres.
Comprendre
- Objectif
- Rendre un contenu existant accessible à d'autres publics (français ↔ anglais, wolof, arabe, portugais, diaspora) sans retourner la vidéo : témoignages, formations, pubs, interviews, contenus de créateurs.
- Plateformes
- YouTube (pistes audio multilingues), Facebook, Instagram, TikTok, LinkedIn, plateformes de formation, WhatsApp.
- Ratio
- Identique à la vidéo source : 16:9 (1920×1080), 9:16 (1080×1920) ou 1:1 ; pas de recadrage.
- Durée
- Identique à la source ; idéal pour des vidéos de 30 s à 10 min (les longues vidéos multiplient les corrections) ; la version traduite peut varier de ±5 %.
- Difficulté
- Équipe
- Min : 1 opérateur (outil de doublage + relecture) · Idéal : chef de projet + traducteur/relecteur natif par langue + opérateur IA + monteur/mixeur + validation de la personne dont la voix est clonée.
- Délai
- Préparation des sources 0,5 j + génération 1-3 h + relecture linguistique et corrections 0,5-1 j par langue + mixage/export 0,5 j.
Raconter
L'accroche et l'intro
- Conserver l'accroche d'origine mais l'adapter culturellement (expression, exemple, référence locale) plutôt que la traduire mot à mot.
- Vérifier que la première phrase tient dans le même temps (les 3 premières secondes restent décisives).
- Remplacer les textes à l'écran de l'intro par leur version traduite (titres incrustés).
- Ajouter si pertinent un court carton « Version doublée par IA » ou le signaler dans la description.
La structure
- Étape 1 : récupérer la source maître + si possible les pistes séparées (voix seule, musique et effets = M&E).
- Étape 2 : transcription automatique, puis correction humaine du texte source (noms, chiffres, termes techniques).
- Étape 3 : traduction + adaptation (longueur, ton, glossaire client) relue par un natif.
- Étape 4 : génération de la voix (clonée ou de synthèse), ajustement du timing phrase par phrase, synchro labiale si visage en gros plan.
- Étape 5 : mixage avec la M&E, sous-titres, textes à l'écran traduits, contrôle qualité complet par un natif.
Le ton et le style
- Garder l'émotion, le rythme et le registre de l'orateur d'origine (familier, institutionnel, commercial).
- Adaptation plutôt que traduction littérale : le français est ≈ 15-25 % plus long que l'anglais ; reformuler pour tenir dans le temps.
- Glossaire de marque : noms de produits, slogans et termes clés qui ne se traduisent pas.
- Respect culturel : salutations, références religieuses, humour à adapter à la cible (Sénégal, diaspora, Afrique anglophone).
L'habillage et les textes
- Traduire et remplacer tous les textes incrustés (titres, lower-thirds, chiffres, CTA) : repartir du projet de montage d'origine si possible.
- Lower-thirds : garder les noms propres, traduire les fonctions.
- Si les textes sont incrustés dans l'image sans projet source : masquer et recréer, ou ajouter un sous-titre explicatif.
- Mention « Voix doublée par IA » en petit (24-28 px) ou dans la description selon la politique du client et des plateformes.
La fin et l'appel à l'action
- Traduire et adapter le CTA : numéro local, lien vers la page dans la bonne langue.
- Écran de fin avec textes traduits et durée identique à l'original.
- Pour YouTube multilingue, rappeler que d'autres langues sont disponibles (menu audio).
- Mention crédits : traduction, voix IA, relecture.
Tourner
Le matériel
- Entrée de gamme : outils tout-en-un (CapCut traduction vidéo, HeyGen Video Translate, fonction de doublage automatique de YouTube quand elle est disponible).
- Pro : ElevenLabs Dubbing Studio (édition phrase par phrase, voix clonée), Rask AI, HeyGen (synchro labiale), outils de lip-sync dédiés ; séparation des pistes (voix/musique) avec Ultimate Vocal Remover, Demucs, iZotope RX ou la séparation de voix de DaVinci Resolve Studio.
- Transcription : Whisper (local), Premiere « Texte », Resolve « Transcription » ; édition des sous-titres : Subtitle Edit.
- Montage/mixage : Premiere Pro, DaVinci Resolve (Fairlight), casque fermé de contrôle.
- Voix humaine de secours : micro condensateur + comédien natif pour les langues mal supportées (wolof, pulaar, sérère).
Plans et cadrage
- Pas de nouveau tournage ; repérer les plans où la bouche est visible en gros plan (lip-sync nécessaire) et ceux en voix off/B-roll (doublage simple).
- Plans de face, bien éclairés, visage non masqué : meilleure qualité de synchronisation labiale.
- Plans à plusieurs locuteurs : identifier chaque voix (diarisation) et vérifier l'attribution des voix.
- Si besoin, remplacer un plan à lèvres très visibles par du B-roll pour éviter une synchro imparfaite.
- Pour les futurs tournages destinés à être doublés : cadrer plus large et prévoir plus de B-roll.
La lumière
- Pas d'éclairage à prévoir ; la qualité de la lumière d'origine conditionne la synchro labiale (visage sombre ou contre-jour = résultats médiocres).
- Corriger l'exposition du visage avant le traitement lip-sync si nécessaire.
- Pour les futurs contenus à doubler : lumière frontale douce 5600K, visage bien éclairé, pas d'ombres sur la bouche.
- Éviter de traiter en lip-sync les plans nocturnes ou très bruités.
La prise de son
- Idéal : récupérer la voix isolée (piste micro cravate) et la M&E du montage d'origine.
- Sinon, séparer la voix de la musique/ambiance par IA et vérifier les artefacts.
- Qualité source : voix propre (sans écho, crêtes -12 à -6 dB) = clone vocal plus fidèle.
- Voix humaine de remplacement : enregistrement en cabine ou pièce traitée, 48 kHz / 24 bits, en regardant l'image pour caler le rythme.
La mise en scène
- Consentement : accord écrit de chaque personne dont la voix est clonée (et le visage modifié en lip-sync), précisant langues, usages, durée et droit de retrait.
- Ne jamais cloner la voix d'un tiers (célébrité, personnalité politique, religieuse) ni lui faire dire ce qu'il n'a pas dit ; au Sénégal, la voix est une donnée personnelle (loi n° 2008-12, CDP).
- Faire valider la traduction par la personne ou le client : ce sont ses propos, dans une autre langue.
- Droits : vérifier que la licence de la musique d'origine couvre les nouvelles versions et territoires.
- Transparence : signaler le doublage IA (description, étiquette de la plateforme pour les contenus réalistes modifiés, obligation de transparence de l'AI Act pour une diffusion dans l'UE).
Astuces de tournage
- Corriger le texte source avant traduction : une erreur de transcription se retrouve dans toutes les langues.
- Ajuster le timing phrase par phrase : vitesse de voix entre 0,9× et 1,15× maximum (au-delà, la voix devient artificielle) ; sinon reformuler plus court.
- Prononciation : dictionnaire de prononciation ou orthographe phonétique pour les noms (Mbacké, Kaolack, Thiaroye) et les sigles.
- Tester d'abord 30 s dans chaque langue avant de lancer la vidéo complète.
- Langues nationales (wolof, pulaar, sérère) : qualité variable ou non prise en charge ; privilégier voix humaine native + lip-sync, ou sous-titres.
Monter
Les pistes de la timeline
- 6 à 8 pistes par version linguistique.
- V1 : vidéo source (ou version lip-sync) ; V2 : plans de remplacement (B-roll) ; V3 : textes et lower-thirds traduits ; V4 : mention IA, logo, écran de fin.
- A1 : voix doublée (langue cible) ; A2 : M&E (musique + effets + ambiance) ; A3 : voix originale en fond (-20 dB) si style « voice-over » documentaire ; A4 : SFX complémentaires.
- Une séquence par langue (FR, EN, WO…) dupliquée depuis le montage maître, nommée clairement.
Le rythme et les coupes
- Garder le montage d'origine ; adapter seulement quand la voix traduite dépasse (rallonger un plan de B-roll de 5-15 images, ou raccourcir le texte).
- Caler le début de chaque phrase doublée sur le mouvement des lèvres d'origine (± 2 images).
- Respecter les respirations et silences de l'orateur (ne pas combler tous les blancs).
- Vérifier les coupes J/L d'origine : la voix traduite ne doit pas déborder sur le plan suivant de façon incohérente.
Transitions et effets
- Pas de nouvelles transitions : conserver celles de la version originale.
- Lip-sync IA uniquement sur les plans où la bouche est bien visible ; contrôler à 100 % les déformations (dents, barbe, profil).
- Recréer les animations de texte avec les textes traduits (longueur différente : ajuster tailles et durées).
- En cas de défaut de synchro, préférer un recadrage ou un B-roll plutôt qu'un visage déformé.
Le sound design
- Réutiliser les SFX d'origine via la M&E ; recréer ceux perdus lors de la séparation voix/musique.
- Égaliser la voix doublée pour qu'elle sonne dans la même pièce que l'original (EQ, réverbération courte adaptée).
- Ajouter du room tone sous la voix de synthèse pour éviter l'effet « voix collée ».
- Vérifier les respirations et bruits de bouche : ni absents (voix robotique), ni exagérés.
La musique
- Reprendre la musique d'origine depuis la M&E ou le projet source (même tempo, mêmes coupes).
- Ducking identique à l'original : -20 à -24 dB sous la voix doublée.
- Si la musique ne peut pas être séparée proprement, la remplacer par une musique sous licence de même tempo et ambiance.
- Vérifier les droits de la musique pour les nouveaux territoires et plateformes.
Les sous-titres
- Sous-titres dans la langue du doublage (accessibilité) + fichier SRT séparé par langue.
- Réseaux : sous-titres dynamiques 60-80 px en vertical ; YouTube/formation : classiques 2 lignes, 42-48 px, 42 caractères par ligne max.
- Option bilingue : doublage en français + sous-titres wolof (ou l'inverse) pour toucher deux publics.
- Relecture native obligatoire (accents, ponctuation, orthographe wolof standardisée).
L'étalonnage
- Pas de nouvel étalonnage : repartir de la version étalonnée finale.
- Vérifier que les plans traités en lip-sync n'ont pas changé de couleur ou de netteté ; corriger pour raccorder.
- Ajouter un grain léger identique sur les plans lip-sync si leur texture paraît trop lisse.
- Contrôler la netteté des visages après upscale éventuel.
Exporter et publier
Mixage et export
- Voix doublée -14 LUFS intégré (réseaux/YouTube), -23 LUFS (TV), true peak -1 dBTP ; même équilibre voix/musique que l'original.
- Export vidéo identique à la source (ex. 1920×1080 25 ips H.264 10-12 Mbps) ; YouTube : téléverser les pistes audio doublées (WAV/AAC) comme pistes multilingues quand la fonction est disponible.
- Livrables par langue : MP4 final, piste voix seule, SRT, versions verticales.
- Archiver les textes validés, voix utilisées et consentements par langue.
Titre et miniature
- Traduire et adapter le titre et la miniature pour chaque langue (mots-clés recherchés localement).
- Miniature : textes incrustés traduits, même visuel.
- Description traduite + mention « Version doublée par IA » + liens vers les autres langues.
- YouTube : ajouter titres et descriptions traduits dans les paramètres de la vidéo.
La publication
- Une chaîne/page avec pistes multilingues, ou des comptes par langue si les publics sont très différents.
- Tenir compte des fuseaux : diaspora en Europe (UTC+1/+2) et en Amérique du Nord (UTC-4/-7).
- Activer l'étiquette de contenu modifié ou synthétique quand la voix ou le visage sont altérés de façon réaliste.
- Commencer par les 3-5 vidéos les plus performantes de la chaîne : meilleur retour sur investissement.
Les erreurs à éviter
- Cloner une voix sans consentement écrit ou faire dire autre chose que l'original.
- Traduction non relue par un natif : contresens, termes ridicules, noms mal prononcés.
- Voix accélérée pour tenir dans le temps : débit robotique et incompréhensible.
- Textes à l'écran restés dans la langue d'origine.
- Lip-sync forcé sur des plans de profil ou sombres : visages déformés.
- Musique et ambiance perdues ou abîmées par une mauvaise séparation des pistes.
Dans KoraCut
Ce type est dans la fenêtre Nouveau projet.
Ouvre KoraCut, fais ⌘N et choisis « Doublage / traduction vidéo par IA ». L'application règle le format, les images par seconde, les pistes nommées et le niveau sonore de l'export. Tu n'as plus qu'à importer tes rushs.