KoraCut

Techniques, spéciaux & IAF13-10

Avatar IA (présentateur virtuel)

Vidéo dans laquelle un présentateur numérique (avatar de catalogue ou clone d'une vraie personne) lit un texte avec une voix de synthèse et une synchronisation labiale générées par IA.

Comprendre

Objectif
Produire vite et à faible coût des vidéos explicatives, formations, messages internes, tutoriels ou actualités en plusieurs langues, pour des entreprises, écoles, ONG et e-commerçants.
Plateformes
LinkedIn, YouTube, Facebook, Instagram, TikTok, WhatsApp (formations et messages internes), plateformes e-learning (LMS), sites web.
Ratio
16:9 (1920×1080) pour formation/YouTube ; 9:16 (1080×1920) pour réseaux ; générer au ratio final dans l'outil.
Durée
Idéal 45-90 s pour les réseaux (fourchette 20 s – 3 min) ; modules de formation 2-6 min (découper au-delà).
Difficulté
Équipe
Min : 1 opérateur (script + outil d'avatar + montage) · Idéal : rédacteur/pédagogue + opérateur IA + monteur/motion designer + la personne clonée (validation) + relecteur linguistique.
Délai
Création d'un avatar personnalisé 1-5 j (tournage de 2-5 min + traitement) ; ensuite script 0,5 j + génération 0,5-2 h + montage 0,5-1 j par vidéo.

Raconter

L'accroche et l'intro

  • L'avatar parle dès la 1re image, sans intro : question ou bénéfice direct (« Vous perdez des clients sur WhatsApp ? Voici 3 solutions. »).
  • Cadrer serré (plan poitrine) au début pour capter l'attention, puis alterner avec des visuels.
  • Afficher un élément visuel fort dans les 3 premières secondes (chiffre, image produit) pour ne pas reposer uniquement sur l'avatar.
  • Mention « présentateur généré par IA » visible dès le début (bandeau ou lower-third).

La structure

  • 0-3 s : accroche de l'avatar + visuel clé.
  • 3-10 s : présentation du sujet (et de l'avatar si nécessaire : « Je suis l'assistante virtuelle de … »).
  • 10-60 s : 3 points maximum, chacun avec un visuel de support (capture, B-roll, schéma) ; l'avatar à l'écran 40-60 % du temps.
  • 60-75 s : récapitulatif en 1 phrase + visuel de synthèse.
  • 75-90 s : CTA de l'avatar + écran de fin.

Le ton et le style

  • Clair, posé, pédagogique ; phrases courtes (10-15 mots) : les voix de synthèse sont plus naturelles sur des phrases simples.
  • Avatar habillé et cadré selon l'image de la marque (tenue professionnelle, boubou ou tailleur selon la cible) ; décor sobre ou fond de marque.
  • Éviter le « faux humain » gênant : assumer l'avatar, l'habiller de graphismes, ne pas le faire passer pour une vraie personne.
  • Style « JT » ou « formateur » selon l'usage.

L'habillage et les textes

  • Lower-third avec le nom de l'avatar et la mention « Avatar IA » (ex. « Awa : assistante virtuelle IA ») 3-4 s au début.
  • Mots-clés à l'écran (60-80 px en vertical, 50-60 px en 16:9) qui renforcent chaque point.
  • Fond de marque ou décor virtuel aux couleurs du client ; logo permanent discret en haut.
  • Schémas, listes numérotées et captures d'écran animés pour la formation.

La fin et l'appel à l'action

  • L'avatar formule un CTA unique et précis : « Écrivez-nous “FORMATION” sur WhatsApp au … ».
  • Écran de fin 3-5 s : logo, contact, QR code.
  • Formation : annoncer le module suivant.
  • Mention finale : « Vidéo réalisée avec un présentateur généré par IA ».

Tourner

Le matériel

  • Entrée de gamme : avatars de catalogue et voix standards dans HeyGen, Synthesia, D-ID ou Captions (abonnement), CapCut pour le montage.
  • Pro (avatar personnalisé) : tournage de la personne à cloner en 4K 25 ips sur hybride (Sony FX30/A7 IV), objectif 35-50 mm, trépied, micro cravate (DJI Mic 2, Sennheiser EW-D), 2 panneaux LED + fond uni ou fond vert.
  • Voix : clonage vocal professionnel (ElevenLabs, fonctions de voix des plateformes d'avatars) à partir de 30 min à 2 h d'enregistrements propres, avec consentement.
  • Montage : Premiere Pro, DaVinci Resolve ou CapCut ; After Effects pour les graphismes.
  • Connexion stable (les rendus se font dans le cloud) et onduleur pour le poste de travail.

Plans et cadrage

  • Tournage de l'avatar personnalisé : plan poitrine à plan taille, caméra à hauteur des yeux, regard dans l'objectif, sujet au centre (ou au tiers si décor à droite).
  • Enregistrer 2-5 min selon la plateforme : parler naturellement, gestes modérés et répétitifs, pauses bouche fermée de 2-3 s, pas de mains devant le visage.
  • Prévoir plusieurs tenues/cadrages (plan serré et plan taille) pour varier les vidéos.
  • Au montage : alterner avatar plein écran, avatar en incrustation (picture-in-picture) sur un visuel, et plans de visuels seuls.
  • Vertical : avatar dans le tiers inférieur-central, textes au-dessus.

La lumière

  • Tournage de l'avatar : lumière douce et homogène (2 softboxes à 45°, 5600K), contre-jour léger pour détacher, aucune ombre qui bouge.
  • Éviter la lumière naturelle changeante (nuages, soleil qui tourne) : la plateforme exige une image stable.
  • Peau : exposer correctement les carnations foncées (pas de sous-exposition), éviter les reflets brillants (poudre matifiante).
  • Fond vert éclairé séparément et uniformément si incrustation prévue.

La prise de son

  • Pour le clonage vocal : micro cravate ou micro de studio, pièce sans écho ni bruit (climatiseur et ventilateur coupés), 48 kHz / 24 bits, crêtes -12 à -6 dB.
  • Enregistrer la voix dans les langues visées (français, wolof…) : un clone entraîné en français parle mal wolof.
  • Le wolof et d'autres langues nationales sont peu ou mal pris en charge par la plupart des outils : tester, sinon faire enregistrer la voix par un comédien puis utiliser la synchro labiale sur cet audio.
  • Room tone 30 s et prise de la déclaration de consentement vidéo exigée par la plateforme.

La mise en scène

  • Consentement : autorisation écrite et signée de la personne clonée (image + voix), précisant usages, durée, langues, territoires, rémunération et droit de retrait ; les plateformes exigent en plus une vidéo de consentement.
  • Ne jamais créer l'avatar d'une personne sans son accord (dirigeant, célébrité, employé parti) ; au Sénégal, visage et voix sont des données personnelles (loi n° 2008-12, CDP).
  • Écrire le script pour l'oral : phrases courtes, chiffres écrits en lettres si la voix les lit mal, orthographe phonétique pour les noms locaux (ex. « Tivaouane », « Ziguinchor »).
  • Faire valider chaque script par la personne clonée ou le client avant génération (c'est « sa » bouche qui parle).
  • Transparence : informer le public que le présentateur est une IA.

Astuces de tournage

  • Tournage de l'avatar en 25 ips, 1/50 s, 4K, balance des blancs manuelle, mise au point manuelle sur les yeux, stabilisation OFF sur trépied.
  • Pas de bijoux qui brillent, pas de vêtements à fines rayures (moiré) ni de couleur proche du fond vert.
  • Régler dans l'outil : vitesse de la voix 0,9-1,0×, pauses (balises de pause de 0,3-0,8 s), prononciation personnalisée des noms.
  • Générer d'abord 15-20 s pour tester voix et synchro avant la vidéo complète (économie de crédits).
  • Découper les longs scripts en segments de 30-60 s : plus faciles à corriger sans tout régénérer.

Monter

Les pistes de la timeline

  • 7 à 9 pistes au total.
  • V1 : fond/décor et B-roll ; V2 : avatar (plein écran ou incrustation détourée) ; V3 : captures, schémas, visuels de support ; V4 : textes, mots-clés, lower-third « Avatar IA » ; V5 : logo et écran de fin.
  • A1 : voix de l'avatar ; A2 : SFX (pops, clics) ; A3 : musique.
  • Exporter l'avatar sur fond vert ou transparent (WebM/ProRes 4444) quand l'outil le permet pour la composition.

Le rythme et les coupes

  • Changer de visuel toutes les 3-5 s (l'avatar seul devient monotone au-delà de 8-10 s).
  • Couper dans les pauses de la voix ; supprimer les silences trop longs générés.
  • Punch-in (100 → 115 %) sur l'avatar pour marquer un point important.
  • Formation : rythme plus lent (visuels de 5-8 s) pour laisser lire.

Transitions et effets

  • Coupes franches et transitions de marque simples (glissement, fondu 0,3 s).
  • Avatar en incrustation avec coins arrondis ou détourage propre, ombre portée légère.
  • Animations de texte sobres (apparition mot par mot) ; éviter les effets qui déforment le visage de l'avatar.
  • Pas de gros plan extrême sur la bouche : les défauts de synchro se voient.

Le sound design

  • Pops légers (-20 dB) à l'apparition des mots-clés et des visuels.
  • Clics ou « swipe » (-18 dB) sur les changements de diapositive/visuel.
  • Ambiance de pièce très légère (-35 dB) sous la voix de synthèse pour la rendre moins « sèche ».
  • Réverbération très courte (pièce, 0,3 s, 5-10 % mix) sur la voix si elle paraît trop artificielle.

La musique

  • Corporate, lo-fi, pop légère ou afro-pop instrumentale, 90-110 BPM.
  • Ducking -22 à -26 dB sous la voix (les voix de synthèse sont moins dynamiques, la musique doit rester discrète).
  • Musique plus présente (-16 dB) sur l'intro et l'écran de fin uniquement.
  • Droits : YouTube Audio Library, Artlist, Epidemic Sound.

Les sous-titres

  • Sous-titres systématiques (beaucoup regardent sans le son) : générés depuis le script exact, donc sans faute.
  • Réseaux : dynamiques mot par mot, 60-80 px, 2-4 mots par ligne ; formation : classiques 2 lignes, 44-50 px.
  • Vertical : zone de sécurité ≈ 900×1400 px, sous-titres au-dessus du visage de l'avatar ou juste en dessous du menton.
  • Versions multilingues : même vidéo en français, anglais, voire wolof/pulaar (voix humaine + synchro) avec sous-titres de la langue correspondante.

L'étalonnage

  • Corriger l'avatar pour qu'il colle au décor (température, contraste, niveau de noir).
  • Tons chair naturels : vérifier au vectorscope, corriger les avatars trop « lissés » ou grisâtres.
  • Harmoniser avec les B-roll réels ; look propre et neutre (Rec.709), pas de look cinéma marqué.
  • Grain très léger (2-3 %) pour réduire l'aspect « trop parfait » si l'avatar est intégré à des images réelles.

Exporter et publier

Mixage et export

  • Voix -14 LUFS intégré (réseaux/YouTube), -16 LUFS pour les plateformes e-learning, true peak -1 dBTP.
  • Export 1920×1080 ou 1080×1920, 25 ips, H.264 8-10 Mbps ; version légère 720p 2-3 Mbps pour WhatsApp et connexions faibles.
  • Formation : fichiers SRT séparés + export SCORM/MP4 selon la plateforme.
  • Archiver script, version de la voix et consentement associé à chaque vidéo.

Titre et miniature

  • Titre orienté bénéfice : « 3 erreurs qui font fuir vos clients sur WhatsApp (en 60 s) ».
  • Miniature : avatar expressif + 3-4 mots + badge de la marque ; ne pas faire passer l'avatar pour une personne réelle.
  • Description : résumé, liens, mention « présentateur généré par IA ».
  • Tags : formation, tutoriel, thème, marque.

La publication

  • Étiquette IA activée sur YouTube/Meta/TikTok si l'avatar est réaliste.
  • Série régulière (1 vidéo par semaine, même avatar, même format) : l'avatar devient une « mascotte » reconnaissable.
  • Diffusion interne : envoyer via WhatsApp/Teams avec version courte + lien vers la version complète.
  • Décliner chaque vidéo en 2-3 langues à coût marginal faible.

Les erreurs à éviter

  • Cloner une personne sans consentement écrit et vidéo, ou continuer à utiliser son avatar après son départ.
  • Cacher que c'est une IA : perte de confiance, sanction des plateformes.
  • Avatar seul à l'écran pendant 2 min : ennui garanti.
  • Mauvaise prononciation des noms locaux et du wolof non vérifiée.
  • Script écrit comme un texte (phrases longues) : voix monotone.
  • Synchronisation labiale visible en gros plan ou en format trop long.

Dans KoraCut

Ce type est dans la fenêtre Nouveau projet.

Ouvre KoraCut, fais ⌘N et choisis « Avatar IA (présentateur virtuel) ». L'application règle le format, les images par seconde, les pistes nommées et le niveau sonore de l'export. Tu n'as plus qu'à importer tes rushs.

Retour à la familleTout le guide

En développement

KoraCut est en développement

L'application arrive. Amadou Ba y travaille tous les jours et le site suit. Laisse ton adresse pour être prévenu à la sortie.