
L'outil vidéo IA le plus récent à devenir viral cette semaine est Avatar V de HeyGen, annoncé le 8 avril avec 472 000 vues sur X, qui crée un jumeau numérique photoréaliste du visage, de la voix et des gestes d'un utilisateur à partir d'un seul enregistrement webcam de 15 secondes, puis génère des vidéos illimitées de qualité studio sans aucun équipement professionnel.
La page de lancement officielle de HeyGen décrit Avatar V comme étant basé sur une conviction unique : le résultat doit être suffisamment bon pour que les utilisateurs soient prêts à y apposer leur nom, pas seulement bon pour l'IA, mais tout simplement bon. Le modèle est entraîné sur ce que HeyGen appelle un "embedding d'identité temporellement ancré" construit à partir du clip de 15 secondes, capturant les gestes spécifiques et les transitions d'expression qui rendent une personne reconnaissable dans différents contextes. Les plans larges, les plans moyens et les gros plans restent tous cohérents d'un enregistrement à l'autre. Le processus ne nécessite aucun éclairage de studio ni d'équipe ; un téléphone standard ou une webcam est suffisant.
Le principe de conception clé est de séparer l'identité de l'apparence. Le clip de 15 secondes définit la façon dont une personne bouge. Une photo de base séparée définit son apparence. Les utilisateurs peuvent ensuite changer l'apparence librement tandis que le mouvement reste indubitablement le leur.
La plupart des systèmes d'avatars IA optimisent un seul moment impressionnant : la capture d'écran, le court clip, la démo contrôlée où tout fonctionne en faveur du modèle. Ils semblent nets pendant deux secondes et s'effondrent en vingt à mesure que le visage s'éloigne de la source. Avatar V a été conçu spécifiquement pour maintenir la cohérence sur toute la durée d'une vidéo sans cette dérive. HeyGen décrit cela comme une cohérence d'identité : le même visage, les mêmes micro-expressions, la même présence de la première à la dernière image, que ce soit sur un clip de 30 secondes ou un module de 10 minutes.
Le flux de travail pratique se déroule en trois étapes : enregistrer une vidéo de 15 secondes, éventuellement enregistrer un clone vocal autonome, puis choisir une photo de base comme référence d'identité pour chaque scène générée par la suite. À partir de cette base, les utilisateurs rédigent des invites pour générer de nouvelles tenues, décors et styles, ou utilisent la bibliothèque HeyGen. La vidéo finie peut être livrée dans l'une des 175 langues avec une synchronisation labiale adaptée automatiquement à la langue cible. HeyGen conseille aux utilisateurs d'être expressifs pendant l'enregistrement car, comme l'entreprise l'a formulé, « l'énergie que vous y mettez est l'énergie que vous en retirez ».
Comme crypto.news l'a rapporté, les outils d'IA qui réduisent le coût et le temps de production de contenu professionnel remodèlent directement les décisions d'effectifs des entreprises en 2026. Comme crypto.news l'a noté, la prolifération des outils de contenu IA est une variable clé dans la façon dont les investisseurs institutionnels évaluent la durabilité des dépenses d'infrastructure IA. Avatar V est désormais entièrement disponible via les plans payants de HeyGen, avec accès à la suite complète de modèles, de traduction et d'outils de studio de la plateforme.