Page d'accueilCentre d'actualités LBank
Black Forest Labs Dévoile FLUX 3 AI : Abandonne les images fixes au profit de la vidéo — et des mains robotiques
black-forest-labs-flux-3-image-video-robot-hands
Black Forest Labs Dévoile FLUX 3 AI : Abandonne les images fixes au profit de la vidéo — et des mains robotiques
FLUX 3 est le premier modèle vidéo du laboratoire d'IA allemand, et le même système enseigne déjà aux robots à travailler sur une chaîne de montage Audi.
2026-07-23 Source:decrypt.co

En bref

  • Black Forest Labs a lancé FLUX 3 en accès anticipé, son premier modèle capable de générer des vidéos, produisant des clips d'une durée allant jusqu'à 20 secondes avec audio synchronisé.
  • La même architecture alimente FLUX-mimic, un modèle robotique conçu avec mimic robotics que Audi teste déjà sur sa chaîne de production.
  • Seule la version "Dev" en poids ouvert est prévue pour plus tard en 2026 ; la vidéo et l'action restent pour l'instant accessibles via des API et des partenariats, l'image suivant dans les semaines à venir.

Black Forest Labs a publié FLUX 3 jeudi, et pour la première fois, le modèle phare de l'entreprise génère des vidéos au lieu de simples images fixes. Le laboratoire d'IA allemand, connu pour sa gamme de générateurs d'images FLUX, a entraîné le nouveau système simultanément sur des images, des vidéos et de l'audio, au sein d'un seul système partagé.

C'est ce que l'on appelle la multimodalité : un modèle qui apprend plusieurs types d'informations ensemble au lieu d'outils séparés juxtaposés.

La partie vidéo est la caractéristique principale. FLUX 3 produit des clips d'une durée maximale de 20 secondes, avec un son généré en même temps que l'image et synchronisé avec ce qui se passe à l'écran – dialogues, effets sonores, bruit ambiant. Lors des premières évaluations, les évaluateurs humains ont préféré le résultat de FLUX 3 à Runway Gen-4.5 dans 77 % des comparaisons directes et à Luma Ray 3.2 dans 93 %. Il semble être légèrement meilleur que Gemini Omni et Seedance, battant ces modèles dans 52 % des évaluations.

Bien sûr, il s'agit d'un test de préférence, et non d'une grille d'évaluation fixe : les évaluateurs regardent simplement deux clips et choisissent celui qui semble et sonne le plus convaincant, et BFL compte la fréquence à laquelle FLUX 3 l'emporte.

En dehors de cela, le modèle semble également très compétent en matière d'images fixes, poursuivant ainsi son héritage. BFL a partagé quelques images, et FLUX 3 semble très polyvalent et capable de générer une grande variété de styles au-delà du photoréalisme.

BFL présente cela comme bien plus qu'un simple outil de contenu. "Un modèle qui n'apprend que des images ne peut générer que des images", a déclaré Robin Rombach, co-fondateur et PDG. Le pari de l'entreprise est qu'apprendre à prédire la vidéo signifie également apprendre la physique sous-jacente — le poids, le contact, le timing — ce qui est exactement ce dont une machine a besoin pour se déplacer dans le monde physique.

Ce pari a un nom : FLUX-mimic. Construit avec mimic robotics, basé à Zurich, il reprend le moteur de prédiction vidéo de FLUX 3 et y ajoute un "décodeur" léger — un petit composant additionnel qui traduit la perception interne du mouvement du modèle en mouvements robotiques réels. Le constructeur automobile Audi le teste déjà sur des tâches telles que l'installation de joints de porte flexibles, un travail que l'automatisation conventionnelle a eu du mal à gérer.

"Audi représente le type de partenaire manufacturier pour lequel nous avons conçu FLUX-mimic", a déclaré Stephan-Daniel Gravert, co-fondateur de mimic. Christoph Schneider d'Audi a déclaré que les robots "résolvent désormais des travaux complexes de manipulation de corps souples" que les machines plus anciennes ne pouvaient pas effectuer. BFL affirme que le système complet réagit en environ 101 millisecondes, soit à peu près le temps de réaction visuelle humaine.

L'ascension de FLUX ne s'est pas faite en vase clos. Fondé en août 2024 par des chercheurs chevronnés qui avaient contribué à la création des modèles originaux Stable Diffusion chez Stability AI, Black Forest Labs a lancé des modèles Flux qui ont surpassé MidJourney et déclassé le peu impressionnant Stable Diffusion 3 de Stability.

Les modèles open-source Flux Dev et Schnell ont décroché le titre de "meilleur générateur d'images open source", que les artistes IA s'attendaient à voir Stable Diffusion 3.5, le nouveau coup d'essai de Stability, récupérer à terme.

Cela n'est jamais arrivé. FLUX 1.1 Pro a ensuite dominé l'arène d'images Artificial Analysis en octobre. Celui-ci n'était pas open source, cependant.

BFL a sorti FLUX.2 en novembre 2025 mais il n'a pas été aussi populaire. La couronne open source détenue par le Flux original a duré jusqu'à ce que Z-Image Turbo d'Alibaba le détrône fin 2025, égalant sa qualité sur les cartes graphiques grand public bas de gamme. "C'est ce que SD3 était censé être", a écrit un utilisateur de CivitAI à l'époque.

FLUX 3 est le retour en force de BFL, et il n'est pas encore entièrement open source. La vidéo et l'action sont en accès anticipé via des API et des partenaires sélectionnés, dont mimic robotics, la génération d'images suivant "dans les semaines à venir", selon BFL. La version Dev à poids ouvert, la seule que BFL prévoit de publier pour une utilisation locale, n'est pas attendue avant fin 2026.