Buzz Panda
  • Nature

    Découverte apocalyptique au mont Shasta : des milliers de haut-parleurs solaires diffusent des voix

    Une femme a fait voler son drone au-dessus d’une montagne, mais ce qu’il a filmé a choqué tout le monde

    J’ai tout vendu et je suis parti vivre hors réseau… Puis CECI s’est produit

    Il manque un milliard d’années à l’histoire de la Terre. Nous savons enfin pourquoi.

    Ma grand-mère traçait toujours un trait de craie sur le seuil en juillet : 50 ans plus tard, on redécouvre pourquoi

    Il se passe quelque chose avec les orques en mer : les attaques se multiplient

    « Arrêtez de faire ça » : pourquoi il ne faut jamais écraser une araignée dans la maison, les experts sont unanimes

  • Animaux

    Cinq jours, huit rencontres : le mystère du Bigfoot dans l’Ohio

    Ce que signifie un chat qui vous fixe longuement sans jamais cligner des yeux

    Il se passe quelque chose avec les orques en mer : les attaques se multiplient

    La tablette sumérienne qui raconte que les chats ont été amenés sur Terre — et qui décrit leur raison d’être initiale

    Votre chat vous pétrit avec ses pattes ? Il essaie de vous dire une chose très précise…

    « Arrêtez de faire ça » : pourquoi il ne faut jamais écraser une araignée dans la maison, les experts sont unanimes

    « Un inconditionnel des chiens » adopte son premier chat, puis prend soudain conscience de quelque chose

  • Lifestyle

    Une astuce japonaise pour emballer des cadeaux que (malheureusement) personne ne connaît

    VIDÉO. Depuis 15 ans, cet homme vit dans une cabane sans eau ni électricité en Auvergne

    VIDÉO. Depuis 15 ans, cet homme vit dans une cabane sans eau ni électricité en Auvergne

    D’après un psychologue, les gens qui décorent tôt pour Noël sont plus heureux !

    D’après un psychologue, les gens qui décorent tôt pour Noël sont plus heureux !

    Être super introverti/extraverti : c’est quoi le pire ?!

    Être super introverti/extraverti : c’est quoi le pire ?!

    La face cachée de la « vanlife » que personne ne veut voir

    La face cachée de la « vanlife » que personne ne veut voir

    Un homme humilie publiquement une femme sans enfants, elle réplique si fortement qu’il prend un « congé maladie »

    Un homme humilie publiquement une femme sans enfants, elle réplique si fortement qu’il prend un « congé maladie »

    15 choses dont vous ignoriez l’utilité !

    15 choses dont vous ignoriez l’utilité !

  • LOL
    Les vidéos d’animaux les plus amusantes de l’année ! 🤣 | Meilleure compilation

    Les vidéos d’animaux les plus amusantes de l’année ! 🤣 | Meilleure compilation

    Voici ce qui arrive quand on énerve un garde royal

    Voici ce qui arrive quand on énerve un garde royal

    Top 10 des pires prénoms qui ont été autorisés par l’État civil, c’est chaud

    Top 10 des pires prénoms qui ont été autorisés par l’État civil, c’est chaud

    Quelqu’un en Bulgarie colle des yeux globuleux sur des objets cassés dans la rue, et c’est encore mieux que de les réparer

    Quelqu’un en Bulgarie colle des yeux globuleux sur des objets cassés dans la rue, et c’est encore mieux que de les réparer

    30 citations démotivantes qui sont douloureusement vraies

    30 citations démotivantes qui sont douloureusement vraies

    Des employés de bureau découvrent qu’un « chat espion » sournois les observait en secret

    Photos avant et après d’avoir été appelés « bon chien »

  • Vidéos

    Deux « Toulousains » Détruisent une Vierge en Corse

    Les 20 plus grands animaux jamais filmés

    Steven Spielberg dévoile enfin la première bande-annonce de son nouveau film sur les ovnis, « Disclosure Day », et nous sommes terrifiés

    Un « voyageur temporel » affirme être le seul survivant sur Terre en 2028 : vidéos et photos à l’appui

    Mars en 4K : l’édition ultime

    Mars en 4K : l’édition ultime

    Moments extrêmement rares de la nature

    Moments extrêmement rares de la nature

    VIDÉO INCROYABLE ! Un homme soulève un bloc de 20 tonnes à la main ?

    VIDÉO INCROYABLE ! Un homme soulève un bloc de 20 tonnes à la main ?

  • Art

    On peut toujours compter sur les gens pour combler les lacunes #TEDTalks

    Colombie: des milliers de pétroglyphes de 12500 ans trouvés

    Ce faussaire raconte comment il a dupé le monde de l’art

    Les 10 bâtiments les plus emblématiques de l’architecte Frank Gehry à découvrir absolument

    14 des chefs-d’œuvre les plus horribles de l’histoire de l’art

    14 des chefs-d’œuvre les plus horribles de l’histoire de l’art

    Cet homme a mis 3 ans pour réaliser la statue de ses parents en bois « Merci d’apprécier mon travail »

    Cet homme a mis 3 ans pour réaliser la statue de ses parents en bois « Merci d’apprécier mon travail »

    Les scientifiques ont fait une nouvelle découverte terrifiante en Afrique qui change tout !

    Les scientifiques ont fait une nouvelle découverte terrifiante en Afrique qui change tout !

  • Innovations

    L’IA vient de devenir gratuite (et personne n’en parle)

    Voici pourquoi Elon Musk construit le plus grand bâtiment du monde

    Les voitures volantes existent DÉJÀ en Chine (et j’ai volé avec)

    Elon Musk vient de prédire la fin du travail (personne n’est prêt)

    « Nous en avons eu le souffle coupé » : sur Mars, Curiosity découvre des structures en nid d’abeille

    N’achetez pas de filtre à eau pour toute la maison ! Une innovation en matière de traitement de l’eau à réaliser soi-même en 2026 à partir de matériaux naturels

    Ce vaisseau spatial est tellement bien conçu qu’on n’a pas le droit de s’en servir

  • Environnement

    Des scientifiques ont envoyé des plongeurs au fond du lac Tahoe — Les images ont tout changé

    J’ai construit des « Cloudbusters » et ils ont essayé de me faire taire

    Le ciel est une arme : la manipulation climatique révélée

    Il se passe quelque chose avec les orques en mer : les attaques se multiplient

    La Terre se dirige vers des journées de 25 heures, avertissent des scientifiques

    Dans le sud de la Chine vit le crotale de Mangshan, un des serpents les plus rares de la planète

    Ce mégatsunami a secoué le monde, et l’un d’eux pourrait frapper à tout moment

Pas de résultat
Voir tous les résultats
Buzz Panda
Pas de résultat
Voir tous les résultats
Accueil Innovation

Mais comment fonctionnent réellement les images et vidéos générées par l’IA ?

9 octobre 2026
dans Innovation, Intelligence Artificielle, Science, Technologie
Partager sur FacebookPartager sur X

Ces dernières années, les systèmes d’intelligence artificielle sont devenus étonnamment performants pour transformer de simples descriptions textuelles en vidéos d’un réalisme saisissant. Au cœur de cette prouesse technologique se cache un lien profond avec la physique. Cette génération de modèles repose sur un processus dit de diffusion, remarquablement équivalent au mouvement brownien que l’on observe dans le déplacement des particules, mais s’opérant à rebours dans le temps et au sein d’un espace mathématique de très grande dimension.

L’application concrète de ces principes physiques donne naissance à des algorithmes puissants. Si l’on observe un modèle open source performant comme Wan2.1, la création d’une vidéo commence toujours par un appel à un générateur de nombres aléatoires. L’IA génère d’abord une vidéo composée de pur bruit, semblable à la neige d’un vieux téléviseur. Cette bouillie de pixels est ensuite passée dans un réseau de type Transformer, similaire à l’architecture de ChatGPT. Au fil de dizaines d’itérations successives, le modèle sculpte littéralement ce bruit aléatoire pour en faire émerger une structure cohérente, transformant le chaos en une vidéo incroyablement détaillée correspondant au texte demandé.

CLIP : le pont mathématique entre les mots et les images

Pour comprendre comment l’IA parvient à lier si intimement le texte à l’image, il faut remonter à février 2021, avec la publication par OpenAI d’une architecture révolutionnaire baptisée CLIP. Entraîné sur 400 millions de paires image-légende issues d’Internet, CLIP se compose en réalité de deux modèles distincts : l’un traite le texte, l’autre la vision.

L’objectif de CLIP est de projeter les images et leurs descriptions dans un espace mathématique commun, appelé espace latent ou d’embedding, sous la forme de vecteurs de 512 dimensions. L’entraînement repose sur une approche dite contrastive : le système apprend à maximiser la similarité (mesurée par la similarité cosinus) entre le vecteur d’une image et celui de sa légende exacte, tout en minimisant la similarité avec toutes les autres légendes du lot de données.

La géométrie de cet espace vectoriel partagé possède des propriétés fascinantes. Il devient possible d’opérer mathématiquement sur des concepts purs. Le vulgarisateur Stephen Welch en donne un exemple frappant : en prenant le vecteur d’une photo de lui portant un chapeau, et en y soustrayant le vecteur d’une photo de lui sans chapeau, on obtient un nouveau vecteur. En comparant ce vecteur mathématique au dictionnaire du modèle texte, la meilleure correspondance obtenue est le mot « chapeau », suivi de « casquette ». L’IA a ainsi appris à traduire la présence visuelle d’un objet en une distance géométrique entre des vecteurs.

DDPM et modèles de diffusion : remonter le temps du bruit

Si CLIP permet de comprendre le contenu, il ne permet pas de générer de nouvelles images. C’est là qu’interviennent les modèles probabilistes de diffusion de débruitage (DDPM), introduits par des chercheurs de Berkeley en 2020.

Le principe fondamental consiste à prendre des images réelles et à y ajouter progressivement du bruit aléatoire jusqu’à leur destruction totale. Un réseau de neurones est ensuite entraîné à inverser ce processus. Contrairement à l’intuition première, le modèle n’apprend pas à retirer le bruit étape par étape. Il est entraîné à prédire, en une seule fois, la totalité du bruit qui a été ajouté à l’image d’origine. Le modèle apprend ainsi un champ vectoriel dynamique, conditionné par le temps, qui pointe toujours dans la direction de la distribution des données réelles.

Pour visualiser ce concept, on peut imaginer que toutes les images réalistes forment une forme de spirale dans un espace en deux dimensions. Ajouter du bruit à une image revient à faire une marche aléatoire (un mouvement brownien) qui l’éloigne de cette spirale. Lors de la génération, le modèle part d’un point aléatoire dans l’espace et suit son champ vectoriel pour retourner vers la spirale des images réelles.

Cependant, l’algorithme DDPM original exige d’ajouter artificiellement du bruit aléatoire à chaque étape de la génération, même en phase de débruitage. Sans cet ajout constant de bruit, toutes les trajectoires convergent vers le centre exact de la spirale, c’est-à-dire vers la moyenne mathématique de toutes les images du jeu de données. Dans l’espace visuel, une moyenne se traduit par une image floue et sans détails. L’injection de bruit force les trajectoires à se disperser et à atterrir sur des points spécifiques de la spirale, générant ainsi des images nettes et variées.

DDIM : l’accélération mathématique

Le principal défaut de l’approche DDPM résidait dans sa lenteur, nécessitant des centaines de passages dans le réseau de neurones. Quelques mois plus tard, des chercheurs de Stanford et de Google ont démontré qu’il était possible de s’affranchir de l’ajout de bruit aléatoire lors de la génération. En s’appuyant sur des concepts de mécanique statistique, ils ont traduit l’équation différentielle stochastique du modèle en une équation différentielle ordinaire.

Cette méthode, baptisée DDIM, modifie l’échelle et la taille des pas effectués par le modèle lors du retour vers la spirale des données. Elle permet aux trajectoires de suivre parfaitement les lignes de courant du champ vectoriel appris, atterrissant proprement sur des images réalistes de manière entièrement déterministe, et ce, en un nombre d’étapes drastiquement réduit.

Le guidage sans classificateur : sculpter l’image avec les mots

Il restait à unir la compréhension sémantique de CLIP à la puissance générative de la diffusion. En 2022, avec des modèles comme DALL-E 2, les chercheurs ont commencé à conditionner les modèles de diffusion en leur injectant les vecteurs textuels. Le modèle sait alors qu’il doit débruiter l’image en tenant compte du contexte fourni par le texte.

Pourtant, le simple conditionnement s’avère insuffisant pour obtenir une correspondance parfaite avec le prompt. Si l’on demande un arbre dans un désert, le modèle peut générer un désert avec une simple ombre, la tâche globale de générer une image réaliste prenant le pas sur la consigne spécifique.

La solution définitive s’appelle le guidage sans classificateur (Classifier-Free Guidance). La technique consiste à calculer deux champs vectoriels distincts lors de la génération :

  • Un vecteur non conditionné (le modèle génère une image au hasard, sans consigne).
  • Un vecteur conditionné (le modèle génère une image en suivant le prompt).

L’algorithme soustrait le vecteur non conditionné du vecteur conditionné. La différence obtenue isole la direction mathématique pure du concept demandé (l’arbre). Ce vecteur de différence est ensuite multiplié par un facteur d’échelle (alpha) pour amplifier artificiellement la direction du prompt, forçant littéralement les pixels à se conformer à la demande textuelle. Plus le facteur alpha est élevé, plus l’arbre apparaît grand et détaillé dans l’image finale.

Cette logique s’applique même à l’envers grâce aux prompts négatifs. Au lieu de soustraire un vecteur vide, des modèles comme Wan2.1 soustraient un vecteur correspondant à des concepts indésirables (comme « doigts en trop » ou « marcher à reculons »), orientant ainsi la diffusion à l’opposé de ces défauts pour garantir une anatomie et une physique cohérentes.

L’assemblage de ces briques fondamentales — la géométrie sémantique de CLIP, la modélisation du mouvement brownien par la diffusion, et l’amplification vectorielle du guidage — a donné naissance à une classe de machines fondamentalement nouvelle. Des systèmes capables de matérialiser l’imagination humaine à partir du néant, où la maîtrise des mathématiques de haute dimension remplace désormais la caméra et le pinceau.

Source : 3Blue1Brown

À lire aussi

L’IA vient de faire l’impossible (personne n’en parle)
Il y a 7 minutes : l’IA quantique de Google vient de défier les lois de la physique !
LA THÉORIE DU COMPLOT DE TOUT | Film complet
Vous n’êtes pas dans une simulation (vous êtes dans quelque chose de bien plus étrange !)
Des photos réelles qui défient toute logique et que les scientifiques ne parviennent pas à expliquer
Un physicien de renom : « La réalité n’est pas physique »
Tags: CLIPDALL-EGénération vidéoModèles de diffusionRéseaux De NeuronesStephen Welch
Article suivant

Le géant de Kandahar : la créature mythique qui aurait été tuée par les forces spéciales américaines en Afghanistan

Tendances

Buzz Panda

Suivez-Nous

  • Politique de confidentialité

© 2025 BuzzPanda

Pas de résultat
Voir tous les résultats
  • Nature
  • Animaux
  • Lifestyle
  • LOL
  • Vidéos
  • Art
  • Innovations
  • Environnement

© 2025 BuzzPanda