📚 Série · Les familles de modèles en IA

Modèles vidéo et world models : générer une séquence, simuler un monde

Modèles vidéo et world models : générer une séquence, simuler un monde

Dernière famille du dossier sur IA : LLM, VLM, OCR... le panorama des familles de modèles : les modèles vidéo et les world models. C’est la famille la plus récente et la plus disputée du lot, celle où même les chercheurs ne s’entendent pas complètement sur le vocabulaire.

Générer une vidéo : la diffusion étendue dans le temps

Les générateurs vidéo type Sora (OpenAI) ou Veo (Google) prolongent le principe des Modèles de diffusion : comment l’IA génère une image à partir de bruit en ajoutant une dimension temporelle. Sora, par exemple, entraîne un modèle de diffusion transformer sur des “patches spatio-temporels” plutôt que sur des patches d’image isolés, ce qui permet de générer jusqu’à une minute de vidéo haute fidélité1. OpenAI a explicitement présenté cette approche comme une voie prometteuse vers des simulateurs généralistes du monde physique1.

Le principal défi technique reste la cohérence entre les frames : un générateur d’images classique produit chaque image indépendamment, alors qu’une vidéo doit garder le même visage, les mêmes objets, la même physique d’une frame à l’autre4. Sora 2, sorti en 2026, a nettement progressé sur ce point : quand un joueur de basket rate un tir, le ballon rebondit désormais sur le panneau au lieu de téléporter jusqu’au panier comme le faisaient les générateurs précédents.

World model : un mot qui recouvre deux philosophies différentes

C’est là que le vocabulaire se complique. Un world model est un système d’IA capable de comprendre et simuler les règles d’un environnement, pas seulement de générer une vidéo qui a l’air réaliste2. Deux écoles s’affrontent sur la façon d’y arriver :

  • Le camp génératif (Sora, Genie 3 de DeepMind) : rendre le futur frame par frame, en utilisant ce rendu comme simulation en soi.
  • Le camp non génératif (JEPA de Meta, Dreamer) : compresser le monde dans un espace latent abstrait sans jamais produire de pixels, et évaluer le modèle sur sa capacité à transférer vers des tâches en aval comme la planification robotique3.

Les deux camps partagent le mot “world model” mais pas la destination3.

flowchart TD
    A[World models] --> B[Camp génératif<br/>Sora, Genie 3]
    A --> C[Camp latent<br/>JEPA, Dreamer]
    B --> D[Rend le futur en pixels,<br/>frame par frame]
    C --> E[Compresse le monde<br/>en représentations abstraites]
    D --> F[Utile pour la création<br/>de contenu, le jeu vidéo]
    E --> G[Utile pour la planification,<br/>la robotique]

Ce qui distingue un vrai world model d’un générateur vidéo

Trois propriétés séparent un world model d’un simple générateur3 :

  1. L’action-conditionnement : le modèle répond à “que se passe-t-il si je fais X”, pas seulement “continue cette séquence”. Genie 3 accepte un signal de contrôle (déplacement, caméra) à chaque frame, ce que Sora ne fait pas3.
  2. La persistance : Genie 3 garde en mémoire les éléments visuels pendant environ une minute, un objet qui sort du champ de vision et qui y revient est restauré correctement2.
  3. La simulation physique : gravité, collisions, friction, fluides, plutôt qu’un rendu qui a simplement l’air plausible2.

Où ça sert concrètement

Waymo utilise une variante de Genie 3 pour simuler des cas limites (tornades, animaux sur la route) et entraîner ses véhicules autonomes. Meta (V-JEPA 2) et NVIDIA (Cosmos) développent des world models pour la robotique et les systèmes physiques, avec l’objectif de réduire la dépendance à des données réelles coûteuses à collecter. Le point commun : apprendre la dynamique d’un environnement pour planifier une action, plutôt que produire un contenu à regarder passivement.

Et la suite du dossier

C’est la fin du tour des familles pour l’instant. Retour à l’article chapeau sur IA : LLM, VLM, OCR... le panorama des familles de modèles pour une vue d’ensemble, ou reprends par le début avec les LLM : comment fonctionnent les grands modèles de langage si tu veux tout relire dans l’ordre.

Sources

  1. Video generation models as world simulators - OpenAIopenai.com
  2. Genie 3: The world model that generates interactive 3D environmentsanthemcreation.com
  3. World Models, From Zero to Hero - HackMDhackmd.io
  4. Génération d'images IA, du bruit à l'image - Labo LLMlabo-llm.fr

← Tous les articles