Quand l’IA me préparera-t-elle des œufs brouillés ? Je suis allé chez NVIDIA pour le savoir.
NVIDIA explique comment Cosmos combine simulation, raisonnement et action, et pourquoi la vérification dictera le rythme de la robotique.
Publié le
Les robots domestiques capables de tout faire ne dépendront pas seulement de meilleurs modèles de langage. Ils auront besoin de modèles du monde capables de représenter une scène, d’en anticiper l’évolution et de transformer une intention en action physique. Chez NVIDIA, la famille Cosmos cherche à réunir ces fonctions dans une plateforme destinée aux robots, aux véhicules autonomes et aux systèmes industriels.
Du texte à l’action
Un modèle de langage produit des symboles. Un modèle du monde peut, lui, générer une simulation, prévoir une trajectoire ou commander un bras robotique. Cosmos associe raisonnement en langage, génération vidéo et représentation des actions. Dans une voiture autonome, une politique observe la route et recalcule continuellement les points de passage. Dans un atelier, elle peut guider une opération de prise et de placement, puis faire vérifier le résultat par un autre système visuel.
Cette architecture doit respecter les contraintes du terrain. Un petit modèle embarqué réagit immédiatement sur une plateforme comme Jetson Thor, tandis qu’un modèle plus puissant en centre de données peut traiter la planification ou le raisonnement de haut niveau. La robotique ne convergera donc probablement pas vers un unique modèle géant, mais vers plusieurs composants spécialisés et coordonnés.
Simuler avant d’agir
Les données réelles restent coûteuses, lentes à collecter et pauvres en événements rares. NVIDIA utilise notamment Omniverse et Isaac pour produire des interactions synthétiques et tester des politiques dans des environnements virtuels. Un modèle du monde devient ainsi un proxy du réel : il permet d’évaluer un véhicule ou un robot sur de nombreux scénarios avant de risquer du matériel ou des personnes.
La progression repose sur quatre leviers complémentaires : le volume de données, la taille des modèles, le calcul effectué au moment de l’inférence et les systèmes agentiques. Ces derniers décomposent un objectif en étapes, appellent plusieurs modèles et outils, observent le résultat puis corrigent l’action suivante.
La vérification, véritable goulot d’étranglement
Les modèles peuvent reproduire de mieux en mieux les effets de la physique sans pour autant en avoir découvert les lois. L’entretien prend l’exemple de la gravité : générer correctement la chute d’un objet ne prouve pas que le système a spontanément identifié la constante physique sous-jacente.
Dans le monde physique, la vitesse d’apprentissage dépend donc de la qualité de la boucle de validation. Le pliage du linge peut être contrôlé visuellement. L’insertion d’un câble peut être confirmée par un test logiciel. Le goût d’œufs brouillés exige encore un jugement humain subjectif. Les robots progresseront d’abord sur les tâches dont la réussite est mesurable automatiquement et reproductible en simulation.
Vers des agents physiques
L’IA physique pourrait suivre le chemin des agents logiciels : des modèles généralistes complétés par des compétences spécialisées, un environnement d’exécution et des outils. La différence est majeure : les agents numériques manipulent des bits, tandis que les robots manipulent des atomes. Chaque erreur prend plus de temps, coûte davantage et peut présenter un risque réel.
L’avantage compétitif se jouera donc autant dans les modèles que dans les simulateurs, les données, les mécanismes de vérification et l’intégration entre matériel et logiciel. C’est aussi pourquoi un robot capable de plier le linge de façon fiable pourrait arriver avant celui qui prépare des œufs brouillés parfaits.
Source
- Chaîne: AI News & Strategy Daily | Nate B Jones
- Vidéo source: https://www.youtube.com/watch?v=ry9J1i3krIY