Wann macht mir KI Rührei? Ich bin zu NVIDIA gefahren, um es herauszufinden.
NVIDIA erklärt, wie Cosmos Simulation, Schlussfolgern und Handeln verbindet und warum Verifikation das Tempo der Robotik bestimmt.
Veröffentlicht am
Allgemein einsetzbare Haushaltsroboter brauchen mehr als leistungsfähigere Sprachmodelle. Sie benötigen Weltmodelle, die eine Szene abbilden, ihre weitere Entwicklung vorhersagen und eine Absicht in eine physische Handlung übersetzen können. NVIDIAs Cosmos-Familie soll diese Fähigkeiten für Roboter, autonome Fahrzeuge und industrielle Systeme zusammenführen.
Von Worten zu Handlungen
Ein Sprachmodell erzeugt Symbole. Ein Weltmodell kann eine Simulation generieren, eine Trajektorie vorhersagen oder einen Roboterarm direkt steuern. Cosmos verbindet sprachliches Schlussfolgern, Videogenerierung und Repräsentationen von Handlungen. In einem autonomen Fahrzeug beobachtet eine Policy die Straße und aktualisiert fortlaufend die Wegpunkte. In einer Fabrik kann sie einen Greif- und Ablagevorgang steuern, während ein separates visuelles System das Ergebnis prüft.
Die Architektur muss zugleich die Latenzanforderungen der realen Welt erfüllen. Ein kompaktes Modell auf einer Plattform wie Jetson Thor kann sofortige Reaktionen übernehmen, während ein größeres Rechenzentrumsmodell für Planung und übergeordnetes Schlussfolgern zuständig ist. Physische KI wird daher wahrscheinlich auf koordinierten Spezialkomponenten beruhen und nicht auf einem einzigen maximalen Modell in jedem Gerät.
Erst simulieren, dann einsetzen
Reale Daten sind teuer, langsam zu erfassen und enthalten nur wenige seltene Ereignisse. NVIDIA nutzt unter anderem Omniverse und Isaac, um synthetische Interaktionen zu erzeugen und Policies in virtuellen Umgebungen zu bewerten. Ein Weltmodell wird damit zu einem Stellvertreter der Realität, an dem Fahrzeuge oder Roboter in vielen Szenarien geprüft werden können, bevor Hardware oder Menschen einem Risiko ausgesetzt werden.
Der Fortschritt beruht auf vier sich ergänzenden Skalierungshebeln: mehr Daten, größere Modelle, mehr Rechenaufwand während der Inferenz und agentische Systeme. Agenten zerlegen ein Ziel in Schritte, rufen unterschiedliche Modelle und Werkzeuge auf, beobachten das Ergebnis und passen die nächste Handlung an.
Verifikation ist der Engpass
Modelle können physikalisches Verhalten immer genauer nachbilden, ohne die zugrunde liegenden Naturgesetze entdeckt zu haben. Im Gespräch dient die Schwerkraft als Beispiel: Ein plausibel fallendes Objekt zu erzeugen beweist nicht, dass das System die physikalische Konstante hinter der Bewegung selbstständig hergeleitet hat.
Die Lerngeschwindigkeit in der physischen Welt hängt deshalb von der Qualität der Prüf- und Rückkopplungsschleife ab. Gefaltete Wäsche lässt sich visuell kontrollieren. Das Einstecken eines Kabels kann ein Softwaretest bestätigen. Der Geschmack von Rührei erfordert weiterhin ein subjektives menschliches Urteil. Roboter werden bei Aufgaben am schnellsten vorankommen, deren Ergebnis automatisch messbar und in einer Simulation reproduzierbar ist.
Auf dem Weg zu physischen Agenten
Physische KI könnte dem Weg von Softwareagenten folgen: allgemeine Modelle werden durch spezialisierte Fähigkeiten, Laufzeitumgebungen und Werkzeuge ergänzt. Der Unterschied ist entscheidend. Digitale Agenten bearbeiten Bits, Roboter bewegen Atome. Jeder Fehler dauert länger, kostet mehr und kann ein reales Sicherheitsrisiko verursachen.
Wettbewerbsvorteile entstehen daher nicht nur durch Modelle, sondern ebenso durch Simulatoren, Daten, Verifikationssysteme und die Integration von Hard- und Software. Deshalb könnte ein Roboter, der zuverlässig Wäsche faltet, früher verfügbar sein als einer, der perfektes Rührei zubereitet.
Source
- Chaîne: AI News & Strategy Daily | Nate B Jones
- Vidéo source: https://www.youtube.com/watch?v=ry9J1i3krIY