Gehört Ihr Computer Codex? Ich habe bei OpenAI nachgefragt

Agenten bedienen inzwischen selbst Software und verbinden verstreuten Kontext. Dadurch werden Urteilsvermögen, Steuerung und gemeinsame Werkzeuge zum Engpass.

Der persönliche Computer wird zum gemeinsamen Arbeitsplatz von Mensch und Agent. Der Mensch formuliert das Ziel, liefert Kontext und greift bei Bedarf ein; der Agent bewegt den Cursor, prüft Oberflächen und arbeitet sich durch Dokumente und Anwendungen. Im Gespräch von Nate B. Jones mit Andrew und Ash bei OpenAI steht diese Rollenverschiebung im Zentrum.

Computernutzung als universelle Verbindung

Spezialisierte Schnittstellen, MCP und direkte Konnektoren sind häufig schneller und token-effizienter. Trotzdem werden sie nie jede Behördenseite, jedes PDF, jedes alte Webformular und jeden Fax-basierten Ablauf abdecken. Die visuelle Bedienung des Computers schließt genau diese Lücken.

Lange galt sie als eindrucksvolle, aber langsame Vorführung. Inzwischen sei sie schnell genug, dass ein Agent für einen nicht abgedeckten Schritt unauffällig vom Konnektor zur Benutzeroberfläche wechseln könne. Für ein breites Publikum dürfen dabei Skripte und Selektoren in den Hintergrund treten. Sichtbar bleiben muss jedoch genug, damit Nutzer die Ausführung nachvollziehen und ihr vertrauen können.

Entscheidend ist verfügbarer Kontext

Softwareentwicklung erreichte den Wendepunkt früh, weil lokale Dateien, Terminal, Git und Kommandozeilenwerkzeuge den benötigten Kontext bereitstellten. Rechtsabteilungen konnten große Dokumentbestände zugänglich machen. Mit besseren Konnektoren und zuverlässigerer Computerbedienung folgten weitere Funktionen.

Damit verliert die Einteilung in technische und nichttechnische Berufe an Aussagekraft. Finanz- und Geschäftsteams bei OpenAI erstellen laut Gespräch bereits interne Sites und Anwendungen, teilen sie mit Kollegen und entwickeln sie weiter. Sie arbeiten faktisch wie Entwickler, obwohl ihnen Werkzeuge wie Versionskontrolle noch fehlen.

Wenn Erzeugen leicht wird, zählt Auswahl

Die Qualität von Sites, Werkzeugen, Dokumenten und anderen Arbeitsergebnissen soll auf mehreren Ebenen steigen: beim Output, beim Verständnis der tatsächlichen Absicht, beim Einbeziehen von Kontext und beim Belegen von Quellen. Der Engpass verlagert sich dadurch auf Ideen, Validierung und Iteration.

Zugleich entsteht ein Konvergenzproblem. Wenn sich fast alles herstellen lässt, braucht es umso mehr Klarheit darüber, was überhaupt entstehen soll. Ein Produkt muss fokussiert, zusammenhängend und verständlich bleiben. Geschmack und Entscheidungsfähigkeit gewinnen an Wert, weil hohe Produktionskapazität nicht automatisch gute Prioritäten schafft.

Steuerung endet nicht mit dem Auftrag

Lange Agentenläufe passen nicht in das Muster aus Frage und fertiger Antwort. Der Agent kann falsch abbiegen; ebenso kann der Nutzer nach zwanzig Minuten erkennen, dass schon der ursprüngliche Auftrag falsch war. Unterbrechen, korrigieren und Fortsetzen müssen deshalb während der gesamten Ausführung möglich sein.

Gezielte Rückfragen gehören dazu. Eine einzige Ja-oder-Nein-Frage auf dem gerade verfügbaren Gerät kann viel Rechenaufwand sparen und das Ergebnis verbessern. Die Person muss nicht ständig zuschauen, soll aber an den entscheidenden Stellen urteilen können.

Sprache hinein, visuelle Ergebnisse heraus

Gesprochene Sprache überträgt umfangreichen Kontext besonders schnell, während Menschen Informationen schneller lesen als anhören. Daraus ergibt sich eine kombinierte Oberfläche: mündliche Eingabe, visuelle Ausgabe und wenige präzise Rückfragen. Frühe Anwender arbeiten bereits so, doch die Gewohnheit ist noch nicht in der Breite angekommen.

Noch anspruchsvoller ist Proaktivität. Ein Agent könnte von selbst auf ein übersehenes Kundenproblem hinweisen. Ohne ausdrückliche Frage liegt die Messlatte für Relevanz, Begründung und Zuverlässigkeit jedoch höher. Stundenlange Inferenz für einige schwache Hinweise wäre teuer und käme Spam gleich.

Vom persönlichen Vorteil zum Teamprozess

Die empfohlene Einstiegsregel lautet: Erst versuchen, die Aufgabe dem Agenten zu geben, statt sofort selbst zu beginnen. Der Nutzen für Teams entsteht, wenn frühe Anwender wiederkehrende Probleme in gemeinsam nutzbare Systeme verwandeln — etwa eine regelmäßig aktualisierte Finanzanwendung, eine interne Site oder eine Automation, die relevante Fehler in Slack veröffentlicht. Solche sichtbaren Lösungen vermitteln Möglichkeiten konkreter als abstrakte Schulungen.

Source