Ehrgeizig arbeiten, ohne die Token-Kosten explodieren zu lassen
Agentenkosten sinken, wenn unnötige Arbeit entfällt und Modelle, Werkzeuge und Evaluationen zur jeweiligen Aufgabe passen.
Veröffentlicht am
Agenten sind inzwischen leistungsfähig genug, um lange und komplexe Aufgaben auszuführen. Diese Autonomie kann den Tokenverbrauch jedoch vervielfachen. Die Antwort besteht nicht nur darin, ein günstigeres Modell einzukaufen, sondern zunächst Arbeit zu entfernen, die keinen Zweck mehr erfüllt.
Vom Geschäftsergebnis ausgehen
Gewachsene Abläufe enthalten oft Zusammenfassungen, Freigaben und Übergaben aus einer Zeit, in der Teams und Systeme Informationen nicht direkt austauschen konnten. An jeder Station einen Agenten einzusetzen, lässt den Prozess modern erscheinen, erhält aber die operative Altlast.
Bei einem Kundenangebot sind die tatsächlichen Anforderungen überschaubar: einen korrekten und genehmigten Preis erstellen, den Vorgang dokumentieren und fehlende Angaben erfragen. Der Ablauf sollte um diese Ergebnisse herum mit möglichst wenigen Übergaben neu aufgebaut werden. Das senkt zugleich Kosten, Wartezeiten und Fehlerquellen.
Intelligenz und Aufgabe aufeinander abstimmen
Nicht jeder Schritt braucht ein Spitzenmodell. Preisregeln, Feldprüfungen und Freigaben sollten deterministisch bleiben. Ein günstigeres Modell kann die Anfrage verstehen, relevante Angaben erfassen und diese Werkzeuge aufrufen; mehrdeutige Ausnahmen werden an ein leistungsfähigeres Modell weitergeleitet.
Dieses Routing benötigt einen zuverlässigen Klassifikator und einen passenden Rahmen. Routineaufgaben profitieren von einer dichten, expliziten Struktur aus Daten, Werkzeugen und Kontrollen. Schwierige Untersuchungen brauchen einen dünneren Rahmen, damit das fortgeschrittene Modell genügend Freiheit zum Schlussfolgern hat.
Wert statt bloßen Tokenverbrauch messen
Evaluationen sollten das konkrete Ergebnis prüfen: Ist der Preis korrekt, wurde die Freigabe erteilt, der Datensatz aktualisiert oder war eine Rückfrage an den Kunden der richtige nächste Schritt? Sie machen außerdem Läufe sichtbar, die weiter Ressourcen verbrauchen, ohne Wert zu schaffen.
Das Ziel ist nicht, jeden Modellaufruf zu minimieren, sondern Intelligenz dort einzusetzen, wo sie den Service verbessert. Eine höhere KI-Rechnung kann sinnvoll sein, wenn Teams schneller antworten und mehr Kunden bedienen. Sie ist es nicht, wenn mehrere Agenten Berichte erstellen, die niemand nutzt.
Source
- Chaîne: AI News & Strategy Daily | Nate B Jones
- Vidéo source: https://www.youtube.com/watch?v=eLpRDIvOMEw