Opus 5.5 im Vergleich: Ist das der neue Branchenstandard?

Opus 5.5 verlagert den Modellvergleich auf Kosten pro erledigter Aufgabe, Steuerbarkeit und nutzbare Qualität.

Opus 5.5 verschiebt den Modellvergleich auf eine praktische Kennzahl: Was kostet eine tatsächlich abgeschlossene Aufgabe einschließlich Fehlversuchen, Korrekturen und menschlicher Arbeit? In Nate B. Jones’ Test verwandelte Claude sein Logo in ein vollständiges Lego-Modell mit 514 Teilen und verbrauchte dabei nur einen kleinen Anteil seines wöchentlichen Abonnementlimits.

Ein vollständiges Ergebnis statt eines Vorzeigebilds

Zum Lieferumfang gehörten eine Animation, eine Modelldatei, eine Teileliste, geometrische Prüfungen und eine 63-seitige Anleitung mit 58 Bauschritten. Das Projekt verbrauchte 89 Millionen Token. Nate schätzt, dass dieselbe Nutzung zu API-Preisen mindestens 44 Dollar gekostet hätte, aber nur ungefähr 1 % seines Wochenlimits beanspruchte.

Dieser Unterschied ist entscheidend. Ein überzeugender Screenshot beweist nicht, dass ein Modell die gesamte Aufgabe abschließen kann. Ein sinnvoller Benchmark umfasst konsistente Dateien, Überarbeitungen, Validierung und die endgültige Qualitätsanforderung.

Steuerbarkeit ist ein wirtschaftlicher Faktor

Nate empfand Opus 5.5 sowohl beim Schreiben als auch bei codegenerierter visueller Arbeit als leichter steuerbar. Eine präzise Anweisung kann ein Objekt, eine Animation oder einen Satz verändern, ohne die unveränderten Bestandteile zu beschädigen. Weniger wiederholte Erklärungen und misslungene Überarbeitungen sparen Zeit und Token.

Die genannten Preise liegen bei 4 Dollar pro Million Eingabetoken und 20 Dollar pro Million Ausgabetoken. Anthropic spricht außerdem von rund 40 % niedrigeren Kosten bei typischen Arbeitslasten, ermöglicht durch niedrigere Preise und weniger Schritte beziehungsweise Token.

Ausdauernde Agenten brauchen Grenzen

Die Beharrlichkeit des Modells hilft bei Aufgaben über Nacht. Nate empfiehlt jedoch einen klaren Arbeitsrahmen, Bewertungskriterien, eine Definition of Done und eine Abbruchbedingung. Ohne diese Grenzen kann ein engagierter Agent die Aufgabe unnötig ausweiten und Budget verbrauchen.

Den Nutzen mit eigenen Aufgaben prüfen

Der aussagekräftigste Test wiederholt eine bekannte Aufgabe mit denselben Dateien, demselben Prompt und demselben Ausgangspunkt. Anschließend werden Endqualität, Fehlversuche, menschliche Eingriffe, Gesamtzahl der Token und geschätzte Kosten verglichen. Opus 5.5 wird nicht in jedem Bereich führen, doch dieses Verfahren zeigt, wo seine Effizienz eine Änderung der Modellwahl rechtfertigt.

Source