Opus 5.5 face au reste : le nouveau standard du secteur ?

Opus 5.5 déplace la comparaison des modèles vers le coût par tâche, la pilotabilité et la qualité finale.

Opus 5.5 déplace la question du « meilleur modèle » vers un indicateur plus concret : combien coûte une tâche réellement terminée, après les essais, les corrections et le temps humain. Dans le test de Nate B. Jones, le modèle a transformé un logo en construction Lego complète de 514 pièces tout en consommant une faible part de son forfait hebdomadaire.

Un test de bout en bout, pas une simple démonstration

Le livrable ne se limite pas à une image réussie. Claude a produit une animation, un modèle exploitable, une liste de pièces, des contrôles géométriques et un manuel de 63 pages comprenant 58 étapes. Le projet a totalisé 89 millions de tokens. Nate estime que ces tokens auraient coûté au moins 44 dollars aux tarifs API, mais qu’ils n’ont représenté qu’environ 1 % de son quota hebdomadaire.

Cette distinction est centrale : une belle capture d’écran ne mesure pas la capacité à terminer le travail. Il faut compter l’ensemble du parcours, y compris les reprises, les fichiers cohérents entre eux et les vérifications finales.

La pilotabilité devient un avantage économique

Nate constate qu’Opus 5.5 suit mieux les corrections, aussi bien pour l’écriture que pour les scènes visuelles générées par le code. Une demande ciblée peut modifier la forme d’un objet, le rythme d’une animation ou une nuance de texte sans dégrader ce qui doit rester intact. Moins de reformulations et de retours inutiles signifient aussi moins de tokens consommés.

Les tarifs cités — 4 dollars par million de tokens en entrée et 20 dollars en sortie — sont inférieurs à ceux des versions comparées. Anthropic évoque en outre une baisse d’environ 40 % du coût de charges typiques, obtenue par la combinaison de prix plus bas et d’une exécution plus concise.

Encadrer les agents persistants

La persistance du modèle est utile pour les tâches nocturnes, mais elle doit être canalisée. Nate recommande de fixer un périmètre, une définition de « terminé », des tests de validation et une condition d’arrêt. Sans ces limites, un agent motivé peut prolonger inutilement son travail et consommer davantage de budget.

Comment vérifier le gain dans son propre travail

La bonne méthode consiste à rejouer une tâche connue avec les mêmes fichiers, la même consigne et le même point de départ. Il faut ensuite comparer la qualité finale, le nombre d’essais, les interventions humaines, les tokens et le coût estimé. Opus 5.5 ne sera pas supérieur partout, mais ce protocole permet d’identifier précisément les domaines où son efficacité change réellement un flux de travail.

Source