Opus 5.5 contro tutti: è il nuovo standard del settore?
Opus 5.5 sposta il confronto tra modelli sul costo per attività completata, la guidabilità e la qualità utile.
Pubblicato il
Opus 5.5 sposta la competizione tra modelli su una misura concreta: quanto costa completare davvero un’attività dopo tentativi, correzioni e intervento umano. Nel test di Nate B. Jones, Claude ha trasformato il suo logo in un progetto Lego completo da 514 pezzi usando soltanto una piccola parte del limite settimanale dell’abbonamento.
Un risultato completo, non una sola immagine
La consegna comprendeva un’animazione, un file del modello, l’elenco dei pezzi, controlli geometrici e un manuale di 63 pagine con 58 passaggi di montaggio. Il progetto ha utilizzato 89 milioni di token. Secondo la stima di Nate, lo stesso consumo sarebbe costato almeno 44 dollari con le tariffe API, ma ha rappresentato circa l’1% del suo limite settimanale.
La distinzione è importante: un’immagine convincente non dimostra che il modello sappia completare l’intero lavoro. Il benchmark utile deve includere revisioni, coerenza tra i file, verifiche e qualità finale.
La guidabilità ha un valore economico
Nate considera Opus 5.5 più facile da dirigere sia nella scrittura sia nei lavori visivi generati tramite codice. Un’istruzione precisa può cambiare un oggetto, un’animazione o una frase senza compromettere gli elementi da conservare. Meno spiegazioni ripetute e meno revisioni fallite riducono tempo e consumo di token.
Le tariffe citate sono 4 dollari per milione di token in ingresso e 20 dollari in uscita. Anthropic dichiara inoltre un costo inferiore di circa il 40% sui carichi tipici grazie alla combinazione di prezzi più bassi e meno passaggi o token.
Gli agenti persistenti richiedono limiti
La persistenza è utile per le attività notturne, ma Nate suggerisce di definire il perimetro, i criteri di valutazione, una chiara definizione di completamento e una condizione di arresto. Senza questi vincoli, l’agente può ampliare inutilmente il lavoro e consumare budget.
Verificare il vantaggio sul proprio flusso
Il test più utile consiste nel ripetere un’attività conosciuta con gli stessi file, lo stesso prompt e lo stesso punto di partenza. Bisogna poi confrontare qualità finale, tentativi falliti, interventi umani, token totali e costo stimato. Opus 5.5 non sarà superiore in ogni ambito, ma questo metodo mostra dove la sua efficienza giustifica un cambiamento nel flusso di lavoro.
Source
- Chaîne: AI News & Strategy Daily | Nate B Jones
- Vidéo source: https://www.youtube.com/watch?v=osZZjdMZVvA