Incolla questo in Claude e non raggiungere più il limite di token
Nate B. Jones mostra come ridurre i limiti di token pulendo il contesto, limitando le risposte e automatizzando le buone pratiche con Token Saver o Ringer.
Nate B. Jones presenta i limiti di token come un problema di gestione del contesto. Nel suo esempio, una giornata di lavoro in Codex ha fatto passare 3,77 miliardi di token, ma quasi il 96% era input riutilizzato. Il messaggio appena scritto dall’utente è quindi solo una piccola parte della richiesta reale.
Pulire il contesto prima di chiedere di più
La video guida propone quindici regole in tre livelli. Il primo è manuale: modificare il prompt sbagliato invece di aggiungere una correzione, raggruppare le domande correlate, aprire una nuova attività quando cambia il lavoro e portare avanti solo l’artefatto utile, non tutta la discussione che lo ha generato.
Anche la lunghezza dell’output è centrale. Una risposta lunga costa quando viene generata e poi costa di nuovo perché rientra nel contesto dei turni successivi. Chiedere cinque punti, un paragrafo o JSON non è solo ordine stilistico: riduce ambiguità e consumo futuro.
Alleggerire fonti e strumenti
Nate consiglia di cercare nei file prima di farlo fare al modello, inviare estratti pertinenti e convertire PDF o screenshot in testo o Markdown quando il layout non è necessario. Il modello può gestire materiale disordinato, ma lo fa bruciando rapidamente token.
Il secondo livello è automatizzare queste abitudini con lo skill “token saver”. Lo skill cerca prima di aprire file grandi, seleziona passaggi, esegue codice quando serve precisione, conserva la versione accettata e costruisce la richiesta successiva dal risultato invece che dall’intera cronologia.
Guardrail avanzati
La parte avanzata riguarda ciò che entra nella richiesta prima ancora del lavoro: definizioni degli strumenti, istruzioni permanenti, cronologia compatta, scelta del modello e prompt caching. Nate cita un setup Claude Desktop con GitHub, Slack, Sentry e Grafana in cui le sole definizioni degli strumenti possono consumare circa 55.000 token.
Infine presenta Ringer, un framework multi-agente locale che si colloca tra lo strumento AI e il provider del modello. Può rispondere localmente, eseguire ricette fisse, selezionare i passaggi utili, imporre limiti duri o bloccare una richiesta troppo grande.
Il punto pratico
Finestre di contesto più grandi aiuteranno, ma non eliminano il bisogno di disciplina. Per ottenere più valore dagli assistenti AI bisogna inviare meno rumore, conservare le risposte accettate e caricare solo gli strumenti realmente necessari.
Source
- Chaîne: AI News & Strategy Daily | Nate B Jones
- Vidéo source: https://www.youtube.com/watch?v=Y8vAQ1FgNbM