← Tutti gli articoli
Il pavimento dei prezzi LLM è crollato: è il momento di ridisegnare il tiering

Il pavimento dei prezzi LLM è crollato: è il momento di ridisegnare il tiering

2 min di lettura

In due settimane di agosto Anthropic ha reso permanente il prezzo di Sonnet 5 a 2 e 10 dollari per milione di token, ha aggiornato Opus 5, OpenAI ha riorganizzato la gamma in tier durevoli e Google ha rilasciato Gemini 3.7 Flash. Se avete una feature AI in produzione, il vostro tiering per costo è già vecchio.

Agosto ha rimescolato i prezzi degli LLM in modo che vale la pena guardare, non perché sia uscito un modello che cambia tutto, ma perché il costo per token si sta stabilizzando verso il basso e i tier si stanno riorganizzando. Il 10 agosto Anthropic ha reso permanente il prezzo introduttivo di Claude Sonnet 5, 2 dollari per milione di token in input e 10 in output. Il 12 agosto ha aggiornato Opus 5, uscito il 24 luglio a 5 e 25 dollari, con inferenza più veloce. OpenAI il 6 agosto ha riorganizzato la gamma attorno a tier di capacità durevoli (Sol, Terra, Luna) e ha lanciato ChatGPT Work, un sistema agentico per progetti lunghi. Google ha rilasciato Gemini 3.7 Flash il 13 agosto, Alibaba Qwen3.8 Max il 2. Se il vostro codice sceglie ancora il modello che avevate a giugno, state pagando prezzi vecchi.

Cosa cambia davvero per chi ha una feature in produzione

La lezione non è "usate il modello più economico". È che il divario di prezzo tra un modello di frontiera e uno di classe intermedia è ormai tale che scegliere il modello per task, e non per abitudine, è la voce di ottimizzazione più grossa che avete. Opus 5 a 5 e 25 dollari contro Sonnet 5 a 2 e 10 è un fattore tra due e mezzo e cinque: classificare un ticket, estrarre campi da un documento, taggare un contenuto non hanno bisogno del modello di punta.

Il tiering per task, in concreto

  • Task deterministici e ad alto volume: classificazione, estrazione, tagging, riformulazione breve vanno sul modello intermedio o flash. È qui che si spende senza accorgersene.
  • Ragionamento e produzione lunga: sintesi complesse, codice, analisi multi-passo giustificano il modello di frontiera, ma solo su quel tratto di flusso.
  • Il model id resta configurazione, non codice: come scrivevamo a luglio parlando di dipendenza dai fornitori, il modello va letto da una variabile e nascosto dietro un'unica interfaccia. Cambiare tier o fornitore deve costare un deploy.
  • Una eval suite vostra: venti casi reali del vostro dominio con output atteso. Senza, non saprete mai se scendere di tier degrada la qualità o solo la fattura.

Verdetto

I prezzi degli LLM cambiano ogni mese, e agosto lo ha dimostrato con quattro annunci in due settimane. Chi ha cablato un solo modello nel codice paga il conto due volte: in fattura oggi e in refactoring quando dovrà cambiarlo. Mettete un'interfaccia astratta davanti al modello, tenete venti test che dicano se un tier più basso regge, e rivedete il tiering ogni trimestre come rivedete la spesa cloud. Mezza giornata di lavoro che si ripaga alla prima bolletta.