Claude Opus 5.5 domina il nuovo confronto tra 9 LLM

Risultati del test su 9 LLM a settembre 2026: Claude Opus 5.5 vince su logica e italiano, DeepSeek V4.1 Flash domina su codice e costi.

Claude Opus 5.5 domina il nuovo confronto tra 9 LLM

Nella sessione di misura del 25 settembre 2026, Claude Opus 5.5 ha registrato un punteggio perfetto di 1.000 su aderenza al vincolo, lingua italiana, chiamate a strumenti e coerenza. Dall'altra parte, DeepSeek V4.1 Flash si è imposto sulla velocità pura, erogando 226.8 token al secondo e ottenendo un 1.000 inesorabile nella generazione di codice eseguibile, il tutto con un costo reale di appena $0.00040 per compito superato.

Ho messo alla prova 9 modelli, spendendo un totale di $1.0231 per l'intera corsa. Oltre ai noti Gemini 3.1 Pro (preview), MiniMax M3, Kimi K3 e Qwen3.8-Max, questa settimana ho inserito cinque novità assolute: Claude Opus 5.5, DeepSeek V4.1 Flash, GPT-6 Sol, Grok 4.7 e GLM-5.3.

Prima di addentrarci nei numeri, è fondamentale chiarire la metodologia. Ho interrogato ogni modello al livello di ragionamento che il fornitore imposta di default. È la configurazione standard, quella che si ottiene chiamando l'API senza manipolare i parametri interni. Il codice generato è stato eseguito per davvero, dentro un ambiente isolato e privato dell'accesso alla rete. Il punteggio riflette una singola verità: i test sono passati o sono falliti. Non valuto l'eleganza del codice o se "sembra" corretto a occhio. Infine, i prezzi utilizzati per calcolare il costo reale per compito superato sono quelli di listino in vigore il giorno della misura, presi direttamente dalle pagine dei fornitori. Restano congelati insieme ai risultati.

Modello Costo per compito superato Italiano Il codice gira Chiamata a strumenti Coerenza Tempo al primo token
DeepSeek V4.1 Flash $0.00040 0.938 1.000 1.000 0.760 2115 ms
Gemini 3.1 Pro (preview) $0.00040 0.938 1.000 0.846 0.960 5012 ms
MiniMax M3 $0.00044 0.875 1.000 0.692 0.400 1903 ms
GPT-6 Sol $0.00073 1.000 0.875 — 0.960 1748 ms
GLM-5.3 $0.00158 0.813 1.000 1.000 0.960 5012 ms
Qwen3.8-Max $0.00198 1.000 1.000 1.000 0.880 9418 ms
Claude Opus 5.5 $0.00258 1.000 0.875 1.000 1.000 2551 ms
Kimi K3 $0.00374 0.867 1.000 1.000 1.000 8308 ms
Grok 4.7 $0.00403 1.000 1.000 1.000 0.960 6428 ms

Cosa misura ogni metrica

Costo per compito superato — Quanto è costato ottenere un risultato buono.

La spesa reale della batteria — token in ingresso e in uscita ai prezzi del giorno — divisa per il numero di compiti superati. Un modello che sbaglia metà dei compiti paga qui i suoi tentativi.

È il numero che decide, e non è il prezzo per milione di token: un modello che ragiona per mille token prima di rispondere li paga tutti.

Italiano — Controllo grammaticale su 16 frasi, non un giudizio di stile.

16 casi con una sola risposta giusta, verificata da un'espressione regolare: il congiuntivo dopo «benché», i plurali che cambiano genere (paia, uova, dita), l'accordo del participio dopo il clitico («le ho lette»), il passato remoto, il passaggio al Lei, l'elisione («un'ora»), gli accenti (perché, così, già), l'assenza di anglicismi. Nessun modello giudice: un giudice porterebbe le sue preferenze, e usare un concorrente per valutare gli altri è peggio che non misurare.

Misura il controllo della lingua, non la bellezza della prosa. È una scelta stretta e dichiarata: quello che si può verificare, si verifica; il resto non si finge di misurarlo.

Il codice gira — Non «il codice sembra giusto»: gira e dà le risposte giuste.

8 funzioni JavaScript da scrivere su specifica — mediana, raggruppamento, formattazione di importi in euro. Il codice generato viene eseguito davvero, in un container Node 22 isolato e senza accesso alla rete, con asserzioni che il modello non ha mai visto. I casi limite (array vuoti, lunghezze pari, arrotondamenti) sono scritti nella richiesta, così un fallimento è incompetenza e non indovinello. Chi non finisce entro 8192 token viene registrato come troncato, che è un guasto diverso.

Leggere il codice e giudicarlo misura il gusto di chi giudica. Eseguirlo misura il codice.

Chiamata a strumenti — Se il modello si può mettere dentro un agente.

Una richiesta, 3 strumenti dichiarati e quattro controlli indipendenti: ha chiamato uno strumento invece di rispondere in prosa; ha scelto quello giusto fra i 3; gli argomenti sono JSON valido; i valori sono corretti, tipi compresi («fra tre giorni» deve arrivare come il numero 3, non come «tre»). Il punteggio è la frazione dei quattro superata, perché falliscono in modo indipendente.

Uno dei tre strumenti è volutamente somigliante a quello giusto. E un modello che emette argomenti non analizzabili ha prodotto qualcosa che un agente non può usare, per quanto sembri corretto.

Coerenza — Quanto spesso dà la stessa risposta alla stessa domanda.

La stessa domanda 25 volte, al livello di temperatura che il fornitore imposta di default. Il punteggio è la quota delle risposte uguali alla più frequente: 1,000 vuol dire 25 risposte identiche, 0,400 vuol dire che ne ha date diverse quasi ogni volta.

Misura la coerenza, non la correttezza: un modello costantemente sbagliato prende 1,000. È voluto — sono proprietà indipendenti, e un modello imprevedibile non si può testare, mettere in cache, né promettere a un cliente.

Aderenza al vincolo — Se fa la cosa noiosa che gli è stata chiesta.

8 casi: stare sotto un limite di parole, non usare una parola vietata, restituire JSON e nient'altro.

Separa un modello che può stare dietro un'API da uno che può solo essere letto da una persona.

Tempo al primo token — Quanto aspetta chi guarda lo schermo prima di vedere qualcosa.

Media su tutte le chiamate della batteria, cronometrata dal primo token visibile: un modello che ragiona per venti secondi e poi risponde ha aspettato venti secondi, anche se stava generando tutto il tempo.

È la reattività percepita. Un chunk iniziale senza testo cronometrerebbe il protocollo invece del modello.

Token al secondo — Quanto in fretta produce, una volta partito.

Tutti i token generati — ragionamento compreso — divisi per la finestra di generazione, che si apre al primo token di qualsiasi tipo. Se la risposta non è arrivata davvero in streaming il valore non viene riportato: alcuni fornitori la bufferizzano e la scaricano in blocco, e la divisione ingenua dava 8.000 token al secondo.

Conta per chi mostra il testo mentre arriva.

Il peso del rumore statistico sulle variazioni

Le classifiche non sono scolpite nella pietra. Tra la corsa del 12 agosto e questa del 25 settembre, ho misurato gli stessi modelli, usando gli stessi prompt e le identiche impostazioni. Qualsiasi variazione nei punteggi è ascrivibile esclusivamente al rumore statistico insito nei modelli di linguaggio.

Se leggi che Gemini 3.1 Pro (preview) è sceso da 1.000 a 0.938 in italiano, o che il suo tempo al primo token è passato da 5442 ms a 5012 ms, fermati un attimo prima di teorizzare un peggioramento o un'ottimizzazione dell'infrastruttura di Google.

I dati sul rumore di questa sessione parlano chiaro. Lo scarto medio sull'aderenza al vincolo è di 0.031, con un picco massimo di 0.125. Sulle chiamate a strumenti, il rumore raggiunge uno scarto massimo di 0.307. Sul tempo al primo token, parliamo di una variazione media di 1843 ms, con picchi di 4193 ms. I token al secondo ballano con uno scarto massimo di 91.7.

Come indicano i dati grezzi della misurazione: una metrica con otto casi si muove di 0,125 se un solo caso cambia esito. Quindi: NON raccontare come regressione o miglioramento uno scarto dentro questi valori. Se scrivi di una variazione, scrivi anche quanto vale il rumore, oppure non scriverne. Che la misura sia rumorosa è di per sé la cosa più onesta da dire al lettore. Allo stesso modo, il miglioramento di Qwen3.8-Max sul tempo al primo token (da 13611 ms a 9418 ms) e il calo dei token al secondo (da 49.5 a 42.5) sono semplici oscillazioni dell'infrastruttura.

Claude Opus 5.5: precisione assoluta, ma con un difetto sul codice

Claude Opus 5.5 ha fatto il vuoto dietro di sé nelle metriche testuali e logiche. Primo per aderenza al vincolo (1.000 contro lo 0.625 del fanalino di coda MiniMax M3). Primo in italiano (nessun errore registrato). Primo per chiamate a strumenti (1.000 contro lo 0.692 di MiniMax M3). Primo in coerenza (1.000). Nel test di coerenza, ripetuto 25 volte con la stessa domanda, Claude Opus 5.5 ha risposto in modo identico per 25 volte: "rust". Zero deviazioni.

Eppure, non è perfetto. In un'anomalia registrata, il modello ha fornito una risposta da cui non è stato possibile estrarre alcun codice. È un difetto da tenere a mente, specialmente se consideriamo che il suo costo reale per compito superato lo piazza al settimo posto nella classifica economica globale. Il listino lo posiziona come il nono più economico ($4/$20 per milione di token), ed ha consumato 7458 token di uscita totali, sebbene Anthropic non dichiari quanti di questi siano stati spesi nel ragionamento nascosto.

La velocità di GPT-6 Sol e le fragilità di Kimi K3

L'analisi dell'affidabilità dell'infrastruttura fa emergere due casi contrastanti. Da una parte abbiamo GPT-6 Sol, che domina in modo assoluto sul tempo al primo token, risultando primo con 1748 ms (contro l'interminabile attesa di 9418 ms di Qwen3.8-Max). Nonostante questa rapidità di reazione, il modello di OpenAI chiude all'ultimo posto nella metrica "Il codice gira", con un punteggio di 0.875.

Dall'altra parte, Kimi K3 ha mostrato gravi fragilità architetturali a causa dei limiti di rateo dell'infrastruttura. Il modello ha perso intere esecuzioni, restituendo errori dal server che segnalavano il raggiungimento del limite di richieste consentite per l'organizzazione. Questo problema di integrazione ha causato mancate risposte nei casi per l'aderenza ai vincoli (due test persi) e nel test sul passato prossimo in italiano, costandogli anche la perdita di ben 5 ripetizioni nel test di varianza.

Il costo occulto del ragionamento

Non credete ai prezzi di listino. L'introduzione del ragionamento nascosto ha scollegato completamente il costo dichiarato per milione di token dalla bolletta reale che vi arriverà a fine mese.

Grok 4.7 ne è l'esempio lampante. Sulla carta, con $2 in ingresso e $6 in uscita per milione di token, si piazza come il quinto modello più economico del lotto. Nei fatti, è risultato l'ultimo assoluto nella classifica del costo per compito superato: ben $0.00403 a test. Analizzando i consumi, il trucco è evidente: per generare appena 1372 token di risposta utile, Grok 4.7 ha consumato l'enormità di 18547 token di ragionamento. Stai pagando il modello per monologare internamente prima di darti una risposta.

Situazione simile per GLM-5.3. Terzo modello più economico di listino ($1.4/$4.4), ma quinto per costo reale. Ha generato 22187 token totali di uscita, di cui ben 20471 spesi esclusivamente per ragionare. Anche Qwen3.8-Max segue questa strada: 19198 token totali, 17472 di ragionamento, scivolando al sesto posto per costo effettivo ($0.00198 per compito superato).

Al contrario, DeepSeek V4.1 Flash si conferma eccezionale per chi deve scalare i volumi. Oltre a essere il primo per listino ($0.3/$1.2), resta saldo al primo posto anche per costo reale ($0.00040 per compito superato). Ha consumato 18830 token in uscita, di cui 17038 di ragionamento, ma il costo base è talmente basso da mantenere la spesa sotto controllo. Inoltre, è in cima alla classifica per throughput: 226.8 token al secondo.

MiniMax M3 si comporta in modo interessante: secondo di listino ($0.3/$1.2) e terzo per costo reale ($0.00044). Dei 12903 token generati in uscita, 5711 erano di ragionamento.

Pesi aperti contro chiusi, e giurisdizione

Dei nove modelli testati, quattro operano con pesi aperti (DeepSeek V4.1 Flash, MiniMax M3, Kimi K3, GLM-5.3) e cinque con pesi chiusi (Claude Opus 5.5, Gemini 3.1 Pro preview, GPT-6 Sol, Qwen3.8-Max, Grok 4.7). Sotto il profilo geografico, la misurazione copre 5 modelli sviluppati da aziende cinesi e 4 di origine statunitense.

La grammatica italiana: fallimenti inequivocabili

La classifica dell'italiano vede Claude Opus 5.5 primo con un punteggio di 1.000 (nessun errore) e GLM-5.3 all'ultimo posto con 0.813. Insieme a Claude, anche GPT-6 Sol, Qwen3.8-Max e Grok 4.7 hanno chiuso la sessione con zero errori grammaticali.

Le risposte fallite dagli altri modelli dimostrano che alcune reti faticano ancora su concetti specifici della nostra lingua:

  • DeepSeek V4.1 Flash ha sbagliato il caso "plurale-cia".
  • Gemini 3.1 Pro (preview) è inciampato sul test "elisione".
  • MiniMax M3 ha mostrato debolezze sui casi "congiuntivo" e "pronome-indiretto".
  • Kimi K3 ha sbagliato "plurale-cia" e "pronome-indiretto".
  • GLM-5.3 ha fallito pesantemente su "plurali-irregolari", "plurale-cia" e "passato-prossimo-ausiliare".

Coerenza e affidabilità in produzione

L'affidabilità di un sistema in produzione si basa sulla sua deterministica prevedibilità. Nel test di coerenza, ho posto a ogni modello la stessa identica domanda per 25 volte consecutive, misurandone la varianza.

Claude Opus 5.5 ha fornito la risposta "rust" per 25 volte su 25. Anche Kimi K3 ha mostrato forte stabilità: nelle 20 prove completate sopravvissute ai limiti di rateo, ha risposto sempre "rust".

Le deviazioni del resto del gruppo spaziano dal tollerabile al caotico. GPT-6 Sol e GLM-5.3 hanno risposto 24 volte "rust" e 1 volta "c". Gemini 3.1 Pro (preview) ha restituito 2 modalità differenti ("rust", "c"). DeepSeek V4.1 Flash si è diviso allo stesso modo in due output ("c", "rust"). Qwen3.8-Max ha prodotto la stringa "c" in tre occasioni, completando il resto con "rust".

Per valutare il livello di instabilità di alcune inferenze, osserviamo la sequenza esatta generata da Grok 4.7 sulle 25 iterazioni: rust, rust, rust, rust, rust, rust, rust, rust, rust, rust, rust, rust, rust, c, rust, rust, rust, rust, rust, rust, rust, rust, rust, rust, rust

MiniMax M3, tuttavia, segna il punto di rottura assoluto. A fronte dello stesso stimolo, ha restituito ben 5 output completamente diversi tra le iterazioni: "c", nessuna risposta (spazio vuoto), "rust", "c++" e "go". Un modello che si comporta come un lancio di dadi non ha i requisiti minimi per essere inserito in un flusso automatizzato. Non a caso, finisce ultimo in coerenza con 0.400.

Conclusioni: cosa mettere in produzione oggi

Con una spesa totale di $1.0231 su nove modelli, i dati misurati tracciano confini chiari per l'utilizzo in produzione.

Se il tuo progetto richiede esecuzione ferrea delle istruzioni, chiamate a strumenti impeccabili e zero sbavature sintattiche in italiano, Claude Opus 5.5 si conferma il riferimento attuale. Il suo punteggio perfetto su queste assi lo rende ideale per agenti e flussi complessi, accettandone il costo di fascia medio-alta e l'incertezza puntuale riscontrata nell'estrazione del codice.

Se devi processare enormi moli di dati o elaborare codice in tempi rapidissimi, DeepSeek V4.1 Flash è insuperabile. A soli $0.00040 per compito superato, un rateo di 226.8 token al secondo e il primo posto per l'esecuzione effettiva del codice, distrugge la concorrenza sul rapporto qualità-prezzo per l'automazione su larga scala, prestando unicamente attenzione a rari inciampi sulla grammatica italiana.

GPT-6 Sol garantisce una prontezza di risposta imbattibile sul tempo al primo token, ma zoppica sull'esecuzione di codice valido. Se i budget sono stretti, Grok 4.7 e GLM-5.3 si rivelano pessimi affari: le migliaia di token invisibili spesi per il ragionamento faranno lievitare il costo reale ben oltre le rassicurazioni dei listini. Infine, tenetevi alla larga da MiniMax M3 se avete bisogno di risposte coerenti, e pianificate un solido sistema di gestione degli errori se scegliete di appoggiarvi all'infrastruttura di Kimi K3, vista l'aggressività dei suoi limiti di richieste.

Misurato l'25 settembre 2026 su 9 modelli, ciascuno al livello di ragionamento che il suo fornitore imposta di default. I prezzi sono quelli in vigore quel giorno. L'intera tornata è costata $1.0231: ogni cifra qui sopra viene da chiamate che ho pagato.


📖 Leggi anche

Hai bisogno di una consulenza?

Aiuto aziende e startup a sviluppare software, automatizzare processi e integrare AI. Parliamone.

Scrivimi
← Torna al blog