Benchmark LLM

Ogni lunedì misuro i modelli di frontiera sulle stesse otto metriche e salvo tutto. Questa è la corsa più recente: ordina come vuoi, e portati via i dati.

Misurato il 25 settembre 2026 · 9 modelli · 4 corse nel dataset · $1.0231 costo della corsa

Leggi l’analisi di questa settimana →
Modello
DeepSeek V4.1 FlashCN · pesi aperti · $0.3/1.2 per M0.8750.9381.0000.7601.0002115 ms226.8$0.00040
Gemini 3.1 Pro (preview)US · pesi chiusi · $2/12 per M0.8750.9380.8460.9601.0005012 ms201.9$0.00040
MiniMax M3CN · pesi aperti · $0.3/1.2 per M0.6250.8750.6920.4001.0001903 ms221.7$0.00044
GPT-6 SolUS · pesi chiusi · $2/10 per M1.0001.000non misurata0.9600.8751748 ms207.3$0.00073
GLM-5.3CN · pesi aperti · $1.4/4.4 per M1.0000.8131.0000.9601.0005012 ms149.4$0.00158
Qwen3.8-MaxCN · pesi chiusi · $2/6 per M1.0001.0001.0000.8801.0009418 ms42.5$0.00198
Claude Opus 5.5US · pesi chiusi · $4/20 per M1.0001.0001.0001.0000.8752551 ms208.4$0.00258
Kimi K3CN · pesi aperti · $3/15 per M1.0000.8671.0001.0001.0008308 ms51.5$0.00374
Grok 4.7US · pesi chiusi · $2/6 per M1.0001.0001.0000.9601.0006428 ms83.7$0.00403

Gli stessi record da cui è disegnata questa tabella, prezzi e fonti compresi. Nessuna registrazione, nessun asterisco.

Quanto vale il rumore

Due corse degli stessi modelli, con gli stessi prompt e le stesse impostazioni, non danno gli stessi numeri: i modelli rispondono alla temperatura scelta dai loro fornitori. Questi sono gli scarti misurati fra le ultime due corse. Una differenza più piccola di così non è un cambiamento del modello.

  • Vincoli: scarto medio 0.031, massimo 0.125
  • Italiano: scarto medio 0.065, massimo 0.133
  • Strumenti: scarto medio 0.096, massimo 0.307
  • Coerenza: scarto medio 0.067, massimo 0.120
  • Primo token: scarto medio 1843 ms, massimo 4193 ms
  • Token/s: scarto medio 31.5, massimo 91.7
  • Costo/compito: scarto medio $0.00040, massimo $0.00140

Le serie storiche arrivano quando ci saranno abbastanza corse da distinguerle dal rumore. Disegnare una linea fra due punti presi lo stesso giorno sarebbe la prima cosa disonesta qui dentro.

Prompt di sistema non dichiarato

Token d’ingresso addebitati per la sola parola «Ciao». È prompt che il fornitore aggiunge e non documenta, e lo paghi a ogni chiamata.

  • Grok 4.7: 1243
  • MiniMax M3: 178
  • Kimi K3: 87
  • Qwen3.8-Max: 63
  • DeepSeek V4.1 Flash: 32
  • GLM-5.3: 14
  • Claude Opus 5.5: 12
  • GPT-6 Sol: 8
  • Gemini 3.1 Pro (preview): 2

Cosa misura ogni metrica

Costo per compito superato

Quanto è costato ottenere un risultato buono.

La spesa reale della batteria — token in ingresso e in uscita ai prezzi del giorno — divisa per il numero di compiti superati. Un modello che sbaglia metà dei compiti paga qui i suoi tentativi.

È il numero che decide, e non è il prezzo per milione di token: un modello che ragiona per mille token prima di rispondere li paga tutti.

Italiano

Controllo grammaticale su 16 frasi, non un giudizio di stile.

16 casi con una sola risposta giusta, verificata da un'espressione regolare: il congiuntivo dopo «benché», i plurali che cambiano genere (paia, uova, dita), l'accordo del participio dopo il clitico («le ho lette»), il passato remoto, il passaggio al Lei, l'elisione («un'ora»), gli accenti (perché, così, già), l'assenza di anglicismi. Nessun modello giudice: un giudice porterebbe le sue preferenze, e usare un concorrente per valutare gli altri è peggio che non misurare.

Misura il controllo della lingua, non la bellezza della prosa. È una scelta stretta e dichiarata: quello che si può verificare, si verifica; il resto non si finge di misurarlo.

Il codice gira

Non «il codice sembra giusto»: gira e dà le risposte giuste.

8 funzioni JavaScript da scrivere su specifica — mediana, raggruppamento, formattazione di importi in euro. Il codice generato viene eseguito davvero, in un container Node 22 isolato e senza accesso alla rete, con asserzioni che il modello non ha mai visto. I casi limite (array vuoti, lunghezze pari, arrotondamenti) sono scritti nella richiesta, così un fallimento è incompetenza e non indovinello. Chi non finisce entro 8192 token viene registrato come troncato, che è un guasto diverso.

Leggere il codice e giudicarlo misura il gusto di chi giudica. Eseguirlo misura il codice.

Chiamata a strumenti

Se il modello si può mettere dentro un agente.

Una richiesta, 3 strumenti dichiarati e quattro controlli indipendenti: ha chiamato uno strumento invece di rispondere in prosa; ha scelto quello giusto fra i 3; gli argomenti sono JSON valido; i valori sono corretti, tipi compresi («fra tre giorni» deve arrivare come il numero 3, non come «tre»). Il punteggio è la frazione dei quattro superata, perché falliscono in modo indipendente.

Uno dei tre strumenti è volutamente somigliante a quello giusto. E un modello che emette argomenti non analizzabili ha prodotto qualcosa che un agente non può usare, per quanto sembri corretto.

Coerenza

Quanto spesso dà la stessa risposta alla stessa domanda.

La stessa domanda 251,000 vuol dire 25 risposte identiche, 0,400 vuol dire che ne ha date diverse quasi ogni volta.

Misura la coerenza, **non la correttezza**: un modello costantemente sbagliato prende 1,000. È voluto — sono proprietà indipendenti, e un modello imprevedibile non si può testare, mettere in cache, né promettere a un cliente.

Aderenza al vincolo

Se fa la cosa noiosa che gli è stata chiesta.

8 casi: stare sotto un limite di parole, non usare una parola vietata, restituire JSON e nient'altro.

Separa un modello che può stare dietro un'API da uno che può solo essere letto da una persona.

Tempo al primo token

Quanto aspetta chi guarda lo schermo prima di vedere qualcosa.

Media su tutte le chiamate della batteria, cronometrata dal primo token visibile: un modello che ragiona per venti secondi e poi risponde ha aspettato venti secondi, anche se stava generando tutto il tempo.

È la reattività percepita. Un chunk iniziale senza testo cronometrerebbe il protocollo invece del modello.

Token al secondo

Quanto in fretta produce, una volta partito.

Tutti i token generati — ragionamento compreso — divisi per la finestra di generazione, che si apre al primo token di qualsiasi tipo. Se la risposta non è arrivata davvero in streaming il valore non viene riportato: alcuni fornitori la bufferizzano e la scaricano in blocco, e la divisione ingenua dava 8.000 token al secondo.

Conta per chi mostra il testo mentre arriva.

Come è misurato

Ogni modello risponde al livello di ragionamento che il suo fornitore imposta di default, cioè quello che ottiene chi non tocca i parametri. Il codice generato viene eseguito davvero, in un container isolato e senza rete. I prezzi sono quelli del giorno della misura e restano congelati insieme al risultato.