Benchmark LLM
Ogni lunedì misuro i modelli di frontiera sulle stesse otto metriche e salvo tutto. Questa è la corsa più recente: ordina come vuoi, e portati via i dati.
Leggi l’analisi di questa settimana →| Modello | ||||||||
|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 0.875 | 0.938 | 1.000 | 0.720 | 1.000 | 4087 ms | 76.7 | $0.00029 |
| Gemini 3.1 Pro (preview) | 0.875 | 1.000 | 0.769 | 1.000 | 1.000 | 5442 ms | 183.4 | $0.00038 |
| MiniMax M3 | 0.750 | 0.938 | 0.385 | 0.520 | 1.000 | 3562 ms | 130.0 | $0.00049 |
| Grok 4.5 | 1.000 | 1.000 | 1.000 | 0.800 | 1.000 | 4002 ms | 63.4 | $0.00230 |
| Claude Opus 5 | 1.000 | 0.563 | 1.000 | 1.000 | 0.875 | 3532 ms | 68.4 | $0.00257 |
| GPT-5.5 | 1.000 | 1.000 | 1.000 | 0.760 | 1.000 | 2360 ms | 250.0 | $0.00270 |
| GLM-5.2 | 0.875 | 0.750 | 1.000 | 0.440 | 0.875 | 6960 ms | 131.8 | $0.00285 |
| Qwen3.8-Max | 1.000 | 1.000 | 1.000 | 0.840 | 1.000 | 13611 ms | 49.5 | $0.00334 |
| Kimi K3 | 1.000 | 1.000 | 1.000 | 0.933 | 1.000 | 9397 ms | 42.7 | $0.00410 |
Gli stessi record da cui è disegnata questa tabella, prezzi e fonti compresi. Nessuna registrazione, nessun asterisco.
Quanto vale il rumore
Due corse degli stessi modelli, con gli stessi prompt e le stesse impostazioni, non danno gli stessi numeri: i modelli rispondono alla temperatura scelta dai loro fornitori. Questi sono gli scarti misurati fra le ultime due corse. Una differenza più piccola di così non è un cambiamento del modello.
- Vincoli: scarto medio 0.014, massimo 0.125
- Italiano: scarto medio 0.059, massimo 0.250
- Strumenti: scarto medio 0.034, massimo 0.307
- Coerenza: scarto medio 0.070, massimo 0.160
- Codice: scarto medio 0.042, massimo 0.125
- Primo token: scarto medio 260 ms, massimo 610 ms
- Token/s: scarto medio 14.8, massimo 49.7
- Costo/compito: scarto medio $0.00030, massimo $0.00070
Le serie storiche arrivano quando ci saranno abbastanza corse da distinguerle dal rumore. Disegnare una linea fra due punti presi lo stesso giorno sarebbe la prima cosa disonesta qui dentro.
Prompt di sistema non dichiarato
Token d’ingresso addebitati per la sola parola «Ciao». È prompt che il fornitore aggiunge e non documenta, e lo paghi a ogni chiamata.
- Grok 4.5: 495
- MiniMax M3: 178
- Kimi K3: 87
- Qwen3.8-Max: 50
- GLM-5.2: 14
- GPT-5.5: 8
- DeepSeek V4 Pro: 6
- Gemini 3.1 Pro (preview): 2
- Claude Opus 5: 0
Cosa misura ogni metrica
Costo per compito superato
Quanto è costato ottenere un risultato buono.
La spesa reale della batteria — token in ingresso e in uscita ai prezzi del giorno — divisa per il numero di compiti superati. Un modello che sbaglia metà dei compiti paga qui i suoi tentativi.
È il numero che decide, e non è il prezzo per milione di token: un modello che ragiona per mille token prima di rispondere li paga tutti.
Italiano
Controllo grammaticale su 16 frasi, non un giudizio di stile.
16 casi con una sola risposta giusta, verificata da un'espressione regolare: il congiuntivo dopo «benché», i plurali che cambiano genere (paia, uova, dita), l'accordo del participio dopo il clitico («le ho lette»), il passato remoto, il passaggio al Lei, l'elisione («un'ora»), gli accenti (perché, così, già), l'assenza di anglicismi. Nessun modello giudice: un giudice porterebbe le sue preferenze, e usare un concorrente per valutare gli altri è peggio che non misurare.
Misura il controllo della lingua, non la bellezza della prosa. È una scelta stretta e dichiarata: quello che si può verificare, si verifica; il resto non si finge di misurarlo.
Il codice gira
Non «il codice sembra giusto»: gira e dà le risposte giuste.
8 funzioni JavaScript da scrivere su specifica — mediana, raggruppamento, formattazione di importi in euro. Il codice generato viene eseguito davvero, in un container Node 22 isolato e senza accesso alla rete, con asserzioni che il modello non ha mai visto. I casi limite (array vuoti, lunghezze pari, arrotondamenti) sono scritti nella richiesta, così un fallimento è incompetenza e non indovinello. Chi non finisce entro 8192 token viene registrato come troncato, che è un guasto diverso.
Leggere il codice e giudicarlo misura il gusto di chi giudica. Eseguirlo misura il codice.
Chiamata a strumenti
Se il modello si può mettere dentro un agente.
Una richiesta, 3 strumenti dichiarati e quattro controlli indipendenti: ha chiamato uno strumento invece di rispondere in prosa; ha scelto quello giusto fra i 3; gli argomenti sono JSON valido; i valori sono corretti, tipi compresi («fra tre giorni» deve arrivare come il numero 3, non come «tre»). Il punteggio è la frazione dei quattro superata, perché falliscono in modo indipendente.
Uno dei tre strumenti è volutamente somigliante a quello giusto. E un modello che emette argomenti non analizzabili ha prodotto qualcosa che un agente non può usare, per quanto sembri corretto.
Coerenza
Quanto spesso dà la stessa risposta alla stessa domanda.
La stessa domanda 251,000 vuol dire 25 risposte identiche, 0,400 vuol dire che ne ha date diverse quasi ogni volta.
Misura la coerenza, **non la correttezza**: un modello costantemente sbagliato prende 1,000. È voluto — sono proprietà indipendenti, e un modello imprevedibile non si può testare, mettere in cache, né promettere a un cliente.
Aderenza al vincolo
Se fa la cosa noiosa che gli è stata chiesta.
8 casi: stare sotto un limite di parole, non usare una parola vietata, restituire JSON e nient'altro.
Separa un modello che può stare dietro un'API da uno che può solo essere letto da una persona.
Tempo al primo token
Quanto aspetta chi guarda lo schermo prima di vedere qualcosa.
Media su tutte le chiamate della batteria, cronometrata dal primo token visibile: un modello che ragiona per venti secondi e poi risponde ha aspettato venti secondi, anche se stava generando tutto il tempo.
È la reattività percepita. Un chunk iniziale senza testo cronometrerebbe il protocollo invece del modello.
Token al secondo
Quanto in fretta produce, una volta partito.
Tutti i token generati — ragionamento compreso — divisi per la finestra di generazione, che si apre al primo token di qualsiasi tipo. Se la risposta non è arrivata davvero in streaming il valore non viene riportato: alcuni fornitori la bufferizzano e la scaricano in blocco, e la divisione ingenua dava 8.000 token al secondo.
Conta per chi mostra il testo mentre arriva.
Come è misurato
Ogni modello risponde al livello di ragionamento che il suo fornitore imposta di default, cioè quello che ottiene chi non tocca i parametri. Il codice generato viene eseguito davvero, in un container isolato e senza rete. I prezzi sono quelli del giorno della misura e restano congelati insieme al risultato.