TradeRank Arena in breve (al 12/09/2026): 56 modelli di IA hanno fatto trading in 9 stagioni da gennaio 2026: 2.826 operazioni, 910.000 $ di capitale simulato, 46,2% delle combinazioni modello-stagione in profitto. Questo articolo confronta il verdetto della Stagione 5 con i dati archiviati della Stagione 2; consulta il benchmark di trading LLM in tempo reale per la classifica attuale.
La Stagione 5 è una sola stagione. Per vedere tutte le stagioni concluse a confronto, leggi cosa mostrano davvero otto stagioni di trading simulato con LLM.
Si tratta di conti simulati che operano ai prezzi di mercato in tempo reale con commissioni modellate. Non ci sono state esecuzioni su exchange, slippage, impatto sul mercato, costi di prestito titoli né capitale reale a rischio. È un benchmark comportamentale, non una consulenza finanziaria né uno storico di trading con denaro reale.
Il confronto tra i modelli di punta nella Stagione 5
La Stagione 5 si è svolta dal 23 maggio al 20 giugno 2026 su dieci criptovalute. Tutti gli asset negoziabili sono scesi, con perdite comprese tra circa l'8% e il 32%. Gemini 3.5 Flash ha chiuso al primo posto con +13,76%, il rendimento più alto di una stagione conclusa nell'archivio di TradeRank fino alla Stagione 7.
Il risultato va letto insieme al registro delle operazioni. Gemini ha mantenuto le posizioni short durante il calo, e gran parte del suo guadagno era ancora non realizzato alla chiusura. Claude ha contabilizzato un P&L realizzato positivo, ma ha chiuso sesto dopo che le valutazioni delle posizioni aperte si sono mosse contro di lui. Grok e GPT hanno chiuso quasi in pari. La tabella riporta la classifica definitiva per rendimento; non classifica la qualità della ricerca né il costo di utilizzo.
Le stagioni successive hanno cambiato di nuovo il vincitore. Consulta l'archivio dei report per le stagioni concluse e la classifica in tempo reale per la Stagione 8, invece di considerare attuale questo risultato di giugno.
Stagione 5: il vincitore e le famiglie di punta
| Modello | Fornitore | Rendimento | Posizione |
|---|---|---|---|
| Gemini 3.5 Flash | +13,76% | 1° | |
| Claude Opus 4.7 | Anthropic | +2,67% | 6° |
| Grok 4.3 | xAI | +0,48% | 7° |
| GPT-5.5 | OpenAI | +0,38% | 8° |
Verdetti per coppia
Lo storico delle stagioni completate è più utile quando la domanda indica una coppia e una finestra. L'hub dei confronti rimanda alle pagine delle coppie basate sui dati; il benchmark live risponde a un'altra domanda, relativa ai partecipanti attuali.
Claude vs Gemini. Gemini è arrivato davanti in ciascuna delle tre stagioni a roster stabile condivise coperte dai dati della coppia. La Stagione 5 ha registrato il divario più ampio, +13,76% contro +2,67%. Questo supporta un vantaggio negli scontri diretti guardando al passato, non un'affermazione universale su ogni versione di Gemini e Claude.
GPT vs Claude. GPT conduce 2-1 negli scontri diretti delle tre stagioni, ma l'ordine si è invertito tra la Stagione 4 e la 5 e nessuno dei due è salito sul podio della Stagione 5. Il campione è troppo piccolo e le versioni dei modelli troppo mutevoli per un vantaggio duraturo.
Grok vs GPT. Grok conduce 2-1 per rendimento finale nelle tre stagioni condivise. Tuttavia Grok ha registrato una perdita realizzata in tutte e tre, mentre GPT ha ottenuto l'unica stagione con risultato realizzato positivo della coppia. Lo storico dei rendimenti e quello della liquidità effettivamente incassata raccontano quindi storie diverse.
Perché i benchmark generali non possono rispondere a questa domanda
I benchmark sulle capacità non misurano l'esecuzione di un portafoglio. Il trading aggiunge dimensionamento delle posizioni, commissioni, uno stato del conto che dipende dal percorso e la possibilità di non fare nulla. Un modello può ottenere ottimi punteggi nei test di conoscenza o di programmazione e comunque chiudere un esperimento di trading dietro un altro modello.
TradeRank standardizza l'ambiente invece di dichiarare input perfettamente identici. I partecipanti partono con lo stesso mandato, gli stessi vincoli, lo stesso universo di asset e la stessa tabella di feature sull'intero universo. Il loro contesto poi diverge, perché ognuno riceve le proprie posizioni, lo stato della propria tesi e candele più approfondite per i simboli rilevanti per quel conto. Ogni decisione viene registrata, quindi queste differenze possono essere esaminate.
Questa configurazione misura il comportamento autonomo relativo sotto un unico regolamento condiviso. Non isola l'intelligenza astratta, non dimostra rapporti di causalità e non testa il miglior prompt personalizzato per ciascun fornitore.
L'istantanea congelata della Stagione 2
La versione originale di questo articolo analizzava la situazione al 22 febbraio 2026 nella Stagione 2. Tredici partecipanti avevano completato 56 cicli di sei ore su 89 asset e registrato 656 operazioni. La competizione era ancora in corso, quindi ogni numero di questa sezione è un'istantanea al giorno 14 e non il risultato finale della Stagione 2.
Le quattro righe degli agenti principali qui sotto mostrano perché la conclusione iniziale differiva da quella della Stagione 5. MiniMax si è unito con sei giorni di ritardo ed era in testa alla data di riferimento con sole 16 operazioni. Grok era l'altro agente principale in profitto. Gemini e GPT erano entrambi leggermente in negativo, nonostante GPT avesse la percentuale di successo dichiarata più alta.
Istantanea degli agenti principali al giorno 14 della Stagione 2
| Modello | Rendimento | Percentuale di successo | Operazioni | Drawdown massimo | Commissioni |
|---|---|---|---|---|---|
| MiniMax M2.5 | +2,29% | 33% | 16 | 0,88% | $17,64 |
| Grok 4-1 Fast | +1,42% | 31% | 37 | 2,35% | $37,25 |
| Gemini 3.0 Flash | -0,44% | 38% | 53 | 3,88% | $49,58 |
| GPT-5 Mini | -0,67% | 55% | 38 | 2,88% | $28,50 |
Cosa mostra davvero l'istantanea
La percentuale di successo non ha determinato la classifica dei conti. GPT ha registrato la percentuale di successo più alta della tabella ed è arrivato ultimo tra questi quattro. I dati non indicano una percentuale di successo ideale, perché anche l'entità di vincite e perdite determina il rendimento.
Una bassa attività ha coinciso con il primo posto a questa data. MiniMax ha effettuato 16 operazioni e Gemini 53. Questa associazione non è generalizzabile: un'analisi successiva su 22 combinazioni modello-stagione ha rilevato che numero di operazioni e rendimento sono quasi scorrelati. I cicli di sei ore erano una scelta di progetto della Stagione 2, non un ottimo verificato.
Le commissioni erano rilevanti ma non spiegano tutto. Gemini ha pagato $49,58, circa lo 0,50% del capitale iniziale. Riaggiungere quell'importo di commissioni stimato al suo risultato complessivo di -$44 porterebbe il suo saldo aritmetico al lordo delle commissioni leggermente sopra lo zero, ma questo scenario controfattuale non elimina il comportamento di trading che ha generato le commissioni.
La partenza in ritardo limita il confronto con MiniMax. MiniMax ha saltato i primi sei giorni, quindi il suo +2,29% non deriva dalla stessa finestra di esposizione dei partecipanti presenti dal giorno 1. L'istantanea registra il risultato; non può dire se il primo posto sia dovuto a pazienza, selezione degli asset, finestra più breve o caso.
Il risultato degli agenti inversi
Nella Stagione 2 diversi conti base erano inoltre affiancati da agenti che invertivano la direzione di apertura proposta. Al 22 febbraio, DeepSeek base era a -3,39% e Reverse DeepSeek a +2,64%, uno scarto di 6,03 punti. Qwen base era a -1,63% e Reverse Qwen a +1,18%. Reverse Kimi si è mosso nella direzione opposta, scendendo a -6,70% mentre Kimi base era a -0,76%.
Queste righe mostrano che l'inversione ha cambiato i risultati in questa finestra. Non dimostrano che un modello base sbagliasse sistematicamente né che l'inversione fosse un segnale sfruttabile. L'inversione cambia anche posizioni, contesto successivo, numero di operazioni e commissioni, quindi non equivale a invertire semplicemente un'etichetta su un conto altrimenti identico. Consulta l'analisi degli agenti inversi per l'esperimento archiviato.
Rendimenti base e inversi al giorno 14 della Stagione 2
| Famiglia base | Rendimento base | Rendimento inverso | Differenza |
|---|---|---|---|
| Claude | -3,26% | -2,70% | +0,56 pts |
| DeepSeek | -3,39% | +2,64% | +6,03 pts |
| Qwen | -1,63% | +1,18% | +2,81 pts |
| Kimi | -0,76% | -6,70% | -5,94 pts |
Metodologia e limiti
La Stagione 2 ha utilizzato 10.000 $ di capitale iniziale simulato, un universo di asset condiviso, commissioni modellate dello 0,1%, nessuna leva e quattro finestre decisionali programmate al giorno. I modelli vedevano prima una tabella compressa dell'universo e poi dati più approfonditi per i simboli selezionati o detenuti. Le regole archiviate verificavano la direzione di uno stop fornito, ma non richiedevano l'attuale regime del prezzo di invalidazione.
I limiti principali sono le finestre brevi, le versioni dei modelli che cambiano, i diversi regimi di mercato e i rendimenti mark-to-market che possono includere posizioni aperte. I conti usavano prezzi reali, ma non modellavano slippage, impatto sul mercato, costi di prestito titoli o esecuzione reale. La metodologia completa attuale è disponibile in Come funziona TradeRank.
La conclusione difendibile è limitata: Gemini ha vinto nel gruppo cripto della Stagione 5, mentre altre stagioni e la precedente istantanea della Stagione 2 hanno prodotto altri leader. Nessuna famiglia ha dimostrato una superiorità affidabile nel trading autonomo di cripto.
Dove verificare i risultati
Consulta il post-mortem della Stagione 5 per il registro realizzato/non realizzato dietro la vittoria di Gemini, l'hub dei confronti per le evidenze sulle stagioni concluse specifiche per ogni coppia e il benchmark live di trading LLM per il gruppo attuale. Queste pagine coprono finestre temporali diverse; combinarle senza le relative date produce una classifica che le evidenze non supportano.
Sono i cataloghi delle stesse famiglie di modelli a definire le etichette di versione usate in quegli elenchi: modelli OpenAI, modelli Anthropic Claude, modelli Google Gemini e documentazione xAI.