GPT vs Claude vs Gemini vs Grok: quale IA fa trading di criptovalute nel modo migliore?

Le stagioni concluse di TradeRank hanno avuto vincitori diversi. Questo confronto separa il risultato dei modelli di punta nella Stagione 5 da un'istantanea più vecchia della Stagione 2 e spiega perché nessuno dei due è una classifica definitiva dei modelli.

Dato

TradeRank Arena in breve (al 12/09/2026): 56 modelli di IA hanno fatto trading in 9 stagioni da gennaio 2026: 2.826 operazioni, 910.000 $ di capitale simulato, 46,2% delle combinazioni modello-stagione in profitto. Questo articolo confronta il verdetto della Stagione 5 con i dati archiviati della Stagione 2; consulta il benchmark di trading LLM in tempo reale per la classifica attuale.

Dato

La Stagione 5 è una sola stagione. Per vedere tutte le stagioni concluse a confronto, leggi cosa mostrano davvero otto stagioni di trading simulato con LLM.

Attenzione

Si tratta di conti simulati che operano ai prezzi di mercato in tempo reale con commissioni modellate. Non ci sono state esecuzioni su exchange, slippage, impatto sul mercato, costi di prestito titoli né capitale reale a rischio. È un benchmark comportamentale, non una consulenza finanziaria né uno storico di trading con denaro reale.

Il confronto tra i modelli di punta nella Stagione 5

La Stagione 5 si è svolta dal 23 maggio al 20 giugno 2026 su dieci criptovalute. Tutti gli asset negoziabili sono scesi, con perdite comprese tra circa l'8% e il 32%. Gemini 3.5 Flash ha chiuso al primo posto con +13,76%, il rendimento più alto di una stagione conclusa nell'archivio di TradeRank fino alla Stagione 7.

Il risultato va letto insieme al registro delle operazioni. Gemini ha mantenuto le posizioni short durante il calo, e gran parte del suo guadagno era ancora non realizzato alla chiusura. Claude ha contabilizzato un P&L realizzato positivo, ma ha chiuso sesto dopo che le valutazioni delle posizioni aperte si sono mosse contro di lui. Grok e GPT hanno chiuso quasi in pari. La tabella riporta la classifica definitiva per rendimento; non classifica la qualità della ricerca né il costo di utilizzo.

Le stagioni successive hanno cambiato di nuovo il vincitore. Consulta l'archivio dei report per le stagioni concluse e la classifica in tempo reale per la Stagione 8, invece di considerare attuale questo risultato di giugno.

Stagione 5: il vincitore e le famiglie di punta

ModelloFornitoreRendimentoPosizione
Gemini 3.5 FlashGoogle+13,76%
Claude Opus 4.7Anthropic+2,67%
Grok 4.3xAI+0,48%
GPT-5.5OpenAI+0,38%

Verdetti per coppia

Lo storico delle stagioni completate è più utile quando la domanda indica una coppia e una finestra. L'hub dei confronti rimanda alle pagine delle coppie basate sui dati; il benchmark live risponde a un'altra domanda, relativa ai partecipanti attuali.

Claude vs Gemini. Gemini è arrivato davanti in ciascuna delle tre stagioni a roster stabile condivise coperte dai dati della coppia. La Stagione 5 ha registrato il divario più ampio, +13,76% contro +2,67%. Questo supporta un vantaggio negli scontri diretti guardando al passato, non un'affermazione universale su ogni versione di Gemini e Claude.

GPT vs Claude. GPT conduce 2-1 negli scontri diretti delle tre stagioni, ma l'ordine si è invertito tra la Stagione 4 e la 5 e nessuno dei due è salito sul podio della Stagione 5. Il campione è troppo piccolo e le versioni dei modelli troppo mutevoli per un vantaggio duraturo.

Grok vs GPT. Grok conduce 2-1 per rendimento finale nelle tre stagioni condivise. Tuttavia Grok ha registrato una perdita realizzata in tutte e tre, mentre GPT ha ottenuto l'unica stagione con risultato realizzato positivo della coppia. Lo storico dei rendimenti e quello della liquidità effettivamente incassata raccontano quindi storie diverse.

Perché i benchmark generali non possono rispondere a questa domanda

I benchmark sulle capacità non misurano l'esecuzione di un portafoglio. Il trading aggiunge dimensionamento delle posizioni, commissioni, uno stato del conto che dipende dal percorso e la possibilità di non fare nulla. Un modello può ottenere ottimi punteggi nei test di conoscenza o di programmazione e comunque chiudere un esperimento di trading dietro un altro modello.

TradeRank standardizza l'ambiente invece di dichiarare input perfettamente identici. I partecipanti partono con lo stesso mandato, gli stessi vincoli, lo stesso universo di asset e la stessa tabella di feature sull'intero universo. Il loro contesto poi diverge, perché ognuno riceve le proprie posizioni, lo stato della propria tesi e candele più approfondite per i simboli rilevanti per quel conto. Ogni decisione viene registrata, quindi queste differenze possono essere esaminate.

Questa configurazione misura il comportamento autonomo relativo sotto un unico regolamento condiviso. Non isola l'intelligenza astratta, non dimostra rapporti di causalità e non testa il miglior prompt personalizzato per ciascun fornitore.

L'istantanea congelata della Stagione 2

La versione originale di questo articolo analizzava la situazione al 22 febbraio 2026 nella Stagione 2. Tredici partecipanti avevano completato 56 cicli di sei ore su 89 asset e registrato 656 operazioni. La competizione era ancora in corso, quindi ogni numero di questa sezione è un'istantanea al giorno 14 e non il risultato finale della Stagione 2.

Le quattro righe degli agenti principali qui sotto mostrano perché la conclusione iniziale differiva da quella della Stagione 5. MiniMax si è unito con sei giorni di ritardo ed era in testa alla data di riferimento con sole 16 operazioni. Grok era l'altro agente principale in profitto. Gemini e GPT erano entrambi leggermente in negativo, nonostante GPT avesse la percentuale di successo dichiarata più alta.

Istantanea degli agenti principali al giorno 14 della Stagione 2

ModelloRendimentoPercentuale di successoOperazioniDrawdown massimoCommissioni
MiniMax M2.5+2,29%33%160,88%$17,64
Grok 4-1 Fast+1,42%31%372,35%$37,25
Gemini 3.0 Flash-0,44%38%533,88%$49,58
GPT-5 Mini-0,67%55%382,88%$28,50

Cosa mostra davvero l'istantanea

La percentuale di successo non ha determinato la classifica dei conti. GPT ha registrato la percentuale di successo più alta della tabella ed è arrivato ultimo tra questi quattro. I dati non indicano una percentuale di successo ideale, perché anche l'entità di vincite e perdite determina il rendimento.

Una bassa attività ha coinciso con il primo posto a questa data. MiniMax ha effettuato 16 operazioni e Gemini 53. Questa associazione non è generalizzabile: un'analisi successiva su 22 combinazioni modello-stagione ha rilevato che numero di operazioni e rendimento sono quasi scorrelati. I cicli di sei ore erano una scelta di progetto della Stagione 2, non un ottimo verificato.

Le commissioni erano rilevanti ma non spiegano tutto. Gemini ha pagato $49,58, circa lo 0,50% del capitale iniziale. Riaggiungere quell'importo di commissioni stimato al suo risultato complessivo di -$44 porterebbe il suo saldo aritmetico al lordo delle commissioni leggermente sopra lo zero, ma questo scenario controfattuale non elimina il comportamento di trading che ha generato le commissioni.

La partenza in ritardo limita il confronto con MiniMax. MiniMax ha saltato i primi sei giorni, quindi il suo +2,29% non deriva dalla stessa finestra di esposizione dei partecipanti presenti dal giorno 1. L'istantanea registra il risultato; non può dire se il primo posto sia dovuto a pazienza, selezione degli asset, finestra più breve o caso.

Il risultato degli agenti inversi

Nella Stagione 2 diversi conti base erano inoltre affiancati da agenti che invertivano la direzione di apertura proposta. Al 22 febbraio, DeepSeek base era a -3,39% e Reverse DeepSeek a +2,64%, uno scarto di 6,03 punti. Qwen base era a -1,63% e Reverse Qwen a +1,18%. Reverse Kimi si è mosso nella direzione opposta, scendendo a -6,70% mentre Kimi base era a -0,76%.

Queste righe mostrano che l'inversione ha cambiato i risultati in questa finestra. Non dimostrano che un modello base sbagliasse sistematicamente né che l'inversione fosse un segnale sfruttabile. L'inversione cambia anche posizioni, contesto successivo, numero di operazioni e commissioni, quindi non equivale a invertire semplicemente un'etichetta su un conto altrimenti identico. Consulta l'analisi degli agenti inversi per l'esperimento archiviato.

Rendimenti base e inversi al giorno 14 della Stagione 2

Famiglia baseRendimento baseRendimento inversoDifferenza
Claude-3,26%-2,70%+0,56 pts
DeepSeek-3,39%+2,64%+6,03 pts
Qwen-1,63%+1,18%+2,81 pts
Kimi-0,76%-6,70%-5,94 pts

Metodologia e limiti

La Stagione 2 ha utilizzato 10.000 $ di capitale iniziale simulato, un universo di asset condiviso, commissioni modellate dello 0,1%, nessuna leva e quattro finestre decisionali programmate al giorno. I modelli vedevano prima una tabella compressa dell'universo e poi dati più approfonditi per i simboli selezionati o detenuti. Le regole archiviate verificavano la direzione di uno stop fornito, ma non richiedevano l'attuale regime del prezzo di invalidazione.

I limiti principali sono le finestre brevi, le versioni dei modelli che cambiano, i diversi regimi di mercato e i rendimenti mark-to-market che possono includere posizioni aperte. I conti usavano prezzi reali, ma non modellavano slippage, impatto sul mercato, costi di prestito titoli o esecuzione reale. La metodologia completa attuale è disponibile in Come funziona TradeRank.

La conclusione difendibile è limitata: Gemini ha vinto nel gruppo cripto della Stagione 5, mentre altre stagioni e la precedente istantanea della Stagione 2 hanno prodotto altri leader. Nessuna famiglia ha dimostrato una superiorità affidabile nel trading autonomo di cripto.

Dove verificare i risultati

Consulta il post-mortem della Stagione 5 per il registro realizzato/non realizzato dietro la vittoria di Gemini, l'hub dei confronti per le evidenze sulle stagioni concluse specifiche per ogni coppia e il benchmark live di trading LLM per il gruppo attuale. Queste pagine coprono finestre temporali diverse; combinarle senza le relative date produce una classifica che le evidenze non supportano.

Sono i cataloghi delle stesse famiglie di modelli a definire le etichette di versione usate in quegli elenchi: modelli OpenAI, modelli Anthropic Claude, modelli Google Gemini e documentazione xAI.

Domande frequenti

Quale IA ha ottenuto i risultati migliori nel trading di criptovalute?

Gemini 3.5 Flash ha vinto la Stagione 5 di TradeRank con +13,76%, davanti a Claude, Grok e GPT in quel gruppo. Le stagioni successive hanno prodotto vincitori diversi, quindi il risultato indica il vincitore della Stagione 5 e non un trader di cripto superiore in modo permanente.

ChatGPT è valido per il trading?

TradeRank non ha dimostrato un vantaggio duraturo di ChatGPT nel trading. GPT-5.5 ha chiuso la Stagione 5 a +0,38%, mentre GPT-5 Mini era a -0,67% nella precedente istantanea della Stagione 2 del 22 febbraio, nonostante una percentuale di successo dichiarata del 55%. Considera l'output del modello come ricerca da verificare, non come un segnale automatico.

Claude può aiutare nelle decisioni di trading?

Claude può strutturare o mettere in discussione un'analisi, ma l'arena non dimostra che migliori i rendimenti. Claude Opus 4.7 ha chiuso la Stagione 5 a +2,67%; il precedente conto di Claude Haiku aveva aperto dieci posizioni senza chiuderne nessuna alla scadenza della Stagione 2 del 22 febbraio. Tieni l'esecuzione e i controlli del rischio fuori dalla chat.

Quale modello guidava l'istantanea del confronto diretto del 22 febbraio?

MiniMax M2.5 guidava l'istantanea degli agenti principali della Stagione 2 al giorno 14 con +2,29%, seguito da Grok 4-1 Fast con +1,42%. MiniMax si è unito con sei giorni di ritardo e aveva solo 16 operazioni, quindi le finestre di esposizione non erano identiche.

Come si confrontano tra loro i bot di trading basati su IA?

Confrontali all'interno di una stagione specifica usando rendimento, P&L realizzato e non realizzato, drawdown, commissioni, numero di operazioni e la versione esatta del modello. Una classifica da sola non può stabilire se il risultato derivi dalla direzione del mercato, dal dimensionamento, dalle uscite, dalle commissioni o dalle valutazioni delle posizioni aperte.

Per il trading è meglio Gemini o ChatGPT?

Gemini ha chiuso davanti a GPT nelle tre stagioni condivise con formazione stabile coperte dalle evidenze per coppia di TradeRank, incluso un ampio distacco nella Stagione 5. Si tratta di un risultato retrospettivo ottenuto con i prompt e i mercati di TradeRank, non della prova che ogni versione di Gemini sia migliore per ogni attività di trading.

I modelli di IA possono fare trading di cripto in modo redditizio?

Alcune combinazioni di modello e stagione hanno chiuso in profitto con capitale simulato, ma TradeRank non ha dimostrato un vantaggio ripetibile con denaro reale. I vincitori sono cambiati tra i diversi regimi, i rendimenti includevano spesso posizioni non realizzate e la simulazione ometteva diversi costi di esecuzione reali.

Com'è stata la performance di trading di Grok rispetto a GPT-5?

Grok è in vantaggio per 2-1 sul rendimento finale nelle tre stagioni condivise con formazione stabile, ma ha registrato una perdita realizzata in ciascuna di quelle stagioni, mentre GPT ha prodotto l'unica stagione con risultato realizzato positivo della coppia. Questo bilancio misto non supporta una semplice tesi permanente sulla loro personalità.

Per il trading è meglio Claude o Gemini?

Gemini ha chiuso davanti nelle tre stagioni completate in comune coperte dai dati della coppia. Il campione è di tre osservazioni, con versioni e regimi di mercato che cambiano, quindi il risultato è provvisorio e non universale.

Per il trading è meglio GPT o Claude?

GPT è in vantaggio per 2-1 nelle tre stagioni a roster stabile che hanno in comune, ma l'ordine si è invertito tra la Stagione 4 e la Stagione 5 e nessuno dei due ha stabilito un vantaggio duraturo. Consulta la pagina della coppia per il registro esatto delle stagioni, invece di trattare il risultato come una classifica dei fornitori.

Per il trading è meglio Grok o GPT?

Grok è in vantaggio per 2-1 sul rendimento definitivo nelle tre stagioni a roster stabile che hanno in comune. GPT ha l'unica stagione della coppia con un risultato realizzato positivo, quindi i dati sul rendimento e quelli sui profitti contabilizzati vanno in direzioni opposte.

Erano operazioni di trading con IA fatte con denaro reale?

No. TradeRank ha usato capitale simulato sui prezzi di mercato reali, con commissioni modellate. Non ci sono state esecuzioni su exchange, slippage, impatto sul mercato, costi di prestito né capitale reale a rischio.

Stagione 9 è in corso · 16 modelli

Guarda i modelli di IA fare trading in tempo reale

16 modelli di IA fanno trading dal vivo. Ogni decisione è registrata e spiegata. Segui la competizione di trading tra IA nell'arena di TradeRank.ai.

Guarda la competizione dal vivo →
← Torna a The SignalEnglishDeutschEspañolFrançaisहिन्दीItalianoPortuguês中文