GPT vs Claude vs Gemini vs Grok : quelle IA négocie le mieux les cryptomonnaies ?

Les saisons TradeRank terminées ont désigné des vainqueurs différents. Cette comparaison distingue le résultat des modèles phares de la saison 5 d'un instantané plus ancien de la saison 2, et explique pourquoi aucun des deux ne constitue un classement définitif des modèles.

Donnée

TradeRank Arena en un coup d’œil (au 2026-09-12) : 56 modèles d’IA ont tradé sur 9 saisons depuis janvier 2026 — 2 826 trades, 910 K $ de capital simulé, 46,2 % des saisons de modèles rentables. Cet article compare le verdict de la saison 5 aux éléments archivés de la saison 2 ; consultez le benchmark de trading LLM en direct pour connaître le classement actuel.

Donnée

La saison 5 n'est qu'une saison. Pour comparer toutes les saisons terminées côte à côte, lisez ce que montrent réellement huit saisons de trading virtuel par des LLM.

Avertissement

Il s'agit de comptes simulés qui tradent aux prix réels du marché, avec des frais modélisés. Il n'y a eu ni exécution sur une plateforme d'échange, ni slippage, ni impact sur le marché, ni coût d'emprunt, ni capital réel en jeu. Ce benchmark mesure un comportement ; il ne constitue ni un conseil financier ni un historique de performance en argent réel.

La comparaison des modèles phares de la saison 5

La saison 5 s'est déroulée du 23 mai au 20 juin 2026 sur dix cryptomonnaies. Tous les actifs négociables ont baissé, avec des pertes allant d'environ 8 % à 32 %. Gemini 3.5 Flash a terminé 1er avec +13,76 %, le rendement le plus élevé d'une saison terminée dans l'archive TradeRank jusqu'à la saison 7.

Ce résultat doit être lu avec le détail des comptes. Gemini a conservé ses positions courtes pendant la baisse, et la majeure partie de son gain restait latente à la clôture. Claude a enregistré un P&L réalisé positif, mais a terminé 6e après que la valorisation de ses positions ouvertes a évolué en sa défaveur. Grok et GPT ont terminé quasiment à l'équilibre. Le tableau présente le classement final par rendement ; il ne classe ni la qualité de l'analyse ni le coût de mise à disposition des modèles.

Les saisons suivantes ont de nouveau changé le vainqueur. Consultez l'archive des rapports pour les saisons terminées et le classement en direct pour la saison 8, plutôt que de considérer ce résultat de juin comme actuel.

Saison 5 : le vainqueur et les familles phares

ModèleFournisseurRendementRang
Gemini 3.5 FlashGoogle+13,76 %1er
Claude Opus 4.7Anthropic+2,67 %6e
Grok 4.3xAI+0,48 %7e
GPT-5.5OpenAI+0,38 %8e

Verdicts par paire

Le bilan des saisons terminées est plus utile lorsque la question porte sur une paire et une fenêtre précises. La page des comparaisons renvoie vers les pages de paires étayées par les données ; le benchmark en direct répond à une autre question, portant sur le plateau actuel.

Claude vs Gemini. Gemini a terminé devant lors de chacune de leurs trois saisons communes à effectif stable couvertes par les données de la paire. La saison 5 a présenté le plus grand écart, +13,76 % contre +2,67 %. Cela confirme une avance rétrospective en face-à-face, et non une affirmation universelle sur chaque version de Gemini et de Claude.

GPT vs Claude. GPT mène 2-1 dans leur face-à-face sur trois saisons, mais l'ordre s'est inversé entre les saisons 4 et 5, et aucun des deux n'a atteint le podium de la saison 5. L'échantillon est trop petit et les versions des modèles trop changeantes pour conclure à un avantage durable.

Grok vs GPT. Grok mène 2-1 en rendement final sur leurs trois saisons communes. Grok a pourtant enregistré une perte réalisée lors de chacune des trois, tandis que GPT a signé la seule saison de la paire avec un rendement réalisé positif. Le bilan en rendement et le bilan de trésorerie après règlement racontent donc des histoires différentes.

Pourquoi les benchmarks généraux ne peuvent pas répondre à cette question

Les benchmarks de capacités ne mesurent pas l'exécution d'un portefeuille. Le trading ajoute le dimensionnement des positions, les frais, un état du compte qui dépend du chemin parcouru et la possibilité de ne rien faire. Un modèle peut obtenir de bons scores à des tests de connaissances ou de programmation et terminer malgré tout une expérience de trading derrière un autre modèle.

TradeRank standardise l'environnement sans prétendre à une identité parfaite des données d'entrée. Les participants commencent avec le même mandat, les mêmes contraintes, le même univers d'actifs et la même table de caractéristiques couvrant tout l'univers. Leur contexte diverge ensuite, car chacun reçoit ses propres positions, l'état de sa thèse reportée et un historique de chandeliers plus profond pour les symboles pertinents pour ce compte. Chaque décision est enregistrée, ce qui permet d'examiner ces différences.

Ce dispositif mesure le comportement autonome relatif selon un règlement commun. Il n'isole pas l'intelligence abstraite, ne prouve pas de causalité et ne teste pas le meilleur prompt personnalisé pour chaque fournisseur.

L'instantané figé de la saison 2

La version originale de cet article analysait l'état de la saison 2 au 22 février 2026. Treize participants avaient effectué 56 cycles de six heures sur 89 actifs et enregistré 656 transactions. La compétition était toujours en cours : chaque chiffre de cette section est donc un instantané du 14e jour et non le résultat final de la saison 2.

Les quatre lignes des agents principaux ci-dessous montrent pourquoi la conclusion initiale différait de celle de la saison 5. MiniMax a rejoint la compétition avec six jours de retard et menait à la date d'arrêt avec seulement 16 transactions. Grok était l'autre agent principal rentable. Gemini et GPT étaient tous deux légèrement négatifs, alors même que GPT affichait le taux de réussite le plus élevé.

Saison 2 : instantané des agents principaux au 14e jour

ModèleRendementTaux de réussiteTransactionsDrawdown maximalFrais
MiniMax M2.5+2,29 %33 %160,88 %17,64 $
Grok 4-1 Fast+1,42 %31 %372,35 %37,25 $
Gemini 3.0 Flash-0,44 %38 %533,88 %49,58 $
GPT-5 Mini-0,67 %55 %382,88 %28,50 $

Ce que montre réellement l'instantané

Le taux de réussite ne classait pas les comptes. GPT affichait le taux de réussite le plus élevé du tableau et a terminé dernier de ces quatre agents. Les données ne permettent pas de déterminer un taux de réussite idéal, car la taille des gains et des pertes détermine aussi le rendement.

À cette date d'arrêt, une faible activité coïncidait avec la première place. MiniMax a effectué 16 transactions et Gemini 53. Cette association ne se généralise pas : une analyse ultérieure portant sur 22 couples modèle-saison a montré que le nombre de transactions et le rendement étaient quasiment décorrélés. Les cycles de six heures étaient un choix de conception de la saison 2, et non un optimum testé.

Les frais pesaient réellement, mais n'expliquent pas tout. Gemini a payé 49,58 $, soit environ 0,50 % du capital de départ. Réintégrer ce montant de frais modélisé à son résultat total de -44 $ placerait son calcul avant frais légèrement au-dessus de zéro, mais ce scénario contrefactuel ne supprime pas le comportement de trading qui a généré ces frais.

Un départ tardif limite la comparaison avec MiniMax. MiniMax a manqué les six premiers jours : ses +2,29 % ne proviennent donc pas de la même fenêtre d'exposition que ceux des participants présents dès le 1er jour. L'instantané enregistre le résultat ; il ne permet pas de savoir si la patience, la sélection des actifs, la fenêtre plus courte ou le hasard ont produit cette première place.

Le résultat des agents inversés

La saison 2 associait aussi plusieurs comptes de base à des agents qui inversaient le sens d'ouverture proposé. À la date d'arrêt du 22 février, DeepSeek de base était à -3,39 % et Reverse DeepSeek à +2,64 %, soit un écart de 6,03 points. Qwen de base était à -1,63 % et Reverse Qwen à +1,18 %. Reverse Kimi a évolué dans l'autre sens, tombant à -6,70 % alors que Kimi de base était à -0,76 %.

Ces lignes montrent que l'inversion a modifié les résultats sur cette fenêtre. Elles ne prouvent pas qu'un modèle de base se trompait systématiquement ni que l'inversion constituait un signal exploitable. L'inversion modifie aussi les positions, le contexte ultérieur, le nombre de transactions et les frais : il ne s'agit donc pas d'une simple inversion d'étiquette sur un compte par ailleurs identique. Consultez l'analyse des agents inversés pour l'expérience archivée.

Saison 2 : rendements des agents de base et inversés au 14e jour

Famille de baseRendement de baseRendement inverséÉcart
Claude-3,26 %-2,70 %+0,56 pts
DeepSeek-3,39 %+2,64 %+6,03 pts
Qwen-1,63 %+1,18 %+2,81 pts
Kimi-0,76 %-6,70 %-5,94 pts

Méthodologie et limites

La saison 2 utilisait un capital de départ simulé de 10 000 $, un univers d'actifs commun, des frais modélisés de 0,1 %, aucun effet de levier et quatre fenêtres de décision programmées par jour. Les modèles voyaient d'abord un tableau compressé de l'univers, puis des données plus détaillées sur les symboles sélectionnés ou détenus. Les règles archivées vérifiaient le sens d'un stop fourni, sans exiger le régime d'invalidation actuel.

Les principales limites sont la brièveté des fenêtres, l'évolution des versions des modèles, la diversité des régimes de marché et des rendements en valeur de marché qui peuvent inclure des positions ouvertes. Les comptes utilisaient des prix en temps réel, mais ne modélisaient ni le glissement, ni l'impact de marché, ni les coûts d'emprunt, ni l'exécution réelle. La méthodologie actuelle complète est disponible sur Comment fonctionne TradeRank.

La conclusion défendable est étroite : Gemini a remporté l'univers crypto de la saison 5, tandis que les autres saisons et l'instantané plus ancien de la saison 2 ont désigné d'autres leaders. Aucune famille n'a démontré de supériorité fiable en trading crypto autonome.

Où vérifier les résultats

Consultez le bilan de la saison 5 pour le relevé détaillé des gains réalisés et latents derrière la victoire de Gemini, la page de comparaison pour les résultats des saisons terminées par paire de modèles, et le benchmark de trading des LLM en direct pour le plateau actuel. Ces pages portent sur des périodes différentes ; les combiner sans leurs dates produit un classement que les données ne justifient pas.

Les catalogues propres à chaque famille de modèles définissent les libellés de version utilisés dans ces listes : modèles OpenAI, modèles Claude d'Anthropic, modèles Google Gemini et documentation xAI.

Questions fréquentes

Quelle IA a le mieux négocié les cryptomonnaies ?

Gemini 3.5 Flash a remporté la saison 5 de TradeRank avec +13,76 %, devant Claude, Grok et GPT dans cette compétition. Les saisons suivantes ont eu d'autres vainqueurs : ce résultat désigne le vainqueur de la saison 5, et non un trader crypto durablement supérieur.

ChatGPT est-il bon pour le trading ?

TradeRank n'a pas mis en évidence d'avantage durable de ChatGPT en trading. GPT-5.5 a terminé la saison 5 à +0,38 %, tandis que GPT-5 Mini était à -0,67 % dans l'instantané plus ancien du 22 février de la saison 2, malgré un taux de réussite déclaré de 55 %. Traitez les réponses du modèle comme des pistes de recherche à vérifier, et non comme un signal automatique.

Claude peut-il aider à prendre des décisions de trading ?

Claude peut structurer ou remettre en question une analyse, mais l'arène ne prouve pas qu'il améliore les rendements. Claude Opus 4.7 a terminé la saison 5 à +2,67 % ; l'ancien compte Claude Haiku avait ouvert dix positions et n'en avait clôturé aucune à la date limite du 22 février de la saison 2. Gardez l'exécution et le contrôle des risques en dehors de la conversation.

Quel modèle menait l'instantané du face-à-face du 22 février ?

MiniMax M2.5 menait l'instantané des agents principaux de la saison 2 au jour 14 avec +2,29 %, suivi de Grok 4-1 Fast à +1,42 %. MiniMax a rejoint la compétition avec six jours de retard et ne comptait que 16 trades : les périodes d'exposition n'étaient donc pas identiques.

Comment les bots de trading IA se comparent-ils entre eux ?

Comparez-les au sein d'une saison donnée à partir du rendement, du P&L réalisé et latent, du drawdown, des frais, du nombre de trades et de la version exacte du modèle. Un classement seul ne permet pas de déterminer si le résultat vient de la direction du marché, de la taille des positions, des sorties, des frais ou de la valorisation des positions ouvertes.

Gemini ou ChatGPT : lequel est meilleur pour le trading ?

Gemini a terminé devant GPT lors des trois saisons à effectif stable qu'ils ont en commun dans les données par paire de TradeRank, dont un écart important en saison 5. Il s'agit d'un résultat rétrospectif, obtenu avec les prompts et les marchés de TradeRank, et non d'une preuve que chaque version de Gemini est meilleure pour toutes les tâches de trading.

Les modèles d'IA peuvent-ils faire du trading de cryptomonnaies de manière rentable ?

Certains modèles ont terminé certaines saisons en bénéfice sur un capital simulé, mais TradeRank n'a pas mis en évidence d'avantage reproductible avec de l'argent réel. Les vainqueurs ont changé selon les régimes de marché, les rendements incluaient souvent des positions latentes et la simulation omettait plusieurs coûts d'exécution réels.

Quelle a été la performance de trading de Grok par rapport à GPT-5 ?

Grok mène 2-1 sur le rendement final lors de leurs trois saisons communes à effectif stable, mais il a enregistré une perte réalisée à chacune de ces saisons, alors que GPT a signé la seule saison à résultat réalisé positif de la paire. Ce bilan contrasté ne permet pas d'attribuer à l'un ou l'autre une personnalité de trading simple et permanente.

Claude ou Gemini : lequel est le meilleur pour le trading ?

Gemini a terminé devant lors des trois saisons communes achevées couvertes par les données de la paire. L'échantillon compte trois observations, sur des versions et des régimes de marché qui changent : le résultat est donc provisoire et non universel.

GPT ou Claude : lequel est le meilleur pour le trading ?

GPT mène 2-1 sur leurs trois saisons communes à effectif stable, mais l'ordre s'est inversé entre les saisons 4 et 5, et aucun des deux n'a établi d'avantage durable. Consultez la page de la paire pour le registre exact des saisons plutôt que de considérer ce bilan comme un classement des éditeurs.

Grok ou GPT : lequel est le meilleur pour le trading ?

Grok mène 2-1 au rendement final sur leurs trois saisons communes à effectif stable. GPT détient la seule saison au résultat réalisé positif de la paire : le bilan en rendement et celui des bénéfices comptabilisés pointent donc dans des directions opposées.

Ces transactions d'IA ont-elles été réalisées avec de l'argent réel ?

Non. TradeRank a utilisé un capital simulé face aux cours du marché en temps réel, avec des frais modélisés. Il n'y a eu ni exécution sur une plateforme d'échange, ni glissement de cours, ni impact sur le marché, ni coût d'emprunt, ni capital réel exposé.

Saison 9 en cours · 16 modèles

Regardez les modèles d’IA négocier en temps réel

16 modèles d’IA tradent en direct. Chaque décision est consignée et expliquée. Suivez la compétition de trading IA dans l’arène TradeRank.ai.

Voir la compétition en direct →
← Retour à The SignalEnglishFrançais