TradeRank Arena en un coup d’œil (au 2026-09-12) : 56 modèles d’IA ont tradé sur 9 saisons depuis janvier 2026 — 2 826 transactions, 910K $ de capital simulé, 46,2 % des saisons-modèles rentables. Ce test archivé de la Saison 2 compare Grok, ChatGPT et Claude sur un portefeuille mixte d’actions et de cryptomonnaies ; consultez le classement en direct pour connaître le classement actuel.
Le test a utilisé un capital simulé et des prix de marché en direct avec des frais modélisés. Il n'a exécuté aucun ordre réel et n'a modélisé ni le slippage, ni l'impact de marché, ni le coût d'emprunt. Rien ici ne constitue un conseil financier.
Ce qui a réellement été testé
La date limite du 22 février 2026 couvrait 14 jours de la saison 2. GPT-5 Mini, Claude Haiku 4.5 et Grok 4-1 Fast ont négocié le même univers de 89 actifs : 49 actions américaines, des cryptomonnaies et deux indices de référence contextuels non négociables. Les décisions étaient prises toutes les six heures.
L'environnement était standardisé : 10 000 $ de capital simulé, un mandat et un univers communs, des données techniques, des frais modélisés de 0,1 %, pas d'effet de levier et le même calendrier. Le contexte complet divergeait pour chaque compte, car les positions et les symboles choisis pour une analyse approfondie différaient. La compétition mesurait les résultats de portefeuilles autonomes, pas une réponse d'analyste isolée. Consultez Comment fonctionne TradeRank pour la méthodologie actuelle et le face-à-face de la saison 2 pour la configuration archivée.
Tableau de la saison 2 au jour 14 : actions et cryptomonnaies combinées
| Indicateur | Grok 4-1 Fast | GPT-5 Mini | Claude Haiku 4.5 |
|---|---|---|---|
| Rendement | +1,42 % | -0,67 % | -3,26 % |
| Taux de réussite déclaré | 31 % | 55 % | Aucune transaction clôturée |
| Transactions | 37 | 38 | 10 ouvertures |
| Drawdown maximal | 2,35 % | 2,88 % | Non communiqué |
| Sens | 100 % à l'achat | Mixte | 100 % à l'achat ; aucune clôture |
| Frais modélisés | 37,25 $ | 28,50 $ | Non communiqué |
Pourquoi le vainqueur de l'analyse boursière reste indéterminé
Le rendement d'un portefeuille combine la sélection des actifs, le sens, la taille des positions, l'entrée, la sortie, les frais et la valorisation des positions ouvertes. Un benchmark d'analyse boursière nécessiterait un objectif distinct : par exemple, une notation à l'aveugle des prévisions par rapport aux prix ultérieurs, l'exactitude factuelle par rapport aux documents financiers fournis, ou une recommandation figée évaluée indépendamment de l'exécution. La saison 2 n'a rien fait de tout cela.
L'article d'origine qualifiait GPT d'analyste boursier le plus utile, car il affichait un taux de réussite déclaré de 55 % et avait opéré des rotations notables vers CAT et LRCX. Cette déduction allait trop loin. Le taux de réussite portait sur le portefeuille mixte, pas sur les seules actions, et retenir deux positions faciles à lire ne constitue pas une notation à l'aveugle. Le compte de GPT a malgré tout terminé dans le rouge. L'affirmation étayée est plus restreinte : ces positions sont des exemples qu'un humain pourrait examiner, pas la preuve que GPT a remporté un benchmark de recherche.
Ce qu'ont fait les trois comptes
Grok a mené en rendement autonome. Il a terminé l'instantané à +1,42 % avec une exposition 100 % à l'achat. Le marché a légèrement progressé sur la période, si bien que l'exposition acheteuse allait dans le sens de la tendance globale. Un taux de réussite déclaré de 31 % et un rendement total positif montrent que le taux de réussite seul n'a pas déterminé le résultat du compte. Ils n'établissent pas la profondeur des recherches.
GPT a combiné un taux de réussite plus élevé et une perte. GPT-5 Mini a affiché un taux de réussite déclaré de 55 % et un rendement de -0,67 %. Ses journaux comprenaient des ventes à découvert pendant la baisse, puis des positions sur CAT et LRCX. Il a aussi conservé Citigroup pendant un drawdown d'environ -4,3 %. Ce bilan illustre la différence entre des observations individuelles et l'exécution d'un portefeuille.
Claude a fourni peu d'éléments sur ses sorties. Claude Haiku a ouvert dix positions et n'en avait clôturé aucune à la date limite. Sans transaction clôturée, l'expérience ne peut pas calculer de taux de réussite comparable sur les transactions clôturées, ni dire grand-chose de son comportement de sortie au-delà de son inactivité avec ce prompt et sur cette période.
Verdict fondé sur les données : Grok a remporté l'instantané du portefeuille mixte autonome. Aucun modèle n'a remporté de test d'analyse boursière, car aucun test distinct d'analyse boursière n'a été mené.
Comment comparer ces modèles pour vos propres recherches
Donnez à chaque modèle le même dossier de sources daté, pas seulement un ticker. Exigez les mêmes livrables : scénario central, scénario baissier, citations factuelles, hypothèses de valorisation, condition d'invalidation et liste des informations manquantes. Évaluez ensuite l'exactitude factuelle et vérifiez si chaque conclusion découle des éléments fournis, avant de regarder le nom du modèle.
Gardez l'exécution des ordres et les limites de risque strictes en dehors du texte. Un modèle peut produire un contre-argument utile et rester inadapté au dimensionnement ou aux sorties autonomes. Le guide des prompts de trading par IA propose des structures auditables, mais il n'affirme pas que ces gabarits améliorent les rendements.
Pour le classement autonome actuel, consultez le benchmark de trading LLM en direct. Les résultats actuels ne remplacent toujours pas un test contrôlé de la qualité des recherches.
Limites des éléments probants
La période a duré 14 jours, mêlait actions et cryptomonnaies et utilisait des versions de modèles d'entrée de gamme spécifiques. Le tableau de rendements publié ne portait pas uniquement sur les actions. Le contexte des modèles divergeait selon l'état de chaque compte. Les rendements incluaient des frais modélisés mais omettaient plusieurs coûts d'exécution réels.
Le P&L par classe d'actifs des positions clôturées de la saison 2 a été analysé plus tard dans Actions vs cryptomonnaies, mais cet agrégat ultérieur ne transforme pas rétroactivement cet instantané à trois modèles en benchmark d'analyste pur. La conclusion défendable reste la même : Grok a mené en rendement autonome ici ; le meilleur modèle d'analyse boursière n'a pas été mesuré.