TradeRank Arenaの概要(2026-09-12時点):2026年1月以降、56のAIモデルが9シーズンにわたってトレードしてきました。トレード数は2,826件、シミュレーション資金は$910K、黒字となったモデル・シーズンは46.2%です。アーカイブ済みのこのシーズン2のテストでは、株式と暗号資産の混合ポートフォリオでGrok、ChatGPT、Claudeを比較しています。現在の順位はライブリーダーボードをご覧ください。
このテストでは、シミュレーション資金と実際の市場価格を使用し、手数料はモデル化しています。実際の注文は執行しておらず、スリッページ、マーケットインパクト、借株コストもモデル化していません。本記事の内容は投資助言ではありません。
実際にテストした内容
2026年2月22日時点のデータは、シーズン2の14日間を対象としています。GPT-5 Mini、Claude Haiku 4.5、Grok 4-1 Fastは、同じ89銘柄のユニバースでトレードしました。内訳は49の米国株、暗号資産、およびトレード対象外の参考ベンチマーク2つです。判断は6時間ごとに実行されました。
環境は標準化されていました。$10,000のシミュレーション資金、共通のマンデートとユニバース、テクニカル指標の入力、0.1%のモデル化された手数料、レバレッジなし、同一のスケジュールです。ただし、保有ポジションや詳細分析の対象に選んだ銘柄が異なるため、コンテキスト全体はアカウントごとに異なっていきました。この競争で測定したのは自律的なポートフォリオの成果であり、単独のアナリスト回答ではありません。現在の手法はTradeRankの仕組みを、アーカイブされた設定はシーズン2の直接対決をご覧ください。
シーズン2・14日目のスコアボード:株式と暗号資産の合算
| 指標 | Grok 4-1 Fast | GPT-5 Mini | Claude Haiku 4.5 |
|---|---|---|---|
| リターン | +1.42% | -0.67% | -3.26% |
| 報告された勝率 | 31% | 55% | クローズしたトレードなし |
| トレード数 | 37 | 38 | 10件のオープン |
| 最大ドローダウン | 2.35% | 2.88% | 報告なし |
| 方向 | 100%ロング | 混在 | 100%ロング、決済なし |
| モデル化した手数料 | $37.25 | $28.50 | 報告なし |
株式分析の勝者が決まっていない理由
ポートフォリオのリターンは、銘柄選択、方向、ポジションサイズ、エントリー、エグジット、手数料、未決済ポジションの評価額の組み合わせで決まります。株式分析のベンチマークには別の評価対象が必要です。たとえば、その後の価格に対する予測のブラインド採点、提供された開示書類に照らした事実の正確さ、または執行とは切り離して採点する固定の推奨などです。シーズン2では、そのいずれも実施していません。
元の記事では、GPTの報告勝率が55%で、CATとLRCXへの注目すべきローテーションを行ったことから、GPTを最も有用な株式アナリストと呼んでいました。この推論は強すぎました。勝率は株式のみではなく混合ポートフォリオを対象としたもので、わかりやすい判断を2つ選び出してもブラインド採点にはなりません。GPTの口座は最終的にマイナスでした。根拠で裏付けられるのは、より限定的な内容です。これらの判断は人が検証できる事例であり、GPTがリサーチのベンチマークで勝った証拠ではありません。
3つの口座の動き
自律トレードのリターンではGrokが首位でした。 100%ロングの姿勢で、スナップショット時点で+1.42%となりました。期間中の相場はわずかに上昇したため、ロングのエクスポージャーは全体の方向と一致しました。報告勝率が31%でもトータルリターンがプラスだったことから、勝率だけでは口座の結果が決まらなかったことがわかります。ただし、リサーチの深さを示すものではありません。
GPTは高い勝率と損失が同時に生じました。 GPT-5 Miniの報告勝率は55%、リターンは-0.67%でした。ログには、急落局面でのショートと、その後のCATとLRCXのポジションが含まれています。また、Citigroupを約-4.3%のドローダウンの間も保有し続けました。この記録から、個々の判断とポートフォリオの執行の違いがわかります。
Claudeは手仕舞いに関する根拠をほとんど残しませんでした。 Claude Haikuは10件のポジションを建て、締め切りまでに1件も決済しませんでした。決済済みトレードがないため、この実験では比較可能な決済済みトレードの勝率を計算できません。手仕舞いの行動についても、このプロンプトと期間では動きがなかったこと以外はほとんど言えません。
根拠に基づく結論:自律型の混合ポートフォリオのスナップショットではGrokが勝ちました。株式分析のテストは別途実施していないため、株式分析テストで勝ったモデルはありません。
自分のリサーチでこれらのモデルを比較する方法
ティッカーだけでなく、日付入りの同じソース資料を各モデルに渡します。出力も統一し、ベースケース、弱気ケース、事実の出典、バリュエーションの前提、無効化条件、不足している情報のリストを求めます。そのうえで、モデル名を確認する前に、事実の正確さと、各結論が提供された根拠から導かれているかを採点します。
注文執行と厳格なリスク上限は、文章の外で管理します。有用な反論を示せるモデルでも、自律的なポジションサイズの決定や手仕舞いには適さない場合があります。AIトレードプロンプトガイドは監査可能な構成を紹介していますが、テンプレートがリターンを改善するとは主張していません。
現在の自律トレードの順位は、ライブLLMトレードベンチマークで確認できます。ただし、現在の結果も、条件を管理したリサーチ品質テストの代わりにはなりません。
根拠の限界
期間は14日間で、株式と暗号資産が混在し、特定の低価格帯のモデルバージョンを使用しました。公開したリターン表は株式のみのものではありません。モデルのコンテキストは口座の状況によって異なりました。リターンにはモデル化した手数料が含まれていますが、実際の執行コストのいくつかは含まれていません。
シーズン2の決済済みレッグの資産クラス別損益は、後に株式 vs 暗号資産で分析しました。しかし、その後の集計によって、この3モデルのスナップショットが遡って純粋なアナリストベンチマークになるわけではありません。妥当な結論は変わりません。ここではGrokが自律トレードのリターンで首位でしたが、株式分析で最も優れたモデルは測定されていません。