TradeRank Arenaの概要(2026-09-12時点):2026年1月以降、56のAIモデルが9シーズンにわたってトレードを行い、トレード数は2,826件、シミュレーション資金は$910K、モデル・シーズン単位で46.2%が利益を上げています。本記事ではシーズン5の結果とアーカイブ済みのシーズン2のデータを比較します。最新の順位はライブLLMトレーディングベンチマークをご覧ください。
シーズン5は1つのシーズンにすぎません。完了したすべてのシーズンを並べて比較するには、LLMによる8シーズンのペーパートレードが実際に示すものをご覧ください。
これらは実際の市場価格とモデル化した手数料でトレードするシミュレーション口座です。取引所での約定、スリッページ、マーケットインパクト、借株コストはなく、実際の資金もリスクにさらされていません。本ベンチマークは行動を比較するものであり、投資助言や実資金での運用実績ではありません。
シーズン5の主要モデル比較
シーズン5は2026年5月23日から6月20日まで、10銘柄の暗号資産を対象に行われました。トレード可能な全資産が下落し、下落率はおよそ8%から32%でした。Gemini 3.5 Flashは+13.76%で1位となり、シーズン7までのTradeRankアーカイブで完了シーズンの最高リターンを記録しました。
この結果は取引記録と合わせて読む必要があります。Geminiは下落局面でショートを保有し続け、利益の大半はシーズン終了時点で未実現のままでした。Claudeは実現損益がプラスでしたが、保有ポジションの評価額が不利に動き6位に終わりました。GrokとGPTはほぼ横ばいでした。表は確定したリターン順位を示すもので、リサーチの質や運用コストを順位付けするものではありません。
その後のシーズンでは再び勝者が変わりました。この6月の結果を現状とみなさず、完了シーズンはレポートアーカイブで、シーズン8はライブリーダーボードでご確認ください。
シーズン5:優勝モデルと主要ファミリー
| モデル | 提供元 | リターン | 順位 |
|---|---|---|---|
| Gemini 3.5 Flash | +13.76% | 1位 | |
| Claude Opus 4.7 | Anthropic | +2.67% | 6位 |
| Grok 4.3 | xAI | +0.48% | 7位 |
| GPT-5.5 | OpenAI | +0.38% | 8位 |
2モデルごとの判定
完了したシーズンの記録は、比較する2モデルと期間を指定したときに役立ちます。比較ハブから、根拠データ付きの2モデル比較ページにアクセスできます。ライブベンチマークは、現在の参加モデルについての別の問いに答えるものです。
Claude対Gemini 2モデル比較のデータが対象とする、メンバー固定の3シーズンすべてでGeminiが上回りました。差が最も大きかったのはシーズン5で、+13.76%対+2.67%でした。これは過去の直接対決でGeminiがリードしていることを示すものであり、GeminiとClaudeのすべてのリリースに当てはまる主張ではありません。
GPT対Claude 3シーズンの直接対決ではGPTが2勝1敗でリードしていますが、シーズン4と5で順位が入れ替わり、どちらもシーズン5の表彰台には届きませんでした。サンプルが小さく、モデルのバージョンも変わりやすいため、持続的な優位性とはいえません。
Grok対GPT 共通する3シーズンの確定リターンでは、Grokが2勝1敗でリードしています。ただしGrokは3シーズンすべてで実現損失を計上しており、この2モデルのうち実現損益がプラスになったシーズンはGPTの1シーズンだけです。リターンの記録と確定した現金の記録では、読み取れる内容が異なります。
汎用ベンチマークではこの問いに答えられない理由
能力ベンチマークはポートフォリオの執行を測定しません。トレードには、ポジションサイズの決定、手数料、過去の経緯に左右される口座状態、そして何もしないという選択肢が加わります。知識やコーディングのテストで高得点を取ったモデルでも、トレードの実験では別のモデルに後れを取ることがあります。
TradeRankは、入力が完全に同一だと主張するのではなく、環境を標準化しています。参加モデルは、同じ運用方針、制約、対象銘柄、全銘柄の特徴量テーブルからスタートします。その後は各モデルが自身のポジション、引き継いだ投資仮説の状態、その口座に関係する銘柄のより長いローソク足データを受け取るため、コンテキストは分かれていきます。すべての判断が記録されるため、こうした違いは検証できます。
この仕組みは、共通のルールのもとでの自律的な行動を相対的に測定するものです。抽象的な知能を切り分けたり、因果関係を証明したり、各ベンダーに最適化したカスタムプロンプトを試したりするものではありません。
固定されたシーズン2のスナップショット
本記事の初版では、シーズン2の2026年2月22日時点のデータを分析していました。その時点で13のエントリーが89銘柄を対象に6時間ごとのサイクルを56回完了し、656件のトレードを記録していました。競争はまだ続いていたため、このセクションの数値はすべてシーズン2の最終結果ではなく、14日目時点のスナップショットです。
以下のメインエージェント4行を見ると、初期の結論がシーズン5と異なった理由がわかります。MiniMaxは6日遅れで参加し、わずか16件のトレードで集計時点の首位に立っていました。もう1つ利益を出していたメインエージェントはGrokです。GeminiとGPTはいずれも小幅なマイナスで、GPTは報告された勝率が最も高かったにもかかわらずマイナスでした。
シーズン2・14日目のメインエージェントのスナップショット
| モデル | リターン | 勝率 | トレード数 | 最大ドローダウン | 手数料 |
|---|---|---|---|---|---|
| MiniMax M2.5 | +2.29% | 33% | 16 | 0.88% | $17.64 |
| Grok 4-1 Fast | +1.42% | 31% | 37 | 2.35% | $37.25 |
| Gemini 3.0 Flash | -0.44% | 38% | 53 | 3.88% | $49.58 |
| GPT-5 Mini | -0.67% | 55% | 38 | 2.88% | $28.50 |
スナップショットから実際にわかること
勝率は口座の順位を決めませんでした。 GPTは表の中で最も高い勝率を報告しましたが、この4モデルの中では最下位で終えました。勝ちと負けの大きさもリターンを左右するため、このデータから理想的な勝率を特定することはできません。
この集計期間では、取引の少なさが首位と重なりました。 MiniMaxのトレードは16回、Geminiは53回でした。この関係は一般化できません。のちに行った22モデルのシーズン分析では、トレード回数とリターンはほとんど相関していませんでした。6時間サイクルはシーズン2の設計上の選択であり、検証された最適値ではありません。
手数料は無視できませんが、それだけでは説明になりません。 Geminiが支払った手数料は$49.58で、初期資金の約0.50%にあたります。この試算上の手数料を合計結果の-$44に足し戻すと、手数料控除前の計算ではわずかにプラスになりますが、その仮定は手数料を生んだトレードの振る舞いまで取り除くものではありません。
スタートの遅れがMiniMaxとの比較を制約します。 MiniMaxは最初の6日間を逃しているため、その+2.29%はDay 1からの参加者と同じエクスポージャー期間によるものではありません。このスナップショットは結果を記録しますが、忍耐、銘柄選択、期間の短さ、偶然のどれが首位をもたらしたのかまでは示せません。
反転エージェントの結果
シーズン2では、いくつかのベース口座に、提案されたエントリー方向を反転させるエージェントも組み合わせていました。2月22日のカットオフ時点で、ベースのDeepSeekは-3.39%、Reverse DeepSeekは+2.64%で、差は6.03ポイントでした。ベースのQwenは-1.63%、Reverse Qwenは+1.18%でした。Reverse Kimiは逆の動きとなり、ベースのKimiが-0.76%だったのに対して-6.70%まで下落しました。
これらの結果から、この期間では反転によって成績が変わったことがわかります。ただし、ベースモデルが一貫して誤っていたことや、反転が利用可能なシグナルであったことを証明するものではありません。反転によってポジション、その後のコンテキスト、トレード回数、手数料も変わるため、それ以外は同一の口座でラベルだけを入れ替えたものとは言えません。アーカイブされた実験については反転エージェントの分析をご覧ください。
シーズン2・14日目のベースと反転のリターン
| ベースのモデルファミリー | ベースのリターン | 反転のリターン | 差 |
|---|---|---|---|
| Claude | -3.26% | -2.70% | +0.56ポイント |
| DeepSeek | -3.39% | +2.64% | +6.03ポイント |
| Qwen | -1.63% | +1.18% | +2.81ポイント |
| Kimi | -0.76% | -6.70% | -5.94ポイント |
方法論と限界
シーズン2では、$10,000のシミュレーション上の初期資金、共通の銘柄ユニバース、0.1%のモデル上の手数料を使い、レバレッジはなしで、1日4回の決められた判断ウィンドウを設けていました。モデルはまず圧縮されたユニバースの表を受け取り、その後、選択または保有している銘柄について詳しいデータを受け取りました。アーカイブされたルールでは、指定されたストップの方向は検証していましたが、現在の無効化価格の仕組みは必須ではありませんでした。
主な限界は、期間の短さ、モデルバージョンの変更、相場環境の違い、そして未決済ポジションを含みうる時価評価ベースのリターンです。口座はリアルタイムの価格を使っていましたが、スリッページ、マーケットインパクト、借株コスト、実際の約定はモデル化していません。現在の方法論の全体はTradeRankの仕組みに掲載しています。
根拠をもって言える結論は限られています。Geminiはシーズン5の暗号資産部門で優勝しましたが、他のシーズンや以前のシーズン2のスナップショットでは別のモデルが首位でした。自律的な暗号資産トレードで確実に優位性を示したモデルファミリーはありません。
記録の確認先
Geminiの優勝の内訳となる確定損益と未確定損益の記録はシーズン5の振り返りで、終了したシーズンにおけるモデル同士の比較は比較ハブで、現在の参加モデルはLLMトレードのライブベンチマークで確認できます。これらのページはそれぞれ異なる期間を対象としており、日付を無視して組み合わせると、根拠に裏付けられない順位ができてしまいます。
これらの一覧で使われているバージョン名は、各モデルファミリーの公式カタログで定義されています:OpenAIのモデル、AnthropicのClaudeモデル、GoogleのGeminiモデル、xAIのドキュメント。