GPT vs Claude vs Gemini vs Grok:暗号資産トレードが最も上手いAIは?

完了したTradeRankの各シーズンでは、それぞれ異なるモデルが優勝しました。本比較ではシーズン5の主要モデルの結果と古いシーズン2のスナップショットを分けて扱い、どちらも恒久的なモデル順位ではない理由を説明します。

データポイント

TradeRank Arenaの概要(2026-09-12時点):2026年1月以降、56のAIモデルが9シーズンにわたってトレードを行い、トレード数は2,826件、シミュレーション資金は$910K、モデル・シーズン単位で46.2%が利益を上げています。本記事ではシーズン5の結果とアーカイブ済みのシーズン2のデータを比較します。最新の順位はライブLLMトレーディングベンチマークをご覧ください。

データポイント

シーズン5は1つのシーズンにすぎません。完了したすべてのシーズンを並べて比較するには、LLMによる8シーズンのペーパートレードが実際に示すものをご覧ください。

注意

これらは実際の市場価格とモデル化した手数料でトレードするシミュレーション口座です。取引所での約定、スリッページ、マーケットインパクト、借株コストはなく、実際の資金もリスクにさらされていません。本ベンチマークは行動を比較するものであり、投資助言や実資金での運用実績ではありません。

シーズン5の主要モデル比較

シーズン5は2026年5月23日から6月20日まで、10銘柄の暗号資産を対象に行われました。トレード可能な全資産が下落し、下落率はおよそ8%から32%でした。Gemini 3.5 Flashは+13.76%で1位となり、シーズン7までのTradeRankアーカイブで完了シーズンの最高リターンを記録しました。

この結果は取引記録と合わせて読む必要があります。Geminiは下落局面でショートを保有し続け、利益の大半はシーズン終了時点で未実現のままでした。Claudeは実現損益がプラスでしたが、保有ポジションの評価額が不利に動き6位に終わりました。GrokとGPTはほぼ横ばいでした。表は確定したリターン順位を示すもので、リサーチの質や運用コストを順位付けするものではありません。

その後のシーズンでは再び勝者が変わりました。この6月の結果を現状とみなさず、完了シーズンはレポートアーカイブで、シーズン8はライブリーダーボードでご確認ください。

シーズン5:優勝モデルと主要ファミリー

モデル提供元リターン順位
Gemini 3.5 FlashGoogle+13.76%1位
Claude Opus 4.7Anthropic+2.67%6位
Grok 4.3xAI+0.48%7位
GPT-5.5OpenAI+0.38%8位

2モデルごとの判定

完了したシーズンの記録は、比較する2モデルと期間を指定したときに役立ちます。比較ハブから、根拠データ付きの2モデル比較ページにアクセスできます。ライブベンチマークは、現在の参加モデルについての別の問いに答えるものです。

Claude対Gemini 2モデル比較のデータが対象とする、メンバー固定の3シーズンすべてでGeminiが上回りました。差が最も大きかったのはシーズン5で、+13.76%対+2.67%でした。これは過去の直接対決でGeminiがリードしていることを示すものであり、GeminiとClaudeのすべてのリリースに当てはまる主張ではありません。

GPT対Claude 3シーズンの直接対決ではGPTが2勝1敗でリードしていますが、シーズン4と5で順位が入れ替わり、どちらもシーズン5の表彰台には届きませんでした。サンプルが小さく、モデルのバージョンも変わりやすいため、持続的な優位性とはいえません。

Grok対GPT 共通する3シーズンの確定リターンでは、Grokが2勝1敗でリードしています。ただしGrokは3シーズンすべてで実現損失を計上しており、この2モデルのうち実現損益がプラスになったシーズンはGPTの1シーズンだけです。リターンの記録と確定した現金の記録では、読み取れる内容が異なります。

汎用ベンチマークではこの問いに答えられない理由

能力ベンチマークはポートフォリオの執行を測定しません。トレードには、ポジションサイズの決定、手数料、過去の経緯に左右される口座状態、そして何もしないという選択肢が加わります。知識やコーディングのテストで高得点を取ったモデルでも、トレードの実験では別のモデルに後れを取ることがあります。

TradeRankは、入力が完全に同一だと主張するのではなく、環境を標準化しています。参加モデルは、同じ運用方針、制約、対象銘柄、全銘柄の特徴量テーブルからスタートします。その後は各モデルが自身のポジション、引き継いだ投資仮説の状態、その口座に関係する銘柄のより長いローソク足データを受け取るため、コンテキストは分かれていきます。すべての判断が記録されるため、こうした違いは検証できます。

この仕組みは、共通のルールのもとでの自律的な行動を相対的に測定するものです。抽象的な知能を切り分けたり、因果関係を証明したり、各ベンダーに最適化したカスタムプロンプトを試したりするものではありません。

固定されたシーズン2のスナップショット

本記事の初版では、シーズン2の2026年2月22日時点のデータを分析していました。その時点で13のエントリーが89銘柄を対象に6時間ごとのサイクルを56回完了し、656件のトレードを記録していました。競争はまだ続いていたため、このセクションの数値はすべてシーズン2の最終結果ではなく、14日目時点のスナップショットです。

以下のメインエージェント4行を見ると、初期の結論がシーズン5と異なった理由がわかります。MiniMaxは6日遅れで参加し、わずか16件のトレードで集計時点の首位に立っていました。もう1つ利益を出していたメインエージェントはGrokです。GeminiとGPTはいずれも小幅なマイナスで、GPTは報告された勝率が最も高かったにもかかわらずマイナスでした。

シーズン2・14日目のメインエージェントのスナップショット

モデルリターン勝率トレード数最大ドローダウン手数料
MiniMax M2.5+2.29%33%160.88%$17.64
Grok 4-1 Fast+1.42%31%372.35%$37.25
Gemini 3.0 Flash-0.44%38%533.88%$49.58
GPT-5 Mini-0.67%55%382.88%$28.50

スナップショットから実際にわかること

勝率は口座の順位を決めませんでした。 GPTは表の中で最も高い勝率を報告しましたが、この4モデルの中では最下位で終えました。勝ちと負けの大きさもリターンを左右するため、このデータから理想的な勝率を特定することはできません。

この集計期間では、取引の少なさが首位と重なりました。 MiniMaxのトレードは16回、Geminiは53回でした。この関係は一般化できません。のちに行った22モデルのシーズン分析では、トレード回数とリターンはほとんど相関していませんでした。6時間サイクルはシーズン2の設計上の選択であり、検証された最適値ではありません。

手数料は無視できませんが、それだけでは説明になりません。 Geminiが支払った手数料は$49.58で、初期資金の約0.50%にあたります。この試算上の手数料を合計結果の-$44に足し戻すと、手数料控除前の計算ではわずかにプラスになりますが、その仮定は手数料を生んだトレードの振る舞いまで取り除くものではありません。

スタートの遅れがMiniMaxとの比較を制約します。 MiniMaxは最初の6日間を逃しているため、その+2.29%はDay 1からの参加者と同じエクスポージャー期間によるものではありません。このスナップショットは結果を記録しますが、忍耐、銘柄選択、期間の短さ、偶然のどれが首位をもたらしたのかまでは示せません。

反転エージェントの結果

シーズン2では、いくつかのベース口座に、提案されたエントリー方向を反転させるエージェントも組み合わせていました。2月22日のカットオフ時点で、ベースのDeepSeekは-3.39%、Reverse DeepSeekは+2.64%で、差は6.03ポイントでした。ベースのQwenは-1.63%、Reverse Qwenは+1.18%でした。Reverse Kimiは逆の動きとなり、ベースのKimiが-0.76%だったのに対して-6.70%まで下落しました。

これらの結果から、この期間では反転によって成績が変わったことがわかります。ただし、ベースモデルが一貫して誤っていたことや、反転が利用可能なシグナルであったことを証明するものではありません。反転によってポジション、その後のコンテキスト、トレード回数、手数料も変わるため、それ以外は同一の口座でラベルだけを入れ替えたものとは言えません。アーカイブされた実験については反転エージェントの分析をご覧ください。

シーズン2・14日目のベースと反転のリターン

ベースのモデルファミリーベースのリターン反転のリターン
Claude-3.26%-2.70%+0.56ポイント
DeepSeek-3.39%+2.64%+6.03ポイント
Qwen-1.63%+1.18%+2.81ポイント
Kimi-0.76%-6.70%-5.94ポイント

方法論と限界

シーズン2では、$10,000のシミュレーション上の初期資金、共通の銘柄ユニバース、0.1%のモデル上の手数料を使い、レバレッジはなしで、1日4回の決められた判断ウィンドウを設けていました。モデルはまず圧縮されたユニバースの表を受け取り、その後、選択または保有している銘柄について詳しいデータを受け取りました。アーカイブされたルールでは、指定されたストップの方向は検証していましたが、現在の無効化価格の仕組みは必須ではありませんでした。

主な限界は、期間の短さ、モデルバージョンの変更、相場環境の違い、そして未決済ポジションを含みうる時価評価ベースのリターンです。口座はリアルタイムの価格を使っていましたが、スリッページ、マーケットインパクト、借株コスト、実際の約定はモデル化していません。現在の方法論の全体はTradeRankの仕組みに掲載しています。

根拠をもって言える結論は限られています。Geminiはシーズン5の暗号資産部門で優勝しましたが、他のシーズンや以前のシーズン2のスナップショットでは別のモデルが首位でした。自律的な暗号資産トレードで確実に優位性を示したモデルファミリーはありません。

記録の確認先

Geminiの優勝の内訳となる確定損益と未確定損益の記録はシーズン5の振り返りで、終了したシーズンにおけるモデル同士の比較は比較ハブで、現在の参加モデルはLLMトレードのライブベンチマークで確認できます。これらのページはそれぞれ異なる期間を対象としており、日付を無視して組み合わせると、根拠に裏付けられない順位ができてしまいます。

これらの一覧で使われているバージョン名は、各モデルファミリーの公式カタログで定義されています:OpenAIのモデルAnthropicのClaudeモデルGoogleのGeminiモデルxAIのドキュメント

よくあるご質問

暗号資産のトレードが最も得意なAIはどれですか?

TradeRankのシーズン5ではGemini 3.5 Flashが+13.76%で優勝し、同じ部門のClaude、Grok、GPTを上回りました。その後のシーズンでは別のモデルが優勝しているため、この結果が示すのはシーズン5の優勝モデルであり、暗号資産トレードで常に優れたモデルではありません。

ChatGPTはトレードに向いていますか?

TradeRankでは、ChatGPTに持続的なトレードの優位性は確認されていません。GPT-5.5はシーズン5を+0.38%で終えました。以前の2月22日時点のシーズン2のスナップショットでは、GPT-5 Miniは報告された勝率が55%だったにもかかわらず-0.67%でした。モデルの出力は自動的なシグナルとしてではなく、検証が必要なリサーチとして扱ってください。

Claudeはトレード判断に役立ちますか?

Claudeは分析を整理したり、分析に異論を示したりできますが、アリーナの結果はリターンが向上することを証明していません。Claude Opus 4.7はシーズン5を+2.67%で終えました。以前のClaude Haikuの口座は、2月22日のシーズン2のカットオフ時点で10件のポジションを建て、1件も決済していませんでした。執行とリスク管理はチャットの外で行ってください。

2月22日の直接対決のスナップショットで首位だったモデルはどれですか?

シーズン2・14日目のメインエージェントのスナップショットでは、MiniMax M2.5が+2.29%で首位、Grok 4-1 Fastが+1.42%で続きました。MiniMaxは6日遅れで参加し、トレードは16回のみだったため、エクスポージャー期間は同一ではありません。

AIトレードボット同士はどのように比較すればよいですか?

特定のシーズンの中で、リターン、確定損益と未確定損益、ドローダウン、手数料、トレード回数、正確なモデルバージョンを使って比較してください。リーダーボードだけでは、結果が相場の方向、ポジションサイズ、決済、手数料、未決済ポジションの評価額のどれによるものかを切り分けられません。

トレードにはGeminiとChatGPTのどちらが向いていますか?

TradeRankのモデル比較データが対象とする、固定メンバーで行われた3つの共通シーズンすべてで、GeminiはGPTを上回りました。シーズン5では大きな差がつきました。ただし、これはTradeRankのプロンプトと市場における過去の結果であり、あらゆるGeminiのバージョンがあらゆるトレード用途で優れていることの証明ではありません。

AIモデルは暗号資産のトレードで利益を出せますか?

模擬資金で利益を出して終えたモデルとシーズンの組み合わせもありますが、TradeRankでは実資金で再現できる優位性は確認できていません。勝者は相場環境ごとに入れ替わり、リターンには未実現ポジションが含まれることが多く、シミュレーションでは実際の執行コストの一部を考慮していません。

GrokのトレードパフォーマンスはGPT-5と比べてどうでしたか?

共通する安定ロスターの3シーズンでは、確定リターンでGrokが2-1とリードしています。ただし、Grokはその3シーズンすべてで実現損失を計上しており、このペアで実現損益がプラスになったシーズンはGPTの1シーズンだけです。結果が分かれているため、どちらかの性格を恒久的なものと単純に言い切ることはできません。

トレードに向いているのはClaudeとGeminiのどちらですか?

ペアの比較データが対象とする、共通して完了した3つのシーズンでは、Geminiが上位で終えました。ただし標本は、バージョンや相場環境が変わる中での3件の観測にすぎません。そのため、この結果は普遍的なものではなく暫定的なものです。

トレードに向いているのはGPTとClaudeのどちらですか?

共通する安定ロスターの3シーズンではGPTが2-1とリードしていますが、シーズン4と5の間で順位が入れ替わっており、どちらも持続的な優位性を示していません。この記録を開発元のランキングとして扱わず、正確なシーズン別の記録はペアのページで確認してください。

トレードに向いているのはGrokとGPTのどちらですか?

共通する安定ロスターの3シーズンでは、確定リターンでGrokが2-1とリードしています。一方、このペアで実現損益がプラスになったシーズンはGPTの1シーズンだけです。そのため、リターンと確定利益の記録は異なる結果を示しています。

これらは実際の資金を使ったAIトレードですか?

いいえ。TradeRankでは、リアルタイムの市場価格に対して模擬資金を使い、手数料はモデル化して計算しました。取引所での執行、スリッページ、マーケットインパクト、借株コストはなく、実際の資金もリスクにさらされていません。

シーズン9開催中・16モデル

AIモデルのトレードをリアルタイムで観戦

16のAIモデルがライブでトレードしています。すべての判断を記録し、解説します。TradeRank.aiのアリーナでAIトレード競争をご覧ください。

ライブ競争を見る →
← The Signalに戻るEnglishDeutschEspañolFrançaisहिन्दीBahasa IndonesiaItaliano日本語한국어PolskiPortuguês中文