GPT、Claude、Gemini与Grok:哪个AI最会交易加密货币?

已结束的TradeRank赛季产生了不同的冠军。本文将第5赛季的旗舰模型结果与更早的第2赛季快照区分开来,并解释为什么这两者都不能作为永久性的模型排名。

数据要点

TradeRank Arena概览(截至2026-09-12):自2026年1月以来,56个AI模型已在9个赛季中进行交易——共2,826笔交易,$910K模拟资金,46.2%的模型赛季实现盈利。本文将第5赛季的结论与第2赛季的存档证据进行对比;当前排名请查看实时LLM交易基准

数据要点

第5赛季只是一个赛季。如需并排查看每个已结束的赛季,请阅读八个赛季的LLM模拟交易究竟说明了什么

警告

这些是以实时市场价格交易、并计入模拟手续费的模拟账户。不涉及交易所执行、滑点、市场冲击或借券成本,也不涉及真实资金风险。这是一项行为基准测试,不构成投资建议,也不是真实资金的业绩记录。

第5赛季旗舰模型对比

第5赛季于2026年5月23日至6月20日进行,涵盖十种加密货币。所有可交易资产均下跌,跌幅约为8%至32%。Gemini 3.5 Flash以+13.76%位列第一,这是截至第7赛季TradeRank存档中已结束赛季的最高回报。

这一结果需要结合账目来看。Gemini在下跌过程中一直持有空头,收盘时大部分收益仍未实现。Claude录得正的已实现盈亏,但由于未平仓头寸的市值变动对其不利,最终排名第六。Grok和GPT基本持平。表格列出的是最终回报排名,并不对研究质量或服务成本进行排名。

之后的赛季又换了冠军。已结束的赛季请查看报告存档,第8赛季请查看实时排行榜,不要把6月的这个结果当作当前结论。

第5赛季:冠军与旗舰模型家族

模型提供商回报排名
Gemini 3.5 FlashGoogle+13.76%第1名
Claude Opus 4.7Anthropic+2.67%第6名
Grok 4.3xAI+0.48%第7名
GPT-5.5OpenAI+0.38%第8名

两两对比结论

当问题指明一对模型和一个时间窗口时,已完成赛季的记录更有参考价值。对比中心链接到有数据支撑的两两对比页面;实时基准回答的是关于当前参赛阵容的另一个问题。

Claude vs Gemini。在配对证据涵盖的三个共同稳定阵容赛季中,Gemini每次都排在前面。第5赛季差距最大,为+13.76%对+2.67%。这支持的是一个回顾性的一对一领先,而不是对每个Gemini和Claude版本的普遍结论。

GPT vs Claude。GPT在双方三个赛季的正面交锋中以2-1领先,但第4和第5赛季之间名次互换,且两者都未进入第5赛季前三。样本太小,模型版本变动太大,无法据此得出持久优势。

Grok vs GPT。按最终收益计算,Grok在双方三个共同赛季中以2-1领先。然而Grok三个赛季都录得已实现亏损,而GPT录得了这组对比中唯一一个已实现盈利的赛季。因此,收益记录和已结算现金记录反映的是不同的情况。

为什么通用基准测试无法回答这个问题

能力基准测试并不衡量投资组合的执行。交易还涉及仓位规模、手续费、依赖路径的账户状态,以及选择不操作的权利。一个模型可以在知识或编程测试中得分很高,却仍在交易实验中落后于另一个模型。

TradeRank统一的是环境,而不是声称输入完全相同。参赛模型以相同的任务、约束、资产范围和覆盖全部资产的特征表开始。之后它们的上下文会出现差异,因为每个模型都会收到自己的持仓、延续下来的交易论点状态,以及与该账户相关标的的更完整K线历史数据。每一个决策都有记录,因此这些差异可以检查。

这一设置衡量的是在同一套共享规则下的相对自主行为。它不能单独衡量抽象智能,不能证明因果关系,也不能测试每家厂商的最佳定制提示词。

冻结的第2赛季快照

本文最初版本分析的是第2赛季2026年2月22日的截止数据。当时十三个参赛账户已完成56个六小时周期,覆盖89种资产,共记录656笔交易。比赛仍在进行,因此本节所有数字都是第14天的快照,而不是第2赛季的最终结果。

下面四个主智能体的数据说明了早期结论为何与第5赛季不同。MiniMax晚六天加入,截止时仅凭16笔交易领先。Grok是另一个盈利的主智能体。Gemini和GPT均小幅亏损,尽管GPT报告的胜率最高。

第2赛季第14天主智能体快照

模型回报胜率交易数最大回撤手续费
MiniMax M2.5+2.29%33%160.88%$17.64
Grok 4-1 Fast+1.42%31%372.35%$37.25
Gemini 3.0 Flash-0.44%38%533.88%$49.58
GPT-5 Mini-0.67%55%382.88%$28.50

快照实际说明了什么

胜率并不能决定账户排名。GPT在表中报告的胜率最高,却在这四个账户中排名最后。数据无法给出理想的胜率,因为盈亏幅度同样决定收益。

在这个截止点,低交易频率与领先同时出现。MiniMax交易16笔,Gemini交易53笔。这种关联不能推广:之后一项覆盖22个模型赛季的分析发现,交易次数与收益几乎不相关。六小时周期是第2赛季的设计选择,并非经过检验的最优值。

手续费影响明显,但不能完全解释结果。Gemini支付了$49.58,约占初始资金的0.50%。把这笔模拟手续费加回去(其总结果为-$44),其扣费前的算术结果会略高于零,但这种假设性的推算并不能抹去产生这些手续费的交易行为。

起步较晚限制了MiniMax的可比性。MiniMax错过了前六天,因此它的+2.29%并非来自与第1天参赛者相同的持仓窗口。快照记录了结果,但无法判断领先源于耐心、资产选择、较短的窗口还是运气。

反向智能体的结果

第2赛季还将几个基础账户与反转开仓方向的智能体配对。在2月22日截止时,基础DeepSeek为-3.39%,反向DeepSeek为+2.64%,相差6.03个百分点。基础Qwen为-1.63%,反向Qwen为+1.18%。反向Kimi则走向相反方向,跌至-6.70%,而基础Kimi为-0.76%。

这些数据表明,在这个窗口内,反转改变了结果。但它们不能证明基础模型一贯判断错误,也不能证明反转是可利用的信号。反转还会改变持仓、后续上下文、交易次数和手续费,因此它并不是在一个其他条件完全相同的账户上简单翻转标签。已归档的实验见反向智能体分析

第2赛季第14天基础与反向收益

基础模型家族基础收益反向收益差值
Claude-3.26%-2.70%+0.56个百分点
DeepSeek-3.39%+2.64%+6.03个百分点
Qwen-1.63%+1.18%+2.81个百分点
Kimi-0.76%-6.70%-5.94个百分点

方法论与局限

第2赛季使用$10,000模拟初始资金、统一的资产池、按0.1%建模的手续费,不加杠杆,每天安排四个决策窗口。模型先看到一张压缩的资产池表格,再获取所选或持有标的的更详细数据。存档规则会校验所提供止损的方向,但并不要求当前的失效规则。

主要局限在于窗口期短、模型版本不断变化、市场行情各异,以及按市值计价的收益可能包含未平仓头寸。账户使用实时价格,但未模拟滑点、市场冲击、借券成本或真实成交。完整的现行方法论见TradeRank如何运作

站得住脚的结论范围很窄:Gemini赢得了第5赛季的加密货币比赛,而其他赛季以及更早的第2赛季快照产生了不同的领先者。没有哪个模型家族确立了可靠的自主加密货币交易优势。

去哪里核查记录

查看第5赛季复盘,了解Gemini获胜背后的已实现与未实现盈亏明细;查看对比中心,了解逐对的已完结赛季证据;查看实时LLM交易基准,了解当前参赛阵容。这些页面对应不同的时间窗口;脱离各自的日期把它们合在一起,会得出证据并不支持的排名。

这些列表中使用的版本标签以各模型家族自己的目录为准:OpenAI模型Anthropic Claude模型Google Gemini模型xAI文档

常见问题

哪个AI交易加密货币最好?

Gemini 3.5 Flash以+13.76%赢得TradeRank第5赛季,在该赛季中领先Claude、Grok和GPT。之后的赛季产生了不同的冠军,因此这一结果只说明谁是第5赛季冠军,并不代表它是永远更强的加密货币交易者。

ChatGPT适合用来交易吗?

TradeRank尚未证明ChatGPT拥有持久的交易优势。GPT-5.5以+0.38%结束第5赛季,而在更早的2月22日第2赛季快照中,GPT-5 Mini尽管报告胜率为55%,收益仍为-0.67%。把模型输出当作需要你核实的研究,而不是自动信号。

Claude能帮助做交易决策吗?

Claude可以帮你梳理或质疑一项分析,但竞技场并不能证明它能提高收益。Claude Opus 4.7以+2.67%结束第5赛季;在2月22日第2赛季截止时,更早的Claude Haiku账户开了十个仓位,一个也没有平仓。把执行和风控放在聊天之外。

在2月22日的正面对比快照中,哪个模型领先?

在第2赛季第14天的主智能体快照中,MiniMax M2.5以+2.29%领先,Grok 4-1 Fast以+1.42%紧随其后。MiniMax晚加入了六天,只有16笔交易,因此各自的持仓暴露窗口并不相同。

AI交易机器人之间如何比较?

在指定赛季内比较它们,看收益、已实现和未实现盈亏、回撤、手续费、交易次数以及确切的模型版本。仅凭排行榜无法分辨结果究竟来自市场方向、仓位大小、离场、手续费还是未平仓估值。

交易方面,Gemini和ChatGPT哪个更好?

在TradeRank逐对证据覆盖的三个共同稳定阵容赛季中,Gemini都排在GPT之前,其中第5赛季差距很大。这是基于TradeRank的提示词和市场得出的回溯性结果,并不能证明每个Gemini版本在每项交易任务上都更好。

AI模型能通过交易加密货币盈利吗?

部分模型在某些赛季用模拟资金实现了盈利,但TradeRank尚未证明存在可重复的实盘优势。不同市场环境下的赢家各不相同,收益常常包含未实现的持仓,而且模拟省略了若干真实成交成本。

与GPT-5相比,Grok的交易表现如何?

在双方共同参加的三个稳定阵容赛季中,按最终收益Grok以2-1领先,但它在每个赛季都录得已实现亏损,而GPT贡献了这组对比中唯一一个已实现盈亏为正的赛季。这份相互矛盾的账面记录不足以支持简单且一成不变的交易性格结论。

Claude和Gemini哪个更适合交易?

在对比数据覆盖的三个共同完成的赛季中,Gemini排名更靠前。但样本只有三个观测值,且横跨不同的模型版本和市场状态,因此这一结果只是暂定的,并不普遍适用。

GPT和Claude哪个更适合交易?

在两者共同参加的三个固定阵容赛季中,GPT以2-1领先,但排名在第4和第5赛季之间发生了反转,双方都没有建立起持久的优势。请查看对比页面上逐个赛季的具体记录,不要把这一战绩当作厂商排名。

Grok和GPT哪个更适合交易?

在两者共同参加的三个固定阵容赛季中,Grok以最终收益2-1领先。GPT则拥有这组对比中唯一一个已实现收益为正的赛季,因此收益记录和已实现利润记录指向了不同的方向。

这些是真实资金的AI交易吗?

不是。TradeRank使用模拟资金,按实时市场价格交易,并计入模型化的手续费。没有交易所执行,也没有滑点、市场冲击、借券成本或真实资金风险。

第9赛季进行中 · 16个模型

实时观看AI模型交易

16个AI模型正在实盘交易,每个决策都有记录和解释。在TradeRank.ai竞技场关注这场AI交易竞赛。

查看实时竞赛 →
← 返回The SignalEnglish中文