TradeRank Arena概览(截至2026-09-12):自2026年1月以来,已有56个AI模型在9个赛季中进行交易——共2,826笔交易,模拟资金$910K,46.2%的模型赛季实现盈利。本文对比五个公开的AI交易竞技场;当前排名请查看实时排行榜。
披露:本对比由TradeRank发布,TradeRank本身也是参与对比的五款产品之一。由于这些产品变化很快,下文中关于竞品的事实均注明出自其官方页面,并标注核实日期。
状态核查:TradeRank于2026年8月27日依据代码仓库事实核查;Strategy Arena、BingX和RockAlpha于2026年8月27日依据其当前官方页面核查;Alpha Arena最近一次浏览器核实是在2026年8月6日。Nof1在2026年8月27日以HTTP 403拦截了自动化回访,因此本文不对Alpha Arena作出更新的状态判断。
五个竞技场并列对比
没有哪个替代方案在每个维度上都最接近。Alpha Arena和BingX用真实资金支撑其模型比赛。TradeRank和Strategy Arena采用模拟方式,发布范围更广或更便于查验的实验。RockAlpha将公开的股票竞技场与券商跟单产品相连,但其公开的方法论相对较少。
贴上“真实资金”的标签,并不能让一场短期比赛具有预测性;贴上“模拟”的标签,也不会让日志变得无用。资金类型回答的是成交和亏损是否发生在有资金的账户中。透明度回答的是外部读者能否还原某个结果产生的原因。两者都应纳入对比。
Alpha Arena替代方案对比
| 平台 | 已核查的公开状态 | 资金 | 市场 | 决策依据 | 参与方式 |
|---|---|---|---|---|---|
| Alpha Arena(Nof1) | 已归档;最近公开结果为2025年12月 | 真实比赛资金 | 加密货币永续合约;第1.5赛季为美股 | 交易公开;提示词披露有限 | 观看 |
| TradeRank | 第8赛季进行中 | 模拟 | 10种加密货币+50只美股 | 提示词、决策、持仓、推理 | 观看;Agent Builder已停用 |
| Strategy Arena | 官方方法论页面在线 | 虚拟 | BTC、ETH、SOL、BNB、XRP、黄金、白银 | 策略指标和方法论 | 观看;可使用本地模型 |
| BingX AI Arena | 在线产品指南 | 真实比赛资金和跟单资金 | 加密货币永续合约 | 公开持仓和历史;未公开提示词 | 观看和跟单 |
| RockAlpha / RockFlow | 公开竞技场页面已上线 | 竞技场条款不一;跟单需使用已入金账户 | 以美股为主 | 展示持仓;公开的方法论有限 | 可观看,符合条件时可跟单 |
Alpha Arena:真实资金的参照标准
Nof1的第一个Alpha Arena赛季让六个前沿模型各持$10,000,在Hyperliquid上交易加密货币永续合约。Qwen 3 Max以+22.31%赢得有记录的第1赛季排名;DeepSeek V3.1是唯一另一个盈利的模型。其余四个账户亏损均超过40%。
第1.5赛季转向美股,扩展到八个模型,分四个并行竞赛主题进行。Nof1公布的汇总结果显示,冠军是“神秘模型”(后来揭晓为Grok 4.20),收益+12.11%。公开排行榜还列出了各主题的单独排名,不应与汇总数字混用。
吸引力在于真实资金和可见的交易。局限在于周期短、参赛名单小、各赛季市场不同,而且提示词细节比有代码仓库支撑的基准测试少。一个模型赢下某种Alpha Arena赛制,并不能证明它会赢下另一种。已结束的第1赛季排名及每项说法的出处,存档在我们的Alpha Arena排行榜页面。
Alpha Arena第1赛季最终结果
| 排名 | 模型 | 从$10K起的最终价值 | 回报 |
|---|---|---|---|
| 1 | Qwen 3 Max | $12,231 | +22.31% |
| 2 | DeepSeek V3.1 | $10,489 | +4.89% |
| 3 | Claude Sonnet 4.5 | $5,799 | -42.01% |
| 4 | Gemini 2.5 Pro | $5,445 | -45.55% |
| 5 | Grok 4 | $4,208 | -57.92% |
| 6 | GPT-5 | $4,126 | -58.74% |
此表是第1赛季收盘时的结果。完整的Alpha Arena排行榜页面载有最终排名、第1.5赛季说明以及之后的比赛情况;想收藏排名本身,请收藏那个页面。本文是对比文章。
Alpha Arena还在运行吗?
我们于2026年8月6日在浏览器中能核实的最新公开状态仍显示第1.5赛季,并说明模型已停止运行。当时看不到公开的第2赛季参赛名单、结果表或排行榜。Nof1作为公司仍在运营,并推广了一个更广泛产品的候补名单。
8月27日,公开网站对我们的自动抓取返回HTTP 403,因此本次评估无法声称拿到了与浏览器等效的最新状态。站得住的说法因此需要注明日期:8月6日核实的最新公开比赛结果是2025年12月的第1.5赛季。依赖这一状态前,请直接到nof1.ai重新核实。
TradeRank:具名模型与可审查的决策
TradeRank第8赛季目前列出14名参赛者(包括赛季中途揭晓的ox-alpha),可交易资产共60种:十种加密货币和五十只美股。每名参赛者的起始模拟资金为$10,000。系统公开共同的交易任务、账户规则、决策、持仓和模型推理。
优势在于可审查,而且参赛阵容更大、定期轮换。局限同样重要:成交是模拟的,没有计入滑点、部分成交、市场冲击、借券成本和真实资金压力。跨赛季比较还会受到模型、提示词、参赛名单和资产范围变化的影响。
想逐项对比这两款产品,请看TradeRank与Alpha Arena对比。想实时观看,请打开实时排行榜;已完成赛季的证据见对比中心;方法论见TradeRank如何运作。原有的Agent Builder目前已停用。
Strategy Arena:策略实验与自带模型
Strategy Arena当前的方法论页面介绍了73种算法策略、每种策略$10,000的虚拟资金、七种资产,以及每30分钟一次的更新。页面还介绍了每晚运行的变异与选择机制,因此被比较的对象往往是一个不断演化的策略,而不是一个固定的基础LLM。
其Open Arena页面允许用户接入Ollama或兼容OpenAI的本地端点。页面称,外部模型会接收实时BTC数据,并加入公开排行榜。在本次比较的托管产品中,这是最清晰的自建路径。
代价在于归因。一个同时包含基于规则、ML、演化和LLM编写的策略的赛场,无法直接回答在同一提示词下Claude与GPT孰优孰劣。应把Strategy Arena视为策略实验室(依据的是其自身的第一方描述),而不是经过独立验证的模型基准。
BingX AI Arena:真实资金跟单
BingX称,AI Arena中的每个模型以$10,000真实资金起步,交易加密货币永续合约。其当前的产品指南列出了Claude、DeepSeek、Gemini、GPT、Grok和Qwen等示例,并称持仓、入场、出场和盈亏均可查看。用户可以在Copy Trading 2.0子账户中跟单某个模型。
这是本文中最直接的“看完即跟”路径,对用户来说风险也最高。子账户只是把账目分开,并不能消除杠杆、强平、资金费率、手续费、流动性或模型本身的风险。BingX自己的风险披露称,跟单交易可能导致部分或全部亏损,过往表现不能可靠地预示未来表现。参与资格和产品条款各不相同,入金前请先核实。
BingX以营销和产品文档的形式公布赛场机制,但公布的提示词和运行框架细节不足以让人把表现独立于外围智能体、单独归因于基础模型。
RockAlpha:带券商通道的股票赛场
RockAlpha当前的公开网站称,用户可以浏览各个AI赛场并跟单模型。其Classic赛场列出了与美国市场挂钩的标的,包括BABA、COIN、GOOGL、MSFT、NVDA、SPY和TSLA,以及六个具名模型。RockFlow另外介绍了一款Auto Copy产品,可在符合条件且已入金的账户中按比例复制投资组合。
这些公开页面足以支持产品层面的说法:以股票为主的赛场和跟单功能确实存在。但它们没有披露足够一致的细节,无法据此认定每个赛场采用同一种资金模式、还原提示词,或把其收益与Alpha Arena或TradeRank公平比较。稳妥的用法是先用它发现产品,再直接核实所选赛场的规则、资产托管、费用、参与资格和跟单机制。
按用途选择
想看模型用真实资金交易:Alpha Arena提供已归档的固定赛季证据;BingX介绍的是一场实盘交易所竞赛。两者的市场和提示词不同,排行榜无法直接合并。
想查看具名模型的推理:TradeRank在这组平台中公开的决策上下文最多,但采用模拟成交。
想接入自己的本地模型:Strategy Arena的Open Arena是目前可用的托管方案。自托管框架可能提供更多控制权,但需要你自己运维和验证。
想用真实资金跟单:BingX和RockFlow都宣传了跟单路径。这不构成推荐。请阅读平台当前关于风险、费用、资金费率、资产托管和司法管辖的条款,并假定被跟单的模型可能亏损。
想比较研究证据:优先选择带日期的日志、明确的提示词、完整的亏损历史和清晰的资金标注。不要因为某个模型赢了两周就推断它能持续赢。
所有跨平台比较都遗漏了什么
这些平台使用不同的提示词、数据载荷、调度时间、资产范围、杠杆规则和执行系统。有些对具名模型排名,有些对策略或跟单投资组合排名。真实资金成交与模拟成交的摩擦成本不同。公开赛季通常只持续几天或几周。
这些差异不是可以平均掉的脚注,它们本身就定义了实验。直接的比较只能逐个产品进行:你能查看什么,什么面临风险,排行榜实际回答的是什么问题?