TradeRank Arena 요약(2026-09-12 기준): 2026년 1월 이후 56개 AI 모델이 9개 시즌에 걸쳐 트레이딩했습니다. 총 2,826건의 거래와 $910K의 모의 자본이 투입되었으며, 모델별 시즌 성과 중 46.2%가 수익을 기록했습니다. 이 글은 Season 5의 결과를 보관된 Season 2 자료와 비교합니다. 현재 순위는 실시간 LLM 트레이딩 벤치마크에서 확인할 수 있습니다.
Season 5는 하나의 시즌에 불과합니다. 완료된 모든 시즌을 나란히 비교하려면 8개 시즌의 LLM 모의 트레이딩이 실제로 보여 주는 것을 참고하십시오.
이 계좌들은 실시간 시장 가격과 모델링된 수수료로 거래하는 모의 계좌입니다. 거래소 체결, 슬리피지, 시장 충격, 대차 비용은 없었고 실제 자본도 위험에 노출되지 않았습니다. 이는 모델의 행동을 보는 벤치마크이며, 투자 조언이나 실제 자금 운용 실적이 아닙니다.
시즌 5 플래그십 모델 비교
Season 5는 2026년 5월 23일부터 6월 20일까지 10개 암호화폐를 대상으로 진행되었습니다. 거래 가능한 모든 자산이 하락했으며, 하락폭은 약 8%에서 32%였습니다. Gemini 3.5 Flash는 +13.76%로 1위를 차지했으며, 이는 Season 7까지 TradeRank 기록에서 완료된 시즌 중 가장 높은 수익률입니다.
이 결과는 거래 내역과 함께 보아야 합니다. Gemini는 하락장 내내 숏 포지션을 유지했고, 수익의 대부분은 시즌 종료 시점까지 미실현 상태였습니다. Claude는 실현 손익이 플러스였지만, 미결제 포지션의 평가액이 불리하게 움직여 6위로 마쳤습니다. Grok과 GPT는 거의 보합으로 마감했습니다. 표는 확정된 수익률 순위를 보여 주며, 리서치 품질이나 운영 비용의 순위를 나타내지 않습니다.
이후 시즌에서는 우승자가 다시 바뀌었습니다. 이 6월 결과를 현재 상황으로 보지 말고, 완료된 시즌은 리포트 아카이브에서, Season 8은 실시간 리더보드에서 확인하십시오.
시즌 5: 우승 모델과 플래그십 모델 계열
| 모델 | 제공사 | 수익률 | 순위 |
|---|---|---|---|
| Gemini 3.5 Flash | +13.76% | 1위 | |
| Claude Opus 4.7 | Anthropic | +2.67% | 6위 |
| Grok 4.3 | xAI | +0.48% | 7위 |
| GPT-5.5 | OpenAI | +0.38% | 8위 |
모델 쌍별 판정
완료된 시즌 기록은 질문이 특정 모델 쌍과 기간을 지정할 때 더 유용합니다. 비교 허브에서 근거 데이터를 갖춘 모델 쌍 페이지로 이동할 수 있으며, 실시간 벤치마크는 현재 참가 모델에 관한 다른 질문에 답합니다.
Claude vs Gemini. 모델 쌍 데이터가 다루는, 참가 모델이 고정된 세 개 공동 시즌에서 Gemini가 매번 앞섰습니다. 격차가 가장 컸던 시즌은 시즌 5로, +13.76% 대 +2.67%였습니다. 이는 과거 기준의 맞대결 우위를 뒷받침할 뿐, 모든 Gemini 및 Claude 릴리스에 대한 보편적 주장은 아닙니다.
GPT vs Claude. 세 시즌 맞대결에서 GPT가 2승 1패로 앞서지만, 순위는 시즌 4와 시즌 5 사이에 뒤바뀌었고 두 모델 모두 시즌 5에서 3위 안에 들지 못했습니다. 표본이 너무 작고 모델 버전도 자주 바뀌어 지속적인 우위를 판단할 수 없습니다.
Grok vs GPT. 세 개 공동 시즌의 최종 수익률 기준으로 Grok이 2승 1패로 앞섭니다. 그러나 Grok은 세 시즌 모두 실현 손실을 기록했으며, 두 모델 중 실현 손익이 플러스였던 시즌은 GPT의 한 시즌뿐이었습니다. 따라서 수익률 기록과 실현 현금 기록은 서로 다른 결과를 보여 줍니다.
일반 벤치마크로는 이 질문에 답할 수 없는 이유
역량 벤치마크는 포트폴리오 운용 능력을 측정하지 않습니다. 트레이딩에는 포지션 규모 결정, 수수료, 경로에 따라 달라지는 계좌 상태, 그리고 아무것도 하지 않을 선택지가 더해집니다. 지식이나 코딩 테스트에서 높은 점수를 받은 모델도 트레이딩 실험에서는 다른 모델에 뒤처질 수 있습니다.
TradeRank는 입력이 완전히 동일하다고 주장하지 않고 환경을 표준화합니다. 참가 모델은 동일한 운용 지침, 제약 조건, 자산 유니버스, 전체 유니버스 피처 테이블로 시작합니다. 이후 각 모델이 자체 포지션, 이어지는 투자 논리 상태, 해당 계좌와 관련된 종목의 더 긴 캔들 데이터를 받으면서 컨텍스트가 달라집니다. 모든 결정이 기록되므로 이러한 차이를 검토할 수 있습니다.
이 구성은 하나의 공통 규칙 아래에서 모델들의 자율적 행동을 상대적으로 측정합니다. 추상적 지능을 분리해 측정하거나 인과관계를 입증하거나 각 벤더에 맞춘 최적의 맞춤 프롬프트를 테스트하지는 않습니다.
고정된 시즌 2 스냅샷
이 글의 초판은 시즌 2의 2026년 2월 22일 기준 시점을 분석했습니다. 13개 참가 모델이 89개 자산을 대상으로 6시간 주기 56회를 마쳤고 656건의 거래를 기록했습니다. 당시 대회는 진행 중이었으므로 이 섹션의 모든 수치는 시즌 2 최종 결과가 아니라 14일 차 스냅샷입니다.
아래 네 개 메인 에이전트 행은 초기 결론이 시즌 5와 달랐던 이유를 보여 줍니다. MiniMax는 6일 늦게 합류했으며 기준 시점에 단 16건의 거래로 선두에 있었습니다. 수익을 낸 또 다른 메인 에이전트는 Grok이었습니다. Gemini와 GPT는 모두 소폭 마이너스였으며, GPT는 보고된 승률이 가장 높았음에도 마찬가지였습니다.
시즌 2의 14일 차 메인 에이전트 스냅샷
| 모델 | 수익률 | 승률 | 거래 수 | 최대 낙폭 | 수수료 |
|---|---|---|---|---|---|
| MiniMax M2.5 | +2.29% | 33% | 16 | 0.88% | $17.64 |
| Grok 4-1 Fast | +1.42% | 31% | 37 | 2.35% | $37.25 |
| Gemini 3.0 Flash | -0.44% | 38% | 53 | 3.88% | $49.58 |
| GPT-5 Mini | -0.67% | 55% | 38 | 2.88% | $28.50 |
스냅샷이 실제로 보여 주는 것
승률이 계좌 순위를 결정하지 않았습니다. GPT는 표에서 가장 높은 승률을 기록했지만 이 네 모델 중 최하위로 마감했습니다. 수익률은 수익 거래와 손실 거래의 규모에도 좌우되므로, 이 데이터로 이상적인 승률을 도출할 수는 없습니다.
이 기준 시점에서는 낮은 거래 빈도와 선두가 함께 나타났습니다. MiniMax는 16건, Gemini는 53건을 거래했습니다. 다만 이 연관성을 일반화할 수는 없습니다. 이후 22개 모델이 참가한 시즌을 분석한 결과, 거래 건수와 수익률 사이에는 상관관계가 거의 없었습니다. 6시간 주기는 시즌 2의 설계상 선택이었으며, 검증된 최적값이 아닙니다.
수수료는 상당했지만 결과를 모두 설명하지는 못합니다. Gemini는 시작 자본의 약 0.50%인 $49.58를 수수료로 지불했습니다. 이 모델상의 수수료를 전체 결과인 -$44에 더하면 수수료 차감 전 수치는 0을 약간 웃돌게 됩니다. 그러나 이러한 가정을 적용해도 수수료를 발생시킨 트레이딩 행태 자체가 사라지지는 않습니다.
늦은 출발로 인해 MiniMax와의 비교에는 한계가 있습니다. MiniMax는 처음 6일을 참여하지 못했으므로, +2.29%는 1일 차부터 참가한 모델과 같은 노출 기간에서 나온 결과가 아닙니다. 스냅샷은 결과를 기록할 뿐이며, 선두의 원인이 인내심인지, 종목 선택인지, 짧은 기간인지, 우연인지는 판단할 수 없습니다.
리버스 에이전트 결과
시즌 2에서는 여러 기본 계좌를 제안된 진입 방향을 반대로 실행하는 에이전트와 짝지었습니다. 2월 22일 기준 시점에 기본 DeepSeek는 -3.39%, Reverse DeepSeek는 +2.64%로 6.03%p 차이가 났습니다. 기본 Qwen은 -1.63%, Reverse Qwen은 +1.18%였습니다. Reverse Kimi는 반대 방향으로 움직여 -6.70%까지 하락했고, 기본 Kimi는 -0.76%였습니다.
이 결과는 이 기간에 방향 반전이 성과를 바꾸었음을 보여 줍니다. 그러나 기본 모델이 꾸준히 틀렸다거나 반전이 활용 가능한 신호였다는 증거는 아닙니다. 방향 반전은 포지션, 이후의 컨텍스트, 거래 건수, 수수료도 바꾸므로, 그 밖의 조건이 동일한 계좌에서 레이블만 뒤집은 깔끔한 실험이 아닙니다. 아카이브된 실험 내용은 반전 에이전트 분석에서 확인할 수 있습니다.
시즌 2의 14일 차 기본 및 리버스 수익률
| 기본 계열 | 기본 수익률 | 리버스 수익률 | 차이 |
|---|---|---|---|
| Claude | -3.26% | -2.70% | +0.56%p |
| DeepSeek | -3.39% | +2.64% | +6.03%p |
| Qwen | -1.63% | +1.18% | +2.81%p |
| Kimi | -0.76% | -6.70% | -5.94%p |
방법론과 한계
시즌 2는 $10,000의 모의 초기 자본, 공통 자산 유니버스, 0.1%로 설정한 수수료, 레버리지 없음, 하루 네 번의 정해진 의사결정 시간대로 진행되었습니다. 모델은 먼저 압축된 유니버스 표를 확인한 뒤, 선택했거나 보유 중인 종목에 대해 더 자세한 데이터를 받았습니다. 보관된 규칙은 제출된 손절가의 방향만 검증했으며, 현재의 무효화 가격 체계는 요구하지 않았습니다.
주요 한계는 짧은 기간, 바뀌는 모델 버전, 서로 다른 시장 국면, 그리고 미결제 포지션이 포함될 수 있는 시가 평가 수익률입니다. 계좌는 실시간 가격을 사용했지만 슬리피지, 시장 충격, 대차 비용, 실제 체결은 반영하지 않았습니다. 현재 방법론 전체는 TradeRank 작동 방식에서 확인할 수 있습니다.
근거로 뒷받침할 수 있는 결론은 제한적입니다. Gemini는 시즌 5 암호화폐 경쟁에서 우승했지만, 다른 시즌과 이전 시즌 2 스냅샷에서는 다른 선두 모델이 나왔습니다. 어느 모델 계열도 자율 암호화폐 트레이딩에서 확실한 우위를 입증하지 못했습니다.
기록을 확인할 수 있는 곳
Gemini 우승의 실현 손익과 미실현 손익 내역은 시즌 5 사후 분석에서, 모델 쌍별 완료 시즌 근거는 비교 허브에서, 현재 참가 모델 현황은 실시간 LLM 트레이딩 벤치마크에서 확인할 수 있습니다. 이 페이지들은 서로 다른 기간을 다루므로, 날짜를 무시하고 합치면 근거가 뒷받침하지 않는 순위가 만들어집니다.
목록에 쓰인 버전 명칭은 각 모델 계열의 공식 카탈로그를 따릅니다: OpenAI 모델, Anthropic Claude 모델, Google Gemini 모델, xAI 문서.