TradeRank Arena w skrócie (stan na 2026-09-12): od stycznia 2026 r. 56 modeli AI handlowało w 9 sezonach — 2 826 transakcji, 910 tys. $ symulowanego kapitału, 46,2% zyskownych startów modeli w sezonach. Ten artykuł zestawia werdykt z sezonu 5 z archiwalnymi danymi z sezonu 2. Aktualną klasyfikację znajdziesz w benchmarku handlu LLM na żywo.
Sezon 5 to tylko jeden sezon. Zestawienie wszystkich zakończonych sezonów znajdziesz w artykule co naprawdę pokazuje osiem sezonów symulowanego handlu LLM.
To symulowane konta handlujące po bieżących cenach rynkowych z modelowanymi opłatami. Nie było realizacji zleceń na giełdzie, poślizgu cenowego, wpływu na rynek, kosztów pożyczki ani ryzyka utraty prawdziwego kapitału. To benchmark zachowań modeli, a nie porada finansowa ani historia wyników na prawdziwych pieniądzach.
Porównanie flagowych modeli w sezonie 5
Sezon 5 trwał od 23 maja do 20 czerwca 2026 r. i obejmował dziesięć kryptowalut. Wszystkie dostępne aktywa straciły, od około 8% do 32%. Gemini 3.5 Flash zajął 1. miejsce z wynikiem +13,76%, najwyższym zwrotem w zakończonym sezonie w archiwum TradeRank do sezonu 7 włącznie.
Ten wynik trzeba czytać razem z księgą transakcji. Gemini utrzymywał pozycje krótkie przez cały spadek, a większość zysku pozostała niezrealizowana w chwili zamknięcia. Claude zaksięgował dodatni zrealizowany wynik (P&L), ale skończył na 6. miejscu, bo wycena otwartych pozycji obróciła się przeciwko niemu. Grok i GPT zakończyły sezon niemal na zero. Tabela pokazuje ostateczny ranking zwrotów. Nie ocenia jakości analiz ani kosztu działania modeli.
W kolejnych sezonach zwycięzca znów się zmieniał. Zakończone sezony znajdziesz w archiwum raportów, a sezon 8 w rankingu na żywo. Nie traktuj tego czerwcowego wyniku jako aktualnego.
Sezon 5: zwycięzca i flagowe rodziny modeli
| Model | Dostawca | Zwrot | Miejsce |
|---|---|---|---|
| Gemini 3.5 Flash | +13,76% | 1. | |
| Claude Opus 4.7 | Anthropic | +2,67% | 6. |
| Grok 4.3 | xAI | +0,48% | 7. |
| GPT-5.5 | OpenAI | +0,38% | 8. |
Werdykty dla par
Zapis zakończonych sezonów jest bardziej przydatny, gdy pytanie dotyczy konkretnej pary i konkretnego okresu. Centrum porównań prowadzi do stron par opartych na danych, a benchmark na żywo odpowiada na inne pytanie: o obecną stawkę.
Claude kontra Gemini. Gemini wyprzedził Claude’a w każdym z trzech wspólnych sezonów ze stałym składem, które obejmują dane tej pary. Największa różnica padła w sezonie 5: +13,76% wobec +2,67%. To uzasadnia dotychczasową przewagę w bezpośrednich starciach, ale nie ogólne twierdzenie o każdej wersji Gemini i Claude.
GPT kontra Claude. GPT prowadzi w bezpośrednich starciach z trzech sezonów 2:1, ale kolejność odwróciła się między sezonami 4 i 5, a żaden z nich nie stanął na podium sezonu 5. Próba jest za mała, a wersje modeli zmieniają się zbyt często, by mówić o trwałej przewadze.
Grok kontra GPT. Grok prowadzi 2:1 pod względem ostatecznego zwrotu w trzech wspólnych sezonach. Mimo to we wszystkich trzech zanotował zrealizowaną stratę, a jedyny sezon z dodatnim zrealizowanym wynikiem w tej parze należy do GPT. Zwroty i rozliczona gotówka opowiadają więc różne historie.
Dlaczego ogólne benchmarki nie odpowiedzą na to pytanie
Benchmarki możliwości nie mierzą zarządzania portfelem. Handel dodaje wielkość pozycji, opłaty, stan konta zależny od wcześniejszych decyzji i możliwość niezrobienia niczego. Model może dobrze wypaść w testach wiedzy lub programowania, a mimo to skończyć eksperyment handlowy za innym modelem.
TradeRank ujednolica środowisko, ale nie twierdzi, że dane wejściowe są idealnie identyczne. Uczestnicy zaczynają z tym samym zadaniem, ograniczeniami, zbiorem aktywów i tabelą cech dla całego zbioru. Potem ich kontekst się rozchodzi, bo każdy dostaje własne pozycje, zapisany stan swojej tezy i dłuższą historię świec dla symboli istotnych dla danego konta. Każda decyzja jest zapisywana, więc te różnice możesz sprawdzić.
Taki układ mierzy względne autonomiczne zachowanie przy jednym wspólnym zestawie zasad. Nie wyodrębnia abstrakcyjnej inteligencji, nie dowodzi przyczynowości i nie testuje najlepszego własnego promptu dla każdego dostawcy.
Zamrożona migawka sezonu 2
Pierwotna wersja tego artykułu analizowała stan sezonu 2 na dzień 22 lutego 2026. Trzynastu uczestników ukończyło wtedy 56 sześciogodzinnych cykli na 89 aktywach i zarejestrowało 656 transakcji. Rywalizacja wciąż trwała, więc każda liczba w tej sekcji to migawka z 14. dnia, a nie końcowy wynik sezonu 2.
Cztery wiersze głównych agentów poniżej pokazują, dlaczego wczesny wniosek różnił się od sezonu 5. MiniMax dołączył sześć dni później i w dniu odcięcia prowadził, mając tylko 16 transakcji. Grok był drugim głównym agentem na plusie. Gemini i GPT miały lekko ujemne wyniki, choć GPT wykazywał najwyższą skuteczność.
Sezon 2, dzień 14: migawka głównych agentów
| Model | Zwrot | Skuteczność | Transakcje | Maks. obsunięcie | Opłaty |
|---|---|---|---|---|---|
| MiniMax M2.5 | +2,29% | 33% | 16 | 0,88% | 17,64 $ |
| Grok 4-1 Fast | +1,42% | 31% | 37 | 2,35% | 37,25 $ |
| Gemini 3.0 Flash | -0,44% | 38% | 53 | 3,88% | 49,58 $ |
| GPT-5 Mini | -0,67% | 55% | 38 | 2,88% | 28,50 $ |
Co naprawdę pokazuje migawka
Skuteczność nie wyznaczyła kolejności kont. GPT miał najwyższą skuteczność w tabeli, a skończył ostatni z tej czwórki. Dane nie wskazują idealnej skuteczności, bo o wyniku decyduje też wielkość zysków i strat.
W tym punkcie odcięcia prowadzenie szło w parze z niską aktywnością. MiniMax zawarł 16 transakcji, a Gemini 53. Tej zależności nie można uogólniać: późniejsza analiza sezonu z 22 modelami wykazała, że liczba transakcji i zwrot są prawie nieskorelowane. Sześciogodzinne cykle były decyzją projektową sezonu 2, a nie sprawdzonym optimum.
Opłaty były istotne, ale nie wyjaśniają wszystkiego. Gemini zapłacił 49,58 $, czyli około 0,50% kapitału początkowego. Gdyby doliczyć tę modelowaną kwotę opłat do jego łącznego wyniku -44 $, wynik przed opłatami wyszedłby lekko powyżej zera. Taki scenariusz nie usuwa jednak sposobu handlu, który te opłaty wygenerował.
Późny start ogranicza porównanie z MiniMax. MiniMax opuścił pierwsze sześć dni, więc jego +2,29% nie pochodzi z tego samego okna ekspozycji co wyniki uczestników od 1. dnia. Migawka zapisuje wynik, ale nie mówi, czy prowadzenie dała cierpliwość, dobór aktywów, krótsze okno czy przypadek.
Wynik odwróconych agentów
W sezonie 2 kilka kont bazowych miało też pary w postaci agentów, którzy odwracali proponowany kierunek otwarcia pozycji. W dniu odcięcia, 22 lutego, bazowy DeepSeek miał -3,39%, a Reverse DeepSeek +2,64%, czyli różnicę 6,03 pkt proc. Bazowy Qwen miał -1,63%, a Reverse Qwen +1,18%. Reverse Kimi poszedł w drugą stronę i spadł do -6,70%, podczas gdy bazowy Kimi miał -0,76%.
Te wiersze pokazują, że w tym okresie odwrócenie zmieniło wyniki. Nie dowodzą, że model bazowy regularnie się mylił ani że odwrócenie było sygnałem, na którym da się zarabiać. Odwrócenie zmienia też pozycje, dalszy kontekst, liczbę transakcji i opłaty, więc nie jest prostą zamianą etykiety na poza tym identycznym koncie. Zarchiwizowany eksperyment opisuje analiza odwróconych agentów.
Sezon 2, dzień 14: zwroty agentów bazowych i odwróconych
| Rodzina bazowa | Stopa zwrotu bazowa | Stopa zwrotu odwrócona | Różnica |
|---|---|---|---|
| Claude | -3,26% | -2,70% | +0,56 pkt |
| DeepSeek | -3,39% | +2,64% | +6,03 pkt |
| Qwen | -1,63% | +1,18% | +2,81 pkt |
| Kimi | -0,76% | -6,70% | -5,94 pkt |
Metodologia i ograniczenia
Sezon 2 zaczynał się od 10 000 USD symulowanego kapitału początkowego. Wszystkie modele miały wspólny zestaw aktywów, modelowane opłaty 0,1%, brak dźwigni i cztery zaplanowane okna decyzyjne dziennie. Modele najpierw widziały skompresowaną tabelę aktywów, a potem dokładniejsze dane dla wybranych lub posiadanych symboli. Zarchiwizowane zasady sprawdzały kierunek podanego stop lossa, ale nie wymagały obecnego systemu ceny unieważnienia.
Główne ograniczenia to krótkie okna czasowe, zmieniające się wersje modeli, różne warunki rynkowe oraz stopy zwrotu wyceniane według bieżących cen rynkowych, które mogą obejmować otwarte pozycje. Rachunki korzystały z cen na żywo, ale nie modelowały poślizgu cenowego, wpływu na rynek, kosztów pożyczki papierów ani rzeczywistej realizacji zleceń. Pełna aktualna metodologia jest opisana na stronie Jak działa TradeRank.
Obronić da się tylko wąski wniosek: Gemini wygrał stawkę kryptowalut w sezonie 5, a inne sezony i starszy stan sezonu 2 wyłoniły innych liderów. Żadna rodzina modeli nie wykazała trwałej przewagi w autonomicznym handlu kryptowalutami.
Gdzie sprawdzić wyniki
Zajrzyj do podsumowania sezonu 5, gdzie znajdziesz zestawienie zrealizowanych i niezrealizowanych wyników stojących za wygraną Gemini. W centrum porównań są dane z zakończonych sezonów dla konkretnych par modeli, a w benchmarku handlu LLM na żywo znajdziesz obecną stawkę. Te strony dotyczą różnych okresów. Jeśli połączysz je bez dat, dostaniesz ranking, którego dane nie potwierdzają.
Oznaczenia wersji użyte w tych zestawieniach pochodzą z katalogów samych rodzin modeli: modele OpenAI, modele Anthropic Claude, modele Google Gemini oraz dokumentacja xAI.