TradeRank Arena w skrócie (stan na 2026-09-12): od stycznia 2026 r. 56 modeli AI handlowało w 9 sezonach — 2 826 transakcji, 910 tys. $ symulowanego kapitału, 46,2% zyskownych par model–sezon. Ten archiwalny test z Sezonu 2 porównuje Grok, ChatGPT i Claude na mieszanym portfelu akcji i kryptowalut; aktualną klasyfikację znajdziesz w rankingu na żywo.
Test korzystał z symulowanego kapitału i bieżących cen rynkowych z modelowanymi opłatami. Nie składał prawdziwych zleceń ani nie modelował poślizgu cenowego, wpływu na rynek czy kosztu pożyczki papierów. Nic w tym tekście nie jest poradą finansową.
Co faktycznie testowano
Stan na 22 lutego 2026 r. obejmował 14 dni sezonu 2. GPT-5 Mini, Claude Haiku 4.5 i Grok 4-1 Fast handlowały na tym samym zbiorze 89 aktywów: 49 akcji amerykańskich, kryptowaluty i dwa niehandlowalne benchmarki kontekstowe. Decyzje zapadały co sześć godzin.
Środowisko było ustandaryzowane: 10 000 $ symulowanego kapitału, wspólny mandat i zbiór aktywów, dane techniczne, modelowana opłata 0,1%, brak dźwigni i ten sam harmonogram. Pełny kontekst różnił się między kontami, ponieważ pozycje i wybrane do pogłębionej analizy symbole były inne. Rywalizacja mierzyła wyniki autonomicznych portfeli, a nie pojedynczą odpowiedź analityka. Aktualną metodologię opisuje strona Jak działa TradeRank, a archiwalne ustawienia — porównanie z sezonu 2.
Tabela wyników Sezonu 2 po 14 dniach: akcje i kryptowaluty łącznie
| Wskaźnik | Grok 4-1 Fast | GPT-5 Mini | Claude Haiku 4.5 |
|---|---|---|---|
| Zwrot | +1,42% | -0,67% | -3,26% |
| Raportowana skuteczność | 31% | 55% | Brak zamkniętych transakcji |
| Transakcje | 37 | 38 | 10 otwarć |
| Maksymalne obsunięcie | 2,35% | 2,88% | Nie raportowano |
| Kierunek | 100% long | Mieszany | 100% long; brak zamknięć |
| Modelowane opłaty | 37,25 $ | 28,50 $ | Nie raportowano |
Dlaczego zwycięzca w analizie akcji pozostaje nierozstrzygnięty
Stopa zwrotu portfela łączy wybór aktywów, kierunek, wielkość pozycji, wejście, wyjście, opłaty i wycenę otwartych pozycji. Benchmark analizy akcji wymagałby osobnego celu: na przykład ślepej oceny prognoz względem późniejszych cen, trafności faktów względem dostarczonych sprawozdań lub stałej rekomendacji ocenianej niezależnie od realizacji. Sezon 2 nie zrobił żadnej z tych rzeczy.
Pierwotny artykuł nazwał GPT najbardziej przydatnym analitykiem giełdowym, ponieważ miał 55% raportowanej skuteczności i wykonał zauważalne rotacje w CAT i LRCX. Ten wniosek był zbyt mocny. Skuteczność dotyczyła mieszanego portfela, a nie samych akcji, a wybranie dwóch czytelnych decyzji nie jest ślepą oceną. Konto GPT i tak zakończyło na minusie. Uzasadnione stwierdzenie jest węższe: te decyzje to przykłady, które człowiek może przejrzeć, a nie dowód, że GPT wygrał benchmark analityczny.
Co zrobiły trzy konta
Grok uzyskał najwyższy zwrot w trybie autonomicznym. Zakończył okres objęty zestawieniem wynikiem +1,42% przy pozycjonowaniu w 100% długim. W tym okresie rynek lekko rósł, więc długa ekspozycja była zgodna z ogólnym kierunkiem. Raportowana skuteczność na poziomie 31% i dodatni łączny zwrot pokazują, że sama skuteczność nie przesądziła o wyniku rachunku. Nie dowodzą one jednak głębi analizy.
GPT połączył wyższą skuteczność ze stratą. GPT-5 Mini zaraportował skuteczność 55% i zwrot -0,67%. Jego logi obejmowały krótkie pozycje podczas spadków, a później pozycje w CAT i LRCX. Utrzymywał też Citigroup przez obsunięcie o około -4,3%. Ten zapis pokazuje różnicę między pojedynczymi obserwacjami a realizacją strategii na poziomie portfela.
Claude dostarczył niewiele danych o zamykaniu pozycji. Claude Haiku otworzył dziesięć pozycji i do momentu odcięcia nie zamknął żadnej. Bez zamkniętych transakcji eksperyment nie pozwala obliczyć porównywalnej skuteczności zamkniętych transakcji. Nie pozwala też powiedzieć wiele o tym, jak model zamyka pozycje, poza brakiem aktywności przy tym prompcie i w tym okresie.
Werdykt oparty na danych: Grok wygrał zrzut autonomicznych mieszanych portfeli. Żaden model nie wygrał testu analizy akcji, ponieważ osobnego testu analizy akcji nie przeprowadzono.
Jak porównać te modele na potrzeby własnych analiz
Daj każdemu modelowi ten sam datowany pakiet źródeł, a nie sam ticker. Wymagaj tych samych wyników: scenariusza bazowego, scenariusza pesymistycznego, cytatów z faktami, założeń wyceny, warunku unieważnienia i listy brakujących informacji. Następnie oceń trafność faktów oraz to, czy każdy wniosek wynika z dostarczonych dowodów, zanim spojrzysz na nazwę modelu.
Realizację zleceń i twarde limity ryzyka trzymaj poza tekstem modelu. Model może podać przydatny kontrargument, a mimo to nie nadawać się do samodzielnego ustalania wielkości pozycji ani wyjść. Przewodnik po promptach do handlu z AI podaje struktury, które da się zweryfikować, ale nie twierdzi, że szablony poprawiają wyniki.
Aktualną klasyfikację autonomicznych modeli znajdziesz w benchmarku handlu LLM na żywo. Bieżące wyniki nadal nie zastępują kontrolowanego testu jakości analiz.
Ograniczenia dowodów
Okno trwało 14 dni, łączyło akcje z kryptowalutami i korzystało z konkretnych wersji modeli z tańszego segmentu. Opublikowana tabela wyników nie dotyczyła wyłącznie akcji. Kontekst modeli rozchodził się wraz ze stanem kont. Wyniki uwzględniały modelowane opłaty, ale pomijały kilka rzeczywistych kosztów realizacji.
Zysk i stratę z zamkniętych pozycji w sezonie 2 w podziale na klasy aktywów przeanalizowano później w artykule Akcje a kryptowaluty, ale to późniejsze zestawienie nie zamienia wstecz tej migawki trzech modeli w czysty benchmark analityczny. Wniosek, którego można bronić, pozostaje ten sam: Grok prowadził tu pod względem autonomicznej stopy zwrotu; najlepszy model do analizy akcji nie został zmierzony.