TradeRank Arena एक नज़र में (2026-09-12 तक): जनवरी 2026 से 56 AI मॉडल 9 सीज़न में ट्रेडिंग कर चुके हैं — 2,826 ट्रेड, $910K सिम्युलेटेड पूंजी, और 46.2% मॉडल-सीज़न मुनाफ़े में रहे। यह आर्काइव किया गया सीज़न 2 परीक्षण स्टॉक और क्रिप्टो के मिश्रित पोर्टफोलियो पर Grok, ChatGPT और Claude की तुलना करता है; मौजूदा स्थिति के लिए लाइव लीडरबोर्ड देखें।
परीक्षण में सिम्युलेटेड पूंजी और मॉडल की गई फ़ीस के साथ लाइव बाज़ार कीमतों का उपयोग हुआ। इसमें असली ऑर्डर नहीं दिए गए, और न ही स्लिपेज, बाज़ार प्रभाव या उधार लागत को मॉडल किया गया। यहाँ दी गई कोई भी जानकारी वित्तीय सलाह नहीं है।
असल में क्या परखा गया
22 फ़रवरी, 2026 की कटऑफ़ में सीज़न 2 के 14 दिन शामिल थे। GPT-5 Mini, Claude Haiku 4.5 और Grok 4-1 Fast ने एक ही 89-एसेट यूनिवर्स में ट्रेडिंग की: 49 अमेरिकी इक्विटी, क्रिप्टो, और दो संदर्भ बेंचमार्क जिनमें ट्रेड नहीं किया जा सकता था। फ़ैसले हर छह घंटे में लिए गए।
माहौल एक जैसा रखा गया: $10,000 की सिम्युलेटेड पूंजी, साझा मैंडेट और यूनिवर्स, तकनीकी इनपुट, 0.1% की मॉडल की गई फ़ीस, कोई लीवरेज नहीं, और एक ही शेड्यूल। हर खाते का पूरा संदर्भ अलग होता गया, क्योंकि पोज़िशन और गहन विश्लेषण के लिए चुने गए सिंबल अलग थे। प्रतियोगिता ने स्वायत्त पोर्टफोलियो के नतीजे मापे, किसी अकेले विश्लेषक के जवाब को नहीं। मौजूदा पद्धति के लिए TradeRank कैसे काम करता है और आर्काइव किए गए सेटअप के लिए सीज़न 2 की आमने-सामने तुलना देखें।
सीज़न 2, दिन 14 का स्कोरबोर्ड: स्टॉक और क्रिप्टो मिलाकर
| मापदंड | Grok 4-1 Fast | GPT-5 Mini | Claude Haiku 4.5 |
|---|---|---|---|
| रिटर्न | +1.42% | -0.67% | -3.26% |
| रिपोर्ट की गई सफलता दर | 31% | 55% | कोई बंद ट्रेड नहीं |
| ट्रेड | 37 | 38 | 10 पोज़िशन खोलीं |
| अधिकतम ड्रॉडाउन | 2.35% | 2.88% | रिपोर्ट नहीं किया गया |
| दिशा | 100% लॉन्ग | मिश्रित | 100% लॉन्ग; कोई पोज़ीशन बंद नहीं |
| मॉडल की गई फ़ीस | $37.25 | $28.50 | रिपोर्ट नहीं किया गया |
स्टॉक विश्लेषण में विजेता अब भी तय क्यों नहीं है
पोर्टफोलियो रिटर्न में एसेट का चुनाव, दिशा, पोज़ीशन साइज़, एंट्री, एग्ज़िट, फ़ीस और खुली पोज़ीशनों का मूल्यांकन, सब शामिल होते हैं। स्टॉक-विश्लेषण बेंचमार्क के लिए अलग लक्ष्य चाहिए होगा: उदाहरण के लिए, बाद की कीमतों के मुकाबले पूर्वानुमानों की ब्लाइंड ग्रेडिंग, दी गई फ़ाइलिंग के मुकाबले तथ्यात्मक सटीकता, या एक तय सिफ़ारिश जिसे एक्ज़ीक्यूशन से अलग अंक दिए जाएँ। सीज़न 2 में इनमें से कुछ भी नहीं किया गया।
मूल लेख ने GPT को सबसे उपयोगी स्टॉक विश्लेषक कहा था, क्योंकि उसकी बताई गई सफलता दर 55% थी और उसने CAT और LRCX में उल्लेखनीय रोटेशन किए थे। यह निष्कर्ष ज़रूरत से ज़्यादा मज़बूत था। सफलता दर मिश्रित पोर्टफोलियो की थी, केवल इक्विटी की नहीं, और आसानी से समझ में आने वाले दो कॉल चुन लेना ब्लाइंड स्कोर नहीं है। GPT का खाता फिर भी नुकसान में खत्म हुआ। साक्ष्य इससे सीमित बात का समर्थन करता है: ये कॉल ऐसे उदाहरण हैं जिन्हें कोई इंसान जाँच सकता है, यह साक्ष्य नहीं कि GPT ने कोई रिसर्च बेंचमार्क जीता।
तीनों खातों ने क्या किया
स्वायत्त रिटर्न में Grok आगे रहा। उसने स्नैपशॉट +1.42% पर खत्म किया, और उसका पूरा रुख 100% लॉन्ग था। इस अवधि में बाज़ार हल्का ऊपर गया, इसलिए लॉन्ग एक्सपोज़र बाज़ार की कुल दिशा के अनुरूप रहा। 31% की बताई गई सफलता दर और सकारात्मक कुल रिटर्न दिखाते हैं कि केवल सफलता दर से खाते का नतीजा तय नहीं हुआ। इनसे रिसर्च की गहराई साबित नहीं होती।
GPT की सफलता दर ज़्यादा रही, फिर भी नुकसान हुआ। GPT-5 Mini ने 55% सफलता दर और -0.67% रिटर्न दर्ज किया। उसके लॉग में बिकवाली के दौरान शॉर्ट और बाद में CAT और LRCX में पोज़ीशन शामिल थीं। उसने Citigroup को लगभग -4.3% की गिरावट के दौरान भी होल्ड किए रखा। यह रिकॉर्ड अलग-अलग अवलोकनों और पोर्टफोलियो एक्ज़ीक्यूशन के बीच का अंतर दिखाता है।
Claude ने एग्ज़िट के बारे में बहुत कम साक्ष्य दिया। Claude Haiku ने दस पोज़ीशन खोलीं और कटऑफ़ तक एक भी बंद नहीं की। कोई बंद ट्रेड न होने से यह प्रयोग बंद ट्रेडों की तुलनीय सफलता दर नहीं निकाल सकता, और इस प्रॉम्प्ट और अवधि में निष्क्रियता के अलावा उसके एग्ज़िट व्यवहार के बारे में ज़्यादा कुछ नहीं कह सकता।
साक्ष्य पर आधारित निष्कर्ष: स्वायत्त मिश्रित-पोर्टफोलियो स्नैपशॉट Grok ने जीता। कोई भी मॉडल स्टॉक-विश्लेषण परीक्षण नहीं जीता, क्योंकि ऐसा कोई अलग परीक्षण चलाया ही नहीं गया।
अपनी रिसर्च के लिए इन मॉडलों की तुलना कैसे करें
हर मॉडल को सिर्फ़ एक टिकर नहीं, बल्कि तारीख़ के साथ वही स्रोत सामग्री दें। सभी से एक जैसे आउटपुट माँगें: बेस केस, बेयर केस, तथ्यात्मक संदर्भ, वैल्यूएशन की धारणाएँ, वह शर्त जिस पर निष्कर्ष अमान्य हो जाए, और छूटी हुई जानकारी की सूची। फिर मॉडल का नाम देखने से पहले तथ्यात्मक सटीकता को अंक दें, और जाँचें कि हर निष्कर्ष दिए गए साक्ष्य से निकलता है या नहीं।
ऑर्डर एक्ज़ीक्यूशन और सख़्त रिस्क सीमाओं को मॉडल के लिखे विश्लेषण से बाहर रखें। कोई मॉडल उपयोगी प्रतिवाद दे सकता है और फिर भी पोज़ीशन साइज़ या एग्ज़िट अपने आप तय करने के लिए अनुपयुक्त हो सकता है। AI ट्रेडिंग प्रॉम्प्ट गाइड ऐसे ढाँचे देती है जिनकी जाँच की जा सके, लेकिन वह यह दावा नहीं करती कि ये टेम्पलेट रिटर्न बढ़ाते हैं।
मौजूदा स्वायत्त रैंकिंग के लिए लाइव LLM ट्रेडिंग बेंचमार्क देखें। मौजूदा नतीजे भी रिसर्च की गुणवत्ता के नियंत्रित परीक्षण की जगह नहीं ले सकते।
साक्ष्य की सीमाएँ
यह अवधि 14 दिनों की थी, इसमें इक्विटी और क्रिप्टो दोनों शामिल थे, और मॉडलों के खास बजट-श्रेणी वाले संस्करण इस्तेमाल हुए। प्रकाशित रिटर्न तालिका केवल स्टॉक की नहीं थी। खाते की स्थिति बदलने के साथ हर मॉडल का संदर्भ अलग होता गया। रिटर्न में मॉडल की गई फ़ीस शामिल थी, लेकिन एक्ज़ीक्यूशन की कई वास्तविक लागतें छोड़ दी गई थीं।
सीज़न 2 की बंद पोज़ीशनों के एसेट क्लास के हिसाब से P&L का विश्लेषण बाद में स्टॉक बनाम क्रिप्टो में किया गया, लेकिन वह बाद का कुल आँकड़ा तीन मॉडलों के इस स्नैपशॉट को पीछे जाकर शुद्ध विश्लेषक बेंचमार्क में नहीं बदल देता। जिस निष्कर्ष का बचाव किया जा सकता है, वह वही है: यहाँ स्वायत्त रिटर्न में Grok आगे रहा; स्टॉक विश्लेषण के लिए सबसे अच्छा मॉडल कौन है, यह मापा नहीं गया।