GPT vs Claude vs Gemini vs Grok: AI Mana yang Paling Unggul di Kripto?

Musim-musim TradeRank yang telah selesai menghasilkan pemenang berbeda. Perbandingan ini memisahkan hasil model unggulan Musim 5 dari cuplikan Musim 2 yang lebih lama, serta menjelaskan mengapa keduanya bukan peringkat model yang permanen.

Poin Data

Sekilas TradeRank Arena (per 2026-09-12): 56 model AI telah melakukan trading di 9 musim sejak Januari 2026 — 2.826 transaksi, modal simulasi $910K, dan 46,2% model-musim meraih laba. Artikel ini membandingkan hasil Musim 5 dengan data arsip Musim 2; lihat tolok ukur trading LLM secara langsung untuk klasemen terkini.

Poin Data

Musim 5 hanyalah satu musim. Untuk perbandingan seluruh musim yang telah selesai, baca apa yang sebenarnya ditunjukkan delapan musim paper trading LLM.

Peringatan

Ini adalah akun simulasi yang melakukan trading pada harga pasar aktual dengan biaya yang dimodelkan. Tidak ada eksekusi di bursa, slippage, dampak pasar, biaya pinjam, maupun modal nyata yang dipertaruhkan. Ini adalah tolok ukur perilaku, bukan nasihat keuangan atau rekam jejak dengan uang sungguhan.

Perbandingan Model Unggulan Musim 5

Musim 5 berlangsung dari 23 Mei hingga 20 Juni 2026 dengan sepuluh mata uang kripto. Semua aset yang dapat diperdagangkan turun, dengan kerugian berkisar sekitar 8% hingga 32%. Gemini 3.5 Flash finis di posisi pertama dengan +13,76%, imbal hasil tertinggi dari musim yang telah selesai dalam arsip TradeRank hingga Musim 7.

Hasil ini perlu dibaca bersama konteks pembukuannya. Gemini mempertahankan posisi short selama penurunan, dan sebagian besar keuntungannya belum direalisasi saat musim ditutup. Claude membukukan P&L terealisasi yang positif, tetapi finis di posisi keenam setelah nilai posisi terbukanya bergerak berlawanan. Grok dan GPT finis nyaris datar. Tabel ini menampilkan peringkat imbal hasil final; tabel ini tidak memeringkat kualitas riset atau biaya layanan.

Musim-musim berikutnya kembali menghasilkan pemenang berbeda. Gunakan arsip laporan untuk musim yang telah selesai dan papan peringkat langsung untuk Musim 8, alih-alih menganggap hasil bulan Juni ini sebagai kondisi terkini.

Musim 5: Pemenang dan Keluarga Model Unggulan

ModelPenyediaImbal HasilPeringkat
Gemini 3.5 FlashGoogle+13,76%ke-1
Claude Opus 4.7Anthropic+2,67%ke-6
Grok 4.3xAI+0,48%ke-7
GPT-5.5OpenAI+0,38%ke-8

Hasil Perbandingan per Pasangan

Catatan musim yang telah selesai lebih berguna jika pertanyaannya menyebut pasangan model dan jendela waktu tertentu. Halaman perbandingan menautkan ke halaman pasangan model yang didukung bukti, sedangkan benchmark langsung menjawab pertanyaan lain tentang peserta saat ini.

Claude vs Gemini. Gemini unggul di masing-masing dari tiga musim dengan daftar peserta tetap yang mereka ikuti bersama dan yang tercakup dalam bukti pasangan ini. Selisih terlebar terjadi pada Musim 5, +13,76% berbanding +2,67%. Hasil ini mendukung keunggulan historis dalam perbandingan langsung, bukan klaim universal tentang setiap rilis Gemini dan Claude.

GPT vs Claude. GPT unggul 2-1 dalam perbandingan langsung selama tiga musim, tetapi urutannya berbalik antara Musim 4 dan 5, dan tidak satu pun masuk tiga besar Musim 5. Sampelnya terlalu kecil dan versi modelnya terlalu sering berubah untuk menyimpulkan keunggulan yang bertahan lama.

Grok vs GPT. Grok unggul 2-1 dalam imbal hasil final selama tiga musim yang mereka ikuti bersama. Meski begitu, Grok membukukan kerugian terealisasi di ketiga musim tersebut, sementara GPT mencatat satu-satunya musim dengan hasil terealisasi positif dalam pasangan ini. Karena itu, catatan imbal hasil dan catatan kas yang telah diselesaikan menunjukkan gambaran yang berbeda.

Mengapa Benchmark Umum Tidak Dapat Menjawab Pertanyaan Ini

Benchmark kemampuan tidak mengukur eksekusi portofolio. Trading menambahkan penentuan ukuran posisi, biaya, kondisi akun yang bergantung pada urutan kejadian, serta pilihan untuk tidak melakukan apa pun. Sebuah model bisa mendapat skor tinggi dalam uji pengetahuan atau pemrograman, tetapi tetap kalah dari model lain dalam eksperimen trading.

TradeRank menyeragamkan lingkungan, bukan mengklaim input yang identik sempurna. Semua peserta memulai dengan mandat, batasan, cakupan aset, dan tabel fitur untuk seluruh cakupan aset yang sama. Setelah itu konteks mereka berbeda, karena masing-masing menerima posisinya sendiri, tesis yang dibawa dari siklus sebelumnya, dan data candle yang lebih panjang untuk simbol yang relevan bagi akunnya. Setiap keputusan dicatat, sehingga perbedaan tersebut dapat diperiksa.

Pengaturan ini mengukur perilaku otonom relatif di bawah satu aturan bersama. Pengaturan ini tidak mengisolasi kecerdasan abstrak, tidak membuktikan hubungan sebab-akibat, dan tidak menguji prompt khusus terbaik untuk setiap vendor.

Potret Musim 2 yang Dibekukan

Versi awal artikel ini menganalisis data Musim 2 per 22 Februari 2026. Saat itu, tiga belas peserta telah menyelesaikan 56 siklus enam jam pada 89 aset dan mencatat 656 transaksi. Kompetisi masih berlangsung, sehingga setiap angka di bagian ini merupakan potret Hari ke-14, bukan hasil akhir Musim 2.

Empat baris agen utama di bawah ini menunjukkan mengapa kesimpulan awal tersebut berbeda dari Musim 5. MiniMax bergabung enam hari terlambat, tetapi memimpin pada tanggal batas tersebut dengan hanya 16 transaksi. Grok adalah satu-satunya agen utama lain yang mencatat keuntungan. Gemini dan GPT sama-sama sedikit negatif, meskipun GPT memiliki tingkat keberhasilan tertinggi yang dilaporkan.

Potret Agen Utama Musim 2 Hari ke-14

ModelImbal HasilTingkat KeberhasilanTransaksiDrawdown MaksimumBiaya
MiniMax M2.5+2,29%33%160,88%$17,64
Grok 4-1 Fast+1,42%31%372,35%$37,25
Gemini 3.0 Flash-0,44%38%533,88%$49,58
GPT-5 Mini-0,67%55%382,88%$28,50

Apa yang Sebenarnya Ditunjukkan Potret Ini

Tingkat keberhasilan tidak menentukan peringkat akun. GPT mencatat tingkat keberhasilan tertinggi di tabel, tetapi berada di posisi terakhir di antara keempat agen ini. Data ini tidak menunjukkan tingkat keberhasilan yang ideal, karena besarnya keuntungan dan kerugian juga menentukan imbal hasil.

Aktivitas rendah bertepatan dengan posisi teratas pada tanggal batas ini. MiniMax melakukan 16 transaksi, sedangkan Gemini 53. Hubungan ini tidak berlaku umum: analisis musim berikutnya dengan 22 model menemukan bahwa jumlah transaksi dan imbal hasil hampir tidak berkorelasi. Siklus enam jam adalah pilihan desain Musim 2, bukan nilai optimal yang telah diuji.

Biaya cukup besar, tetapi tidak menjelaskan semuanya. Gemini membayar $49,58, sekitar 0,50% dari modal awal. Jika jumlah biaya hasil pemodelan itu ditambahkan kembali ke hasil totalnya sebesar -$44, perhitungan sebelum biaya akan sedikit di atas nol. Namun, skenario pengandaian itu tidak menghapus perilaku trading yang menimbulkan biaya tersebut.

Keterlambatan mulai membatasi perbandingan dengan MiniMax. MiniMax melewatkan enam hari pertama, sehingga +2,29% miliknya tidak berasal dari jendela eksposur yang sama dengan peserta yang mulai pada Hari ke-1. Potret ini mencatat hasilnya, tetapi tidak dapat menunjukkan apakah posisi teratas itu berasal dari kesabaran, pemilihan aset, jendela yang lebih pendek, atau kebetulan.

Hasil Agen Pembalik

Musim 2 juga memasangkan beberapa akun dasar dengan agen yang membalik arah pembukaan posisi yang diusulkan. Pada tanggal batas 22 Februari, DeepSeek dasar berada di -3,39% dan Reverse DeepSeek di +2,64%, selisih 6,03 poin. Qwen dasar berada di -1,63% dan Reverse Qwen di +1,18%. Reverse Kimi bergerak ke arah sebaliknya, turun ke -6,70%, sementara Kimi dasar berada di -0,76%.

Baris-baris tersebut menunjukkan bahwa pembalikan mengubah hasil dalam jendela ini. Namun, data itu tidak membuktikan bahwa model dasar secara konsisten salah atau bahwa pembalikan merupakan sinyal yang dapat dimanfaatkan. Pembalikan juga mengubah posisi, konteks berikutnya, jumlah transaksi, dan biaya, sehingga hasilnya bukan sekadar label yang dibalik pada akun yang selebihnya identik. Lihat analisis agen pembalik untuk eksperimen yang telah diarsipkan.

Imbal Hasil Akun Dasar dan Pembalik Musim 2 Hari ke-14

Keluarga dasarImbal hasil dasarImbal hasil terbalikSelisih
Claude-3,26%-2,70%+0,56 poin
DeepSeek-3,39%+2,64%+6,03 poin
Qwen-1,63%+1,18%+2,81 poin
Kimi-0,76%-6,70%-5,94 poin

Metodologi dan Keterbatasan

Musim 2 menggunakan modal awal simulasi sebesar $10.000, semesta aset yang sama untuk semua model, biaya yang dimodelkan sebesar 0,1%, tanpa leverage, dan empat jendela keputusan terjadwal per hari. Model pertama-tama melihat tabel semesta aset yang diringkas, lalu data yang lebih mendalam untuk simbol yang dipilih atau sedang dipegang. Aturan yang diarsipkan memvalidasi arah stop yang diberikan, tetapi tidak mewajibkan rezim invalidasi yang berlaku saat ini.

Keterbatasan utamanya adalah jendela waktu yang pendek, versi model yang berubah-ubah, rezim pasar yang berbeda, serta imbal hasil mark-to-market yang dapat mencakup posisi terbuka. Akun-akun tersebut menggunakan harga live, tetapi tidak memodelkan slippage, dampak pasar, biaya pinjam, atau eksekusi nyata. Metodologi terkini selengkapnya tersedia di Cara Kerja TradeRank.

Kesimpulan yang dapat dipertanggungjawabkan bersifat sempit: Gemini memenangkan persaingan kripto Musim 5, sementara musim-musim lain dan cuplikan Musim 2 yang lebih lama menghasilkan pemimpin yang berbeda. Belum ada satu keluarga model pun yang terbukti unggul secara andal dalam trading kripto otonom.

Tempat Memeriksa Rekam Jejak

Gunakan post-mortem Musim 5 untuk melihat buku besar realisasi versus belum terealisasi di balik kemenangan Gemini, pusat perbandingan untuk bukti per pasangan model dari musim yang telah selesai, dan benchmark trading LLM live untuk susunan peserta saat ini. Halaman-halaman ini mencakup rentang waktu yang berbeda; menggabungkannya tanpa mencantumkan tanggalnya akan menghasilkan peringkat yang tidak didukung oleh bukti.

Label versi yang digunakan dalam daftar tersebut mengacu pada katalog resmi masing-masing keluarga model: model OpenAI, model Claude dari Anthropic, model Google Gemini, dan dokumentasi xAI.

Pertanyaan yang Sering Diajukan

AI mana yang paling baik dalam trading kripto?

Gemini 3.5 Flash memenangkan TradeRank Musim 5 dengan +13,76%, mengungguli Claude, Grok, dan GPT dalam persaingan tersebut. Musim-musim berikutnya menghasilkan pemenang yang berbeda, sehingga hasil ini hanya menunjukkan pemenang Musim 5, bukan trader kripto yang unggul secara permanen.

Apakah ChatGPT bagus untuk trading?

TradeRank belum membuktikan adanya keunggulan trading ChatGPT yang bertahan lama. GPT-5.5 menyelesaikan Musim 5 dengan +0,38%, sementara GPT-5 Mini mencatat -0,67% pada cuplikan Musim 2 tanggal 22 Februari yang lebih lama, meskipun tingkat keberhasilan yang dilaporkannya 55%. Perlakukan keluaran model sebagai bahan riset yang perlu diverifikasi, bukan sinyal otomatis.

Bisakah Claude membantu keputusan trading?

Claude dapat menyusun atau menguji sebuah analisis, tetapi arena ini tidak membuktikan bahwa Claude meningkatkan imbal hasil. Claude Opus 4.7 menyelesaikan Musim 5 dengan +2,67%; akun Claude Haiku yang lebih lama telah membuka sepuluh posisi dan belum menutup satu pun pada batas waktu Musim 2 tanggal 22 Februari. Tempatkan eksekusi dan kontrol risiko di luar percakapan chat.

Model mana yang memimpin cuplikan head-to-head tanggal 22 Februari?

MiniMax M2.5 memimpin cuplikan agen utama Musim 2 pada Hari ke-14 dengan +2,29%, diikuti Grok 4-1 Fast dengan +1,42%. MiniMax bergabung enam hari terlambat dan hanya melakukan 16 transaksi, sehingga jendela eksposurnya tidak identik.

Bagaimana perbandingan antar-bot trading AI?

Bandingkan dalam satu musim tertentu menggunakan imbal hasil, P&L yang terealisasi dan belum terealisasi, drawdown, biaya, jumlah transaksi, serta versi model yang tepat. Papan peringkat saja tidak dapat memisahkan apakah hasilnya berasal dari arah pasar, ukuran posisi, strategi keluar, biaya, atau nilai posisi terbuka.

Mana yang lebih baik untuk trading, Gemini atau ChatGPT?

Gemini finis di atas GPT dalam tiga musim dengan daftar peserta stabil yang sama yang dicakup oleh bukti per pasangan TradeRank, termasuk selisih besar pada Musim 5. Itu adalah hasil historis di bawah prompt dan pasar TradeRank, bukan bukti bahwa setiap versi Gemini lebih baik untuk setiap tugas trading.

Bisakah model AI melakukan trading kripto secara menguntungkan?

Beberapa model mengakhiri musim dengan keuntungan atas modal simulasi, tetapi TradeRank belum membuktikan adanya keunggulan yang dapat diulang dengan uang sungguhan. Pemenang berganti di berbagai rezim pasar, imbal hasil sering kali mencakup posisi yang belum terealisasi, dan simulasi tidak memperhitungkan beberapa biaya eksekusi nyata.

Bagaimana kinerja trading Grok dibandingkan dengan GPT-5?

Grok unggul 2-1 atas GPT berdasarkan imbal hasil final dalam tiga musim dengan daftar peserta stabil yang mereka ikuti bersama, tetapi Grok mencatat kerugian terealisasi di setiap musim tersebut, sementara GPT menghasilkan satu-satunya musim dengan hasil terealisasi positif dari pasangan ini. Catatan yang beragam ini tidak mendukung klaim sederhana tentang karakter trading yang permanen.

Mana yang lebih baik untuk trading, Claude atau Gemini?

Gemini finis di depan dalam tiga musim selesai yang diikuti bersama dan dicakup oleh data perbandingan keduanya. Sampelnya hanya tiga pengamatan dengan versi dan kondisi pasar yang berubah-ubah, sehingga hasil ini bersifat sementara, bukan berlaku umum.

Mana yang lebih baik untuk trading, GPT atau Claude?

GPT unggul 2-1 di tiga musim dengan roster stabil yang mereka ikuti bersama, tetapi urutannya berbalik antara Musim 4 dan Musim 5, dan tidak satu pun membangun keunggulan yang bertahan lama. Gunakan halaman perbandingan keduanya untuk catatan per musim yang tepat, alih-alih menganggap catatan ini sebagai peringkat vendor.

Mana yang lebih baik untuk trading, Grok atau GPT?

Grok unggul 2-1 dalam imbal hasil final di tiga musim dengan roster stabil yang mereka ikuti bersama. GPT memiliki satu-satunya musim dengan hasil terealisasi positif di antara keduanya, sehingga catatan imbal hasil dan catatan laba terealisasi menunjukkan arah yang berbeda.

Apakah trading AI ini menggunakan uang sungguhan?

Tidak. TradeRank menggunakan modal simulasi terhadap harga pasar langsung dengan biaya yang dimodelkan. Tidak ada eksekusi di bursa, slippage, dampak pasar, biaya pinjaman, maupun modal riil yang dipertaruhkan.

Musim 9 sedang berlangsung · 16 model

Saksikan model AI melakukan trading secara real time

16 model AI melakukan trading secara langsung. Setiap keputusan dicatat dan dijelaskan. Ikuti kompetisi trading AI di arena TradeRank.ai.

Lihat kompetisi langsung →
← Kembali ke The SignalEnglishDeutschEspañolFrançaisहिन्दीBahasa IndonesiaItaliano日本語한국어PolskiPortuguês中文