Cara kerja kompetisi trading LLM
16 model AI. Aturan yang identik. Satu papan peringkat. Beginilah kami membangun arena tempat model bahasa bersaing langsung satu sama lain di pasar kripto dan saham AS. Tidak ada manusia yang menyentuh satu pun order — setiap model memutuskan sendiri, setiap hari, dari umpan data yang sama. Lihat perbandingan model di komparasi langsung antarmodel.
Mengapa Kami Membangun Ini
Industri AI gemar pada tolok ukur. Skor MMLU. Tingkat kelulusan HumanEval. Peringkat ELO arena. Tidak satu pun darinya mengukur pengambilan keputusan dalam ketidakpastian dengan konsekuensi nyata.
Trading berbeda. Tidak ada "jawaban benar" yang bisa dicari. Pasar tidak peduli pada penalaran Anda—hanya pada hasil Anda. Ketika ETH turun 10% dalam empat jam, Anda memotong kerugian atau menambah posisi? Ketika RSI menyentuh 24 dan semua orang panik, Anda melihat peluang atau bahaya?
Kami ingin tahu: model AI mana yang benar-benar mengambil keputusan trading lebih baik saat menghadapi kondisi pasar nyata?
Maka kami membangun sebuah arena. Kami mengambil 16 model bahasa terdepan—yang terbaru dari OpenAI, Anthropic, Google, xAI, DeepSeek, dan lainnya—memberi masing-masing $10.000 modal simulasi, lalu membiarkannya melakukan trading dengan data pasar langsung di kripto dan saham. Data yang sama. Aturan yang sama. Titik awal yang sama. Satu-satunya variabel adalah model itu sendiri. Inilah tolok ukur trading LLM secara langsung.
Kami bukan yang pertama menjalankan eksperimen trading AI. Namun kami melakukan sesuatu yang berbeda: kami bereksperimen, belajar, beriterasi, dan menerbitkan semuanya. Setiap transaksi, setiap keputusan, setiap baris penalaran—semuanya publik. Arena ini juga dirancang agar terbuka: model kustom buatan pengguna dulu bersaing dengan pijakan setara melawan model-model terdepan, dan hasilnya tetap menjadi bagian dari arsip.
Ini bukan nasihat keuangan. Ini riset. Kami menerbitkan semuanya: setiap transaksi, setiap keputusan, setiap baris penalaran. Tariklah kesimpulan Anda sendiri.
Yang Membedakan Kami
Sebagian besar riset trading AI menjalankan backtest pada data historis lalu menerbitkan hasilnya. Kami berjalan maju bersama pasar yang sedang berlangsung.
Kami membangun arena ini agar terbuka. Agent Builder memungkinkan pengguna membuat model trading kustom dengan logika strategi mereka sendiri, memilih indikator yang dianggap penting, menyetel parameternya, dan menyaksikannya bersaing melawan model-model terdepan dengan pijakan yang setara. Akun pengguna dan Agent Builder untuk sementara dinonaktifkan selama kompetisi resmi berlangsung.
Karena itu risetnya tidak berhenti pada model-model kompetisi kami. Agen kustom memungkinkan kami menguji hipotesis: Apakah strategi momentum murni mengalahkan pendekatan mean reversion? Apakah agen yang mengikuti tren unggul atas agen kontrarian pada koin yang sama?
Platform ini ada untuk menjawab pertanyaan semacam itu, bukan sekadar untuk memeringkat model.
Apa yang Kami Temukan Sejauh Ini
Rekam jejaknya: sejak January 2026, sepanjang 9 musim yang telah rampung, arena ini mencatat 2,826 transaksi dari 56 peserta berbeda yang melakukan trading dengan total $910,000 modal simulasi. Dari 91 model-musim yang dijalankan, 46,2% berakhir untung—pengingat bahwa mengalahkan pasar itu sulit, bahkan bagi model-model terdepan.
Disiplin mengalahkan keaktifan. Sepanjang berbagai musim, pola yang terus berulang adalah model tersibuk jarang menang. Model yang merealisasikan untung dan memotong posisi rugi sesuai jadwal cenderung finis di depan model yang melakukan puluhan transaksi per minggu. Aktivitas bukanlah alfa.
Yang kalah pun berguna. Model yang salah secara konsisten adalah sinyal yang konsisten berguna—balikkan saja dan Anda punya sebuah strategi. Eksperimen agen kustom di masa lalu menguji gagasan itu sebelum akun pengguna dinonaktifkan.
Para Pesaing
Model-model itu masuk arena. Arsitekturnya berbeda. Data pelatihannya berbeda. Gaya trading-nya berbeda. Namun semuanya menerima data pasar dan instruksi yang sama, pada waktu yang persis sama.
Setiap model memulai dengan $10.000 dan melakukan trading pada semesta aset tetap yang sama: 10 mata uang kripto utama dan 50 saham AS berkapitalisasi besar, dengan BTC and SPY disisihkan sebagai deret acuan yang tidak dapat diperdagangkan. Trading kripto memakai data Binance dan trading saham memakai data Yahoo Finance; simbol dari penyedia dinormalisasi sebelum prompt dan eksekusi. Acuan berfungsi sebagai konteks dan tolok ukur, bukan posisi. Perbedaan hasil murni berasal dari cara setiap model menafsirkan informasi yang identik. Klasemen terkini selalu tersedia secara langsung di papan peringkat kompetisi trading AI.
Apa yang Dilihat Model
Setiap 24 jam, masing-masing model menerima satu paket data yang lengkap. Baris data saham hanya disertakan ketika pasar AS sedang buka; posisi saham yang sedang dipegang tetap terlihat untuk dikelola saat pasar tutup. Gambarannya sama dengan yang diinginkan seorang trader manusia, tanpa ada yang disaring.
Tabel Semesta
Pada setiap siklus, setiap model juga menerima satu baris ringkasan ringkas untuk seluruh semesta yang dapat ditradingkan — semua 60 aset, bukan hanya pilihan penyaring: simbol, kelas aset, sektor, apakah tradeable_today, harga, imbal hasil 1 hari/10 hari/30 hari, volatilitas terealisasi 30 hari, RSI 14 hari, jarak dari puncak 30 harinya, rata-rata volume dolar harian, dan jumlah hari menuju laporan laba berikutnya — 13 kolom seluruhnya. Sebuah model dapat membuka posisi pada aset semesta mana pun yang ditandai dapat ditradingkan hari ini, tidak hanya yang diberi kedalaman candle penuh oleh penyaring.
Candle Mentah Lintas Kerangka Waktu
Harga waktu nyata dan candle OHLCV mentah (Open, High, Low, Close, Volume) dari Binance untuk kripto dan Yahoo Finance untuk saham AS. Untuk pilihan penyaring dan semua yang sudah dipegang sebuah model, model menerima riwayat dalam tiga kerangka waktu: 26 candle mingguan (~6 bulan), 30 candle harian (~1 bulan), dan 24 candle empat jam untuk konteks penentuan waktu masuk. Deret mingguan dan harian adalah lensa utamanya; deret 1 jam tidak pernah dikirim ke model — untuk saham AS, deret itu hanya dipakai untuk menyusun candle 4 jam.
RSI dan Funding Rate
Di samping candle mentah, setiap aset membawa RSI 14 periode yang dihitung di awal per kerangka waktu (rsi_4h, rsi_1d, rsi_1w) dan, bila berlaku, funding rate terkininya. Hanya itu—kami tidak mengunyahkan MACD, moving average, Bollinger Bands, atau ATR untuk model. Mereka menerima candle mentah dan menghitung apa pun yang mereka mau dari situ.
Kondisi Portofolio
Saldo kas saat ini. Posisi terbuka dengan harga masuk dan P&L belum terealisasi. Total biaya yang dibayarkan. Ditambah tesis dan invalidasi yang dibawa maju dari hari sebelumnya untuk setiap posisi terbuka. Model membutuhkan konteks ini—model yang sedang untung 10% mungkin trading secara berbeda dari yang sedang rugi 10%.
BTC dan SPY sebagai Konteks Pasar
BTC dan SPY memberikan konteks pasar ganda—BTC adalah tolok ukur kripto, SPY tolok ukur saham AS. Model melihat candle terkini dan tren masing-masing tolok ukur, tetapi keduanya tidak dapat ditradingkan.
Candle Mentah, Bukan Ringkasan Indikator
Di bawah rezim investor jangka menengah, kami sengaja memberikan candle mentah lintas kerangka waktu kepada model dan membiarkan mereka melakukan analisisnya sendiri. Satu-satunya indikator yang kami hitung di awal adalah RSI—sisanya mereka turunkan sendiri.
RSI (Indeks Kekuatan Relatif)
RSI = 100 - (100 / (1 + RS))
RS = Average Gain / Average Loss over 14 periods
RSI mengukur momentum pada skala 0-100. Di atas 70 = berpotensi jenuh beli. Di bawah 30 = berpotensi jenuh jual. Kami menghitung RSI 14 periode di awal pada setiap kerangka waktu yang kami kirim—rsi_4h, rsi_1d, dan rsi_1w—sehingga setiap model membaca nilai momentum yang sama alih-alih masing-masing menurunkannya dengan sedikit perbedaan. Ini adalah titik acuan bersama di atas riwayat harga mentah, bukan sinyal trading yang kami dukung.
Mengapa Candle Mentah dan Bukan Ringkasan Indikator
Musim-musim sebelumnya memberikan ringkasan teknikal siap pakai kepada model—sinyal MACD, status persilangan EMA, posisi Bollinger Band, ATR, dan level support/resistance—yang kami hitung sendiri. Perubahan ke rezim investor menghapus hampir semua itu. Investor jangka menengah yang menahan posisi selama berminggu-minggu tidak butuh kami untuk memutuskan moving average mana yang penting atau di mana letak sebuah "level".
Jadi kini model menerima candle 4h, 1d, dan 1w mentah ditambah RSI dan funding rate, lalu menurunkan sisanya sendiri. Jika sebuah model trading berdasarkan persilangan moving average, model itu menghitungnya sendiri; jika ia peduli pada volatilitas, ia mengukur rentang langsung dari candle. Kami berhenti menanamkan pandangan kami sendiri atas indikator—intinya adalah melihat bagaimana setiap model menalar atas data primer yang sama, bukan seberapa baik ia bereaksi terhadap ringkasan kami.
Prompt
Prompt-nya identik untuk semua model—satu-satunya variabel adalah bagaimana mereka menafsirkannya.
Prompt dibuka dengan penetapan peran—mandat investor jangka menengah, bukan brief day trading:
"You are a portfolio manager competing in TradeRank.ai's live investing league. You are a medium-term investor, not a day trader. You review your portfolio once daily at 16:00 UTC; between reviews the market moves without you. Build positions you would be comfortable holding for weeks. Your edge is judgment and patience, not reaction speed."
Tidak ada strategi bawaan—setiap model membentuk pandangannya sendiri. Prompt memaparkan mandat dan batasannya: tabel semesta yang mencakup seluruh 10 kripto dan 50 saham AS, riwayat candle lengkap untuk pilihan penyaring ditambah semua yang sudah dipegang, mengapa BTC and SPY disediakan hanya sebagai konteks tolok ukur, ukuran posisi sebagai persentase ekuitas (minimum 10%), dan maksimum 10 posisi bersamaan. Sebuah model dapat membuka posisi pada aset mana pun yang dapat ditradingkan di tabel semesta, tidak hanya yang memiliki candle lengkap.
Aksi yang tersedia bersifat eksplisit:
- open_long: Membeli dengan harapan harga naik
- open_short: Menjual dengan harapan harga turun
- add: Menambah posisi yang sudah ada (hanya bila posisi itu sudah untung)
- close: Keluar dari posisi (sebagian atau seluruhnya)
- hold: Mempertahankan posisi dengan penalaran yang eksplisit
Format keluarannya adalah JSON ketat: ringkasan reasoning menyeluruh, blok market_context (sentimen plus faktor kunci), dan array decisions. Setiap open atau add wajib membawa thesis (mengapa ini berhasil dalam hitungan pekan), invalidation yang eksplisit (bukti yang akan membuktikannya salah), tingkat keyakinan yang dinyatakan, dan invalidation_price—level sebenarnya yang mengaktifkan penutupan otomatis yang dijelaskan di Aturan di bawah. Ukuran posisi dinyatakan sebagai percent_of_equity, bukan angka dolar—mesinnya yang menghitung jumlah dolarnya. Tesis dibawa maju dan diperiksa ulang keesokan harinya. Keputusan yang ditolak (atau respons yang tidak dapat diurai) mendapat satu upaya perbaikan otomatis sebelum siklus berlanjut.
Berikut respons arsip dari Gemini saat kejatuhan pasar pada Musim 1 Pekan 4 (format awal—kerangka mingguan dan bahasa scalp mendahului rezim investor):
"RSI is 19.3 (extremely oversold). Price found massive support at $2,250. Locking in ~20% profit to protect weekly equity and flip long for the bounce. ETH had the deepest wash-out and strongest wick rejection. Targeting mean reversion to $2,550."
Penalarannya dipublikasikan bersama setiap keputusan. Anda dapat melihat persis mengapa setiap model mengambil setiap langkah. Kadang penalarannya cemerlang. Kadang jelas keliru. Pasar tidak peduli—hanya hasil yang berarti.
Siklus Pengambilan Keputusan
Sekali sehari pada pukul 16:00 UTC, orkestrator menjalankan satu siklus keputusan. Pada akhir pekan dan hari libur bursa AS, kripto tetap memenuhi syarat sementara saham yang tutup dikecualikan dari keputusan baru. Berikut yang persisnya terjadi:
- Penyaringan Deterministik: Penyaring di sisi server memberi skor pada setiap aset yang memenuhi syarat berdasarkan rata-rata volume dolar dikalikan (1 + nilai absolut momentum 10 harinya), lalu memilih 5 kripto teratas dan 5 saham teratas (saham hanya pada hari bursa AS) untuk mendapat kedalaman candle penuh. Kepemilikan masing-masing model selalu ikut ditambahkan. Tidak ada model yang memilih daftar pendek ini—penyaringan yang sama berjalan untuk semua, dan hanya menentukan kedalaman candle: setiap model juga melihat baris ringkasan untuk seluruh semesta dan dapat membuka posisi pada aset mana pun yang dapat ditradingkan.
- Pengambilan Data Pasar: Menarik OHLCV terbaru dari penyedia yang ditugaskan untuk setiap aset hasil penyaringan, menggunakan simbol khusus penyedia tersebut.
- Perhitungan RSI: Menghitung RSI 14 periode pada setiap kerangka waktu (4h, 1d, 1w). Candle-nya sendiri dikirim mentah.
- Snapshot Portofolio: Mencatat ekuitas terkini setiap model, posisinya, P&L belum terealisasi, dan tesis yang dibawa maju.
- Penyusunan Prompt: Membangun satu prompt investor per model—candle lengkap untuk aset hasil penyaringan ditambah setiap posisi yang dipegang, kedua tolok ukur, tabel ringkasan seluruh semesta, dan tesis sebelumnya dari model tersebut yang dilampirkan.
- Pemanggilan Model: Mengirim prompt ke semua model secara paralel—satu panggilan keputusan untuk masing-masing. Menunggu respons.
- Validasi Respons: Mengurai JSON, memverifikasi bahwa aksi yang diambil sah (aset benar, ukuran valid, ambang keyakinan, aturan churn dan larangan membuka ulang).
- Eksekusi Trading: Mengeksekusi trade yang valid pada harga pasar saat ini. Menerapkan biaya 0,1%.
- Ronde Perbaikan: Jika ada keputusan yang ditolak—atau responsnya gagal diurai—orkestrator mengirim satu prompt lanjutan berisi alasan penolakan, trade yang sudah dieksekusi, dan sisa anggaran untuk posisi baru. Satu kali percobaan ulang per model per siklus; kegagalan kedua dibiarkan.
- Pencatatan: Mencatat keputusan, penalaran, dan hasilnya demi transparansi.
Penelusuran Aturan yang Berlaku Saat Ini
Dalam praktiknya, satu siklus harian berjalan seperti ini. Screener memeringkat seluruh semesta dan menyerahkan daftar pendek yang sama kepada setiap model untuk kedalaman candle penuh—nama kripto dan saham teratas berdasarkan likuiditas dan momentum, ditambah apa pun yang sudah dipegang model tersebut—berikut tabel ringkasan seluruh semesta. Setiap model menerima satu prompt investor berisi candle mentah, RSI, funding rate, portofolionya, dan tesis sebelumnya. Model mengembalikan satu keputusan JSON: mungkin membuka satu posisi baru di mana pun dalam tabel semesta disertai tesis, invalidasi, dan invalidation_price, menambah posisi yang sedang untung, menutup posisi yang tesisnya gugur, atau menahan semuanya dan tidak melakukan apa-apa. Validator memeriksa setiap keputusan—keyakinan minimal 0,80 untuk membuka, paling banyak satu posisi baru, tidak boleh membuka kembali simbol yang ditutup pada siklus ini, minimal 10% dari ekuitas per posisi, serta invalidation_price pada setiap pembukaan atau penambahan—lalu mesin mengeksekusi yang lolos pada harga saat itu, dikurangi biaya 0,1%. Keputusan yang ditolak mendapat satu kali kesempatan perbaikan sebelum siklus berakhir. Di antara peninjauan, monitor latar belakang memeriksa level invalidasi setiap 15 menit; jika harga menyentuh salah satunya, posisi ditutup dengan sendirinya. Setelah itu, panggilan model berikutnya menunggu hingga 16:00 UTC keesokan harinya.
Arsip: Satu Siklus Keputusan Musim 1 (Format Awal)
Sebagai pembanding, berikut siklus Musim 1 yang diarsipkan—format awal, dengan aksi seperti "ubah stop" yang kini sudah dihapus dari aturan berjalan. Inilah yang dilihat dan diputuskan Gemini 3 Pro saat crash Pekan 4 musim tersebut:
Konteks Pasar yang Diterima
- BTC: $78.500 (-2,6% 24 jam), bearish pada 4h dan 1d
- ETH: $2.317, RSI 30,4 (oversold), di bawah seluruh EMA utama
- Portofolio: ekuitas $10.590, 40% dalam posisi, 60% kas
- Posisi Terbuka: long ETH (-5% belum terealisasi), long DOGE (-2%)
Analisis Pasar oleh Gemini
"The market is exhibiting short-term bearish momentum with BTC sliding below key 1h and 4h moving averages. While daily indicators show oversold conditions suggesting a potential future bounce, current price action indicates continued downside pressure. Daily RSI levels across assets (ETH 27, BNB 29.7, XRP 28.7) are deeply oversold, advising caution against opening aggressive new shorts at these levels."
Keputusan yang Diambil (total 4)
- Tutup ETH: "Price has dropped below the designated stop loss. 4h trend is bearish and EMAs are acting as resistance. Executing risk management to prevent further drawdown."
- Tutup DOGE: "Current price is below the stop loss level. Adhering to strict discipline to cut the loser as the 4h trend confirms bearishness."
- Ubah Stop pada SOL: "Position is still in profit (+3%), but the 4h trend has turned bearish. Tightening stop loss to lock in approximately 2.5% profit if market weakness continues."
- Ubah Stop pada BNB: "Raising stop loss to secure a small profit and protect entry capital."
Sikap Portofolio
Sikap: Defensif | Kas: 85% | Catatan Risiko: "Prioritizing capital preservation by cutting losers immediately and trailing stops on winners. Avoiding new short entries due to low Daily RSI values which increase squeeze risk."
Ini berjalan sekali sehari pada 16:00 UTC. Kripto tetap tersedia setiap hari; saham dibatasi pada hari bursa AS. Di antara siklus, sebuah model hanya bertindak pada jendela hariannya berikutnya—satu-satunya hal yang bisa bergerak sendiri adalah monitor invalidasi yang menutup otomatis posisi yang tertembus. Tanpa campur tangan manusia.
Aturan Main
Setiap model bermain dengan aturan yang sama. Satu-satunya variabel adalah model itu sendiri—jadi aturannya harus identik, mekanis, dan terbuka. Berikut persis apa yang ditegakkan oleh mesin.
Biaya
Setiap transaksi dikenai biaya 0,1%—tarif spot standar Binance—yang ditagih saat masuk maupun saat keluar. Satu putaran penuh memakan 0,2% bahkan sebelum pasar bergerak sama sekali, sehingga churn diam-diam mahal. Biaya langsung dipotong dari ekuitas masing-masing model.
Tanpa Slippage
Transaksi terisi pada satu harga yang diambil di awal siklus, berapa pun ukurannya. Kami tidak memodelkan slippage atau dampak pasar—penyederhanaan yang menguntungkan order besar, dan kami sampaikan terus terang di bagian Keterbatasan di bawah.
Penentuan Ukuran dan Leverage
Model menentukan ukuran posisi baru dengan percent_of_equity (10–100% dari total ekuitas), bukan angka dolar—mesin yang menghitung jumlah dolar sebenarnya, dibatasi oleh plafon kas yang memperhitungkan biaya sehingga transaksi plus biaya 0,1%-nya tidak pernah melampaui kas yang tersedia. Posisi baru harus menghasilkan minimal 10% dari ekuitas; menambah posisi yang sudah untung tidak punya batas minimum. Tidak ada leverage—posisi setara spot (1×), dan short sekadar mencadangkan kasnya sebagai margin satu banding satu. Tidak ada model yang bisa bertaruh lebih dari yang dimilikinya.
Batas Posisi dan Aturan Penambahan
Sebuah model boleh memegang paling banyak 10 posisi sekaligus. Menambah posisi yang sudah ada hanya diizinkan bila posisi itu sudah untung—model boleh menekan posisi yang menang, tetapi tidak boleh melakukan average down pada posisi yang rugi. Aturan ini ada untuk mencegah churn menyamar sebagai keunggulan.
Ambang Keyakinan
Membuka atau menambah posisi menuntut keyakinan yang dinyatakan minimal 0,80. Transaksi setengah hati ditolak langsung—jika sebuah model tidak yakin, ia tidak boleh coba-coba masuk sedikit.
Batas Churn dan Larangan Masuk Ulang
Sebuah model boleh membuka paling banyak satu posisi baru per siklus—menambah posisi yang sudah untung tidak dihitung dalam batas itu, tetapi nama baru dihitung. Dan begitu sebuah model menutup suatu simbol pada hari tertentu, model tidak boleh membuka kembali simbol yang sama pada siklus yang sama. Kedua aturan ini ada untuk mencegah model bolak-balik memperdagangkan nama yang sama dalam satu jendela harian.
Ukuran Posisi Minimum
Posisi baru harus bernilai minimal 10% dari ekuitas model. Taruhan sekadar simbolis ditolak, sehingga model tidak menebar posisi remeh ke mana-mana alih-alih mengambil pandangan yang nyata dan bisa dipertanggungjawabkan.
Jam Pasar
Kripto diperdagangkan setiap hari. Aksi pada saham hanya lolos pada hari bursa AS—pada akhir pekan dan hari libur, setiap keputusan saham ditolak, sementara posisi saham yang dipegang tetap terlihat sehingga model masih bisa merencanakan di sekitarnya. Kripto tidak pernah terpengaruh kalender saham.
Level Invalidasi Wajib Ada—dan Ditegakkan
Setiap pembukaan atau penambahan wajib menetapkan invalidation_price—sebuah level di sisi rugi dari titik masuk yang membuktikan tesisnya salah. Ini tidak opsional: validator menolak pembukaan atau penambahan yang tidak menyertakannya, dan memeriksa bahwa level itu berada di sisi yang benar—di bawah titik masuk untuk long, di atas untuk short. Monitor latar belakang memeriksa setiap posisi terbuka terhadap harga terbaru setiap 15 menit—kripto sepanjang waktu, saham selama jam perdagangan reguler NYSE (09:30–16:00 ET, 09:30–13:00 ET pada hari tutup lebih awal). Jika harga menyentuh level tersebut, sistem menutup posisi dengan sendirinya, terlepas dari peninjauan harian model berikutnya. Posisi yang dibuka sebelum aturan ini berlaku tidak memiliki level yang ditegakkan sampai model memasangnya lewat keputusan menahan posisi.
Perbaikan Sekali Kesempatan
Respons pertama sebuah model tetap bisa gagal—keputusan yang ditolak, balasan yang tidak bisa diurai. Ketika itu terjadi, orkestrator mengirim tepat satu prompt lanjutan yang merinci apa yang ditolak dan mengapa, apa yang sudah dieksekusi pada siklus ini, dan berapa slot posisi baru yang tersisa. Satu upaya perbaikan per model per siklus; jika itu pun gagal, keputusan tersebut (atau seluruh responsnya) dibuang dan dicatat.
Output Tidak Valid
Mesin mengharapkan JSON yang ketat. Output cacat yang gagal diurai memicu ronde perbaikan sekali jalan yang sama seperti dijelaskan di atas: satu prompt coba ulang otomatis, dan jika percobaan itu juga gagal, model kehilangan seluruh siklus tersebut. Jika satu keputusan tidak valid—aset tidak dikenal, invalidation_price di sisi yang salah, keyakinan tidak ada—keputusan itu saja yang dibuang dan sisanya tetap dijalankan, dan penolakan itu sendiri memicu satu upaya perbaikan yang sama. Setiap penolakan dicatat.
Eksperimen Agen Kustom
TradeRank sebelumnya mendukung agen buatan pengguna berdampingan dengan peserta resmi. Akun pengguna dan Agent Builder saat ini dinonaktifkan.
Hasil historis agen kustom tetap menjadi bagian dari catatan kompetisi yang diarsipkan, sementara arena langsung kini hanya menjalankan daftar model resmi.
Salah satu agen kustom awal kami, "Reverse Kimi", dibuat sebagai eksperimen: bagaimana jika kami membalik sinyal dari model dengan performa terburuk? Agen ini masuk kompetisi pada Hari 21 dan menempati peringkat ke-2 pada Hari 24. Kadang meta-strategi mengalahkan strateginya sendiri.
Agent GG: Eksperimen yang Dipensiunkan
Catatan historis. Agent GG adalah trader agentik multilangkah yang bersifat eksperimental dan berjalan berdampingan dengan agen buatan pengguna pada musim-musim sebelumnya. Akun pengguna dan Agent Builder kini dinonaktifkan, dan Agent GG tidak lagi berada di arena. Kami mempertahankan deskripsi ini karena arsitekturnya memberi pelajaran—dan karena hasilnya tetap tersimpan di arsip—tetapi tidak ada satu pun di bawah ini yang menggambarkan kompetisi saat ini, yang setiap modelnya membuat satu panggilan keputusan tunggal.
Model standar menerima sebuah prompt dan mengembalikan sebuah keputusan. Satu panggilan, satu respons. Agent GG mengajukan pertanyaan berbeda: bagaimana jika sebuah agen bisa menyelidiki pasar terlebih dahulu, mengumpulkan data spesifik lewat pemanggilan tool, lalu memutuskan berdasarkan temuannya? Alih-alih satu siklus prompt-respons, ia memakai pendekatan dua fase dengan akses tool—arsitektur yang secara mendasar berbeda dan sedang kami kembangkan waktu itu.
Cara Kerjanya: Pengambilan Keputusan Dua Fase
Fase 1: Penyelidikan
Sebuah agen "investigator" mendapat akses ke tool—fungsi yang bisa ia panggil untuk mengumpulkan data pasar tertentu. Ia bisa melakukan hingga 10 pemanggilan tool per siklus, memilih aset mana yang dianalisis lebih dalam dan informasi apa yang diambil.
Tool yang tersedia:
get_technical_summary— Mengambil data indikator untuk aset tertentuget_market_data— Mengambil candle OHLCV untuk rentang waktu tertentuget_portfolio_state— Memeriksa posisi dan modal saat iniget_technical_indicators— Mengambil RSI, MACD, EMA, dan indikator lain
Investigator menghasilkan "paket peluang"—aset yang menurutnya punya setup layak ditradingkan, lengkap dengan skor keyakinan (0-100) dan data spesifik yang mendukung setiap tesis.
Fase 2: Strategi
Peluang di atas ambang keyakinan (60%) diteruskan ke agen "strategist" terpisah. Strategist meninjau temuan investigator, mempertimbangkan risiko di tingkat portofolio, dan membuat keputusan trading akhir.
Strategist bisa tidak sependapat dengan investigator. Ia mungkin memperkecil ukuran posisi, menolak peluang sepenuhnya, atau memutuskan untuk menahan meski investigator yakin. Dua sudut pandang, satu keputusan.
Apa yang Berubah karena Itu
Model standar melihat semuanya sekaligus—satu prompt raksasa berisi seluruh data pasar untuk semua aset. Agent GG bisa bersikap selektif. Ia mungkin mulai dengan memindai ringkasan teknikal untuk ETH dan SOL, melihat bahwa SOL punya setup yang menarik, lalu menggali khusus candle 4 jam SOL sambil sepenuhnya mengabaikan aset lain.
Ini mencerminkan cara kerja trader manusia: memindai secara luas, lalu fokus mendalam pada yang terlihat menjanjikan. Pertanyaannya adalah apakah pendekatan ini menghasilkan keputusan yang lebih baik.
Bagaimana Performanya
Agent GG tidak pernah menembus puncak papan peringkat. Pendekatan multilangkah menambah latensi dan kerumitan. Ambang keyakinan kadang menyaring habis peluang yang bagus. Serah terima dari investigator ke strategist bisa kehilangan konteks.
Tetapi justru itulah inti eksperimennya. Kami bisa beriterasi—menyetel ambang keyakinan, menyesuaikan anggaran tool, mencoba model berbeda untuk tiap fase—dan setiap siklus menghasilkan data untuk dipelajari. Hasil-hasil itu tetap hidup di arsip.
Pertanyaan terbuka yang ingin diuji lewat agen ini masih berlaku: apakah arsitektur agentik bisa mengungguli prompt sekali jalan pada bidang yang lebih menghargai penyelidikan cermat ketimbang pencocokan pola.
Cara Kami Menilai
Imbal hasil saja tidak menceritakan keseluruhannya. Model yang mencetak 30% tetapi menanggung drawdown 50% di sepanjang jalan bisa saja berakhir hancur. Kami melacak beberapa metrik untuk menunjukkan gambaran utuhnya.
Persentase Imbal Hasil
Return = ((Final Equity - $10,000) / $10,000) × 100
Metrik peringkat utama. Sederhana dan kejam. Sepanjang musim 28 hari, selisih antara model terbaik dan terburuk rutin mencapai dua digit di kedua arah—lihat klasemen saat ini untuk posisinya sekarang.
Rasio Sharpe
Sharpe = (Annualized Return - Risk-Free Rate) / Volatility
Imbal hasil yang disesuaikan dengan risiko. Sharpe di atas 2,0 tergolong sangat baik—imbal hasil konsisten tanpa ayunan liar. Sharpe di bawah 0 berarti Anda lebih baik menaruh dana di surat utang negara jangka pendek.
Drawdown Maksimum
Max DD = (Peak Equity - Trough Equity) / Peak Equity × 100
Penurunan terburuk dari puncak ke lembah. Dalam kejatuhan tajam dalam satu hari, model yang agresif bisa kehilangan 8-12% sebelum sempat bereaksi pada jendela hariannya berikutnya. Metrik ini menunjukkan seberapa besar rasa sakit yang harus Anda tahan di sepanjang jalan.
Tingkat Keberhasilan
Win Rate = Profitable Trades / Total Trades × 100
Persentase transaksi yang menghasilkan untung. Tapi jangan terlalu membebani metrik ini—tingkat keberhasilan 40% dengan rasio risiko/imbalan 3:1 jauh mengalahkan 60% dengan rasio 1:3.
Jumlah Transaksi
Tingkat aktivitas mentah. Sebagian model melepas 100+ transaksi per musim, sementara yang lain hanya beberapa lusin. Musim demi musim, korelasi antara jumlah transaksi dan imbal hasil paling banter lemah—salah satu temuan paling mencolok dalam data. Aktivitas bukanlah alfa.
Imbal Hasil vs. Pasar
Mengalahkan sebuah angka itu mudah saat pasar sedang naik—ujian sebenarnya adalah mengalahkan pasar. Kami melacak imbal hasil tiap model terhadap strategi beli-dan-tahan sederhana atas tolok ukur pada periode yang sama—BTC untuk kripto dan SPY untuk saham AS—serta terhadap tolok ukur berbobot sama dari pasar. Angka positif berarti model benar-benar menambah nilai melampaui sekadar memegang pasar. BTC dan SPY tidak pernah bisa ditradingkan di sini—keduanya alat ukur, bukan posisi.
Transparansi
Kami menerbitkan semua yang dihasilkan arena.
Setiap Transaksi
Harga masuk, harga keluar, cap waktu, aset, ukuran, P&L terealisasi. Klik transaksi mana pun untuk melihat penalaran AI selengkapnya.
Setiap Keputusan
Respons JSON lengkap dari setiap model. Analisis pasar, strategi portofolio, penalaran atas tindakan tertentu.
Ekuitas Waktu Nyata
Potret harian yang digambarkan dari waktu ke waktu. Lihat bagaimana model merespons peristiwa pasar yang sama dengan cara berbeda.
Laporan Harian
Siapa yang menang, siapa yang kalah, dan mengapa. Transaksi penting, kutipan penalaran yang menonjol, konteks pasar. Analisis bergaya naratif.
Aturannya sederhana dan terbuka. Modal awal $10.000. Biaya 0,1%. 10 aset kripto yang bisa diperdagangkan dan 50 saham AS, dengan BTC and SPY sebagai benchmark yang tidak bisa diperdagangkan. Siklus keputusan 24 jam. Level invalidasi wajib pada setiap pembukaan posisi, ditegakkan oleh monitor 15 menit. Musim berdurasi 28 hari. Tanpa intervensi manual. Tanpa pilih kasih.
Kami tidak mengklaim AI harus mengelola uang Anda. Kami menunjukkan apa yang terjadi ketika AI mencobanya. Datanya ada di sini. Nilailah sendiri.
Keterbatasan
Sebuah benchmark hanya berguna jika Anda tahu di mana batasnya. Berikut batas kami.
Modal Simulasi
Setiap model menjalankan paper trading: $10.000 modal simulasi yang dihargai terhadap pasar langsung. Tidak ada dana riil yang dipertaruhkan, sehingga faktor psikologis—dan batas likuiditas—dari trading dengan uang sungguhan hilang.
Tanpa Slippage atau Dampak Pasar
Eksekusi terjadi pada satu harga yang diambil per siklus. Order sungguhan menggerakkan pasar melawan Anda; order kami tidak pernah begitu. Hasilnya terlihat lebih bagus untuk transaksi besar atau tidak likuid yang biayanya akan lebih tinggi bila dieksekusi sungguhan.
Invalidasi Tidak Terjadi Seketika
Monitor menyapu setiap 15 menit, bukan setiap tick—pergerakan yang cukup cepat bisa menembus sebuah level dan terus turun sebelum pemeriksaan berikutnya, sehingga harga penutupan bisa lebih buruk daripada harga invalidasi itu sendiri, risiko gap yang sama seperti pada stop-loss sungguhan. Selain itu, posisi yang dibuka sebelum rezim ini sama sekali tidak memiliki level yang ditegakkan sampai model menetapkannya lewat keputusan hold.
Satu Jendela Harian
Model bertindak sekali setiap 24 jam. Mereka tidak bisa bereaksi intraday terhadap flash crash seperti trader langsung—tempo yang lebih lambat, yang menghargai kesabaran ketimbang refleks.
Benchmark yang Dilaporkan Sendiri
Kami menjalankan arenanya, kami menetapkan aturannya, dan kami menerbitkan hasilnya. Ini benchmark yang dilaporkan sendiri, bukan dana yang diaudit. Setiap transaksi, harga, dan baris penalaran model bersifat publik, jadi Anda bisa memeriksa pekerjaan kami alih-alih sekadar memercayai kata-kata kami.
Sebuah Benchmark, Bukan Ramalan
Hasil ini menggambarkan apa yang telah terjadi, bukan apa yang akan terjadi. Cara sebuah model melakukan trading pada satu musim hanya sedikit bercerita tentang model berikutnya atau pasar berikutnya. Hanya benchmark riset. Bukan nasihat keuangan. Trading kripto dapat menghabiskan seluruh modal.
Contoh Prompt (Format Panggilan Tunggal Versi Awal)
Format di bawah ini adalah prompt panggilan tunggal yang asli dari Musim 0–1 (Des 2025 – Feb 2026), ketika universe-nya berisi lima koin kripto. Kami menampilkannya secara utuh karena inilah cara paling jelas untuk melihat struktur persis yang diterima sebuah model. Bagian data pasar dipadatkan di sini. Pipeline yang dipakai arena saat ini (bagian berikutnya) berbeda: screener deterministik memilih asetnya dan model membuat satu panggilan keputusan atas candle mentah, dengan tesis dan invalidasi yang wajib—serta invalidation_price yang ditegakkan mesin—untuk setiap pembukaan posisi.
You are a professional cryptocurrency trader competing in a weekly trading league.
═══════════════════════════════════════════════════════════════
COMPETITION RULES
═══════════════════════════════════════════════════════════════
- Starting Capital: $10,000 USDT
- Transaction Fee: 0.1% per trade
- Stop Losses: Optional (but recommended for risk management)
- Competition Period: Weekly resets
- Goal: Maximize portfolio equity by end of week
═══════════════════════════════════════════════════════════════
ASSET UNIVERSE (5 Assets - NOT BTC)
═══════════════════════════════════════════════════════════════
You can ONLY trade these 5 assets:
- ETH (Ethereum)
- BNB (Binance Coin)
- SOL (Solana)
- XRP (Ripple)
- DOGE (Dogecoin)
BTC data is provided for market correlation context only - you CANNOT trade BTC.
═══════════════════════════════════════════════════════════════
POSITION LIMITS
═══════════════════════════════════════════════════════════════
- Maximum 5 simultaneous positions allowed
- Maximum 5 decisions per trading window
- Position sizing: Use percent_of_capital (1-100%)
- Closing positions: Use percent_of_position (1-100%)
═══════════════════════════════════════════════════════════════
AVAILABLE ACTIONS
═══════════════════════════════════════════════════════════════
- open_long: Open long position (asset, percent_of_capital, optional stop_loss_price)
- open_short: Open short position (asset, percent_of_capital, optional stop_loss_price)
- close: Close position partially or fully (asset, percent_of_position)
- modify_stop: Update stop loss (asset, new_stop_loss_price)
- hold: Maintain current position (asset, reasoning)
═══════════════════════════════════════════════════════════════
OUTPUT FORMAT (STRICT JSON)
═══════════════════════════════════════════════════════════════
{
"timestamp": "<ISO 8601 timestamp>",
"market_analysis": {
"overall_assessment": "<1-2 sentences on current market conditions>",
"btc_outlook": "<BTC trend and its impact on altcoins>",
"key_observations": ["<observation 1>", "<observation 2>"]
},
"decisions": [
{
"action": "open_long" | "open_short" | "close" | "modify_stop" | "hold",
"asset": "<ETH|BNB|SOL|XRP|DOGE>",
"percent_of_capital": <1-100>,
"stop_loss_price": <price>,
"reasoning": "<clear explanation for this decision>"
}
],
"portfolio_strategy": {
"current_stance": "aggressive" | "moderate" | "defensive" | "neutral",
"cash_allocation_reason": "<why holding this cash level>",
"risk_notes": "<risk considerations>"
}
}
---
## Current Market Data
**Timestamp**: 2026-02-03T18:00:00Z
### BTC Context
{
"price": 84500,
"change_24h_percent": -2.6,
"trend_4h": "bearish",
"trend_1d": "bearish"
}
### Your Portfolio
{
"capital": {
"total_equity": 10590,
"available_cash": 4200,
"unrealized_pnl": -85
},
"positions": [
{
"asset": "ETH",
"side": "long",
"entry_price": 2310,
"current_price": 2195,
"unrealized_pnl": -115,
"pnl_percent": -4.98,
"stop_loss": 2150
}
]
}
### Technical Summaries
[
{
"asset": "ETH",
"current_price": 2195.95,
"price_change_24h_percent": -5.2,
"technical_summary": {
"trend": { "1h": "bearish", "4h": "bearish", "1d": "bearish", "1w": "neutral" },
"momentum": { "rsi_4h": 24.7, "rsi_1d": 38.2, "macd_4h_signal": "bearish" },
"key_levels": { "resistance_1": 2280, "support_1": 2150, "support_2": 2050 }
}
}
// ... other assets
]
### Raw OHLCV Data
[12 hourly candles, 12 four-hour candles, 20 daily candles, 10 weekly candles per asset]
---
**Provide your analysis and decisions in the specified JSON format.**Inilah konteks lengkap dalam format panggilan tunggal versi awal. Satu-satunya variabel selama ini hanyalah bagaimana tiap model menafsirkannya.
Alur Prompt Saat Ini
Universe-nya tidak diam di tempat. Musim 0–1 menjalankan prompt panggilan tunggal dengan lima koin seperti di atas. Pada musim-musim pertengahan kami memperluasnya secara drastis—pada satu titik lebih dari 80 instrumen yang mencakup saham AS, kripto di Binance, dan perpetual di Hyperliquid. Mengirim data OHLCV lengkap untuk setiap aset ke setiap model pada setiap siklus tidak praktis, sehingga arena membutuhkan cara untuk memfokuskan tiap prompt pada irisan pasar yang bisa dikelola. Saat ini tugas tersebut dijalankan oleh screener deterministik, bukan oleh panggilan model tambahan.
Pipeline-nya satu panggilan, bukan dua: penyaringan di sisi server memilih asetnya, lalu setiap model mengambil satu keputusan investor atas aset-aset tersebut. Berikut cara kerjanya.
Langkah 1: Penyaringan Deterministik
Sebelum model mana pun berjalan, screener di sisi server memberi skor kepada setiap aset yang memenuhi syarat. Skornya adalah rata-rata volume harian dalam dolar dikalikan (1 + nilai absolut momentum 10 harinya)—likuiditas dengan kecondongan ke apa pun yang sedang bergerak, naik maupun turun. Screener lalu mengambil 5 kripto teratas dan, pada hari bursa AS buka, 5 saham teratas, serta selalu menyertakan posisi terbuka milik tiap model agar model dapat mengelola apa yang dipegangnya.
Tidak ada model yang memilih daftar pendek itu. Penyaringan yang sama menghasilkan kumpulan kandidat yang sama untuk semua, dihitung murni dari harga dan volume—tanpa menggunakan RSI, MACD, atau indikator lain untuk memilih. Justru itulah intinya: setiap model bernalar atas masukan yang identik.
Penyaringan mengendalikan kedalaman candle, bukan kelayakan trading—setiap model juga menerima baris ringkasan untuk seluruh universe yang bisa diperdagangkan dan dapat membuka posisi pada aset mana pun yang ditandai tradeable_today, baik lolos penyaringan maupun tidak.
Langkah 2: Keputusan Investor (~10,5 ribu token)
Setiap model kemudian menerima satu prompt yang mencakup aset hasil penyaringan ditambah setiap posisi yang dipegangnya dan kedua benchmark. Untuk tiap aset, prompt memuat:
- Tabel semesta aset: satu baris ringkasan per aset yang bisa diperdagangkan (total 60: simbol, kelas, sektor,
tradeable_today, harga, imbal hasil 1d/10d/30d, volatilitas 30 hari, RSI-14, jarak dari titik tertinggi 30 hari, rata-rata volume dalam dolar, dan hari menuju rilis laba—13 kolom. Inilah yang memungkinkan pembukaan posisi pada aset mana pun tanpa harus mengirim candle lengkap untuk seluruh 60 nama pada setiap siklus. - Candle OHLCV mentah: 26 candle mingguan, 30 candle harian, dan 24 candle empat jam per simbol (open/high/low/close/volume) untuk pilihan screener dan segala sesuatu yang sudah dipegang sebuah model. Seri mingguan dan harian adalah lensa utama; 4h merupakan konteks penentuan waktu masuk.
- RSI dan funding: RSI 14 periode per kerangka waktu (rsi_4h, rsi_1d, rsi_1w) serta funding rate jika berlaku. Tidak ada indikator lain yang dihitung di awal.
- Konteks benchmark: seri BTC dan SPY, disediakan sebagai konteks pasar dan tidak pernah dapat diperdagangkan.
- Status portofolio lengkap: kas, ekuitas, semua posisi beserta harga masuk dan P&L belum terealisasi, ditambah tesis dan invalidasi yang dibawa dari siklus sebelumnya untuk setiap posisi terbuka.
Keluarannya berupa JSON ketat: ringkasan penalaran, blok konteks pasar, dan array keputusan. Aksi yang tersedia adalah open_long, open_short, add, close, dan hold—setiap open atau add wajib menyatakan tesis, invalidasi, dan sebuah invalidation_price, menentukan ukuran dengan percent_of_equity (10–100), serta melewati ambang keyakinan 0,80. Keputusan yang ditolak mendapat satu kali upaya perbaikan. Seluruh payload menghabiskan sekitar 10,5K token per model per siklus. Berikut skemanya:
{
"reasoning": "<2-4 sentences: portfolio-level view>",
"market_context": {
"overall_sentiment": "bullish" | "bearish" | "neutral",
"key_factors": ["...", "..."]
},
"decisions": [
{
"action": "open_long" | "open_short" | "add" | "close" | "hold",
"symbol": "<any symbol from the UNIVERSE table>",
"percent_of_equity": <10-100>,
"invalidation_price": <price — REQUIRED for open/add; optional on hold to move your level>,
"confidence": <0.80-1.00>,
"percent_of_position": <1-100, close only — omit for a full close>,
"thesis": "<REQUIRED for open/add: why this works over weeks>",
"invalidation": "<REQUIRED for open/add: what would prove you wrong>",
"rationale": "<one sentence>"
}
]
}Mengapa Penyaringan Deterministik
Masukan identik untuk setiap model: karena rumus tetap—bukan sebuah model—yang memilih aset mana yang mendapat kedalaman candle penuh, setiap peserta melihat daftar pendek yang sama pada tiap siklus, ditambah kepemilikannya sendiri, di atas tabel ringkasan seluruh semesta yang sama. Tidak ada model yang mendapat daftar pendek yang beruntung atau sial, dan satu-satunya variabel yang tersisa adalah bagaimana masing-masing bernalar atas data yang sama.
Tidak ada bias seleksi antarmodel: desain sebelumnya membiarkan setiap model menjalankan panggilan "scan" sendiri untuk memilih apa yang akan dilihat, yang berarti setiap model pada praktiknya menyusun semestanya sendiri. Penyaringan deterministik menghapus kebebasan itu, sehingga perbedaan hasil berasal dari pertimbangan, bukan dari daftar pantauan yang dipilih sendiri.
Komparabilitas benchmark: aturan seleksi yang stabil dan transparan menjaga kompetisi tetap sebanding antarmodel dan lintas musim. Ukuran input bisa berubah seiring semesta aset; kontrak keputusan yang harus dipenuhi setiap model tidak berubah.
Semesta Aset
Semesta yang dapat diperdagangkan saat ini bersifat campuran: 10 aset kripto dari Binance dan 50 saham AS berkapitalisasi besar dari Yahoo Finance—total 60 nama yang dapat diperdagangkan, semuanya terlihat dalam tabel semesta setiap siklus. BTC and SPY hanya menjadi konteks benchmark, tidak pernah dapat diperdagangkan. Pada hari libur bursa AS dan akhir pekan, tabel menandai setiap saham sebagai tidak dapat diperdagangkan hari ini alih-alih menghilangkannya, sehingga model tetap bisa melihat posisi harga. Posisi saham yang dipegang tetap terlihat sepenuhnya beserta candle untuk pengelolaan, apa pun kondisinya.
Model dapat memegang hingga 10 posisi secara bersamaan. Siklus keputusan berjalan setiap 24 jam (harian pada 16:00 UTC), dan monitor latar belakang memeriksa level invalidasi setiap 15 menit di antaranya. Pipeline yang sama berlaku untuk agen buatan pengguna ketika Agent Builder masih berjalan; kini pipeline itu mengatur daftar model resmi.