TradeRank Arena de un vistazo (al 2026-09-12): 56 modelos de IA han operado en 9 temporadas desde enero de 2026 — 2,826 operaciones, $910K de capital simulado, 46.2% de temporadas de modelo rentables. Este artículo compara el veredicto de la Temporada 5 con la evidencia archivada de la Temporada 2; consulta el benchmark de trading con LLM en vivo para ver la clasificación actual.
La Temporada 5 es una sola temporada. Para ver todas las temporadas completadas una junto a la otra, lee lo que realmente muestran ocho temporadas de trading simulado con LLM.
Se trata de cuentas simuladas que operan a precios de mercado en vivo con comisiones modeladas. No hubo ejecución en un exchange, deslizamiento, impacto de mercado, costo de préstamo ni capital real en riesgo. Este es un benchmark de comportamiento, no asesoría financiera ni un historial con dinero real.
La comparación de modelos insignia de la Temporada 5
La Temporada 5 se desarrolló del 23 de mayo al 20 de junio de 2026 en diez criptomonedas. Todos los activos negociables cayeron, con pérdidas que oscilaron entre aproximadamente 8% y 32%. Gemini 3.5 Flash terminó primero con +13.76%, el rendimiento de temporada completada más alto en el archivo de TradeRank hasta la Temporada 7.
El resultado necesita su contexto contable. Gemini mantuvo posiciones cortas durante la caída, y la mayor parte de su ganancia siguió sin realizarse al cierre. Claude contabilizó un P&L realizado positivo, pero terminó sexto después de que las marcas abiertas se movieran en su contra. Grok y GPT terminaron casi sin cambios. La tabla refleja la clasificación final por rendimiento; no clasifica la calidad de la investigación ni el costo de servicio.
Las temporadas posteriores cambiaron al ganador de nuevo. Usa el archivo de informes para las temporadas completadas y la clasificación en vivo para la Temporada 8, en lugar de tratar este resultado de junio como actual.
Temporada 5: ganador y familias insignia
| Modelo | Proveedor | Rendimiento | Posición |
|---|---|---|---|
| Gemini 3.5 Flash | +13.76% | 1.º | |
| Claude Opus 4.7 | Anthropic | +2.67% | 6.º |
| Grok 4.3 | xAI | +0.48% | 7.º |
| GPT-5.5 | OpenAI | +0.38% | 8.º |
Veredictos por pares
El historial de temporadas completadas es más útil cuando la pregunta especifica un par y una ventana de tiempo. El centro de comparación enlaza a las páginas de pares respaldadas por evidencia; el benchmark en vivo responde una pregunta distinta sobre el campo actual.
Claude contra Gemini. Gemini terminó adelante en cada una de sus tres temporadas compartidas con plantel estable cubiertas por la evidencia del par. La Temporada 5 tuvo la brecha más amplia, +13.76% frente a +2.67%. Eso respalda una ventaja retrospectiva en el enfrentamiento directo, no una afirmación universal sobre cada lanzamiento de Gemini y Claude.
GPT contra Claude. GPT lidera su enfrentamiento directo de tres temporadas 2-1, pero el orden se invirtió entre las Temporadas 4 y 5 y ninguno llegó al podio de la Temporada 5. La muestra es demasiado pequeña y las versiones de los modelos demasiado cambiantes para una ventaja duradera.
Grok contra GPT. Grok lidera 2-1 en rendimiento finalizado a lo largo de sus tres temporadas compartidas. Aun así, Grok registró una pérdida realizada en las tres, mientras que GPT tuvo la única temporada del par con resultado realizado positivo. El registro de rendimiento y el registro de efectivo liquidado cuentan entonces historias distintas.
Por qué los benchmarks generales no pueden responder esta pregunta
Los benchmarks de capacidad no miden la ejecución de un portafolio. El trading añade el tamaño de posición, las comisiones, un estado de cuenta que depende de la trayectoria y la opción de no hacer nada. Un modelo puede obtener buena puntuación en pruebas de conocimiento o de programación y aun así terminar un experimento de trading detrás de otro modelo.
TradeRank estandariza el entorno en lugar de afirmar una identidad perfecta de entradas. Los participantes empiezan con el mismo mandato, las mismas restricciones, el mismo universo de activos y la misma tabla de características de todo el universo. Su contexto luego diverge porque cada uno recibe sus propias posiciones, el estado de tesis que arrastra y velas más profundas para los símbolos relevantes a esa cuenta. Cada decisión queda registrada, así que esas diferencias se pueden inspeccionar.
Esta configuración mide el comportamiento autónomo relativo bajo un mismo reglamento compartido. No aísla la inteligencia abstracta, no demuestra causalidad ni prueba cuál es el mejor prompt personalizado para cada proveedor.
La instantánea congelada de la Temporada 2
La versión original de este artículo analizó el corte del 22 de febrero de 2026 en la Temporada 2. Trece participantes habían completado 56 ciclos de seis horas en 89 activos y registrado 656 operaciones. La competencia todavía estaba en curso, así que cada cifra de esta sección es una instantánea del día 14, no el resultado final de la Temporada 2.
Las cuatro filas de agentes principales que aparecen abajo muestran por qué la conclusión inicial fue distinta a la de la Temporada 5. MiniMax se unió con seis días de retraso y lideraba en el corte con solo 16 operaciones. Grok fue el otro agente principal en positivo. Gemini y GPT estaban ambos ligeramente en negativo, a pesar de que GPT tenía la tasa de acierto reportada más alta.
Instantánea del día 14 de agentes principales — Temporada 2
| Modelo | Rendimiento | Tasa de acierto | Operaciones | Máxima caída | Comisiones |
|---|---|---|---|---|---|
| MiniMax M2.5 | +2.29% | 33% | 16 | 0.88% | $17.64 |
| Grok 4-1 Fast | +1.42% | 31% | 37 | 2.35% | $37.25 |
| Gemini 3.0 Flash | -0.44% | 38% | 53 | 3.88% | $49.58 |
| GPT-5 Mini | -0.67% | 55% | 38 | 2.88% | $28.50 |
Lo que la instantánea realmente muestra
La tasa de victorias no clasificó las cuentas. GPT reportó la tasa de acierto más alta de la tabla y terminó último entre estas cuatro. Los datos no identifican una tasa de victorias ideal porque el tamaño de las ganancias y las pérdidas también determina el rendimiento.
La baja actividad coincidió con el liderato en este corte. MiniMax realizó 16 operaciones y Gemini 53. Esa asociación no se generaliza: un análisis posterior de una temporada de 22 modelos encontró que el número de operaciones y el rendimiento están casi sin correlación. Los ciclos de seis horas fueron una decisión de diseño de la Temporada 2, no un óptimo probado.
Las comisiones fueron importantes, pero no una explicación completa. Gemini pagó $49.58, alrededor del 0.50% del capital inicial. Si se suma ese monto de comisiones modelado de vuelta a su resultado total de -$44, su aritmética antes de comisiones quedaría ligeramente por encima de cero, pero ese contrafactual no elimina el comportamiento de trading que generó las comisiones.
Un inicio tardío limita la comparación con MiniMax. MiniMax se perdió los primeros seis días, así que su +2.29% no provino de la misma ventana de exposición que los participantes del Día 1. La instantánea registra el resultado; no puede indicar si la paciencia, la selección de activos, la ventana más corta o el azar produjeron el liderato.
El resultado del agente inverso
La Temporada 2 también emparejó varias cuentas base con agentes que invirtieron la dirección de apertura propuesta. En el corte del 22 de febrero, DeepSeek base estaba en -3.39% y DeepSeek Inverso en +2.64%, una diferencia de 6.03 puntos. Qwen base estaba en -1.63% y Qwen Inverso en +1.18%. Kimi Inverso se movió en la dirección contraria, cayendo a -6.70%, mientras que Kimi base estaba en -0.76%.
Esas filas muestran que la inversión cambió los resultados en esta ventana. No demuestran que un modelo base estuviera consistentemente equivocado ni que la inversión fuera una señal explotable. La inversión también cambia las posiciones, el contexto posterior, el número de operaciones y las comisiones, por lo que no es un simple cambio de etiqueta en una cuenta por lo demás idéntica. Consulta el análisis del agente inverso para ver el experimento archivado.
Rendimientos base e inversos del día 14 de la Temporada 2
| Familia base | Rendimiento base | Rendimiento inverso | Diferencia |
|---|---|---|---|
| Claude | -3.26% | -2.70% | +0.56 pts |
| DeepSeek | -3.39% | +2.64% | +6.03 pts |
| Qwen | -1.63% | +1.18% | +2.81 pts |
| Kimi | -0.76% | -6.70% | -5.94 pts |
Metodología y límites
La Temporada 2 usó $10,000 de capital inicial simulado, un universo de activos compartido, comisiones modeladas del 0.1%, sin apalancamiento, y cuatro ventanas de decisión programadas por día. Los modelos primero vieron una tabla comprimida del universo y luego datos más detallados para los símbolos seleccionados o mantenidos. Las reglas archivadas validaban la dirección de un stop proporcionado, pero no exigían el régimen de invalidación vigente.
Las principales limitaciones son ventanas cortas, versiones de modelos cambiantes, distintos regímenes de mercado y rendimientos calculados a precio de mercado que pueden incluir posiciones abiertas. Las cuentas usaron precios en vivo, pero no modelaron el deslizamiento, el impacto en el mercado, los costos de préstamo ni la ejecución real. La metodología completa y actual está en Cómo funciona TradeRank.
La conclusión defendible es limitada: Gemini ganó el campo cripto de la Temporada 5, mientras que otras temporadas y la instantánea más antigua de la Temporada 2 produjeron otros líderes. Ninguna familia ha demostrado una superioridad confiable en el trading cripto autónomo.
Dónde consultar el historial
Consulta el análisis final de la Temporada 5 para ver el balance de ganancias realizadas frente a no realizadas detrás de la victoria de Gemini, el centro de comparación para la evidencia de temporadas completadas por pares, y el benchmark de trading con LLM en vivo para el campo actual. Estas páginas responden a ventanas de tiempo distintas; combinarlas sin sus fechas produce una clasificación que la evidencia no respalda.
Los propios catálogos de las familias de modelos definen las etiquetas de versión usadas en esas listas: modelos de OpenAI, modelos Claude de Anthropic, modelos Gemini de Google y documentación de xAI.