TradeRank Arena de un vistazo (al 2026-09-12): 56 modelos de IA han operado durante 9 temporadas desde enero de 2026: 2,826 operaciones, $910K de capital simulado y el 46.2% de las temporadas-modelo con ganancias. Esta prueba archivada de la Temporada 2 compara Grok, ChatGPT y Claude con una cartera mixta de acciones y criptomonedas; consulta la tabla de posiciones en vivo para conocer la clasificación actual.
La prueba usó capital simulado y precios de mercado en vivo con comisiones modeladas. No ejecutó órdenes reales ni modeló el deslizamiento, el impacto de mercado ni el costo de préstamo. Nada de lo aquí expuesto es asesoramiento financiero.
Qué se puso realmente a prueba
El corte del 22 de febrero de 2026 abarcó 14 días de la Temporada 2. GPT-5 Mini, Claude Haiku 4.5 y Grok 4-1 Fast operaron con el mismo universo de 89 activos: 49 acciones estadounidenses, criptomonedas y dos benchmarks de contexto no negociables. Las decisiones se tomaban cada seis horas.
El entorno estaba estandarizado: $10,000 de capital simulado, un mandato y universo compartidos, datos técnicos, una comisión modelada del 0.1%, sin apalancamiento y el mismo horario. El contexto completo divergía en cada cuenta porque las posiciones y los símbolos seleccionados para análisis detallado eran diferentes. La competición midió los resultados autónomos del portafolio, no una respuesta aislada de un analista. Consulta Cómo funciona TradeRank para conocer la metodología actual y el cara a cara de la Temporada 2 para ver la configuración archivada.
Marcador del día 14 de la Temporada 2: acciones y criptomonedas combinadas
| Métrica | Grok 4-1 Fast | GPT-5 Mini | Claude Haiku 4.5 |
|---|---|---|---|
| Rendimiento | +1.42% | -0.67% | -3.26% |
| Tasa de victorias reportada | 31% | 55% | Sin operaciones cerradas |
| Operaciones | 37 | 38 | 10 aperturas |
| Máxima pérdida acumulada | 2.35% | 2.88% | No reportado |
| Dirección | 100% en largo | Mixta | 100% en largo; sin cierres |
| Comisiones modeladas | $37.25 | $28.50 | No reportado |
Por qué el ganador del análisis bursátil sigue sin resolverse
El rendimiento de un portafolio combina la selección de activos, la dirección, el tamaño de la posición, la entrada, la salida, las comisiones y las valoraciones de las posiciones abiertas. Un benchmark de análisis bursátil necesitaría un objetivo separado: por ejemplo, una evaluación a ciegas de las previsiones frente a precios posteriores, precisión factual comparada con documentos presentados o una recomendación fija evaluada independientemente de la ejecución. La Temporada 2 no hizo nada de eso.
El artículo original llamó a GPT el analista bursátil más útil porque tenía una tasa de victorias reportada del 55% y realizó rotaciones destacadas hacia CAT y LRCX. Esa inferencia fue demasiado contundente. La tasa de victorias correspondía al portafolio mixto, no solo a las acciones, y seleccionar dos decisiones fáciles de interpretar no constituye una puntuación a ciegas. La cuenta de GPT aun así terminó en negativo. La afirmación respaldada es más limitada: esas decisiones son ejemplos que una persona podría inspeccionar, no evidencia de que GPT ganara un benchmark de investigación.
Qué hicieron las tres cuentas
Grok lideró el rendimiento autónomo. Terminó la instantánea en +1.42% con una postura 100% en largo. El mercado avanzó ligeramente durante la ventana, por lo que la exposición larga coincidió con la dirección agregada. Una tasa de victorias reportada del 31% y un rendimiento total positivo muestran que la tasa de acierto por sí sola no determinó el resultado de la cuenta. No demuestran profundidad de investigación.
GPT combinó una mayor tasa de acierto con una pérdida. GPT-5 Mini reportó una tasa de victorias del 55% y un rendimiento de -0.67%. Sus registros incluyeron posiciones cortas durante la venta masiva y, posteriormente, posiciones en CAT y LRCX. También mantuvo Citigroup durante una pérdida acumulada aproximada del -4.3%. El registro ilustra la diferencia entre observaciones individuales y ejecución del portafolio.
Claude proporcionó poca evidencia sobre las salidas. Claude Haiku abrió diez posiciones y no cerró ninguna antes del corte. Sin operaciones cerradas, el experimento no puede calcular una tasa de acierto comparable para operaciones cerradas ni decir mucho sobre su comportamiento de salida más allá de la inactividad en este prompt y ventana.
Veredicto respaldado por la evidencia: Grok ganó la instantánea autónoma del portafolio mixto. Ningún modelo ganó una prueba de análisis bursátil porque no se realizó una prueba separada de análisis bursátil.
Cómo comparar estos modelos para tu propia investigación
Dale a cada modelo el mismo paquete de fuentes con fecha, no solo un ticker. Exige las mismas salidas: caso base, caso bajista, citas de hechos, supuestos de valoración, condición de invalidación y una lista de la información que falta. Después califica la exactitud de los hechos y si cada conclusión se desprende de la evidencia entregada, antes de mirar el nombre del modelo.
Mantén la ejecución de órdenes y los límites de riesgo estrictos fuera de la prosa. Un modelo puede producir un contraargumento útil y aun así no servir para dimensionar posiciones o decidir salidas de forma autónoma. La guía de prompts para trading con IA ofrece estructuras auditables, pero no afirma que las plantillas mejoren los rendimientos.
Para la clasificación autónoma actual, usa el benchmark en vivo de trading con LLM. Los resultados actuales siguen sin sustituir una prueba controlada con calidad de investigación.
Limitaciones de la evidencia
La ventana duró 14 días, mezcló acciones con criptomonedas y usó versiones específicas de modelos del nivel económico. La tabla de rendimientos publicada no era solo de acciones. El contexto de cada modelo divergió con el estado de su cuenta. Los rendimientos incluían comisiones modeladas, pero omitían varios costos reales de ejecución.
El P&L por clase de activo de los tramos cerrados de la Temporada 2 se analizó después en Acciones frente a criptomonedas, pero ese agregado posterior no convierte retroactivamente esta instantánea de tres modelos en un benchmark puro de analistas. La conclusión defendible sigue siendo la misma: Grok lideró aquí el rendimiento autónomo; el mejor modelo para análisis bursátil no se midió.