La narrativa de moda en redes en los últimos tiempos nos dice que los nuevos modelos chinos como DeepSeek o Kimi están logrando, con una fracción de la inversión, los mismos resultados que las grandes americanas.
Hoy leía un artículo en Bloomberg donde precisamente hablaban de cómo China está reduciendo rápidamente la ventaja con respecto a Estados Unidos e incluso tomando la delantera en algunas métricas, y cómo esto puede ser un problema para empresas como OpenAI y Anthropic, cuyas valoraciones se basan en la superioridad de sus capacidades.
Modelos como Kimi K3 supuestamente casi igualan las capacidades del modelo más avanzado de Anthropic a una fracción del coste.
¿Pero hasta qué punto es esto cierto? ¿Cómo se miden las capacidades de los modelos de inteligencia artificial? ¿Son fiables las pruebas que se realizan?
Antes de enterrar en vida a Claude o ChatGPT deberíamos hacernos algunas preguntas.
¿Cómo se comparan los LLM?
Arenas
Uno de los métodos para comparar LLM es mediante las llamadas arenas. Existen varios sitios que implementan estas arenas. Uno bastante conocido es arena.ai.
La idea básica detrás de ellas es que no existe un examen prestablecido para examinar a todos los modelos. Es más bien una batalla entre modelos: el usuario introduce un prompt y recibe dos respuestas de dos LLM diferentes, sin saber cuál de ellos ha producido cada respuesta.
Con ellas en pantalla, el usuario elige:
respuesta A
respuesta B
empate
o, según la arena concreta, podría indicar que ninguna es buena.
Con una gran cantidad de enfrentamientos y votos de usuarios, se construye un ranking basado en sus preferencias.
Problemas de las arenas
Este método de comparación tiene varios problemas:
Mide preferencia humana sobre las respuestas. Lo cual es bastante diferente a medir precisión de la respuesta, capacidad matemática, razonamiento, capacidad de programación, capacidad para detectar errores, resistencia a alucinaciones, seguridad de las respuestas o capacidad de seguir instrucciones complejas.
Un modelo puede producir una respuesta que un humano considere mejor y, sin embargo, contener un error que el usuario no detecte.
El humano puede, directamente, no saber cuál es la respuesta correcta.
Sesgo de estilo: un par de emoticonos y un chascarrillo en el lugar adecuado pueden cambiar por completo la elección del usuario y una vez más, quizás la respuesta más bonita o más graciosa, no sea la respuesta más exacta.
Idioma: esto también es importante porque un modelo puede ser tremendamente bueno en chino y solamente bueno en inglés, o viceversa.
También hay que tener en cuenta qué versión de cada modelo se usa en la arena en cuestión, porque no siempre se están usando los modelos más avanzados o de pago, con modos de razonamiento más intensivos.
Prompts aislados: en las arenas se evalúan prompts de forma aislada, y sus respuestas. En la vida real el LLM se usa de forma totalmente distinta.
Prompt aislado: Prompt → respuesta A / respuesta B → voto.
Vida real: Prompt → respuesta → corrección → nuevo contexto → documento → contraargumento → revisión → cálculo → nueva información → conclusión.
Benchmarks y evaluaciones especializadas
Como vemos, las arenas no parecen el sistema más adecuado para medir por sí solas la capacidad de una IA.
En el artículo que os comentaba de Bloomberg, las gráficas que comparten hacen referencia a índices compuestos por el resultado de varios benchmarks especializados: Artificial Analysis Intelligence Index, Epoch Capabilities Index, Vals Index y Terminal-Bench 2.1.
Estos benchmarks son pruebas diseñadas para medir capacidades concretas de los modelos, como razonamiento, matemáticas, programación, ciencia o trabajo con agentes.
Experimento: diseñando una prueba de razonamiento para LLM
Vamos a hacer un pequeño experimento sencillo para entender qué tipo de pruebas se diseñan y se utilizan en estos benchmarks especializados.
Vamos a utilizar este prompt contra varios modelos públicos:
Hay 5 personas: Ana, Bruno, Carla, David y Elena. Cada una lleva una camiseta roja o azul. Cada persona puede ver las camisetas de los demás, pero no la suya. Ana dice: “No puedo saber mi color”. Bruno dice: “Yo tampoco”. Carla dice: “Ahora sí sé mi color”. ¿De qué color es la camiseta de Carla y cómo puede saberlo? Respuesta concisa y corta, en 4 o 5 líneas.
La gracia de este prompt es que es una variante del acertijo de los tres sombreros. Pero tal como está planteado, no tiene solución. Un buen LLM debería darse cuenta de que faltan datos y llegar a la conclusión de que no tiene solución, en vez de intentar resolverlo por similitud con algo conocido, como el acertijo de los tres sombreros.
Las respuestas recopiladas de cada modelo son las siguientes:
Grok 4.5 Fast (modo gratuito, las versiones con más procesamiento son de pago):
Carla lleva camiseta roja.
Se asume el conocimiento común de que hay al menos una roja.
Ana no sabe → ve ≥1 roja (no hay solo 1 en total).
Bruno tampoco → ve ≥1 (no hay solo 2 en total).
Carla, al oír eso, ve exactamente 2 rojas y deduce que la suya es la tercera (roja).
Ernie de Baidu, versión web por defecto:
La camiseta de Carla es de color distinto al común de David y Elena; lo sabe porque si David y Elena fueran iguales, su color no puede coincidir con ellos (de lo contrario Bruno habría adivinado el suyo propio).
Kimi, Instant con esfuerzo de pensamiento alto (por alta demanda de usuarios no permite el modo con mayor procesamiento de forma gratuita):
Carla lleva el color opuesto al que ve en David y Elena.
Del silencio de Ana deduce que entre Bruno, Carla, David y Elena hay ambos colores. Del silencio de Bruno deduce que entre ella, David y Elena también hay ambos colores. Al ver que David y Elena llevan el mismo color, sabe que el suyo debe ser el contrario para cumplir esa condición.
DeepSeek sin pensamiento profundo:
La camiseta de Carla es azul.
Carla razona así: si Ana y Bruno no pueden saber su color, significa que no están viendo dos camisetas rojas en los demás (porque entonces sabrían que la suya es azul). Al ver Carla que Ana y Bruno dudan, deduce que su propia camiseta no puede ser roja, por lo tanto es azul.
DeepSeek con pensamiento profundo:
Con la premisa usual de que hay al menos una camiseta roja (si no, no se puede deducir), Carla es roja. Ana no supo → no vio a Bruno, Carla, David y Elena todos azules. Bruno no supo → no vio a Ana, Carla, David y Elena todos azules. Carla deduce que, si ella fuera azul, Ana o Bruno habría visto a todos azules y habría sabido; como no fue así, su camiseta es roja.
Qwen 3.7-plus sin nivel de pensamiento automático:
Asumiendo la regla clásica de 3 rojas y 2 azules: Ana no ve 2 azules (ve máximo 1). Si Bruno viera 1 azul en los demás, sabría que él es rojo (para no superar el límite de Ana). Como Bruno no sabe, significa que no ve ninguna azul entre Carla, David y Elena. Carla deduce entonces que ella no lleva azul al escuchar a Bruno. Por lo tanto, la camiseta de Carla es roja.
Qwen 3.7-plus con nivel de pensamiento alto:
La camiseta de Carla es roja.
Asumiendo la premisa clásica omitida (3 rojas y 2 azules),
Ana no sabe porque no ve 2 azules (no hay 4 azules en total).
Bruno tampoco sabe porque no ve 1 azul entre Carla, David y Elena.
Carla deduce entonces que ella, David y Elena llevan camisetas rojas.
Gemini 3.6 Flash:
La única forma en que Carla puede deducir su color tras oír que Ana y Bruno dudan es que las camisetas de Ana y Bruno sean iguales. Si Ana duda, descarta que las otras 4 sean del mismo color. Al dudar Bruno después, deduce que su camiseta y la de Ana no pueden romper la simetría con las demás. Carla sabe que el único patrón que genera esa secuencia de dudas ocurre cuando las dos primeras personas ven camisetas idénticas; al ver la camiseta de Ana (o Bruno), Carla sabe que la suya es exactamente del mismo color.
Gemini 3.1 Pro con pensamiento extendido:
Asumiendo la regla clásica faltante en este acertijo de que hay 3 camisetas de un color (ej. rojas) y 2 del otro (azules):
-Ana no sabe su color porque no ve las 2 camisetas azules en los demás (ve máximo una).
-Bruno tampoco lo sabe porque no ve 1 azul delante; si la viera, sabría que su camiseta es roja para no sumar las 2 que delatarían a Ana.
-Carla deduce lógicamente que si Bruno también dudó, es porque vio cero camisetas azules frente a él.
-En consecuencia, Carla sabe con total seguridad que su propia camiseta es roja (el color mayoritario).
Claude Sonnet 5:
No hay solución lógica válida: es un enunciado “trampa”. Para que las declaraciones de Ana y Bruno aporten información, necesitaría existir algún dato común previo (p. ej. “hay al menos una camiseta roja”), que aquí no se da. Sin eso, cualquiera puede decir siempre “no sé mi color” sin importar lo que vea, así que esas frases no transmiten nada.
Por tanto, Carla no puede deducir su color a partir de esas dos afirmaciones vacías; el problema, tal como está planteado, no tiene información suficiente para resolverse.
ChatGPT versión gratuita en web actualmente, GPT 5.6:
No se puede determinar: el acertijo está incompleto.
Ana siempre podría decir “no sé”, independientemente de lo que vea.
Por tanto, la afirmación de Bruno tampoco aporta información suficiente para Carla. Carla no puede deducir su color sin una regla adicional (p. ej., número limitado de camisetas de cada color).
Y esta es la comparativa final de las respuestas de cada modelo:
En la comparación no he tenido en cuenta tiempos. Pero modelos como Kimi, DeepSeek, Ernie,… han tardado muchísimo más en dar la respuesta que otros como ChatGPT, Claude o Gemini.
Ojo, vemos que cerca de Claude y ChatGPT, tenemos a la china Qwen con una puntuación relativamente buena a pesar de no haber resuelto correctamente el problema original (al igual que Gemini), pero que al menos explicita la premisa adicional que está introduciendo.
Pero Qwen tiene detrás un gigante como Alibaba y una infraestructura que nada tiene que envidiar a las occidentales. No tiene nada que ver con DeepSeek o Kimi (que son las supuestas amenazas de bajo coste que rondan a los titanes de la IA, devoradores de CapEx).
Problemas de los benchmarks
El ejemplo anterior nos ha valido para hacernos una idea del tipo de pruebas que un benchmark podría plantear a los LLM para comparar lo correctas que son sus respuestas.
Nuestro ejemplo es muy sencillo, un benchmark se compone de un montón de pruebas diferentes, y cada grupo de pruebas va orientado a probar una capacidad del modelo.
Y los índices compuestos como los que referencia Bloomberg en su artículo pueden agregar benchmarks muy diferentes. El resultado final dependerá de qué capacidades se ponderan más y cómo se construye el índice.
Los benchmarks e índices compuestos no están exentos de problemas:
Aunque eliminemos el sesgo de estilo y las carencias de un humano para decidir qué respuesta es mejor, incluso en un benchmark lo más objetivo posible, los diseñadores tienen que tomar decisiones que terminan afectando al resultado de la prueba:
qué tareas incluir.
qué métricas utilizar.
qué peso dar a cada una.
cómo normalizar resultados.
cómo tratar modelos que son excelentes en algo pero peores en otra cosa.
Un benchmark sigue sin ser comparable a la vida real. Por muchas capacidades que se quieran testear, por mucho que se quiera abarcar en la prueba, nunca será igual a la vida real y a lo que un LLM tendrá que solucionar en un caso práctico real (por ejemplo análisis financiero + razonamiento complejo + documentos largos + detectar errores + consistencia + investigación).
Contaminación del benchmark: si una pregunta del conjunto de evaluación ya aparece en los datos de entrenamiento del LLM, el LLM podría saber la respuesta a esa pregunta por haberla visto durante el entrenamiento. Es decir, no la está resolviendo por capacidad de razonamiento y generalización. Es algo así como cuando vas a un examen tipo test y marcas la respuesta adecuada porque te la sabes de memoria o te suena, y ni siquiera estás entendiendo la pregunta ni la respuesta.
Preparación para el examen: es ligeramente diferente a la contaminación. Un modelo podría haber sido entrenado con miles de ejemplos similares a los del propio benchmark haciendo que aprenda el formato de las preguntas, el tipo de razonamiento que se espera de él, patrones que suelen producir respuestas correctas, incluso estrategias para maximizar la puntuación. El modelo es perfecto para enfrentarse a ese benchmark, pero, ¿qué pasará con cualquier problema fuera del benchmark para el que fue “artificialmente” entrenado?
Knowledge distillation / Destilación de conocimiento:
Es una técnica legítima mediante la cual un modelo pequeño utiliza respuestas de un modelo más potente como datos de entrada para su entrenamiento.
El problema aparece cuando se extraen sistemáticamente respuestas de modelos propietarios sin autorización. Esto no es una hipótesis. Según Anthropic, en febrero de 2026 DeepSeek, Moonshot y MiniMax habían utilizado millones de interacciones con Claude para entrenar sus modelos mediante destilación.
Esto no significa que un modelo pequeño simplemente copie respuestas de un modelo grande como ChatGPT o Claude, para saberse los benchmarks “de memoria”. Aunque en parte eso puede pasar, un modelo también puede desarrollar capacidades reales mediante destilación, no simplemente aprender una copia literal de las respuestas.
Pero la duda, y lo que tiene más que ver con la problemática de los benchmarks, es: ¿Cuánto de la capacidad de los modelos de bajo coste proviene de su propia capacidad general para razonar o para otros campos, y cuánto proviene de haber aprendido a mimetizar modelos que ya resolvieron esos problemas antes?
Hay mucha literatura sobre esto, pero como hemos visto en los puntos anteriores, los tests con pruebas prediseñadas no están exentos de problemas.
Para mí son especialmente críticos los puntos relacionados con contaminación, preparación para el examen, y sobre todo el último, el que habla de la destilación de conocimiento. Porque no permite distinguir fácilmente la capacidad genérica de un modelo en algunas áreas. No permite diferenciar fácilmente qué parte de su capacidad matemática, de razonamiento o de programación procede de una capacidad general propia y qué parte puede proceder de haber aprendido de otros modelos que ya resolvieron problemas similares.
No es lo mismo ser un gran físico que entiende y domina la teoría de la relatividad, que ser Einstein y ser capaz de idearla y desarrollarla desde cero.
Conclusión
Siento que este artículo se haya desviado un poco de la temática principal de este blog, que es la inversión y las finanzas. Aunque en parte, está relacionado con dudas que todo inversor en las BigTechs tiene ahora mismo: ¿Qué pasará con el enorme gasto en CapEx, se rentabilizará a tiempo? ¿Es realmente necesaria esa brutal inversión cuando vemos compañías chinas consiguiendo resultados similares con mucho menos?
En este artículo he intentado dar otro punto de vista para responder a esas preguntas.
No es lo mismo ser la locomotora del tren, que un vagón.
No es lo mismo que un LLM tenga capacidades generales para razonar y ser capaz de resolver problemas nuevos a los que no se ha enfrentado previamente, a que un LLM pueda resolver un problema porque ya ha visto y aprendido cómo otros lo han resuelto antes.
Es difícil saber qué ocurrirá a nivel financiero con Claude o ChatGPT. Podrían estar muy por delante de Kimi o DeepSeek, tecnológicamente hablando. Pero si estos últimos te resuelven el 90% de tus necesidades por un precio muy inferior, ¿estará la gente dispuesta a pagar un plus por la excelencia? ¿Y por ese porcentaje de problemas que Claude o ChatGPT sí son capaces de resolver?
Hay casos críticos. Por ejemplo, en mi experiencia, el análisis que te hacen Claude o ChatGPT de un informe de resultados de una empresa sigue estando bastante por encima del que consigue Kimi, DeepSeek e incluso Gemini. Y eso es algo que posiblemente algunos de los lectores de mi substack podrían haber experimentado ya. Si quieres obtener un análisis decente y correcto, necesitas recurrir a ellos.
Pero está claro que estos modelos “low-cost” van a llevarse una parte del pastel. La duda es si la parte del pastel restante, la que va a quedar para las grandes, será suficiente para mantenerlas a flote y permitirles rentabilizar la brutal inversión en CapEx que están haciendo.
Sea como sea, aunque he intentado recopilar toda la información que he podido, este artículo no deja de ser más de opinión que de números, y por tanto es mejor cogerlo con pinzas. Y por supuesto, como siempre, no es ningún tipo de consejo de inversión.
Espero que lo hayáis disfrutado.
Saludos.





