Paul Kedrosky:

El modelo Kimi K3 de Moonshot tiene a la gente demasiado entusiasmada, como si se hubiera roto alguna tendencia, pero están equivocados. Como he escrito aquí muchas veces, el rendimiento de los modelos de lenguaje de gran tamaño comenzó a converger hace algún tiempo. Las puntuaciones siguen subiendo, pero la curva ajustada se está aplanando y la varianza se está reduciendo, especialmente una vez que salimos de la era del preentrenamiento y pasamos a depender más del postentrenamiento, como el RLHF.

En la era del postentrenamiento, los lanzamientos sucesivos ofrecen menores ganancias de capacidad, menos valores atípicos duraderos y una diferenciación técnica menos defendible. Utilizando el Índice de Capacidades de Epoch, el centro de la distribución subió de aproximadamente 117 a principios de 2024 a unos 150 a mediados de 2026. La pendiente decreciente, sin embargo, significa que el valor de cada lanzamiento incremental de modelos (ignorando los arneses) está cayendo, incluso si los costes de producción no lo hacen.

Ben Thompson:

Uno de los conceptos erróneos más comunes que sustentan la discusión sobre los modelos de pesos abiertos es que son más baratos, incluso gratuitos. Después de todo, uno puede simplemente descargar los pesos y saltarse el tiempo, el gasto y las capacidades necesarias para crear su propio modelo. Eso es, por supuesto, cierto, pero el "gratis" en este caso es una referencia a la cantidad que se necesita gastar en investigación y desarrollo; el I+D es un gasto fijo que es independiente de los ingresos que se generen. Si gastas $1 millón en I+D, no importa si generas $100 mil en ingresos o $100 millones; de todos modos gastaste $1 millón en I+D (aunque, por supuesto, esto impacta tu rentabilidad).

Lo que sí está relacionado con los ingresos es el COGS —costo de los bienes vendidos— y el COGS es real para la IA de una manera que no lo ha sido para el software durante mucho tiempo. Específicamente, ejecutar la inferencia en un modelo —ya sea que ese modelo sea Kimi o Fable— cuesta dinero, y la cantidad de dinero que un proveedor de IA gasta en inferencia está, al menos en la mayoría de los modelos de negocio, directamente correlacionada con los ingresos. Para reutilizar el ejemplo anterior, generar $100 millones frente a $100 mil en ingresos probablemente requerirá 1,000 veces el COGS. En términos concretos, si cuesta 50 centavos generar los tokens que impulsan $1 en ingresos, entonces $100 millones en ingresos tendrán $50 millones en COGS; $100 mil en ingresos solo tendrán $50 mil en COGS.

El punto en términos de los modelos de pesos abiertos es que no es gratis ponerlos en servicio. Kimi K3 cuesta $3 por millón de tokens de entrada y $15 por millón de tokens de salida; eso es más barato que los $5 por millón de tokens de entrada y $30 por millón de tokens de salida de Sol, pero puede que esa ni siquiera sea la medida correcta.

En mayo de este año escribí:

¿Tiene sentido que tengas un agente de Claude, que corre 24 h al día, que (en teoría) funciona con mínima supervisión, pero que está 100 % en infraestructura externa; que usas para avanzar objetivos de negocio, y que te estén cobrando por cuántos tokens usa? Los incentivos no funcionan para ninguna de las partes: la empresa quiere asegurarse de que está pagando por algo que funciona y, en el momento que no puedan asociar un token gastado con un resultado de negocio favorable, van a dejar de usarlo; por otro lado, los proveedores de modelos no quieren estar nada más quemando GPU de manera irresponsable, porque su capacidad de vender sus servicios está limitada por estos assets que, cada segundo que pasan funcionando, se están depreciando y desgastando.

Si Anthropic y OpenAI se ponen pilas, podrían comenzar a cobrar un porcentaje de las ganancias que sus agentes logren para el negocio.

Vas con OpenAI y le dices que quieres que te hagan un agente de ventas, les pones objetivos de negocio medibles, parámetros de ejecución y firmas un contrato que dice que le vas a dar un porcentaje de la comisión por cada venta que cierre de manera autónoma, por ejemplo.

Los incentivos estarían alineados: tu empresa paga por resultados y no por token generado sin un resultado atribuible. Como el proveedor absorbe el costo de los tokens, los motiva a hacer sus modelos más eficientes, lo que a su vez debería hacer que el precio por token baje también para todos los demás. El partnership de OpenAI con Cerebras (y el hecho de que justo hoy Cerebras salió a la bolsa) es un indicador de que la industria está buscando formas de optimizar los sistemas de inferencia.

Chance ese futuro no va a llegar vía OpenAI o Anthropic, sino de laboratorios Chinos