Nota

Jalapeño, el chip de inferencia de OpenAI, tiene mejor performance que cualquier oferta de NVIDIA, AMD o Google

SemiAnalysis:

OpenAI ha pasado los últimos dos años construyendo silenciosamente “Jalapeño”, un chip de inferencia recién anunciado en Hot Chips. Los rumores de un tapeout exitoso llevaban tiempo circulando. Pero ahora tenemos los detalles. OpenAI nos invitó a ver su chip, ir a sus laboratorios para comprobar cuán real es y evaluarlo con nuestra suite InferenceX.

En junio, OpenAI presentó el programa de chips en asociación con Broadcom, construido desde cero exclusivamente para la inferencia de LLM. El trabajo de diseño comenzó a mediados de 2024, pasando de la contratación inicial del equipo al tape-out de fabricación en aproximadamente 16 meses, un ciclo de desarrollo de ASIC extremadamente rápido.

En general, los chips de primera generación no son competitivos, pero OpenAI rompe la tendencia al ser líder en la industria y superar a todos los chips de Nvidia, AMD y Google que hemos podido probar en múltiples modelos de código abierto destacados. OpenAI logra esto con un codesarrollo extremo de hardware y software. Sorprendentemente, OpenAI no se excede en la especialización de ninguna parte específica de la inferencia de modelos, sino que se enfoca en ser un chip general que ofrece un alto rendimiento en todos los escenarios.

😱

Jalapeño supera a Blackwell en rendimiento por vatio (perf/W) en casi todos los escenarios sin estar optimizado para ningún punto específico de la curva. Destaca no solo en escenarios de baja latencia, sino también en escenarios de alto rendimiento. Una comparación más directa es frente a los resultados de predicción de un solo token (Single Token Prediction), donde deja a todos los competidores por los suelos. En escenarios de baja concurrencia, Jalapeño demuestra una interactividad notable, alcanzando más de 700 tokens por segundo por usuario con una concurrencia de 1 en el modelo DeepSeek R1.

Increíblemente, todo esto se logra con la predicción de un solo token (STP), sin decodificación especulativa y sin desagregación de prefill-decode. Además de DeepSeek R1, también pudimos ver algunos otros modelos, incluidos Kimi-K2.5 y GPT-OSS, que funcionaron a aproximadamente 1,400 tok/sec/user. Para todos los modelos, confirmamos que las evaluaciones de GSM8k de Jalapeño alcanzaron resultados a la par de los chips de Nvidia.

Comparto enlaces y analisis como este regularmente. Recíbelos por correo.