Jalapeño promete hasta 1,9 veces más trabajo de IA por vatio

OpenAI publicó el 25 de agosto de 2026 los primeros resultados medidos de Jalapeño, su primer chip personalizado para inferencia de inteligencia artificial. La cobertura de Axios sobre el anuncio confirma que las pruebas incluyeron GPT‑OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T, y que la empresa espera instalar una cantidad limitada de sistemas durante 2026.
La afirmación central publicada ese 25 de agosto procede de OpenAI: Jalapeño completó entre 1,5 y 1,9 veces más trabajo de IA por vatio al máximo rendimiento y obtuvo entre 1,7 y 3,6 veces menos latencia de extremo a extremo que los sistemas comparados. Las tablas técnicas de OpenAI circunscriben estos resultados a configuraciones concretas de InferenceX; no demuestran una ventaja general ante cualquier acelerador, modelo o carga.
Qué sistemas y cargas comparó OpenAI

InferenceX es un benchmark público de SemiAnalysis que mide el servicio completo de una solicitud de IA. OpenAI utilizó una carga nominal de 8.000 tokens de entrada y 1.000 de salida, abreviada como 8k/1k, y predicción de un solo token o STP. El rendimiento se expresó en tokens mixtos por segundo y kilovatio, combinando el trabajo de entrada y salida antes de normalizarlo por potencia.
No hubo una única comparación. Jalapeño ejecutó GPT‑OSS 120B frente a un sistema Nvidia GB200, mientras que DeepSeek R1 670B y Kimi K2.5 1T se enfrentaron a GB300. Para calcular la eficiencia, OpenAI empleó la potencia nominal publicada de cada acelerador: 700 W para Jalapeño, 1.200 W para GB200 y 1.400 W para GB300; también indicó que su chip se mantuvo en 550 W o menos de potencia sostenida durante las cargas probadas.
El benchmark recorre varios puntos de operación porque rendimiento y rapidez individual no son la misma medida. Un sistema puede aumentar el número de solicitudes procesadas simultáneamente para maximizar el trabajo total, o reducir el lote para entregar antes cada token. Por eso los resultados separan el máximo de tokens por kilovatio, la latencia completa de la solicitud y el TBT mínimo, es decir, el intervalo entre tokens durante la generación.
De dónde sale la ventaja máxima de 1,9 veces
El valor del título corresponde específicamente a GPT‑OSS 120B frente a GB200 bajo STP y potencia nominal del paquete. Jalapeño registró 85.448 tokens mixtos por segundo y kilovatio, frente a 44.960, una relación aproximada de 1,9 veces. En esa configuración, la latencia de extremo a extremo fue de 1,03 segundos frente a 1,80 segundos, mientras que el TBT mínimo quedó en 0,69 milisegundos frente a 1,87.
Con DeepSeek R1 670B frente a GB300, las cifras fueron 19.641 y 11.781 tokens mixtos por segundo y kilovatio: alrededor de 1,7 veces más para Jalapeño. La diferencia de latencia completa fue mayor, con 1,65 segundos frente a 5,99 segundos, equivalente a unas 3,6 veces menos.
En Kimi K2.5 1T, Jalapeño alcanzó 18.195 tokens mixtos por segundo y kilovatio frente a 11.862, aproximadamente 1,5 veces más. La latencia fue de 1,56 segundos frente a 5,31, unas 3,4 veces menos. Así, los intervalos de 1,5 a 1,9 veces en eficiencia y de 1,7 a 3,6 veces en latencia resumen resultados de modelos y rivales distintos, no variaciones de una sola prueba.
Las ventajas mucho mayores que aparecen en otras partes de las tablas responden a otra comparación. OpenAI calculó cuánto trabajo podía completar Jalapeño manteniendo el mejor TBT previamente logrado por el rival. Esos puntos de latencia igualada no deben confundirse con la ventaja máxima de 1,9 veces en rendimiento por kilovatio.
Por qué el resultado todavía necesita validación externa

InferenceX es público, pero estos números continúan siendo resultados divulgados por el fabricante y obtenidos en su entorno. El análisis metodológico de Tom’s Hardware señala que SemiAnalysis ejecutó el benchmark junto con ingenieros de OpenAI en el laboratorio de la compañía, que las comparaciones principales utilizaron STP y que Jalapeño no fue enfrentado con Nvidia Vera Rubin.
El límite energético elegido también afecta al resultado. La cifra de hasta 1,9 veces utiliza el TDP del paquete, no toda la electricidad consumida por el servidor o el rack. En una comparación alternativa de potencia total por acelerador, los valores recogidos fueron 1,18 kW para Jalapeño y 2,55 kW para GB300; la diferencia también se estrechó aproximadamente a 1,5 veces al comparar Jalapeño con GB300 usando predicción de múltiples tokens.
Ninguna de estas cautelas invalida las mediciones publicadas, pero sí delimita su alcance. La participación de SemiAnalysis aporta supervisión especializada, aunque no equivale a una reproducción separada por un tercero, con infraestructura bajo su control y resultados publicados independientemente. Tampoco permite concluir que Jalapeño supere a todos los aceleradores bajo cualquier modelo, modalidad de predicción o método para contabilizar la energía.
El despliegue sigue siendo limitado
Jalapeño es un acelerador para servir modelos ya entrenados; no sustituye el hardware necesario para entrenarlos. OpenAI continúa con la calificación para producción, la maduración del software, la preparación operativa y las pruebas con más modelos. La compañía también prevé seguir desplegando aceleradores de Nvidia y otros proveedores para cargas de entrenamiento e inferencia.
Por ahora, la historia queda en un primer conjunto de resultados medidos y publicados por OpenAI, no en una victoria universal certificada. La promesa de hasta 1,9 veces más trabajo por vatio está respaldada por la configuración declarada de GPT‑OSS 120B frente a GB200. Faltan una reproducción externa, comparaciones con otras plataformas y datos sostenidos de consumo, rendimiento y fiabilidad cuando Jalapeño pase del laboratorio a una implantación más amplia.
Lee también:
Suscríbete a nuestro boletín
Reciba las últimas noticias sobre Web3, IA y criptomonedas directamente en su bandeja de entrada.