Jalapeño обошёл системы Nvidia по ваттам — но тест ещё не независимый

25 августа 2026 года OpenAI опубликовала первые измеренные результаты Jalapeño — специализированного чипа для обработки запросов к моделям. В испытании InferenceX система превзошла сравниваемые решения Nvidia по пропускной способности на единицу мощности и показала меньшую задержку, однако проверка не была полностью независимой.
Прогоны наблюдала SemiAnalysis, но испытание проводилось совместно с инженерами OpenAI, а численные данные предоставила сама компания. Результаты подтверждают работоспособность инженерных образцов и преимущество в проверенных режимах, но пока не доказывают лидерство по абсолютной скорости, цене или готовности к массовому развёртыванию.
Что именно измеряли

В испытании сравнивались не изолированные микросхемы, а полные системы обработки запросов: ускорители, память, соединения и программное обеспечение. В публикации OpenAI от 25 августа сказано, что на модели GPT-OSS 120B новая система достигла более высокой пиковой пропускной способности на киловатт и меньшей задержки токенов, чем участвовавшие в сравнении коммерческие платформы.
Главная величина — число выходных токенов в секунду на единицу полной потребляемой мощности. Она показывает, сколько работы система выполняет в заданном энергетическом контуре. Для центра обработки данных это практически важно: при ограничении со стороны электросети и охлаждения более эффективная платформа способна обслуживать больше запросов без пропорционального увеличения доступной мощности.
Условия и границы опубликованного сравнения можно свести к четырём позициям:
- Модель: GPT-OSS 120B.
- Режим: 8000 входных и 1000 выходных токенов за один обмен.
- Измеряемые величины: пропускная способность на киловатт и задержка выдачи токенов.
- Система сравнения: коммерческие стойковые решения, включая Nvidia GB200; исходные числа для нового чипа предоставила OpenAI.
Энергоэффективность при этом не равна абсолютной скорости. Итог меняется вместе с моделью, числом одновременных запросов, длиной контекста и допустимой задержкой, поэтому преимущество в токенах на ватт нельзя автоматически переносить на любой производственный сценарий.
Где Jalapeño оказался впереди
разбор SemiAnalysis показывает преимущество новой системы над платформами Blackwell по производительности на ватт почти на всей исследованной кривой. На модели DeepSeek R1 при одном одновременном запросе скорость превысила 700 токенов в секунду на пользователя, а на GPT-OSS 120B пропускная способность при сопоставимой интерактивности была почти вдвое выше максимальной точки GB200.
Этот результат получен с предсказанием одного токена за шаг, без спекулятивного декодирования и без разделения обработки входа и генерации между разными группами оборудования. В части чужих результатов применялось предсказание нескольких токенов, поэтому условия нельзя считать полностью одинаковыми.
Испытания проходили на ранней ревизии A0 с памятью HBM4. Измеренный результат относится ко всей стойковой связке оборудования и программного обеспечения, а не только к кристаллу. Поэтому формулировка «чип быстрее Nvidia» была бы шире имеющихся данных: установлено преимущество конкретной системы в определённых режимах и по определённым показателям.
Почему проверка ещё не независимая

Внешние наблюдатели присутствовали в лаборатории и следили за выполнением прогонов, но не управляли испытанием самостоятельно. Численные показатели поступили от OpenAI, её инженеры участвовали в запуске, а внешняя команда не провела полный набор испытаний на оборудовании под собственным контролем.
Нагрузка с 8000 входных и 1000 выходных токенов представляет один обмен. Она не воспроизводит все условия долгих агентных сеансов, где меняются длина контекста, доля обращений к кешу, параллельность, маршрутизация и распределение ресурсов. Успех в таком режиме поэтому не подтверждает аналогичное преимущество на всём смешанном трафике.
Не все сопоставления были синхронными прогонами на одинаково управляемом оборудовании. Часть результатов новой системы сравнивалась с ранее опубликованными данными коммерческих платформ, программное обеспечение которых продолжает развиваться. Это не обесценивает измерения, но сужает вывод до фактически проверенных конфигураций.
Что результат означает для стоимости запросов

Больше токенов на ватт потенциально означает больше обработанных запросов при той же доступной мощности. Меньшая задержка может также повысить отзывчивость сервисов, если преимущество сохранится при длительной работе, меняющейся нагрузке и реальной смеси запросов.
Но стоимость одного запроса из энергетического показателя вывести нельзя. В открытом доступе нет достаточных данных о цене стойки, выходе годных кристаллов, надёжности, сетевой инфраструктуре, обслуживании и расходах на программное обеспечение. Без этих составляющих невозможно независимо рассчитать совокупную стоимость владения и сопоставить её с платформами Nvidia.
Jalapeño предназначен для обработки запросов, а не для обучения моделей. данные Axios о развёртывании указывают на ограниченное число систем в 2026 году и наращивание мощности в 2027-м; продавать ускоритель сторонним покупателям компания не планирует. Следовательно, разработка пока не устраняет зависимость OpenAI от внешних ускорителей для обучения.
Каких подтверждений пока не хватает
На 28 августа подтверждён значимый, но узкий результат: инженерные образцы Jalapeño в наблюдавшихся прогонах превзошли сравниваемые системы Nvidia по пропускной способности на единицу мощности. Не подтверждено общее превосходство по абсолютной скорости, цене, надёжности или зрелости платформы.
Для более сильного вывода потребуются самостоятельный доступ внешней лаборатории к оборудованию, полный набор прогонов и данные серийной эксплуатации. До их появления корректно говорить о лидерстве в конкретных измеренных режимах, а не о готовой замене Blackwell или будущих систем Rubin во всех задачах.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.