Jalapeño ilk ölçümde iddialı: OpenAI’ın çipi gecikmeyi 3,6 kata dek düşürdü

Axios’un 25 Ağustos 2026 tarihli haberi, OpenAI’ın ilk özel çıkarım çipi Jalapeño için ölçülmüş performans sonuçlarını yayımladığını ve sınırlı sayıdaki sistemi yıl bitmeden kendi altyapısına yerleştirmeyi planladığını aktarıyor. Jalapeño henüz müşterilere satılan bağımsız bir ürün değil; şirketin yapay zekâ hizmetlerini çalıştıracak veri merkezi altyapısının bir parçası.
OpenAI’ın InferenceX sonuçları, Jalapeño çevresinde kurulan sistemin üç açık modelde tepe noktasında watt başına 1,5–1,9 kat daha fazla iş ve 1,7–3,6 kat daha düşük uçtan uca gecikme sağladığını gösteriyor. Başlıktaki 3,6 katlık değer, bütün modeller için geçerli genel bir hızlanma değil; DeepSeek R1 karşılaştırmasında, açıklanan belirli çalışma noktasında ölçülen en yüksek fark.
Üç modelde hangi sonuçlar ölçüldü?

Yayımlanan veriler iki farklı sonucu yan yana getiriyor: tepe performansı/watt, güç bütçesi başına iş miktarını; uçtan uca gecikme ise nominal isteğin tamamlanma süresini ölçüyor. Bu nedenle iki metriği tek bir genel performans puanı gibi okumamak gerekiyor.
- GPT‑OSS 120B: Jalapeño, Nvidia GB200 sistemine karşı tepe noktasında kilowatt başına yaklaşık 1,9 kat daha fazla karma token işledi. Uçtan uca süre 1,03 saniyeye karşı 1,80 saniyeydi; açıklanan gecikme farkı yaklaşık 1,7 kat.
- DeepSeek R1 670B: Nvidia GB300 karşısındaki tepe verimliliği farkı yaklaşık 1,7 kat oldu. Uçtan uca süre Jalapeño’da 1,65 saniye, GB300’de 5,99 saniye ölçüldü; başlığa taşınan 3,6 katlık en yüksek avantaj bu karşılaştırmadan geliyor.
- Kimi K2.5 1T: Jalapeño yaklaşık 1,5 kat daha yüksek tepe performansı/watt sundu. Uçtan uca süre 1,56 saniyeye karşı 5,31 saniyeydi; bu da yaklaşık 3,4 katlık fark demek.
Üç test de nominal 8 bin giriş ve bin çıkış tokenından oluşan 8k/1k iş yükünde, tek token tahmini anlamındaki STP ayarıyla yürütüldü. GPT‑OSS için GB200, DeepSeek R1 ve Kimi K2.5 için GB300 kullanıldı. Dolayısıyla açıklanan aralıklar, aynı model ve aynı rakip sistem üzerinde tekrarlanan tek bir deneyden değil, üç ayrı karşılaştırmadan oluşuyor.
Güç normalizasyonu gerçek tüketimden farklı
Ana karşılaştırmada prizden ölçülen toplam sistem tüketimi değil, hızlandırıcıların yayımlanmış paket güç değerleri kullanıldı: Jalapeño 700 watt, GB200 1.200 watt ve GB300 1.400 watt. Jalapeño’nun testlerde ölçülen sürekli paket gücü ise 550 wattı aşmadı. Tepe performansı/watt çarpanları, fiilî şebeke tüketimine değil bu paket değerleriyle yapılan normalizasyona dayanıyor.
Bu ayrım, üç metriğin birbirine karıştırılmamasını gerektiriyor. Tepe verimliliği seçili çalışma noktasındaki güç başına işi, uçtan uca gecikme tüm isteğin süresini, gerçek güç tüketimi ise test sırasında kullanılan elektriği anlatıyor. Bir sistem ilk iki ölçütte öne geçerken veri merkezindeki soğutma, ağ ve diğer kayıplar aynı oranda azalmayabilir.
Ek sistem karşılaştırmasında hızlandırıcı başına şebeke gücü Jalapeño için 1,18 kW, GB300 için 2,55 kW olarak ele alındığında verimlilik farkı daralıyor. Bu sonuç ana ölçümü ortadan kaldırmıyor; yalnızca paket düzeyindeki üstünlüğün veri merkezi faturasına bire bir taşınamayacağını gösteriyor.
Tek token ayarı ve eksik rakipler sonucu sınırlıyor

Tom’s Hardware’ın metodoloji incelemesi, ana karşılaştırmada Jalapeño ile Nvidia sistemlerinin tek token tahmini kullandığını, bazı üretim kurulumlarında ise Nvidia’nın çoklu token tahmininden yararlandığını belirtiyor. GB300 çoklu token ayarıyla değerlendirildiğinde Jalapeño’nun açıklanan tepe verimliliği üstünlüğü yaklaşık 1,5 kata kadar geriliyor.
Nvidia’nın daha yeni Vera Rubin sistemi test grubunda yer almadı. Bu yüzden sonuçlar, Jalapeño’nun bütün mevcut veya gelecek Nvidia donanımlarından hızlı olduğunu kanıtlamıyor; yalnızca listelenen modeller, GB200 ve GB300 yapılandırmaları, yazılım ayarları ve çalışma noktaları için geçerli.
InferenceX kamuya açık bir benchmark olsa da Jalapeño donanımı genel erişime açılmış değil. SemiAnalysis ölçümleri OpenAI mühendisleriyle birlikte şirketin laboratuvarında çalıştırdı. Bu, yalnızca üreticinin teorik özelliklerine dayanan bir karşılaştırmadan daha güçlü bir doğrulama sağlıyor; ancak başka bir ekibin kendi eriştiği donanım üzerinde yaptığı bağımsız tekrar testi anlamına gelmiyor.
Asıl etki tüketici donanımında değil, yapay zekâ hizmetlerinde
Jalapeño model eğitimi için değil, hazırlanmış modellerden yanıt üretme aşaması olan çıkarım için tasarlandı. Açıklanan kazançlar bu nedenle dizüstü bilgisayarların veya tüketici ekran kartlarının doğrudan hızlanacağı anlamına gelmiyor. Olası ilk etkiler OpenAI’ın veri merkezlerinde isteklerin tamamlanma süresi, aynı güç bütçesiyle karşılanabilen talep ve başarılı bir yanıtı sunmanın maliyeti üzerinde görülecek.
Daha düşük uçtan uca gecikme, arka arkaya çok sayıda model çağrısı yapan ajanlarda biriken bekleme süresini azaltabilir. Watt başına daha fazla iş de aynı elektrik kapasitesi içinde daha çok isteğin çalıştırılmasına yardımcı olabilir. Ancak şirket, ölçümlerin API fiyatlarına, kapasite sınırlarına veya kullanıcıların gördüğü yanıt sürelerine ne ölçüde yansıyacağını açıklamadı.
OpenAI’ın önünde üretim yeterliliğini tamamlama, yazılım katmanını olgunlaştırma, sistemi ölçekli işletime hazırlama ve daha fazla modelde doğrulama aşamaları bulunuyor. Şimdilik kesin olan, üç açık modelde güçlü fakat koşullara bağlı ilk sonuçların yayımlanmış olması. Daha geniş iş yükleri, gerçek ölçekli veri merkezi verileri ve bağımsız tekrarlar gelmeden 3,6 katlık en yüksek farkı Jalapeño’nun genel performansı olarak yorumlamak için erken.
Bültenimize abone olun
En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.