Jalapeño, 전력당 처리량 최대 1.9배…비교표가 말하지 않는 것

OpenAI가 2026년 8월 25일 자체 추론 칩 Jalapeño의 첫 공개 성능 측정 결과를 발표했다. OpenAI가 공개한 InferenceX 결과 에서 Jalapeño 시스템은 GPT-OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T를 실행했을 때 Nvidia GB200·GB300 비교 시스템보다 최고 전력당 처리량이 1.5~1.9배 높고 종단 간 지연시간은 1.7~3.6배 낮았다. OpenAI는 연말까지 자사 컴퓨팅 인프라에 배치를 시작할 계획이라고 밝혔지만, 현재 공개된 것은 배치 완료 후의 운영 성적이 아니라 실제 칩으로 측정한 첫 벤치마크다.
2026년 8월 25일 발표가 확인해 준 핵심은 Jalapeño가 지정된 세 모델과 시험 조건에서 Nvidia Blackwell 시스템보다 유리한 처리량·지연시간 조합을 기록했다는 점이다. 그러나 ‘최대 1.9배’는 모든 모델과 운용 구간에 적용되는 단일 성능 배수가 아니다. 비교 상대가 모델마다 다르고, 효율 계산의 분모도 데이터센터 전체 소비전력이 아닌 가속기 패키지의 정격전력이라는 조건이 붙는다.
최대 1.9배는 GPT-OSS와 GB200의 한 비교점이다

세 모델의 결과는 동일한 두 시스템을 반복 측정한 표가 아니다. GPT-OSS 120B에서는 Jalapeño와 GB200을 비교했지만, DeepSeek R1과 Kimi K2.5에서는 상대가 GB300으로 바뀐다. 따라서 제목의 최대치는 세 결과의 평균도, GB300을 상대로 한 최고 격차도 아니다.
GPT-OSS 120B의 최고 혼합 처리량은 Jalapeño가 kW당 초당 85,448토큰, GB200이 44,960토큰으로 약 1.9배 차이가 났다. 종단 간 지연시간은 각각 1.03초와 1.80초였다. 이 결과가 보여 주는 것은 해당 모델의 지정된 운용점에서 Jalapeño 시스템이 더 많은 작업을 전력 단위당 처리했다는 사실이지, 개별 응답이 언제나 1.9배 빠르다는 뜻은 아니다.
DeepSeek R1에서는 Jalapeño와 GB300의 최고 혼합 처리량이 각각 kW당 초당 19,641토큰과 11,781토큰으로 약 1.7배였다. 종단 간 지연시간은 1.65초와 5.99초로 약 3.6배 차이가 났다. Kimi K2.5에서는 처리량이 18,195 대 11,862로 약 1.5배, 지연시간은 1.56초 대 5.31초로 약 3.4배였다.
- GPT-OSS 120B: Jalapeño 대 GB200, 최고 전력당 처리량 약 1.9배, 종단 간 지연시간 약 1.7배 차이
- DeepSeek R1 670B: Jalapeño 대 GB300, 최고 전력당 처리량 약 1.7배, 종단 간 지연시간 약 3.6배 차이
- Kimi K2.5 1T: Jalapeño 대 GB300, 최고 전력당 처리량 약 1.5배, 종단 간 지연시간 약 3.4배 차이
그러므로 “Jalapeño가 GB300보다 1.9배 빠르다”는 요약은 비교 대상을 잘못 합친 표현이다. 1.9배는 GPT-OSS 120B에서 GB200과 비교한 최고 전력당 처리량이고, GB300을 상대한 두 모델의 최고치는 각각 약 1.7배와 1.5배다.
8k/1k와 STP가 시험 범위를 고정했다
공개 시험은 세 모델 모두 InferenceX의 명목상 8k 입력·1k 출력 조건에서 진행됐다. 약 8,000토큰의 입력을 받은 뒤 약 1,000토큰을 생성하는 요청 형태이며, DeepSeek R1과 Kimi K2.5에는 MXFP4 조건이 표시됐다. 문맥 길이, 정밀도 또는 요청 구성이 다른 결과와 모델 이름만으로 직접 비교할 수 없는 이유다.
주 비교표는 STP, 즉 한 번에 한 토큰을 예측하는 조건을 사용했다. InferenceX를 운영하는 SemiAnalysis의 현장 설명 에 따르면 이 회사는 OpenAI 연구실에서 엔지니어들과 벤치마크를 실행했으며, Jalapeño는 다중 토큰 예측 없이 시험됐다. 이는 결과가 단순 시뮬레이션이 아니라 작동하는 실리콘에서 나왔다는 근거를 보태지만, 가능한 모든 Nvidia 소프트웨어 구성을 같은 표에서 비교했다는 의미는 아니다.
InferenceX가 칩의 이론 연산량만 보지 않고 요청 처리의 종단 간 성능을 측정한다는 점은 유의미하다. 처리량과 지연시간의 관계를 실제 모델 서빙에 가까운 단위로 볼 수 있기 때문이다. 다만 공개된 세 워크로드만으로 긴 문맥, 다른 배치 크기, 검색·도구 호출이 포함된 에이전트 작업, 영상 생성 또는 훈련 성능까지 일반화할 근거는 없다.
전력당 성능의 분모는 랙 전체 전력이 아니다

주 비교표는 각 가속기의 공개 패키지 정격전력으로 처리량을 정규화했다. Jalapeño는 700W, GB200은 1,200W, GB300은 1,400W가 분모로 쓰였다. OpenAI는 시험 중 Jalapeño의 지속 측정 전력이 550W 이하였다고 설명했지만, 표의 주 결과에는 더 보수적인 700W 정격을 적용했다.
패키지 정격전력은 가속기 단위 비교에는 명료한 기준이지만 데이터센터가 전력망에서 끌어오는 총전력과 같지 않다. CPU, 네트워크, 냉각, 전원 변환 손실과 시스템 구성 차이가 모두 포함된 수치가 아니기 때문이다. 반면 처리량의 분자는 칩 하나의 이론치가 아니라 모델을 서비스하는 시스템에서 측정됐다. ‘칩 전력’과 ‘랙 시스템의 처리량’을 완전히 같은 경계의 측정값처럼 받아들이면 비교 범위를 놓치게 된다.
Tom’s Hardware의 조건별 검토 는 가속기당 전체 설비전력을 적용한 부록 비교에서 Jalapeño 1.18kW와 GB300 2.55kW가 사용됐으며, GB300에 다중 토큰 예측을 적용하면 최고 효율 격차가 약 1.5배로 좁아진다고 짚었다. 최대 1.9배가 무효라는 뜻은 아니다. 전력의 측정 경계와 토큰 생성 방식에 따라 비교 결과의 크기가 달라진다는 뜻이다.
낮은 지연시간의 강점도 같은 측정점끼리 봐야 한다
최고 처리량 외에 주목할 결과는 Jalapeño가 시험된 운용 범위에서 처리량과 지연시간의 파레토 경계를 형성했다는 점이다. 이는 한 지표를 더 개선하려면 다른 지표를 희생해야 하는 경계에서 비교 시스템보다 유리한 조합을 보였다는 의미다. 모든 지연시간 구간에서 동일한 배수로 앞섰다는 뜻은 아니다.
OpenAI 표에는 Nvidia 비교 시스템이 기존에 달성한 최저 토큰 간 시간에 맞춘 뒤 전력당 처리량을 비교한 수치도 있다. 이 방식에서는 격차가 수십 배에서 100배 이상으로 커지지만, 각 시스템의 최고 처리량끼리 비교한 1.5~1.9배와는 측정점이 다르다. 낮은 지연시간을 고정한 결과를 일반적인 최고 성능 차이로 바꾸어 말하면 서로 다른 지표를 섞게 된다.
비교 세대에도 빈칸이 남아 있다. 공개 표의 Nvidia 상대는 Blackwell 계열 GB200과 GB300이며 Vera Rubin은 시험 대상이 아니었다. Jalapeño는 추론을 위해 설계됐지만 Nvidia 시스템은 훈련과 추론을 포함한 더 넓은 용도를 지원한다. 이번 측정으로 특정 언어모델 추론 조건의 효율 우위는 확인할 수 있어도 훈련 성능, 범용성 또는 차세대 시스템 대비 경쟁력까지 입증됐다고 볼 수는 없다.
확인된 것은 작동 칩의 첫 결과, 상용 효과는 아직이다

이번 발표의 진전은 Jalapeño가 설계안이나 시뮬레이션을 넘어 실제 작동하는 칩에서 공개 수치를 냈다는 데 있다. 세 공개 모델을 같은 InferenceX 틀로 시험했고, 모델별 상대 시스템과 패키지 전력 기준도 공개했다. 명시된 조건에서는 Jalapeño 시스템이 최고 전력당 처리량과 종단 간 지연시간 모두 비교 시스템보다 앞섰다는 결론이 성립한다.
그 결과가 곧바로 데이터센터 비용 절감이나 모든 이용자의 체감 속도 향상을 보장하지는 않는다. 실제 효과는 생산 수율과 공급량, 랙 규모 확장, 소프트웨어 성숙도, 네트워크와 냉각을 포함한 전체 전력, 서비스에 투입되는 모델과 요청 형태에 달려 있다. OpenAI는 생산 적격성 검증과 소프트웨어 정비, 대규모 운영 준비, 추가 모델 검증을 계속하고 있다.
현재 Jalapeño의 상태는 첫 공개 측정을 마치고 OpenAI 내부 배치를 준비하는 단계다. 판단 범위를 넓히려면 장시간 실제 부하의 안정성, 전체 설비전력, 더 다양한 문맥과 배치 조건, 동등한 소프트웨어 구성, 차세대 경쟁 시스템과의 결과가 추가로 필요하다. 그때까지 최대 1.9배는 확인된 벤치마크 수치이지만, GPT-OSS 120B와 GB200, 8k/1k·STP, 패키지 정격전력이라는 조건 안에서 읽어야 한다.
뉴스레터 구독
최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.