OpenAI의 첫 번째 맞춤형 추론 칩인 Jalapeño를 발표한 이후, 저희는 해당 칩과 이를 기반으로 구축된 시스템을 테스트해 왔습니다. 그 결과, 상당한 성능 향상을 확인할 수 있었습니다. Jalapeño는 단위 전력당 더 많은 AI 작업을 처리하면서도 응답 속도를 더욱 빠르게 합니다. 기존 하드웨어 시스템에서는 처리량과 지연 시간 중 하나를 선택해야 했던 것과 달리, Jalapeño는 단일 아키텍처로 더 높은 처리량과 더 낮은 지연 시간을 모두 제공합니다.
고객에게는 더 빠른 응답, 더욱 신속한 상담원 응대, 그리고 수요 증가에 따른 더욱 안정적인 접근성을 의미합니다. 저희의 사명은 인공 일반 지능이 모든 인류에게 혜택을 줄 수 있도록 하는 것입니다. 이러한 성과는 더욱 강력해진 AI를 더욱 저렴하고 널리 보급하는 데 도움이 될 것입니다.
OpenAI 모델은 Jalapeño 개발을 가속화하는 데에도 기여했습니다. 이전 세대 모델은 칩 설계 및 개발에 도움을 주었고, 최신 모델은 칩 최적화 및 프로그래밍 속도를 높여줍니다. Jalapeño의 성능은 GPT-OSS 120B, DeepSeek R1, Kimi K2.5 1T 등 다양한 모델에서 검증되었으며, 이는 OpenAI 내부 및 외부에서 개발된 모델 모두에서 아키텍처가 원활하게 작동함을 보여줍니다. 세 가지 모델 모두에서 Jalapeño는 최대 처리량 기준으로 비교 시스템 대비 와트당 1.5~1.9배 더 많은 AI 작업을 처리했으며, 종단 간 지연 시간은 1.7~3.6배 더 낮았습니다. 특히 고도로 상호작용적인 워크로드에서는 2.1~4.1배 더 높은 성능을 제공했습니다.
Jalapeño는 더 광범위한 풀스택 우위를 보여주는 증거이기도 합니다. OpenAI는 실제 워크로드에서 얻은 학습을 바탕으로 스택의 모든 계층을 개선하여 모델, 제품, 서빙 소프트웨어, 칩, 메모리, 네트워킹 및 시스템을 통합적으로 설계할 수 있습니다. Jalapeño는 자체 개발한 실리콘을 사용하여 측정된 결과를 보여주고 있으며, 이는 여러 세대에 걸쳐 활용될 수 있는 플랫폼의 시작입니다. 앞으로 몇 달 동안 Jalapeño의 성능을 향상시켜 고객에게 더 빠르고, 더 강력하며, 더 효율적인 제품을 제공할 것입니다.
우리는 할라피뇨의 성과를 어떻게 측정했을까요?
우리는 동일한 사용자 경험을 기준으로 성능을 평가합니다. 각 시스템이 단위 전력당 얼마나 많은 유용한 AI 작업을 완료할 수 있는지, 그리고 고객과 대화형 에이전트가 요구하는 지연 시간을 충족하는지를 측정합니다. 이는 특히 여러 단계를 순차적으로 완료해야 하는 에이전트에게 중요하며, 지연이 전체 작업에 걸쳐 누적될 수 있기 때문입니다.
Jalapeño의 실제 성능을 이해하기 위해 SemiAnalysis에서 제공하는 공개 벤치마크인 InferenceX를 사용하여 테스트를 진행했습니다. InferenceX는 AI 요청 처리의 전체 과정을 측정하는 도구입니다. Jalapeño를 시중의 주요 AI 시스템들과 비교 분석했으며, 높은 처리량부터 고도의 상호작용과 낮은 지연 시간을 요구하는 다양한 환경에서 테스트를 수행했습니다. 그 결과, Jalapeño는 처리량, 전력 효율성, 지연 시간 측면에서 더 나은 성능을 보여주었습니다. 칩 단위 성능이 보고되는 경우도 있지만, 전력 소비량 대비 성능이 더 유용한 기준이라고 생각합니다.
할라페뇨, TBT 최고 기록 경신하며 선두 격차 벌려
할라페뇨는 사용자당 더 많은 토큰을 제공합니다.
할라피뇨는 킬로와트당 더 높은 처리량을 제공합니다.
세 가지 공개 모델 모두에서 Jalapeño는 테스트된 작동 범위 전체에 걸쳐 와트당 성능과 지연 시간 측면에서 더 나은 조합을 제공하여 파레토 최적점에 위치했습니다. 시스템 간 일관된 비교를 위해 각 가속기의 공개된 칩 전력 등급을 기준으로 결과를 정규화했습니다. Jalapeño의 정격 전력은 700와트이지만, 테스트된 워크로드에서 측정된 지속적인 전력은 550와트 이하를 유지했습니다.
Jalapeño는 GPT-OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T 등 다양한 데이터셋에서 뛰어난 성능을 보여주었습니다. 특히 테스트에 사용된 가장 큰 공개 모델인 Kimi에서는 비교 시스템 대비 와트당 최고 성능이 약 1.5배 높았고, 엔드투엔드 지연 시간은 3.4배 낮았습니다. 자체 테스트 결과, Jalapeño의 성능 우위는 OpenAI의 최신 모델에서 더욱 두드러지게 나타났으며, 이는 워크로드가 커지고 요구 사항이 높아질수록 해당 아키텍처의 가치가 더욱 높아짐을 시사합니다.
단일 칩 내에서 속도와 효율성을 고려한 아키텍처 설계
Jalapeño는 처음부터 "주요 임무가 현대 및 미래의 언어 모델, 특히 대화형 에이전트를 지원하는 것이라면 어떤 하드웨어를 구축해야 할까?"라는 질문에서 설계되었습니다. Jalapeño의 강점은 실제 언어 모델 워크로드를 중심으로 칩, 메모리, 네트워크, 소프트웨어 및 랙 규모 시스템을 통합적으로 설계한 데 있습니다. 언어 모델 추론은 여러 단계로 나뉘며 각 단계마다 병목 현상이 발생합니다. 시스템이 프롬프트를 처리하는 사전 입력(prefill) 단계는 연산 집약적이며, 시스템이 토큰 단위로 응답을 생성하는 디코딩(decode) 단계는 메모리 대역폭의 제약을 받습니다. 또한 데이터가 코어와 칩 사이를 이동해야 할 때 통신 지연이 발생할 수 있으며, 이로 인해 일부 처리 장치가 대기하는 동안 유휴 상태가 됩니다. 특정 단계에서 뛰어난 성능을 보이는 시스템이라도 데이터 대기 또는 모델 상태를 다른 리소스 간에 이동하는 동안에는 그 장점을 잃을 수 있습니다.
Jalapeño는 데이터 이동과 통신 지연을 최소화하도록 설계되었습니다. 즉, 응답 생성 시 사용되는 KV 캐시를 포함한 모델 상태를 명시적으로 로컬에 저장하고, 시스템은 각 추론 단계에 맞춰 최적의 컴퓨팅, 메모리, 네트워킹 조합을 활성화할 수 있습니다. 네트워크는 아키텍처의 핵심 요소입니다. 넓은 도메인 덕분에 전체 워크로드를 하나의 연결된 시스템 내에 유지할 수 있어 데이터 이동을 최소화하고, 요청 처리의 처음부터 끝까지 빠르고 효율적인 성능을 유지할 수 있습니다. 그 결과, 변화하는 모델 아키텍처를 지원하고, 사전 데이터 입력과 디코딩 모두에서 뛰어난 성능을 발휘하며, 두 작업 간의 균형 변화에 따라 적응할 수 있는 균형 잡히고 유연한 가속기가 탄생했습니다. 이는 에이전트 기반 워크로드의 핵심적인 특징입니다.
우리는 인공지능을 사용하여 칩을 설계했고, 인공지능이 프로그래밍할 수 있도록 칩을 설계했습니다.
AI는 할라페뇨 개발에 직접적인 역할을 했습니다. AI 덕분에 팀은 구현 방식을 탐색하고, 설계, 측정 및 검증 주기를 단축하고, 모델 워크로드를 지속적으로 개선함으로써 초기 설계에서 테이프아웃까지 9개월 만에 완료할 수 있었습니다. 또한 AI는 칩의 연산 회로를 최적화하여 팀이 예정대로 더 높은 연산 성능을 칩에 탑재할 수 있도록 지원했습니다.
Jalapeño는 사람과 AI 모두에게 명확하고 예측 가능한 프로그래밍 목표를 제공하도록 설계되었습니다. 엔지니어는 로컬 텐서, 명시적인 통신, 그리고 예측 가능한 동기화를 통해 작업을 설명할 수 있습니다. 그러면 AI는 시스템 전체에서 해당 작업이 어떻게 매핑되고, 배치되고, 스케줄링되고, 조정되는지를 최적화할 수 있습니다. 이러한 명확하고 예측 가능한 구조는 AI에게 기존에 어려웠던 병렬 프로그래밍 문제를 해결할 수 있는 효율적인 방법을 제공합니다.
새로운 모델 패밀리를 지원하려면 여전히 새로운 커널과 모델별 최적화가 필요합니다. GPT-Astra와 Codex를 활용하여, 팀은 Jalapeño의 원래 생산 계획에 포함되지 않았던 세 가지 오픈웨이트 모델을 두 달 만에 고성능으로 구현했습니다. 이는 아키텍처의 유연성과 AI가 프로그래밍을 지원하는 속도를 모두 입증했습니다. 선택된 GPT-OSS 어텐션 및 전문가 혼합 블록의 경우, AI가 생성한 구현이 기존 인간 전문가가 작성한 구현보다 1.5~1.8배 더 빠르게 실행되었습니다. 이 수치는 전체 모델이 아닌 선택된 블록에 대한 것이지만, 강력한 새로운 개발 루프의 가능성을 보여줍니다.
효율적이고 초고속 추론을 향한 미래
AI 인프라는 실질적인 업무 수행을 가능하게 한다는 점에서 가치가 있습니다. Jalapeño는 동일한 성능과 하드웨어로 더 많은 유용한 작업을 생산함으로써, 더 많은 수요를 충족하고 성공적인 결과를 제공하는 비용을 절감하는 데 도움을 줄 수 있습니다. OpenAI의 경우, 이는 유용한 작업과 수익이 서비스 제공 비용보다 빠르게 성장할 수 있도록 하여 운영 레버리지를 향상시킬 수 있습니다. 또한, 더 광범위한 도입과 더 나은 모델, 제품 및 인프라에 대한 지속적인 투자를 지원할 수 있습니다. 더 빠른 추론은 더 빠른 반복 작업과 새로운 사용 사례를 가능하게 합니다.
Jalapeño는 효율적이고 지연 시간이 짧은 추론의 가능성을 확장합니다.
- 이전에는 고속 모드에서만 가능했던 효율성으로 초고속 모드 추론을 구현합니다.
- 이전에는 배치 모드에서만 가능했던 효율성으로 고속 추론을 구현합니다.
- 배치 모드 추론의 효율성 향상
저희는 올해 말까지 OpenAI의 컴퓨팅 인프라에 Jalapeño를 배포할 계획입니다. 이는 여러 세대에 걸친 로드맵의 첫 번째 세대이며, 2세대는 개발이 한창 진행 중이고 3세대도 구체화되고 있습니다. 각 세대는 저희의 경험을 바탕으로 효율성과 속도를 더욱 향상시킬 것입니다.
인공지능에 대한 증가하는 수요를 충족하려면 모든 가용 자원에서 더 많은 컴퓨팅 성능이 필요합니다. NVIDIA는 학습 및 추론 워크로드 모두에 NVIDIA 및 기타 파트너의 가속기를 지속적으로 광범위하게 배포할 것입니다. 우리의 목표는 인공 일반 지능이 모든 인류에게 혜택을 줄 수 있도록 하는 것입니다.
배포를 준비하면서, 우리는 지속적인 제품 검증, 소프트웨어 완성도 향상, Jalapeño의 대규모 운영 준비, 그리고 더 많은 모델에 걸친 성능 검증을 진행하고 있습니다. 지금까지의 결과는 전체 시스템을 함께 설계할 때 무엇이 가능한지를 보여줍니다. 더욱 반응성이 뛰어나고, 역량이 탁월하며, 능동적인 AI를 더욱 효율적으로 더 많은 사람들에게 제공할 수 있게 된 것입니다.
충수
할라피뇨는 GPT-OSS 120B에서 파레토 경계선입니다.
kW당 처리량 프론티어
InferenceX · GPT‑OSS‑120B · 공칭 8k/1k · STP · 패키지 TDP: Jalapeño 700W; GB200 1,200W
Jalapeño는 GPT-OSS 운영 전반에 걸쳐 리더십을 발휘합니다.
최대 처리량 및 일치하는 처리량
InferenceX · GPT‑OSS‑120B · 공칭 8k/1k · STP · 패키지 TDP: Jalapeño 700W; GB200 1,200W
더 높은 피크 혼합 TPS/kW
≈1.9×
85,448 대 44,960 혼합/kW
종단 간 지연 시간 감소
≈1.7배
1.03초 대 1.80초
최저 TBT
≈2.7배
0.69ms 대 1.87ms (1,459 대 535 tok/s/사용자)
이전 TBT에서 처리량 증가
약 53.7배
22,935 대 427 혼합/kW (사용자당 535.28 tok/s 기준)
할라피뇨는 DeepSeek R1 670B에서 파레토 경계선으로 분류됩니다.
kW당 처리량 프론티어
InferenceX · DeepSeek R1 MXFP4 · 공칭 8k/1k · STP · 패키지 TDP: Jalapeño 700W; GB300 1,400W
Jalapeño는 DeepSeek R1 운영 지점 전반에서 선두를 달리고 있습니다.
최대 처리량 및 일치하는 처리량
InferenceX · DeepSeek R1 MXFP4 · 공칭 8k/1k · STP · 패키지 TDP: Jalapeño 700W; GB300 1,400W
더 높은 피크 혼합 TPS/kW
≈1.7배
19,641 대 11,781 혼합/kW
종단 간 지연 시간 감소
≈3.6배
1.65초 대 5.99초
최저 TBT
≈4.1×
1.43ms 대 5.90ms (700 대 169 tok/s/사용자)
이전 TBT에서 처리량 증가
≈104.3×
12,258 대 118 혼합/kW (사용자당 169.41 tok/s 기준)
할라피뇨는 키미 K2.5 1T에서 파레토 경계선입니다.
kW당 처리량 프론티어
InferenceX · Kimi K2.5 MXFP4 · 공칭 8k/1k · STP · 패키지 TDP: Jalapeño 700W; GB300 1,400W
할라페뇨는 Kimi K2.5 운영 지점 전반에 걸쳐 선두를 달리고 있습니다.
최대 처리량 및 일치하는 처리량
InferenceX · Kimi K2.5 MXFP4 · 공칭 8k/1k · STP · 패키지 TDP: Jalapeño 700W; GB300 1,400W
더 높은 피크 혼합 TPS/kW
약 1.5배
18,195 대 11,862 혼합/kW
종단 간 지연 시간 감소
≈3.4배
1.56초 대 5.31초
최저 TBT
≈3.8배
1.44ms 대 5.48ms (694 대 182 tok/s/사용자)
이전 TBT에서 처리량 증가
≈56.1×
6,744 대 120 혼합/kW (사용자당 182.46 tok/s 기준)
