OpenAI анхны AI инференс чип "Jalapeño"-гоо танилцууллаа: NVIDIA-ийн ноёрхолд хүчтэй цохилт өгөх үү?
Хиймэл оюун ухааны салбарт сүүлийн жилүүдэд хамгийн их хөрөнгө, хүч зарцуулагдсан талбар бол их хэмжээний загваруудыг сургах (training) кластерууд байлаа. Гэвч өнөөдөр AI агентууд, чатбот болон enterprise системүүд хэдэн зуун сая хэрэглэгчийн хүсэлтийг өдөр тутам боловсруулж эхэлснээр гол зардал болон инженерийн сорилт инференс (inference) буюу бэлэн загварыг ажиллуулах зардал руу огцом шилжлээ.
Яг энэ үед OpenAI компани Broadcom болон Celestica-тай хамтран бүтээсэн анхны өөрийн тусгай зориулалтын ASIC (Application-Specific Integrated Circuit) процессор болох "Jalapeño" чипийн анхны бодит хэмжилт, бенчмаркийн үр дүнгээ албан ёсоор дэлгэлээ.
1. Ерөнхий зориулалтын GPU-ээс тусгай зориулалтын инференс рүү
NVIDIA-ийн Hopper болон Blackwell архитектурууд нь матриц үржүүлэлт, сургалт, инференс, график боловсруулалт зэрэг олон төрлийн үйлдлийг зэрэг гүйцэтгэх чадвартай ерөнхий зориулалтын (general-purpose) хүчирхэг шийдлүүд юм. Харин энэ нь нөгөө талдаа зөвхөн текст, токен боловсруулах LLM инференсийн ажилд илүүдэл транзистор, өндөр цахилгаан зарцуулалтыг бий болгодог.
OpenAI-ийн танилцуулсан Jalapeño нь зөвхөн авторегрессив (autoregressive) LLM декодинг, токен үүсгэлтийн өгөгдлийн урсгалд зориулагдсан юм. Энэхүү архитектур нь:
- Илүүдэл график болон сургалтын тусгай блокуудыг хассан,
- HBM4 (High Bandwidth Memory 4) өндөр хурдны санах ойн интерфейсийг шууд чип дээр уялдуулсан,
- FP8 болон FP4 нарийвчлалтай тензор боловсруулалт, KV-cache-ийн өгөгдөл дамжуулах зурвасын өргөнийг дээд зэргээр оновчилсон.
2. Бенчмаркийн үр дүн: Токен гаргалтын хурд ба цахилгааны үр ашиг
SemiAnalysis болон олон нийтийн нээлттэй InferenceX бенчмарк тестээр Jalapeño-г NVIDIA-ийн одоогийн GB200/GB300 системүүдтэй харьцуулахад дараах үзүүлэлтүүд гарчээ:
- Эрчим хүчний ашигт ажиллагаа (Performance per Watt): Нэг ватт эрчим хүчинд ногдох токен боловсруулах чадвар өнөөгийн шилдэг GPU системүүдээс 1.5x–1.9x дахин өндөр байна. Чипийн нийт TDP цахилгаан зарцуулалт нь дунджаар ~700W байгаа нь өрсөлдөгчдийн ижил түвшний кластеруудтай харьцуулахад даруй 2 дахин бага үзүүлэлт юм.
- Токений хоцролт (Time-to-First-Token ба Latency): Төгсгөлөөс төгсгөл хүртэлх (End-to-End) хариу өгөх хоцролт загварын бүтцээс хамаарч 1.7x-оос 3.6x хүртэл богиноссон байна.
- Загваруудын нийцэл: Зөвхөн OpenAI-ийн загварууд бус, DeepSeek R1, Kimi K2.5 болон GPT-OSS 120B зэрэг олон төрлийн нээлттэй загваруудад ижил өндөр үр дүн үзүүлжээ.
3. Чипийг бүтээхэд AI өөрөө оролцсон нь: 9 сарын рекордон хурд
Уламжлалт чип хөгжүүлэлт нь архитектур гаргахаас эхлээд tape-out буюу үйлдвэрлэлд бэлэн болтол доод тал нь 2–3 жил шаарддаг. Харин OpenAI Broadcom-той хамтран Jalapeño-г 9-хөн сарын дотор дизайны эхнээс туршилтын цахиур (silicon) болгон гаргаж авсан байна.
Энэхүү хурдасгасан циклийг OpenAI-ийн өөрийн дотоод Codex агент болон reasoning моделууд удирджээ. Тэд чипийн RTL (Register-Transfer Level) логик шалгалт, дулаан хуваарилалтын симуляци болон физик холболтын маршрутчлалын оновчлолыг автоматжуулж, инженерүүдийн ажлын ачааллыг олон сараар хэмнэсэн байна.
4. Хөгжүүлэгчид болон салбарт үзүүлэх нөлөө
Энэхүү зарлал нь практик дээр дараах томоохон өөрчлөлтүүдийг авчирна:
- API-ийн өртөг эрс хямдарна: Инференсийн зардал буурснаар OpenAI болон түүний дэд бүтцэд суурилсан LLM үйлчилгээнүүдийн нэг токенд ногдох үнэ буурах боломж бүрдэнэ.
- Бодит цагийн агент ажлууд (Real-time Agents): Time-to-First-Token хугацаа богиноссоноор олон шатлалт agentic workflow, код засвар, дуут туслахууд хүний бичих хурдаас хэд дахин хурдан ажиллах нөхцөл бүрдэнэ.
- Тоног төхөөрөмжийн монополь задрах эхлэл: Google өөрийн TPU-тай, AWS өөрийн Inferentia/Trainium-тай, харин OpenAI өөрийн Jalapeño-той болсноор зах зээл дээр зөвхөн ганц GPU үйлдвэрлэгчээс хараат байх эрсдэл багасаж байна.
OpenAI Jalapeño чипээ 2026 оны сүүлээс эхлэн дата төвүүддээ туршилтаар нэвтрүүлж, 2027 оны турш бүрэн хэмжээний гигаватт түвшний кластерууддаа ашиглаж эхлэхээ мэдэгдээд байна.
Эх сурвалж: OpenAI Engineering Blog, SemiAnalysis Hot Chips 2026 Report, Broadcom Press Release
Сэтгэгдэл
Ачаалж байна...