Nvidia-ийн ноёрхолд цэг тавих уу? OpenAI өөрийн анхны "Jalapeño" чипийн хүчин чадлыг дэлгэлээ
Хиймэл оюуны салбарын өрсөлдөөн зөвхөн загварын (LLM) архитектур, параметр дээр биш, харин түүнийг ажиллуулах дэд бүтэц, цахиур (silicon) чип дээр шийдэгдэх шинэ үе шатандаа орлоо. OpenAI жил бүр зохиогддог Hot Chips чуулганы үеэр Broadcom-той хамтран TSMC-ийн 3nm (N3P) технологиор 16 сарын дотор бүтээсэн анхны бие даасан инференс чип болох Jalapeño-ийн бодит туршилтын үр дүнг нийтэд дэлгэв.
SemiAnalysis-ийн хөндлөнгийн InferenceX бенчмаркаар шалгасан тус чипийн үр дүн салбарынхныг гайхшруулж байна. Учир нь энэ нь зах зээлийг монополдож буй Nvidia-ийн Blackwell (GB200 болон GB300) архитектураас илт давуу үзүүлэлт үзүүлжээ.
Өндөр хурд ба Эрчим хүчний үр ашиг: Бенчмарк тоонууд юу өгүүлэв?
LLM ажиллуулахад хамгийн том толгойн өвчин бол "Latency" (хариу өгөх хугацаа) болон "Throughput" (нэгж хугацаанд боловсруулах токений хэмжээ) хоёрын хоорондох баланс байдаг. Хэрэглэгчийн тоо нэмэгдэх тусам GPU дээр саатал үүсдэг бол Jalapeño нь уг хязгаарлалтыг эрс багасгасан байна.
Туршилтыг GPT-OSS 120B, DeepSeek R1, болон 1 их наяд параметртэй Kimi K2.5 зэрэг OpenAI доторх болон гаднын нээлттэй томоохон загварууд дээр хийжээ:
- Ватт тутмын бүтээмж (Work per Watt): Jalapeño нь оргил ачааллын үед өрсөлдөгч системүүдээсээ 1.5-аас 1.9 дахин их токен боловсруулалт хийсэн байна.
- Latency (Саатал): Загваруудын хариу өгөх нийт хугацаа (End-to-end latency) 1.7-оос 3.6 дахин буурчээ.
- Интерактив ба Агент ажлын ачаалал: Олон шатлалт AI агент, кодчиллын автоматжуулалт зэрэг нааш цааш байнга холбогддог ажлын урсгал дээр 2.1-ээс 4.1 дахин илүү өндөр гүйцэтгэл үзүүлсэн байна.
- Цахилгаан зарцуулалт: Нэрлэсэн чадал нь 700W боловч бодит ажлын үед ердөө 550W эсвэл түүнээс бага эрчим хүч зарцуулж ажиллажээ.
Чип нь 15.4 TB/s хурдтай HBM4 санах ойтой бөгөөд санах ойн өгөгдөл шилжүүлэх гацааг (Memory Wall) багасгах тусгай On-chip архитектуртай хийгдсэн байна.
Сургалт (Training) биш Инференс (Inference): Яагаад энэ тийм чухал вэ?
Өнгөрсөн жилүүдэд хиймэл оюуны гол зардал суурь загваруудыг анхнаас нь сургах (Pre-training) тооцоололд зориулагдаж байсан бол өдгөө зах зээлийн зардлын 80-90% нь загваруудыг өдөр тутмын хэрэглээнд ажиллуулах Inference үйл явцад шилжээд байна.
Nvidia-ийн GPU-ууд нь бүх нийтийн зориулалттай (General-purpose) тул инференс хийх үед илүүдэл эрчим хүч үрж, өндөр зардал гаргадаг. Харин OpenAI чипийн micro-architecture-аас эхлээд программ хангамжийн kernel, үйлчилгээний сервер (Serving stack) хүртэл бүтэн стекээр нь өөрсдийн загваруудад тусгайлан тохируулсан ASIC (Application-Specific Integrated Circuit) гаргаж ирсэн нь зардлыг огцом бууруулах боломжийг нээлээ.
OpenAI-ийн инженерүүдийн онцолсноор тус чипийн анхны архитектурын дизайн болон верификацийн кодыг боловсруулахад OpenAI-ийн өөрийн AI загварууд шууд оролцсон нь хөгжүүлэлтийн хугацааг ердөө 16-хан сар болгож хурдасгажээ.
Хөгжүүлэгчдэд энэ нь ямар ач холбогдолтой вэ?
Энэхүү техник хангамжийн дэвшил нь зөвхөн дата төвүүдийн асуудал биш бөгөөд бидний өдөр тутмын хөгжүүлэлтэд шууд нөлөөлнө:
- API үнийн огцом бууралт: Инференсийн цахилгаан болон дэд бүтцийн зардал 2 дахин хэмнэгдсэнээр OpenAI болон түүний экосистемийн API токений үнэ дахин хямдрах үүд нээгдэнэ.
- AI Агентуудын "Real-time" хурд: Олон шатлалт кодын агент, CLI автоматжуулалтууд зэрэг олон удаагийн дуудалт шаарддаг системүүдийн саатал 3-4 дахин багассанаар "бодох" хугацаа үл мэдэгдэм түвшинд хүрнэ.
- Hardware Lock-in-оос ангижрах нь: AI лабораториуд зөвхөн Nvidia-ийн CUDA-аас бүрэн хамааралтай байхаа больж, Custom Silicon түвшинд өөрсдийн моделуудыг оновчлох бодит боломжтойг Jalapeño баталж байна.
OpenAI уг чипийг 2026 оны сүүлчээр үйлдвэрлэлд бага хэмжээгээр нэвтрүүлж эхлэх ба 2027 оноос нийт ChatGPT, Codex болон API үйлчилгээнийхээ үндсэн инференс суурь болгохоор төлөвлөж байгаа бөгөөд дараагийн үеийн чипүүдийн хөгжүүлэлт аль хэдийнээ эхэлсэн байна.
Эх сурвалж: OpenAI Engineering Blog, SemiAnalysis ("OpenAI Jalapeño: Better Than Nvidia Blackwell"), Hot Chips 2026 Presentation.
Сэтгэгдэл
Ачаалж байна...