Мэдээ

OpenAI анхны AI чип "Jalapeño"-гоо дэлгэлээ: NVIDIA-ийн ноёрхлыг ганхуулах инференс архитектур

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 31·0 үзсэн·
OpenAI анхны AI чип "Jalapeño"-гоо дэлгэлээ: NVIDIA-ийн ноёрхлыг ганхуулах инференс архитектур

Хиймэл оюуны компаниуд чип зохион бүтээгч болж буй эрин үе

Сүүлийн жилүүдэд хэлний том загваруудын (LLM) сургалт болон бодит хэрэглээний тооцоолол (inference) эрчимтэй өсөхийн хэрээр хөгжүүлэгчид болон технологийн компаниудын өмнө тулгарч буй хамгийн том саад нь тооцоолох дэд бүтцийн зардал, цахилгаан эрчим хүчний хэрэглээ болоод байгаа билээ. Өнөөг хүртэл зах зээл дээр NVIDIA-ийн график процессорууд (GPU) үнэмлэхүй ноёрхож байсан бол OpenAI чип үйлдвэрлэгч Broadcom-той хамтран боловсруулсан анхны бие даасан инференс чип "Jalapeño"-гийн туршилтын үр дүн болон архитектурын нарийвчилсан мэдээллийг Hot Chips хуралд албан ёсоор дэлгэлээ.

Энэхүү алхам нь зөвхөн техник хангамжийн зах зээлийн өрсөлдөөн бус, программ хангамж ба чипийн бүтцийг төгс хослуулах (Hardware-Software Co-design) замаар хиймэл оюуны загваруудыг олон нийтэд хамгийн бага зардлаар, асар өндөр хурдаар хүргэх шинэ шатны эхлэл болж байна.


"Jalapeño" чипийн гол үзүүлэлт ба архитектурын давуу тал

OpenAI ерөнхий зориулалтын сургалтын (training) чип бүтээхийн оронд орчин үеийн LLM-үүдийн авторегрессив (autoregressive) токен үүсгэлт, инференс ачаалалд тусгайлан төвлөрсөн ASIC (Application-Specific Integrated Circuit) зохион бүтээжээ.

  • 216 GB HBM4 санах ой: Санах ойн өргөн зурвасын (memory bandwidth) хязгаарлалтыг даван туулахын тулд шинэ үеийн HBM4 санах ойг нэгтгэсэн нь өгөгдөл дамжуулах хурдыг огцом нэмэгдүүлсэн.
  • 64 Slice бүхий NUMA бүтэц: Санах ой болон тооцоолох цөмийг 64 тусдаа хэсэгт хуваарилж, өгөгдлийг чип даяар хол зайд зөөхгүйгээр тооцооллын нэгжийн дэргэд боловсруулах боломжийг бүрдүүлсэн.
  • KV-Cache оновчлол: Олон сая контекст болон урт ярианы түүхийг хадгалах Key-Value кэшийг тусгай түвшинд удирдах тооцооллын логикийг суулгаж, хоцрогдлыг (latency) эрс багасгасан.
  • AI тусламжтай кернел оновчлол: Чипийн бага түвшний үйлдлүүд болон драйверуудыг OpenAI-ийн өөрсдийн хиймэл оюуны загваруудаар кодлуулан сайжруулснаар зохион бүтээх хугацааг ердөө 16 сар болгон богиносгожээ.

Бенчмарк: Эрчим хүчний хэмнэлтээр 50-100 дахин давуу

Хөндлөнгийн шинжээчдийн ашигладаг InferenceX нээлттэй бенчмаркаар шалгахад Jalapeño нь одоогийн тэргүүлэх GPU системүүдтэй харьцуулахад итгэмээргүй үр дүн үзүүлсэн байна:

  1. GPT-OSS 120B: 1 кВт эрчим хүчинд ногдох токен гаргалтын хурд нь 22,935 tokens/s/kW хүрсэн нь одоогийн зах зээлийн шилдэг түвшнээс 53.7 дахин өндөр үзүүлэлт юм.
  2. DeepSeek-R1 & Kimi K2: Зөвхөн OpenAI-ийн загварууд төдийгүй бусад нээлттэй загварууд дээр DeepSeek-R1 дээр 104.3 дахин, Kimi K2.5 дээр 56.1 дахин эрчим хүчний үр ашигтай ажиллаж чадсан байна.
  3. Хэрэглэгчид ногдох хурд: Хэрэглэгч бүрт секундэд 500+ токен үүсгэх decoding хурдыг тогтвортой хадгалж, бодит цагийн (real-time) яриа, код генераци хийх боломжийг олгосон.

Хөгжүүлэгчид болон инженерийн экосистемд юу авчрах вэ?

Энэхүү техник хангамжийн дэвшил нь практик программ хөгжүүлэлтийн түвшинд хэд хэдэн чухал өөрчлөлтийг авчирна:

  1. AI Агентуудын зардлын огцом бууралт: Олон зуун файл шинжлэх, өөрөө алдаагаа засч дахин оролдох бие даасан код бичигч агентууд (Agentic workflows) олон сая токен зарцуулдаг. Инференс эрчим хүч, тооцооллын өртөг хямдарснаар эдгээр агентуудыг ажиллуулах API-ийн үнэ дахин хэд дахин буурах нөхцөл бүрдэнэ.
  2. Бодит цагийн хариу үйлдэл: Токен үүсгэх хурд секундын дотор хэдэн зуугаар хэмжигдэх болсноор IDE доторх ухаалаг компиляци, шуурхай кодын бүтцийн өөрчлөлт (refactoring) хүлээлтгүй, шууд мэдрэгдэх болно.
  3. Нэг нийлүүлэгчээс хараат бус дэд бүтэц: Хиймэл оюуны томоохон лабууд өөрсдийн чипийг бодит хэрэглээнд нэвтрүүлснээр GPU-ийн нийлүүлэлтийн хомсдол, өндөр үнийн дарамтаас ангижирч, хөгжүүлэгчдийн үйлчилгээний тогтвортой байдал (SLA) эрс сайжирна.

OpenAI өөрсдийн загвар, программ хангамж, дэд бүтэц, чипийг нэгдмэл нэг экосистем болгон хөгжүүлж эхэлсэн нь цаашид хиймэл оюуны программ хангамжийн салбарын өртөг, хурдыг цоо шинэ түвшинд аваачих нь тодорхой болов.


Эх сурвалж: OpenAI Official Research, SemiAnalysis, Hot Chips 2026 Technical Proceedings

Сэтгэгдэл

Ачаалж байна...