Мэдээ

Qwen4 архитектурын урьдчилсан загвар гарлаа: GDN + Sparse Attention эрлийз бүтэц ба 1 сая токений шинэ эрин

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 29·0 үзсэн·
Qwen4 архитектурын урьдчилсан загвар гарлаа: GDN + Sparse Attention эрлийз бүтэц ба 1 сая токений шинэ эрин

Сүүлийн жилүүдэд хиймэл оюуны загварууд зөвхөн параметр өсгөхөөс гадна 100K-аас 1M хүртэлх урт контекст (Long-Context) цонхыг боловсруулах чиглэлд хүчтэй хөгжиж байна. Гэвч уламжлалт Transformer архитектур дээр контекстийн хэмжээ тэлэх тусам тооцооллын зардал квадратаар ($O(N^2)$) өсөж, KV (Key-Value) Cache нь GPU-ийн VRAM санах ойг хэдхэн хормын дотор дүүргэх том саад болдог.

Энэхүү суурь асуудлыг шийдвэрлэх зорилгоор Alibaba Cloud-ийн Qwen баг өөрсдийн дараагийн үеийн Qwen4 моделийн архитектурын урьдчилсан хувилбар болох Qwen3.8-Flash-Next нээлттэй жингүүдийг (open-weights) албан ёсоор дэлхий нийтэд танилцууллаа.

Энэ нь ердийн нэг жижиг шинэчлэл биш бөгөөд загварын дөрвөн үндсэн хэсэг болох Attention, Residual, Embedding болон Optimizer түвшинд хийгдсэн суурь архитектурын томоохон эргэлт юм.


1. GDN + QSA: KV Cache-ийг хязгааргүй сунах боломжтой болгосон эрлийз шийдэл

Урт текст болон олон мянган мөр кодтой агентуудын (Agentic Coding) хувьд хамгийн том толгойн өвчин нь санах ойн менежмент байдаг. Qwen3.8-Flash-Next нь үүнийг шийдэхийн тулд Gated DeltaNet (GDN) ба Qwen Sparse Attention (QSA) гэсэн эрлийз (hybrid) бүтцийг нэвтрүүлжээ:

  • Gated DeltaNet (GDN): Нийт давхаргуудын 75%-д (4 давхарга тутмын 3-т) шугаман давтагдах (linear recurrent) GDN ажиллана. Энэ нь өмнөх бүх түүхийг тогтмол хэмжээтэй төлөвт (state) тасралтгүй шахаж хадгалдаг тул эдгээр давхаргуудад KV Cache нэмж үүсэхгүй.
  • Qwen Sparse Attention (QSA): Үлдсэн 25% буюу 4 дэх давхарга бүрт QSA ажиллана. Уламжлалт Sparse Attention нь токен бүрийг тус тусад нь индегслэдэг учир урт дараалалд хүндэрдэг байсан бол QSA нь өгөгдлийг микро-блок (micro-blocks) түвшинд багцалж, зөвхөн хамгийн өндөр хамааралтай хэсгүүдийг маш хөнгөн индексээр шүүн авдаг.

Үүний үр дүнд 1 сая токен бүхий том даалгавруудын үед бүтэн Attention-той харьцуулахад Prefill үе шат 7.6 дахин, Decoding үе шат 4.9 дахин хурдассан үр дүн гарчээ.


2. 125B MoE + 51B N-gram Embedding: Төхөөрөмжийн RAM-руу санах ойг шилжүүлэх боломж

Загварын параметр ба багтаамжийг хэрхэн зохион байгуулсан нь инженерийн хувьд онцгой сонирхол татаж байна:

  • 125B нийт параметр / 6B идэвхтэй параметр: Модель нь Mixture-of-Experts (MoE) бүтэцтэй тул токен бүрийг боловсруулахад ердөө 6 тэрбум параметр л ачааллагдана.
  • 51B N-gram Lookup Table: Хэлний тогтсон хэллэг, синтакс загваруудыг тогтмол матриц үржүүлэлтээр биш, санах ойн Lookup Table байдлаар маш бага тооцооллоор дуудах N-gram Embedding-ийг нэмжээ.
  • Host Memory Offloading: Хамгийн гайхалтай нь энэхүү 51 тэрбум N-gram жингүүдийг үнэтэй GPU VRAM дээр байршуулах шаардлагагүй бөгөөд серверийн эсвэл компьютерын энгийн RAM / SSD санах ой руу асинхрон (prefetching) байдлаар шилжүүлэн унших боломжтой юм.

3. Gated Residual (FP8) ба Muon Optimizer

Загварыг гүнзгийрүүлэх тусам мэдээлэл давхарга хооронд алдагдах эрсдэлтэй байдаг. Qwen баг үүнийг засахын тулд Gated Residual (GR) механизмыг нэвтрүүлж, үндсэн residual урсгалыг 4 зэрэгцээ суваг болгон задалж, оролтын өгөгдлөөс хамаарсан динамик хаалтаар (dynamic gate) зохицуулдаг болгожээ. Мөн уг төлөвийг FP8 (8-bit floating point) нарийвчлалтайгаар хадгалснаар санах ойн дамжуулалтын траффикийг эрс багасгасан байна.

Сургалтын (Training) тал дээр сүүлийн үед хиймэл оюуны судалгаанд шуугиан тарьж буй Muon Optimizer-ийг албан ёсоор ашиглаж, AdamW-тэй хослуулан сургалтын тогтвортой байдлыг ханган, өмнөх Qwen3.7-Plus-аас 9 дахин бага тооцооллын зардлаар сургасан гэдгээ зарлав.


4. Хөгжүүлэгчид болон Local AI нийгэмлэгт юу авчрах вэ?

Энэхүү шинэ архитектур нь практик хөгжүүлэлтийн орчинд шууд бодит өөрчлөлтүүдийг авчирч эхэллээ:

  1. Local AI / Edge төхөөрөмж дээрх хувьсгал: Unsloth болон llama.cpp төслүүд өдрийн 0 дэх (Day 0) дэмжлэгийг үзүүлж, N-gram санах ойг системийн RAM руу offload хийх боломжтой болгосноор 96GB нэгдсэн санах ойтой (Mac Studio эсвэл Spark системүүд) энгийн машин дээр уг аварга загварыг бие даан local байдлаар ажиллуулах боломжтой болов.
  2. Coding Agent-уудын үнэ цэнэ: 262K унаган (native) контексттой ба YaRN ашиглан 1M хүртэл тэлэх энэхүү загвар нь код репозиторыг бүхэлд нь уншиж дүн шинжилгээ хийх агент даалгавруудыг өмнөхөөс хэд дахин хямд, хурдан гүйцэтгэнэ.
  3. Qwen4-ийн эхлэл: Энэхүү хувилбар нь бүрэн Qwen4 загварын гэр бүл гарахаас өмнө хөгжүүлэгчид болон судлаачдад шинэ архитектурыг турших, нээлттэй эх дээр үнэлгээ хийх талбар болж байна.

Дүгнэлт

Хиймэл оюуны загварууд зөвхөн "томрох" биш, харин "ухаалаг архитектуртай болох" чиглэл рүү эрс шилжиж буйн тод жишээ нь Qwen3.8-Flash-Next болж байна. Gated DeltaNet болон Sparse Attention-ийг хослуулсан энэхүү hybrid бүтэц нь ирээдүйн бүх open-source загваруудын жишиг стандарт болох өндөр магадлалтай юм.

Эх сурвалж:

  • Qwen Team Technical Report: On the Design of Qwen3.8-Next Architecture
  • Alibaba Cloud ModelScope & GitHub Repository
  • NVIDIA Developer Blog & Unsloth AI Documentation

Сэтгэгдэл

Ачаалж байна...