Нөүтбүүк дээр ажиллах бие даасан Агент: Alibaba нээлттэй эхийн "Qwen3.8-27B" загвараа зарлалаа
Томоохон хэлний загварууд (LLM) асар хурдацтай томорч, триллион параметрийн хэмжээнд хүрч буй өнөө үед ихэнх бие даасан agentic загварууд зөвхөн үүлэн дэд бүтэц, хаалттай API хэлбэрээр хэрэглэгчдэд хүрч байв. Гэвч хөгжүүлэгчдийн хувьд өөрийн локал машин, ажлын станц дээрээ нууцлал өндөртэй, токен төлбөргүйгээр ажиллах найдвартай кодчиллын агент ажиллуулах хэрэгцээ улам бүр өссөөр байна.
Энэхүү орон зайг нөхөхөөр Alibaba-ийн Tongyi Lab (Qwen Team) сүүлийн 24 цагийн дотор өөрсдийн цоо шинэ Qwen3.8-27B загварын жингүүдийг (weights) Hugging Face дээр Apache 2.0 лицензтэйгээр нийтийн хүртээл болголоо. Энэ нь өмнөх үеийн загваруудаас эрс сайжирсан код бичих болон компьютер удирдах (agentic coding & computer use) чадварыг хэрэглэгчийн түвшний техник хангамж дээр шууд ашиглах боломжийг бүрдүүлж байна.
27.8B Параметр дэх Frontier түвшний үзүүлэлт
Qwen3.8-27B нь 27.78 тэрбум параметртэй нягт (dense) мультимодал загвар бөгөөд текстээс гадна зураг болон видеог хүлээн авч боловсруулах чадвартай. Загварын гол анхаарал татсан үзүүлэлт нь зөвхөн энгийн чат биш, харин бодит кодчиллын орчин дахь бие даасан агентийн гүйцэтгэл юм:
- DeepSWE 1.1: 13.3-аас шууд 42.2 болж өссөн нь уг ангиллын загваруудын дунд дээд амжилт болж байна.
- Terminal-Bench 2.1: 73.0 оноо авч, терминал дээр тушаал гүйцэтгэх, алдаа засах түвшинд өндөр найдвартай болжээ.
- OSWorld-Verified: Систем болон график интерфэйстэй харьцах туршилтаар 84.3 оноо авчээ.
- SWE-bench Pro: 61.7 онооны гүйцэтгэл үзүүлж, өөрийн жингээс 10 дахин том зарим төлбөрт загваруудтай эн зэрэгцэх чадвартайг харуулав.
Эдгээр бенчмаркийн үр дүн нь уг загварыг Meta-ийн Muse Glimmer (30B) болон бусад нээлттэй жижиг загваруудаас кодчиллын хувьд илт давуу болохыг илтгэж байна.
Архитектурын шинэчлэл: Gated DeltaNet ба Гибрид Linear Attention
Qwen3.8-27B нь зөвхөн хэмжээгээрээ бус, дотоод архитектурын шийдлээрээ маш том дэвшил болсон. Уламжлалт Full Attention нь том контекст дээр маш их санах ой шаардаж, inference хурдыг удаашруулдаг асуудалтай байдаг.
Үүнийг шийдэхийн тулд Tongyi Lab-ийн баг 3:1 харьцаатай Hybrid Attention бүтцийг ашиглажээ:
- Gated DeltaNet (Linear Attention) — 48 давхарга: Санах ойн өсөлтийг шугаман (linear) хэлбэрт барьж, inference тооцооллын хурдыг огцом нэмэгдүүлсэн.
- Gated Full Attention — 16 давхарга: Нарийн логик сэтгэлгээ болон кодын холын хамаарлыг алдагдуулахгүй хадгалах үүрэгтэй.
- Multi-Token Prediction (MTP): Нэг алхамд олон токен зэрэг таамаглах механизм суулгаснаар код үүсгэх секундын хурдыг мэдэгдэхүйц нэмэгдүүлсэн байна.
Уг загвар нь үйлдвэрээсээ 262,144 (256K) токены натив контекст цонхтой гарч ирж байгаа ба YaRN скалинг ашиглан 1 сая токен хүртэл сунган ажиллах боломжтой.
Хөгжүүлэгчийн ширээн дээр: Техник хангамжийн шаардлага
Энэхүү загварын хамгийн том давуу тал бол хувийн төхөөрөмж дээр ажиллах боломж юм. 2.4 триллион параметр бүхий аварга Qwen3.8-Max-ыг хэн ч локал дээр ажиллуулах боломжгүй бол 27B хувилбар дараах үзүүлэлттэйгээр ажиллана:
- FP16 / BF16 (Бүрэн жин): ~55.6GB VRAM шаардана (Серверийн 1x A100/H100 эсвэл 2x RTX 4090).
- 8-bit (FP8 / GGUF): ~28GB - 30GB VRAM.
- 4-bit Quantized (GGUF / MLX / AWQ): Ердөө 16GB - 17GB санах ой шаардагдана.
Энэ нь 32GB санах ойтой Apple Silicon Mac (M2/M3/M4 Max) эсвэл 24GB VRAM-тай RTX 3090 / 4090 карттай энгийн хөгжүүлэгчийн систем дээр бүтэн agentic цикл (Aider, OpenCode, VS Code local extension-үүд)-ийг ямар нэгэн хоцрогдолгүйгээр бие даан ажиллуулах боломжтой гэсэн үг юм.
Apache 2.0: Нээлттэй экосистем ба Аюулгүй байдал
Qwen3.8-27B нь бүрэн Apache 2.0 лицензтэй гарсан тул гарааны бизнесүүд, бие даасан хөгжүүлэгчид болон томоохон байгууллагууд үүнийг арилжааны зориулалтаар ямар нэгэн хязгаарлалт, лицензийн төлбөргүйгээр ашиглах, өөрсдийн дотоод өгөгдөл дээр fine-tune хийх боломжтой.
Компанийн дотоод кодын санг гадаад үүлэн сервер рүү илгээхгүйгээр, 100% локал орчинд бүтэн төслийн архитектурыг ойлгож рефакторинг хийх, unit тест бичих чадвартай AI туслахтай болох нь enterprise түвшний аюулгүй байдлын шаардлагыг бүрэн хангаж байна.
Дүгнэлт
Alibaba-ийн шинэ загвар нь "хүчирхэг AI загвар заавал олон зуун тэрбум параметртэй байх албагүй, харин зөв архитектур болон нягт сургалт чухал" гэдгийг дахин баталлаа. Одоогийн байдлаар Hugging Face, Ollama болон llama.cpp экосистемд Qwen3.8-27B-ийн квантчилсан хувилбарууд нийлүүлэгдэж эхлээд байгаа бөгөөд та яг одоо өөрийн локал төхөөрөмж дээрээ татан авч турших боломжтой.
Эх сурвалж: Hugging Face Qwen Repository, Alibaba Tongyi Lab Model Card, Local AI Zone Technical Analysis
Сэтгэгдэл
Ачаалж байна...