Нөүтбүүк дээр ажиллах Claude түвшний хүч: Alibaba нээлттэй эхийн "Qwen 3.8 27B" загвараа зарлалаа — Гэхдээ нэг том анхааруулгатай!
Локал хиймэл оюуны (Local LLM) экосистемд ээлжит том үйл явдал боллоо. Alibaba-ийн Qwen судалгааны баг 27 тэрбум параметртэй, Apache 2.0 бүрэн нээлттэй лицензтэй, Vision болон Reasoning хосолсон Qwen 3.8 27B загвараа албан ёсоор нийтийн хүртээл болголоо.
Энэхүү загвар нь 17GB санах ойд (quantized GGUF хэлбэрээр) багтах тул 24GB RAM-тай ердийн MacBook Pro эсвэл RTX 4090/5080 график карттай хувийн компьютер дээр ямар ч клоуд сервергүйгээр, бүрэн офлайн ажиллах боломжтой юм.
Гэвч нээлттэй эхийн нийгэмлэг болон салбарын хөгжүүлэгчид үүнийг туршиж эхлэхдээ гайхалтай дэвшлийг нь магтахын зэрэгцээ нэгэн сонирхолтой "гажиг"-ийг илрүүлээд байна.
Архитектурын хувьсгал: KV Cache-ийг 75% хэмнэсэн нь
Qwen 3.8 27B загварын хамгийн том техникийн амжилт нь түүний эрлийз бүтэц юм. Уламжлалт Transformer загварууд контекстийн хэмжээ 256K эсвэл 1M токен хүрэх үед KV Cache (Key-Value санах ой) нь хэдэн зуун гигабайт болж томордог.
Үүнийг шийдэхийн тулд Qwen-ийн инженерүүд 64 давхаргынхаа:
- 48 давхаргад нь Gated DeltaNet (шугаман анхаарлын - Linear Attention механизм),
- 16 давхаргад нь Gated Attention (уламжлалт Transformer бүтэц) ашиглажээ.
Үүний үр дүнд 1 сая токены контекст дээр ажиллахад шаардагдах санах ойн хэмжээ 244 GB байснаас 61 GB болж 4 дахин (75%) буурсан байна. Энэ нь локал компьютерт бүтэн код сан (codebase)-ийг ачаалж, гүн шинжилгээ хийх бодит үүдийг нээж өглөө.
Гүйцэтгэл ба Бенчмарк: Claude Opus 4.6-тай өрсөлдөхүйц
Alibaba-ийн нийтэлсэн албан ёсны тайлангаар энэхүү 27B нягт (dense) загвар нь өөрийн жингээсээ хэд дахин том proprietary загваруудтай тэнцэхүйц үр дүнг үзүүлжээ:
- SWE-bench Pro: 61.7 оноо (Өмнөх үеийн 53.5-аас өссөн).
- DeepSWE 1.1: 42.2 оноо.
- LiveCodeBench v6: 90.3.
- OSWorld / AndroidWorld: Компьютер ба үйлдлийн системтэй бие даан харьцах агент чадвараар 81–84%-ийн амжилт үзүүлсэн.
Түүнчлэн NVIDIA болон AMD аль аль нь Day-0 дэмжлэгийг үзүүлж, Multi-Token Prediction (MTP) алгоритмыг ашигласнаар RTX 5090 дээр секундэд 131 токен, Mac болон Ryzen AI платформ дээр секундэд 25–50 токен боловсруулах боломжтой болжээ.
Том сэрэмжлүүлэг: "Хэт туйлширч бодох" анхдагч тохиргоо
Энэхүү нээлтийн хамгийн их шуугиан тарьсан хэсэг нь түүний анхдагч тохиргоо (default reasoning effort) байлаа.
Нээлттэй эхийн нэрт мэргэжилтэн, програмист Саймон Уиллисон (Simon Willison) уг загварыг локал дээрээ туршиж үзээд нэгэн анхааруулгыг нийтэлсэн нь Hacker News дээр хэдхэн цагийн дотор хамгийн өндөр хандалтыг авчээ.
Qwen 3.8 27B нь анхнаасаа reasoning горим нь хамгийн дээд түвшин буюу xhigh дээр тохируулагдсан ирдэг. Жишээ нь, загвараас ердөө л "дугуй унасан тоншуул шувууны SVG вектор зураг гаргаад өг" гэж хүсэхэд загвар дотроо 21 минутын турш бодож, 22,276 reasoning токен шатааж байж ердөө 3,223 токены гаралт өгсөн байна. Бүр зүгээр "дугуй зур" гэхэд хүртэл захын цэг, радиусын нарийн логик дээр 10 гаруй минут гацаж, код дотроо "FINAL APPROACH", "OK TRULY FINAL APPROACH" гэж эргэлдэн шаналж байжээ.
"17GB хэмжээтэй файл миний хувийн компьютер дээр энэ бүхнийг хийж чадаж байгаа нь гайхамшиг. Гэхдээ
xhighгэсэн анхдагч тохиргоо нь энгийн даалгаврыг асар удаашруулж байна. Хөгжүүлэгчид үүнийг шуудlowболгох эсвэл reasoning-ийг нь унтрааж ашиглах хэрэгтэй." — Саймон Уиллисон
Reasoning горимыг унтрааж эсвэл багасгаж ажиллуулахад яг ижил чанартай үр дүнг ердөө 137 секундэд гаргаж чадсан байна.
Монголын хөгжүүлэгчид хэрхэн турших вэ?
Хэрэв та өөрийн төслийн кодын нууцлалыг чанд хадгалж, гадаад API-д мөнгө төлөхгүйгээр өөрийн нөүтбүүк дээр хүчирхэг туслах агент ажиллуулахыг хүсвэл дараах замаар эхлүүлж болно:
- Unsloth эсвэл llama.cpp ашиглах:
Qwen3.8-27B-Instruct-GGUF(4-bit Dynamic quant) татаж авснаар 17-19GB VRAM/RAM дээр бүрэн ажиллана. - Reasoning тохиргоог хянах: Ollama эсвэл LM Studio дээр
thinking_budgetэсвэлreasoning_effort-ийгlowболгож тохируулах. - Claude Code / OpenCode Harness-тай холбох: Локал API endpoint (
http://localhost:11434/v1) үүсгэн өөрийн IDE болон агент хэрэгслүүдтэйгээ холбож ажиллуулах.
Хиймэл оюуны загварууд томорсоор байгаа ч хэрэглэгчийн компьютер дээр ажиллах авсаархан, өндөр бүтээмжтэй нээлттэй загваруудын хөгжил 2026 онд цоо шинэ түвшинд гарсныг Qwen 3.8 бэлхнээ баталж байна.
Эх сурвалж: Simon Willison's Weblog & Hacker News Discussion, Alibaba Qwen Technical Release
Сэтгэгдэл
Ачаалж байна...