Мэдээ

Ганц моделд найдах эрин дуусав: NVIDIA "Nemotron 3.5 Lightning" болон "NeMo Switchyard" ухаалаг чиглүүлэгчийг зарлалаа

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 15·1 үзсэн·
Ганц моделд найдах эрин дуусав: NVIDIA "Nemotron 3.5 Lightning" болон "NeMo Switchyard" ухаалаг чиглүүлэгчийг зарлалаа

AI Coding Agent болон автоном агентууд хөгжүүлэлтийн өдөр тутмын хэрэгсэл болсон өнөө үед нэг том асуудал тулгараад буй нь зардал болон хурдны үр ашиггүй байдал юм. Урт хугацаанд тасралтгүй ажилладаг (always-on) агентууд ихэнх хугацаагаа "гүн сэтгэх"-д биш, харин файл унших, тест ажиллуулах, JSON форматлах, tool call дуудах зэрэг механик гүйцэтгэлд зарцуулдаг. Гэтэл хөгжүүлэгчид эдгээр энгийн үйлдэл бүрийг үнэтэй frontier reasoning модел руу (GPT-5, Claude зэрэг) илгээсээр байна.

Энэхүү гацааг шийдвэрлэхээр NVIDIA компани агент системүүдийн гүйцэтгэлийн давхаргад (execution layer) зориулсан Nemotron 3.5 Lightning загвар болон олон төрлийн моделууд дунд хүсэлтийг ухаалгаар чиглүүлэх NeMo Switchyard нээлттэй эхийн (open-source) санг албан ёсоор танилцууллаа.


"System of Models" Архитектур: Монолит загварын төгсгөл

Орчин үеийн агент системүүд дан ганц нүсэр загвар дээр тулгуурлахаа больж, олон загвар хамтран ажилладаг System of Models (Model Ensemble) бүтэц рүү шилжиж байна.

  • Plan & Orchestration Layer: Төлөвлөлт, системийн архитектур гаргах, ярвигтай алдаа шинжлэх зэрэгт Frontier reasoning загвар ажиллана.
  • Execution Layer: Код форматлах, linter-ийн алдаа шалгах, tool call аргументуудыг өөрчлөн турших зэрэг давтамж өндөртэй үйлдлүүдийг бага оврын, өндөр хурдтай, хямд модел хариуцна.

NVIDIA-ийн танилцуулсан шинэ шийдэл нь яг энэ гүйцэтгэлийн давхаргыг оновчлоход чиглэжээ.


Nemotron 3.5 Lightning гэж юу вэ?

Nemotron 3.5 Lightning нь нийт 30 тэрбум (30B) параметртэй Mixture-of-Experts (MoE) архитектуртай боловч нэг токен боловсруулахад ердөө 3 тэрбум (3B) параметр нь идэвхждэг.

Гол онцлогууд:

  1. Mamba-2 SSM ба Sparse Attention хослол: Загварын архитектурт цэвэр Transformer-аас татгалзаж, 23 Mamba-2 SSM үе, 23 MoE үе, 6 Sparse Attention үеийг хослуулсан. Үүний үр дүнд урт контексттэй ажиллах үеийн KV Cache санах ойн хэрэгцээ 52GB-аас ердөө 46MB болж эрс буурчээ.
  2. NVFP4 4-bit Пре-трейнинг: 20+ их наяд токен дээр анхнаасаа 4-bit NVFP4 форматаар сургагдсан тул орон нутгийн DGX/GPU дээр болон Ollama, vLLM орчинд секундэд 70–100+ токен гаргах өндөр хурдтай ажиллана.
  3. OpenMDW-1.1 Лиценз: Жин (weights), сургалтын өгөгдөл, реципийг бүрэн нээлттэй нийтэлсэн тул байгууллагууд өөрсдийн сервэрт байршуулан локалаар ажиллуулах бүрэн боломжтой.
  4. Agent Harness дэмжлэг: OpenClaw, Hermes Agent, LangChain зэрэг өргөн хэрэглэгддэг агентын framework-уудтай шууд нийцтэй.

NeMo Switchyard: Ухаалаг хүсэлт чиглүүлэгч (Router & Proxy)

Загвар нь байлаа ч хүсэлтийг хэрхэн зөв модел руу хуваарилах вэ? Үүнийг NeMo Switchyard шийдэж байна.

Switchyard нь Rust хэл дээр бичигдсэн хөнгөн proxy болон номын сан бөгөөд OpenAI болон Anthropic-ийн API стандартуудын хооронд протокол хөрвүүлэлт хийж, дурын AI Agent-ийн хүсэлтийг шаардлагатай загвар руу нь дамжуулдаг.

                +------------------+
                |  AI Coding Agent | (Claude Code / OpenClaw)
                +--------+---------+
                         |
                         v
             +-----------------------+
             |    NeMo Switchyard    | (Rust Proxy / Router)
             +---+---------------+---+
                 |               |
     (93% Execution Steps)   (7% Complex Planning)
                 |               |
                 v               v
         +---------------+ +---------------+
         | Nemotron 3.5  | | Claude Opus / |
         |   Lightning   | |    GPT-5.x    |
         | (Local/Fast)  | |  (Frontier)   |
         +---------------+ +---------------+

Хэрхэн ажилладаг вэ?

  • Protocol Translation: Жишээ нь, Claude Code ашиглаж байлаа ч Switchyard цаана нь хүсэлтийг хөрвүүлж vLLM, Ollama эсвэл NVIDIA NIM дээр ажиллаж буй орон нутгийн нээлттэй загварууд руу явуулж чадна.
  • Smart Classification: Хүсэлтийн түвшнээс хамаарч хөнгөн judge модель ашиглах, эсвэл дүрэмд суурилсан (signal-driven stage routing) аргаар хүсэлтийг ангилна.
  • Шууд тохиргоо (CLI): uv tool install nemo-switchyard[cli] тушаалаар суулган, хөгжүүлэгчийн IDE эсвэл terminal agent-тай шууд холбож ашиглах боломжтой.

74% Зардал хэмнэсэн үр дүн

LangChain багийн хийсэн бодит туршилтаар агент ажлын урсгалын нийт дуудлагуудын ердөө 7% нь л заавал үнэтэй Frontier загвар шаарддаг болох нь тогтоогджээ. Үлдсэн 93% энгийн алхмуудыг Nemotron 3.5 Lightning загвар бүрэн хариуцаж чадсан байна.

Claude Opus болон Nemotron 3.5 Lightning-ийг Switchyard-аар дамжуулан хослуулснаар нарийвчлалыг бараг алдалгүйгээр (93% accuracy parity) нийт AI дуудлагын зардлыг 74%-иар бууруулж чаджээ.


Хөгжүүлэгчдэд юу өөрчлөгдөх вэ?

  1. Local + Cloud Hybrid Агентууд: Код унших, форматлах зэрэг өгөгдлийн нууцлал шаардлагатай алхмуудыг локал DGX/Workstation дээрээ Nemotron-оор үнэгүй бөгөөд аюулгүй гүйцэтгээд, зөвхөн төлөвлөлтөө Cloud API руу шилжүүлэх боломжтой.
  2. Токен түгжрэл (Throttling) багасна: Агент өдөрт хэдэн мянган tool-call хийхэд cloud rate limit-д хүрэх асуудал эрс багасна.
  3. Vendors-оос хараат бус байдал: Switchyard нь OpenAI, Anthropic, Ollama, vLLM зэрэг ямар ч backend руу саадгүй хөрвүүлдэг тул агентаа дурын загварт түгжигдэлгүй (vendor lock-in) ажиллуулах гарц нээгдэж байна.

Энэхүү алхам нь AI агентууд нэг супер загварт бүхнийг даатгадаг үеэс тусгай үүрэгтэй жижиг загваруудыг ухаалгаар хоршуулдаг "үйлдвэрлэлийн түвшний архитектур" руу эргэлт буцалтгүй шилжиж буйг баталж байна.


Эх сурвалж:

Сэтгэгдэл

Ачаалж байна...