Мэдээ

Зардлыг 74% Бууруулна: NVIDIA Нээлттэй Эхийн Ухаалаг LLM Чиглүүлэгч "NeMo Switchyard"-ийг Зарлалаа

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 17·2 үзсэн·
Зардлыг 74% Бууруулна: NVIDIA Нээлттэй Эхийн Ухаалаг LLM Чиглүүлэгч "NeMo Switchyard"-ийг Зарлалаа

Орчин үеийн программ хангамжийн хөгжүүлэлтэд AI агентууд (Agentic Workflows) болон олон шатлалт LLM системүүд хүч түрэн орж ирж байна. Гэвч бодит үйлдвэрлэлийн (production) түвшинд эдгээр системийг нэвтрүүлэхэд тулгардаг хамгийн том бэрхшээл бол Tokenomics буюу API-ийн асар өндөр зардал юм.

Хэрэглэгчийн энгийн текст засварлах, мэдээлэл ангилах эсвэл хэрэгсэл дуудах (tool calling) алхам бүрд хамгийн хүчирхэг, үнэтэй "frontier" загваруудыг дуудах нь төсвийг маш хурдан үрдэг. Энэхүү асуудлыг шийдвэрлэхээр NVIDIA компани загваруудын хооронд хүсэлтийг ухаалгаар чиглүүлдэг NVIDIA NeMo Switchyard нээлттэй эхийн шинэ сангаа албан ёсоор танилцууллаа.

AI Агентын дуудлагын ердөө 7%-д л Frontier загвар шаардлагатай

LangChain багийнхан NeMo Switchyard-ийг ашиглан 145 олон үе шаттай (multi-turn) Deep Agents даалгавар дээр бодит бенчмарк туршилт явуулжээ. Туршилтын үр дүн хөгжүүлэгчдийн дунд маш их шуугиан тарьж байна:

  • Нийт ажлын урсгалын алхмуудын ердөө 7%-д нь л Claude Sonnet эсвэл GPT түвшний том frontier загвар шаардагдсан байна.
  • Үлдсэн 93% даалгавар нь (өгөгдөл задлах, төлөв хадгалах, энгийн тушаал гүйцэтгэх гэх мэт) хямд, авсаархан SLM (Small Language Model) болон дунд хэмжээний загваруудад хангалттай даалгавар байв.
  • Switchyard ашиглан ухаалаг чиглүүлэлт хийснээр үнэн зөв байдлыг frontier түвшинд хадгалахын зэрэгцээ нийт зардлыг 74% бууруулж чаджээ.

Түүнчлэн NVIDIA дотооддоо Cognition-ийн Devin Desktop дээр Switchyard-ийн чиглүүлэгчийг нэгтгэн туршихад гүйцэтгэлийн чанарыг алдагдуулахгүйгээр нийт зардлыг 28% хэмнэсэн байна.

NeMo Switchyard хэрхэн ажилладаг вэ?

NeMo Switchyard нь уламжлалт "rule-based" энгийн if/else логикоос тэс өөр зарчмаар ажилладаг.

  1. Ажлын ачааллын нарийн үнэлгээ: Ирж буй prompt, context болон хүсэлтийн нарийн төвөгтэй байдлыг (task complexity) "Tuning-free" болон "Tunable" хоёр төрлийн алгоритмаар бодит хугацаанд үнэлнэ.
  2. Оновчтой сонголт: Тодорхойлсон босго утга (threshold) дээр үндэслэн чанар (accuracy), хугацааны хоцрогдол (latency), зардал (cost) гурвын тэнцвэрийг хангасан хамгийн тохиромжтой загварыг сонгож хүсэлтийг дамжуулдаг.
  3. Rust дээр суурилсан хурдан Proxy: NeMo Switchyard v0.2.0 нь бүхэлдээ Rust хэл дээр бичигдсэн тул microsecond-ийн бага нэмэлт latency-тай ажиллана. Бие даасан сервер (standalone proxy) болон Rust сан (crate) хэлбэрээр шууд ашиглах боломжтой.

Хамгийн чухал давуу тал нь Switchyard нь OpenAI болон Anthropic-ийн унаган API форматыг 100% хадгалдаг. Өөрөөр хэлбэл, та өөрийн систем дэх одоогийн кодоо өөрчлөх шаардлагагүй, зөвхөн endpoint болон routes.toml тохиргоогоо зааж өгөхөд л хангалттай.

# routes.toml жишээ тохиргоо
[[routes]]
id = "smart_agent_router"
strategy = "cost_latency_balanced"

[routes.targets]
simple_tasks = "openrouter/meta-llama/llama-3.1-8b-instruct"
medium_tasks = "nvidia/nemotron-3.5-lightning"
complex_reasoning = "anthropic/claude-3-7-sonnet"

Kong AI Gateway болон Enterprise экосистемтэй нэгдсэн нь

Зөвхөн хөгжүүлэлтийн сангаар зогсохгүй, API удирдлагын тэргүүлэгч Kong AI Gateway NeMo Switchyard-ийг албан ёсоор өөрийн системдээ шууд нэгтгэснээ зарлалаа.

Үйлдвэрлэлийн системд загвар чиглүүлэх логикийг шууд кодондоо хатуу бичих (hardcode хийх) нь аюулгүй байдал болон удирдлагын хувьд эрсдэлтэй байдаг. Kong болон Switchyard-ийн хамтын шийдэл нь:

  • Загварын ухаалаг сонголтыг NeMo Switchyard хариуцна.
  • Traffic management, Rate-limiting, PII masking (нууцлал хамгаалалт), Token governance-ийг Kong AI Gateway гүйцэтгэнэ.

Ингэснээр инженерийн багууд дэд бүтцийн эрсдэл үүсгэхгүйгээр, платформын түвшинд зардлаа хянах боломжтой болж байна.

Хөгжүүлэгчдэд ямар ач холбогдолтой вэ?

Өнгөрсөн он жилүүдэд бид "бүх даалгаварт хамгийн том загварыг ашиглах" хандлагатай байсан бол 2026 оны AI архитектур нь "System of Models" буюу олон төрөлжсөн загваруудын сүлжээ рүү бүрэн шилжиж байна.

NeMo Switchyard нь хөгжүүлэгчдэд:

  • Зардлыг шууд 50-75% хэмнэх: Жижиг ба дунд хэмжээний SLM загваруудыг туслах алхмуудад ашиглах замаар.
  • Хурдыг нэмэгдүүлэх: Энгийн асуултуудад том загварыг хүлээлгүйгээр хэд дахин хурдан хариу авах.
  • Vendor Lock-in-оос гарах: Нэг ханган нийлүүлэгчээс (OpenAI, Anthropic, Google) хараат бусаар загваруудаа dynamic байдлаар сольж ажиллах боломжийг олгож байна.

NVIDIA NeMo Switchyard нь GitHub дээр нээлттэй эхээр нийтлэгдсэн бөгөөд cargo install --locked switchyard-server эсвэл Python/Rust орчинд шууд суулган туршиж үзэх боломжтой.

Эх сурвалж: NVIDIA Technical Blog, LangChain Research, Kong Inc. Engineering

Сэтгэгдэл

Ачаалж байна...