Мэдээ

Gartner-ийн Дүгнэлт: AI-ийн Түүхэнд Анх Удаа Inference Зардал Training-ийг Даван Гарав — AI Агентууд Үүлэн Архитектурыг Өөрчилж Эхэллээ

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 13·2 үзсэн·
Gartner-ийн Дүгнэлт: AI-ийн Түүхэнд Анх Удаа Inference Зардал Training-ийг Даван Гарав — AI Агентууд Үүлэн Архитектурыг Өөрчилж Эхэллээ

Gartner судалгааны байгууллагаас AI ба үүлэн технологийн дэд бүтцийн (AI-optimized IaaS) зардал болон чиглэлийн талаарх шинэ тайлангаа танилцууллаа. Уг тайлангаас харвал AI-д зориулсан үүлэн дэд бүтцийн зах зээл энэ онд 96.4%-иар өсөж, 42.2 тэрбум ам.долларт хүрэх төлөвтэй байна.

Гэвч технологийн салбарын хувьд хамгийн онцлох, түүхэн эргэлтийн цэг нь Inference (Ажиглалт/Дүгнэлт хийх зардал) болон Training (Загвар сургах зардал)-ийн харьцаа өөрчлөгдсөн явдал юм. 2026 онд дэлхий даяар Inference ачаалалд зориулсан зардал 23.3 тэрбум ам.долларт хүрч, AI загваруудыг сургахад зарцуулсан 19 тэрбум ам.долларыг анх удаа даван гарлаа.

Энэхүү шилжилт нь програм хангамжийн хөгжүүлэлт болон систем архитектурын салбар маш хурдацтайгаар "Модель хөгжүүлэх" шатнаас "Продакшн системд агентуудыг ажиллуулах" шат руу шилжиж байгааг илтгэж байна.

AI Трэйнингээс Агент Боловсруулалт руу: Түүхэн Эргэлтийн Цэг

Сүүлийн хэдэн жилд хиймэл интеллектийн салбарын гол сэдэв нь GPU кластерууд дээр асар их токеноор их наяд параметр бүхий суурь загваруудыг (Foundation Models) сургах (Training) явдал байв. Асар их тооцоолох чадал, цахилгаан эх үүсвэр, санхүүжилт шаарддаг энэ шатанд ихэнх хөрөнгө оруулалт загвар бүтээгч томоохон лабораториудад төвлөрч байсан юм.

Харин 2026 онд Agentic AI буюу даалгаврыг бие даан биелүүлдэг AI агентууд бүх төрлийн байгууллагын системд шууд нэвтэрч эхэлснээр compute боловсруулалтын загвар үндсээрээ өөрчлөгдлөө. AI агентууд нь хэрэглэгчийн нэг асуултад ганц удаа хариулаад зогсохгүй:

  • Өгөгдлийн бааз руу хандах,
  • Гадаад API дуудах,
  • Код бичиж, түүнийгээ изолирацитай sandbox орчинд тестийг нь ажиллуулах,
  • Олон шатлалт дараалсан эргэцүүлэл (Multi-step reasoning loops) хийх зэргээр тасралтгүй тооцоолол хийдэг.

Үүний үр дүнд системийн хэрэглэгчдийн тоо өсөх тусам загварыг бодит хугацаанд ажиллуулах (Real-time Inference) ачаалал хэд дахин нэмэгдэж, үүлэн системд үзүүлэх дарамт болон зардлын бүтцийг бүрэн өөрчилж байна.

Системийн Архитектурч, Хөгжүүлэгчдэд Энэ Ямар Сануулга Өгч Байна Вэ?

Инженерүүдийн хувьд энэхүү статистик нь зөвхөн санхүүгийн үзүүлэлт биш бөгөөд програм хангамжийн архитектур ба дев-опс (DevOps/MLOps) практикт дараах чухал өөрчлөлтүүдийг шаардаж байна.

1. Inference Optimization & Cost Control

Сургалтын зардал багссан ч одоо токен бүрийн ажиллах хугацаа (Latency) болон нэг хүсэлтийн санхүүгийн өртөг (Cost per Request) систем хөгжүүлэгчдийн хамгийн том асуудал боллоо. Томоохон системүүдэд:

  • Prompt & Context Caching: Дахин давтагдах контекст, систем промптуудыг memory дээр cache хийж GPU ачааллыг багасгах.
  • Speculative Decoding & Quantization: 8-bit, 4-bit квантчилсан загваруудыг ашиглаж, хурдыг нэмэгдүүлэн санах ойн ачааллыг бууруулах.
  • vLLM, TensorRT-LLM, SGLang: Тусгайлан тохируулсан Inference engine-үүдийг Kubernetes орчинд Auto-scaling хийж ажиллуулах нь стандарт болов.

2. Domain-Specific Models (DSM) ба Small Language Models (SLM)

Заавал 100+ тэрбум параметртэй маш том загварыг бүх зүйлд ашиглах нь санхүүгийн хувьд ашиггүй бөгөөд ажиллах хурд удаан байдаг. Тиймээс хөгжүүлэгчид тодорхой нэг task-д (тухайлбал зөвхөн SQL query үүсгэх, эсвэл зөвхөн кодын баг шалгах) тусгайлан Fine-tune хийсэн жижиг загваруудыг (SLM) ашиглах нь эрс нэмэгдэж байна. Gartner-ийн мэдээлснээр байгууллагууд өөрсдийн дотоод өгөгдөл дээр дагнасан тусгай загваруудыг Inference дээр идэвхтэй ажиллуулж байна.

3. AI-Native Infrastructure ба Low-Latency Pipelines

Агент системүүд асар олон Tool дуудаж, API хооронд өгөгдөл дамжуулдаг тул сүлжээний хоцролт (Network Latency) системийн хамгийн том гацаа (Bottleneck) болж байна. Иймд олон хөгжүүлэгчид үүлэн ба эдж (Cloud & Edge) хосолсон архитектур ашиглаж, хэрэглэгчдэд ойр цэгт жижиг AI загваруудыг ажиллуулах (Edge Inference) чиглэлд анхаарч байна.

Дүгнэлт: Модель Бүтээгч Эрин Үеэс "Inference Engineering" Эрин Үе рүү

Gartner-ийн энэхүү тайлан нь AI салбарт сургалтын шат дуусаагүй ч, ашиглалтын (Inference) шат жинхэнэ утгаараа давамгайлж эхэлснийг харууллаа.

Одоо хөгжүүлэгчдийн өмнө тулгарч буй хамгийн том сорилт бол "AI загварыг хэрхэн ашиглах вэ?" гэдэг асуулт биш, харин "Асар олон AI агентуудын Inference ачааллыг хэрхэн хямд, бага latency-тай, 99.9% бэлэн байдалтайгаар (Availability) масштаблах (Scale) вэ?" гэдэг шинэ үеийн инженерчлэлийн бодлого юм.

Хэрэв та backend болон cloud архитектур дээр ажилладаг бол одооноос Inference optimization, token rate-limiting, агент сүлжээний ачаалал тэнцвэржүүлэлтэд анхаарлаа хандуулах цаг болжээ.

Эх сурвалж: Gartner Inc. Enterprise Research (August 2026)

Сэтгэгдэл

Ачаалж байна...