Мэдээ

AI салбарт түүхэн эргэлт: Inference зардал анх удаа Training зардлыг давж, Хөгжүүлэгчдийн анхаарал Дэд Бүтэц рүү шилжлээ

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 11·1 үзсэн·
AI салбарт түүхэн эргэлт: Inference зардал анх удаа Training зардлыг давж, Хөгжүүлэгчдийн анхаарал Дэд Бүтэц рүү шилжлээ

Хиймэл оюун ухааны эрин үеийн шинэ эргэлтийн цэг

Сүүлийн хэдэн жил технологийн салбар "хэн хамгийн том загвар сургах вэ?", "хэдэн зуун мянган GPU ашиглан LLM-ээ сургав?" гэх өрсөлдөөнд бүх анхаарлаа чиглүүлж ирсэн билээ. Гэвч Gartner судалгааны байгууллагаас гаргасан шинэ судалгааны тайлан AI салбар нэгэн түүхэн шинэ эрин үед шилжсэнийг албан ёсоор зарлалаа.

Энэ онд дэлхий даяар AI-д зориулсан Клауд дэд бүтцийн (Infrastructure as a Service - IaaS) зардал 42 тэрбум ам.долларт хүрэх төлөвтэй байгаа бөгөөд үүний 23.3 тэрбум ам.долларыг зөвхөн Inference (загварыг бодитоор ажиллуулах, хэрэглэгчийн асуулгад хариулах) зардал эзэлж байна. Харин загвар сургах (Training) зардал 19 тэрбум ам.доллартай тэнцэж, түүхэндээ анх удаа Inference-ийн зардлын ард орлоо.

Энэхүү үзүүлэлт нь ердөө санхүүгийн статистик биш юм. Энэ бол программ хөгжүүлэгчид, дата инженерүүд болон систем архитекторуудын хувьд өдөр тутмын ажлын барил, систем зохиомждог арга барил үндсээрээ өөрчлөгдөж байгааг илтгэх томоохон дохио юм.

"Сургах" шатнаас "Бүтээмжтэй ажиллуулах" шат руу

Өмнө нь олон стартап болон аж ахуйн нэгжүүд өөрсдийн сангаас их хэмжээний хөрөнгө оруулалт хийн, нээлттэй эх сурвалжийн (Open-source) загваруудыг fine-tune хийх эсвэл эхнээс нь сургахад хамаг ресурсаа зарцуулдаг байв. Гэвч 2026 онд AI Агент (Agentic AI) болон автоматжуулалтын системүүд үйлдвэрлэлд (production) гүнзгий нэвтрэхийн хэрээр хамгийн том сорилт нь загварыг хэрхэн хурдан, хямд, тасралтгүй тогтвортой ажиллуулах вэ гэдэгт чиглэж эхэллээ.

Gartner-ийн ахлах шинжээч Хардип Сингхийн дурдсанаар: "Inference-ийн зардал Training-ийн зардлыг давж байгаа нь AI технологи лабораторийн туршилт, судалгааны шатнаас бүрэн гарч, байгууллагуудын өдөр тутмын үйлдвэрлэлийн процессын цөм хэсэг болсныг баталж байна."

Ялангуяа олон шаталсан бодолт хийдэг AI Агентууд (Reasoning Models & Multi-agent Workflows) нэг удаагийн хэрэглэгчийн хүсэлтэд ар араас нь олон API call хийж, кодын орчинд тест хийх, хэрэгсэл дуудах (Tool Calling), хариуг эргэн шинжлэх зэрэг дараалсан үйлдлүүдийг хийдэг. Энэ нь уламжлалт чатботоос хэдэн арван дахин их сервер боловсруулах ачаалал (compute power) шаарддаг тул Inference-ийн хэрэглээ асар хурдацтай өсөж байгаа юм.

AI Архитектурт гарах 4 чухал өөрчлөлт

Gartner-ийн прогнозоор 2027 он гэхэд энэ чиглэлийн IaaS дэд бүтцийн зардал 66 тэрбум ам.долларт хүрэх төлөвтэй байна. Энэхүү асар том зах зээлийн шилжилт нь хөгжүүлэгчдээс дараах техникийн шинэ архитектур, инженерчлэлийн шийдлүүдийг шаардаж байна:

1. Latency болон Throughput-ийн Инженерчлэл

Загварыг зүгээр нэг API-аар дуудаж хариу авах нь хангалтгүй болсон. vLLM, TensorRT-LLM, SGLang, Ollama зэрэг Inference Engine-үүдийг тохируулах, Time to First Token (TTFT) болон Tokens Per Second (TPS) үзүүлэлтүүдийг миллисекундийн түвшинд оновчлох нь веб ба апплипейшний performance-д шууд нөлөөлж байна.

2. Context Window ба Caching Менежмент

Олон сая токен бүхий контексттэй ажиллах үед асуулга бүрд өгөгдлийг дахин дамжуулах нь асар өндөр зардал дагуулдаг. Иймд KV Caching, Prompt Caching, мөн хэрэглэгчдийн ижил төстэй хүсэлтийг вектор сангаар дамжуулан барьж авдаг Semantic Caching концепцуудыг системдээ ашигласнаар API зардлыг 50-80% хүртэл бууруулах боломжтой болж байна.

3. Model Routing ба Hybrid Инхеренс

Бүх асуулгад GPT-4o эсвэл Claude 3.5 Sonnet шиг өндөр үнэтэй, аварга том загварыг дуудах нь эдийн засгийн хувьд ашиггүй. Шинэ үеийн системүүд "Model Router" архитектур ашиглан энгийн хүсэлтүүдийг хөнгөн, хурдан жижиг загвар руу (Small Language Models - SLM), харин цогц логик шаардлагатай бодолтыг том загвар руу автоматаар чиглүүлдэг боллоо.

4. Speculative Decoding ба Quantization

Нөөц бололцоог хэмнэх үүднээс FP16 эсвэл FP8 түвшний загваруудыг нарийвчлал алдагдуулахгүйгээр INT4/INT8 түвшинд квантчлах (Quantization) болон жижиг загвараар драфт токен үүсгэж, том загвараар баталгаажуулдаг Speculative Decoding техникүүд production орчинд стандарт болон нэвтэрч байна.

Дүгнэлт: Хөгжүүлэгчдийн шинэ рол

Ирээдүйн программ хангамжийн салбарт амжилттай ажиллах хөгжүүлэгч гэдэг нь зөвхөн хиймэл интеллектийн API холбодог нэгэн биш, харин AI ажиллуулах инженерийн бүтцийг оновчтой, найдвартай, эдийн засгийн ашигтайгаар зохиомжилдог Inference Infrastructure Engineer юм.

Хэрэв та өөрийн системдээ AI функциональ нэмж байгаа бол "Ямар загвар сонгох вэ?" гэдгээс гадна "Бид энэ загварын нэг хүсэлтийн зардлыг (cost per query) хэрхэн хамгийн бага байлгаж, latency-г яаж бууруулах вэ?" гэдэгт одооноос анхаарлаа чиглүүлэх шаардлагатай боллоо.

Эх сурвалж: CIO Dive / Gartner Research Report

Сэтгэгдэл

Ачаалж байна...