Мэдээ

Databricks AI кодинг агентуудын зардлын дэлбэрэлтийг шийдэх "AI Gateway" архитектурыг танилцууллаа

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 7·3 үзсэн·
Databricks AI кодинг агентуудын зардлын дэлбэрэлтийг шийдэх "AI Gateway" архитектурыг танилцууллаа

AI агентуудын эрин үе ба Enterprise-уудад тулгарч буй "Зардлын хана"

2026 онд AI кодинг хэрэгслүүд (Claude Code, Cursor, Codex гэх мэт) нь зүгээр нэг кодын авто-гүйцээлт (autocomplete) байхаа больж, багийн гишүүдийн түвшинд ажилладаг бие даасан AI агентууд болон хөгжжээ. Databricks компанийн шинээр нийтэлсэн судалгаагаар, agentic coding хэрэгслүүдийг багууддаа нэвтрүүлснээр хөгжүүлэлтийн хурд болон бүтээмж (velocity metrics) зарим инженерүүдийн хувьд хэд дахин өссөн байна.

Гэвч AI агентуудыг байгууллагын хэмжээнд өргөн хүрээнд ашиглаж эхлэхэд бараг бүх компани нэг ижил том асуудалтай тулгарч эхэллээ: Экспоненциалаар өсөж буй API болон токены зардал. AI агентууд бие даан олон файлын refactor хийх, тест ажиллуулах, алдааг олж засахын тулд асар том контекст (код баазын түүх, тохиргоо, лог) дахин дахин LLM руу илгээдэг. Хэрэв энэ өсөлтийг хяналтгүй орхивол AI хэрэгслийн авчирч буй ашиг тусыг зардлаараа даван гарах эрсдэлтэй юм.

Энэхүү асуудлыг шийдвэрлэхийн тулд Databricks-ийн инженерийн баг зардлыг оновчлох хөшүүргүүд болон байгууллагын түвшний AI Gateway архитектурын загварыг танилцууллаа.

Зардлыг бууруулах архитектурын 4 үндсэн хөшүүрэг

Databricks-ийн туршлагаас харахад AI кодингийн зардлыг кодын чанарт нөлөөлөхгүйгээр бууруулах дөрвөн гол архитектурын шийдэл байна:

1. Нээлттэй эхтэй ба хямд загварууд руу шилжих (Moving to Open Source and Lower Cost Models)

Хамгийн өндөр чадалтай, өндөр өртөгтэй топ загваруудыг (ж.нь Opus эсвэл GPT-5.6 Sol) бүх төрлийн даалгаварт дараалан ашиглах нь зардлын хамгийн том алдагдал болдог. Энгийн CRUD функц бичих, логийг шинжлэх, нэгж тест (unit test) үүсгэх зэрэг өдөр тутмын даалгавруудыг нээлттэй эхтэй загварууд эсвэл хямд өртөгтэй загварууд руу чиглүүлснээр зардлыг 50–80% хүртэл бууруулах боломжтой.

2. Динамик хүсэлт ба даалгаврын чиглүүлэлт (Dynamic Request and Task Routing)

Хөгжүүлэгч бүр гараар аль загварыг сонгохыг шийдэх нь төвөгтэй бөгөөд оновчгүй байдаг. Тиймээс кодын Prompt болон даалгаврын нарийн төвөгтэй байдлыг автоматаар үнэлдэг Router систем хэрэгтэй. Жижиг, тодорхой өөрчлөлтүүдэд хурдан бөгөөд хямд загварыг хуваарилж, зөвхөн олон систем дамнасан, систем архитектурын гүн шинжилгээ шаардсан хүсэлт дээр топ түвшний загваруудыг идэвхжүүлдэг.

3. Токены илүүдэл зардлыг бууруулах (Reducing Token Overhead)

Агент бүрийн хүсэлт (request) бүрд бүх репозиторын файлуудыг давтан илгээх нь токены зардлыг эрс өсгөдөг. Архитектурт Prompt Caching, контекст тохируулах буюу Context Compaction (хэрэггүй лог болон дубликат хэсгийг цэвэрлэх), мөн зөвхөн хамааралтай кодын хэсгийг илгээх механизмыг суурилуулснаар токен зарцуулалтыг эрс танадаг.

4. Хөгжүүлэгчийн хяналт ба зардлын зааг (Visibility, Tripwires, and Budgets)

Хөгжүүлэгч бүрт өөрийн токены хэрэглээ ба зардлыг бодит хугацаанд харах Dashboard өгөх шаардлагатай. Мөн тодорхой зардлын зааг (Spend Gates) тохируулснаар, өдрийн/долоо хоногийн төсөв хэтрэх үед систем хөгжүүлэгчид сануулга өгөх эсвэл хямд загвар руу автоматаар шилжүүлэх (Model Downshifting) боломжийг олгодог.

"AI Gateway" архитектурын загвар гэж юу вэ?

Эдгээр дөрвөн хөшүүргийг системтэйгээр хэрэгжүүлэхийн тулд Databricks AI Gateway гэх төвлөрсөн дэд бүтцийн хэв шинжийг (design pattern) санал болгож байна.

Уламжлалт бүтцэд хөгжүүлэгчийн IDE эсвэл CLI агентууд шууд AI provider-уудын API руу холбогддог бол AI Gateway архитектурт голд нь төвлөрсөн прокси (Proxy) байрлана:

[ Developer IDEs / CLI Agents ]
             │
             ▼
    ┌─────────────────┐
    │   AI GATEWAY    │  ──► Budget Tracking & Spend Gates
    │                 │  ──► Dynamic LLM Routing
    │                 │  ──► Context Compaction & Caching
    └─────────────────┘
             │
     ┌───────┼───────┐
     ▼       ▼       ▼
 [OpenAI] [Anthropic] [Open Source Models]

AI Gateway-ийн үндсэн функцууд:

  • Capacity & Access Management: Загваруудын хандалт, API Key болон Rate Limit-ийг нэг дороос хянах.
  • Budget Policy Enforcement: Моделийн түвшин бууруулах (Model Downshifting) болон төсвийн хязгаарлалтыг автоматаар хэрэгжүүлэх.
  • Context Optimization: Илгээж буй токены хэмжээг багасгах, Prompt Caching хийх.
  • Telemetry & Session Tracing: Кодинг сесс бүрийн өртөг болон үр ашгийг логдож, ROI-ийг тооцоолох.

Монгол хөгжүүлэгчид ба Engineering Lead-үүдэд өгөх зөвлөмж

AI агентуудыг програм хөгжүүлэлтэд ашиглах нь сонголт биш стандарт болж буй энэ үед зөвхөн API Key тарааж ашиглах нь санхүүгийн хувьд эрсдэлтэй. Монголын стартапууд болон энтерпрайз компаниудын инженерийн багууд дотоод хөгжүүлэлтийн дэд бүтцэд AI Gateway шийдлүүдийг нэвтрүүлж, LLM Routing болон контекст оновчлолыг хийснээр AI-ийн ашиг тусыг хамгийн бага зардлаар хүртэх боломжтой юм.

Эх сурвалж: Databricks Blog - Managing AI Coding Costs at Scale

Сэтгэгдэл

Ачаалж байна...