Мэдээ

AWS болон GitHub Actions: AI агент тань муудвал PR автоматаар унадаг CI/CD "Quality Gate" гарлаа

TOGTOKHTOGTOKH·2026 оны есдүгээр сарын 10·0 үзсэн·
AWS болон GitHub Actions: AI агент тань муудвал PR автоматаар унадаг CI/CD "Quality Gate" гарлаа

Промпт засвар бүр аюул дагуулдаг үе дуусах уу?

Орчин үеийн программ хангамж хөгжүүлэлтэд AI агентууд хүч түрэн орж ирж буй ч инженерүүдийн өмнө нэгэн том саад үүсээд байна: AI агентын регресс (regression).

Бид уламжлалт программ дээр pytest юм уу jest ажиллуулаад код эвдэрсэн эсэхийг 100% детерминистик байдлаар шалгаж чаддаг. Харин AI агент дээр System Prompt-оо нэг өгүүлбэрээр сайжруулах, суурь моделийн хувилбарыг ахиулах, эсвэл MCP (Model Context Protocol) хэрэгслийн тодорхойлолтыг өөрчлөх үед өмнө нь зөв ажиллаж байсан 10 өөр хувилбар чимээгүйхэн эвдэрч, буруу tool дуудах эсвэл хий хоосон хариулт (hallucination) өгч эхэлдэг билээ.

Ихэнх багууд агентын чанарыг хөгжүүлэгч өөрөө гараараа чатлаж, "За болж байх шиг байна" гэж үзээд Merge хийдэг байсан бол энэхүү сорилтыг шийдэхээр AWS сүүлийн 24 цагийн дотор Amazon Bedrock AgentCore Evaluations болон GitHub Actions-ийг холбосон автомат регресс тестийн reference шийдлийг албан ёсоор дэлгэлээ.

Энэхүү шинэ архитектур нь AI агентын үнэлгээг (Eval) уламжлалт CI/CD хоолойн салшгүй нэг хэсэг болгож, агентын оноо тогтоосон босгоос доошилбол Pull Request (PR)-ийг автоматаар унагадаг хатуу чанарын хаалт (Quality Gate) үүсгэх боломжийг олгож байна.


Пробабилистик ертөнцийг CI/CD-д нийцүүлэх механизм

AWS-ийн танилцуулсан загварт агентын кодод өөрчлөлт орох бүрд дараах 4 шатлалт процесс автоматаар хэрэгждэг:

  1. Trigger ба Sandbox Deployment: Хөгжүүлэгч агентын код, prompt тохиргоо эсвэл MCP серверийн файлуудад гар хүрээд PR нээхэд GitHub Actions workflow шууд ажиллана. Энэхүү pipeline нь агентыг Bedrock AgentCore Runtime дээр тусгаарлагдсан хөгжүүлэлтийн (sandbox) орчинд түр байршуулдаг.
  2. Evaluation Dataset Invocations: Workflow нь бэлтгэсэн тест промптуудын сан (evaluation suite)-аас агентийг олон дахин дуудаж, агентын гаргасан бүх Trace буюу хэрэгсэл дуудсан дараалал, хариултуудыг цуглуулна.
  3. Bedrock AgentCore Evaluate API: Цугларсан trace-үүдийг AgentCore Evaluate API руу илгээж, хэд хэдэн үндсэн метрикээр (Tool Selection Accuracy, Goal Completion, Safety, Hallucination Index) дүгнэнэ.
  4. Automated Blocking (PR Status Check): Хэрэв агентын ерөнхий чанарын оноо тохируулсан босгоос (жишээ нь 90%) буурсан байвал GitHub Actions-ийн job амжилтгүй болж (Failed), GitHub Branch Protection эсвэл Ruleset-ийн тусламжтайгаар тухайн PR-ийг Main branch руу нэгтгэх эрхийг шууд түгжинэ.

Үр дүнд нь инженерүүд "Промпт өөрчилсөн чинь продакшн дээр төлбөрийн хэрэгсэл дуудахаа больчихлоо" гэх мэтийн сөрөг үр дагавраас урьдчилан бүрэн сэргийлэх боломжтой болж байна.


MCP ба Энтерпрайз аюулгүй байдал

Энэхүү шийдлийн бас нэгэн чухал тал нь орчин үеийн Model Context Protocol (MCP) архитектурыг бүрэн дэмжиж байгаа явдал юм. Олон багууд одоогийн байдлаар агентаа гадны системүүдтэй холбохдоо нээлттэй MCP протоколыг ашиглаж буй ч тэдгээрийг тестлэхдээ нууц үг, OAuth token-ийг CI дээр хэрхэн зохицуулахаа мэддэггүй байв.

AWS-ийн жишээ кодод дараах нарийн инженерчлэлийг багтаажээ:

  • Strands Framework суурь: Хөнгөн, модульчлагдсан Strands агентын бүтэц ашигласан.
  • OAuth & Cognito интеграц: Machine-to-Machine (M2M) болон хэрэглэгчийн scoped эрхийг Amazon Cognito Pool-ээр дамжуулан баталгаажуулж, MCP серверүүдийг хамгаалсан байдалтайгаар автомат тест ажиллуулна.
  • AWS CDK (Cloud Development Kit): Дэд бүтэц болон CI/CD-ийн тохиргоог бүхэлд нь код хэлбэрээр (Infrastructure-as-Code) автоматжуулсан тул багууд өөрсдийн репозитортоо хэдхэн минутын дотор хуулбарлан нэвтрүүлэх боломжтой.

Хөгжүүлэгчдэд өгөх сургамж: "Eval-Driven Development" (EDD) ирлээ

Бид олон жил TDD (Test-Driven Development) буюу "эхлээд тестээ бич, дараа нь кодоо бич" зарчмаар амьдарсан. Тэгвэл AI агентуудын эрин үед энэ зарчим EDD (Evaluation-Driven Development) болон хувирч байна.

Хэрэв танай баг AI агент хөгжүүлж байгаа бол:

  1. Eval Dataset үүсгэх: Зөвхөн хөгжүүлэгчийн цонхон дээр туршихаа зогсоож, агентын заавал гүйцэтгэх ёстой 50-100 бодит хэрэглээний кэйс (Golden Dataset)-ийг JSON хэлбэрээр цуглуул.
  2. CI-д шалгалт тавих: Программдаа ямар ч жижиг өөрчлөлт хийсэн тэр 100 кэйсийг автоматаар гүйлгэж, метрик унаж буй эсэхийг хэмждэг болго.
  3. Хүний оролцоог бууруулах: Хөгжүүлэгч гараар шалгаж цаг алдахын оронд pipeline-аас гарч ирэх дүн шинжилгээний дагуу сул талуудаа сайжруул.

AWS болон GitHub-ийн энэхүү нэгдэл нь хиймэл оюун ухааны агентууд "тоглоомын демо" төдий байхаа больж, үйлдвэрлэлийн түвшний найдвартай программ хангамжийн инженерийн стандартад албан ёсоор шилжиж буйн тод баталгаа боллоо.


Эх сурвалж: Developer Tech News - AWS brings AI agent regression testing to GitHub Actions / AWS Architecture Blog - Automated agent evaluation with Amazon Bedrock AgentCore

Сэтгэгдэл

Ачаалж байна...