Мэдээ

AI-ийн автоматаар зассан кодод итгэж болох уу? 1Password-ийн шинэ судалгаагаар патчуудын 74% нь алдаатай гарлаа

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 7·2 үзсэн·
AI-ийн автоматаар зассан кодод итгэж болох уу? 1Password-ийн шинэ судалгаагаар патчуудын 74% нь алдаатай гарлаа

Сүүлийн үед хиймэл интеллект (AI) болон LLM-д суурилсан кодинг агентууд программ хангамжийн эмзэг байдлыг (vulnerability) маш өндөр хурдтайгаар илрүүлдэг болсон билээ. Anthropic-ийн Project Glasswing эсвэл OpenAI-ийн Patch the Planet (Project Daybreak) зэрэг томоохон санаачилгууд нь нээлттэй эхийн экосистем дэх кодын багаас эхлээд томоохон системийг автоматаар засах, нөхөх (patching) зорилго тавин ажиллаж байна.

Гэвч AI агент танд өнгөц харахад "төгс зассан" мэт харагдах Pull Request (PR) илгээхэд түүнд бүрэн итгэж шууд production систем рүү merge хийж болох уу?

1Password компанийн шинээр байгуулсан аюулгүй байдлын судалгааны баг болох Off-by-1 Labs энэхүү асуултад хариулахаар цуврал туршилт явуулж, "Frontier Models' Vulnerability Patches are Often F.L.A.W.E.D." нэртэй томоохон судалгааны тайланг нийтэллээ.

"F.L.A.W.E.D" судалгаа ба туршилтын хамрах хүрээ

Судалгааны баг AI моделиудын сургалтын датад (training data) орох боломжгүй, хамгийн сүүлд шинээр илэрсэн, нарийн нийтэг бүтэцтэй 6 удаагийн бодит CVE (Common Vulnerabilities and Exposures) дээр туршилт хийжээ. Энэхүү туршилтад Linux privilege escalation, ActiveMQ Remote Code Execution, Chrome-ийн File System Access API дахь Use-after-free, Spring AI болон Exim зэрэг чухал системүүдийн эмзэг байдлууд багтсан байна.

Судалгаанд OpenAI-ийн ChatGPT 5.5 болон Anthropic-ийн Claude Opus 4.8 зэрэг салбартаа тэргүүлэгч кодинг болон reasoning моделиудыг ашиглан нийт 6,080 тусдаа патч (patch) үүсгэн туршжээ.

Судалгааны багийн гол зорилго нь AI агентууд кодын үндсэн логикийг эвдэлгүйгээр, шинэ баг үүсгэхгүйгээр эмзэг байдлыг яг таг засаж чадаж байгаа эсэхийг баталгаажуулах явдал байв.

Туршилтын цочирдом үр дүн

Судалгааны үр дүн AI-д суурилсан автономит код засалтын өнөөгийн түвшний талаар хөгжүүлэгчдэд чухал сануулга өглөө:

  • Дөнгөж 26.0%-ийн амжилт: AI-ийн үүсгэсэн 6,000 гаруй патчаас дөнгөж 26% нь л тухайн эмзэг байдлыг бүрэн засаж, аппликейшны функцэд сөрөг нөлөө үзүүлэлгүйгээр даалгаврыг чанартай биелүүлсэн.
  • 53.9% нь FLAWED (Fix-Like Artifacts With Embedded Defects): Патчуудын талаас илүү хувь нь өнгөц харахад маш цэвэрхэн бичигдсэн, Unit Test-үүдийг даван туулдаг ч цаанаа нууцлаг алдаа эсвэл бүр шинэ аюулгүй байдлын эрсдэл агуулж байв.
  • Логикийн хазайлт (Logic Drift): Амжилттай засагдсан патчуудын 20% нь систем дэх бизнес логик болон функцийг хөгжүүлэгчийн төлөвлөөгүй байдлаар өөрчилсөн байжээ.

AI патчуудад түгээмэл ажиглагдсан алдааны хэв маягууд

  1. Хагас засалт (Partial Fixes): AI систем эмзэг байдал үүсэж болох 3 боломжит кодын урсгал (path)-ын 2-ыг нь засаад, 1-ийг нь анзааралгүй орхих тохиолдол маш их гарсан.
  2. Шинэ эмзэг байдал үүсгэх: Код дахь нэг Use-After-Free эсвэл Memory Leak-ийг засахдаа тухайн функц дотор өөр төрлийн Crash үүсгэх шинэ вектор нээх тохиолдол ажиглагдсан. Жишээ нь, freenginx сервер дээр хийсэн туршилтаар ChatGPT-ийн үүсгэсэн 270 патчаас 114 нь үндсэн алдааг зассан ч 114-үүлээ серверийг унагаж чадах шинэ боломжийг кодод үлдээсэн байна.
  3. Хэврэг патч (Fragile Patches): Кодын үндсэн шалтгааныг (root cause) засахаас илүүтэйгээр зөвхөн тухайн тест кейсд тааруулж шинэ Edge Case нөхөх байдлаар "хүчээр" аргацаасан код бичих.

Хөгжүүлэгчдийн "Танин мэдэхүйн буулт" ба ирээдүйн аюул

Энэхүү судалгаа нь хөгжүүлэгчдийн "Cognitive Surrender" буюу AI-д хэт итгэх сэтгэл зүйн асуудлыг онцолж байна. Сүүлийн үед хөгжүүлэгчид "Vibe Coding" буюу AI-ийн бичсэн кодыг гүнзгий анхаарахгүйгээр, тест нь ногоон асч байвал шууд хүлээн зөвшөөрөх хандлага ажиглагдах болсон.

Аюулгүй байдлын салбарын мэргэжилтнүүдийн үзэж байгаагаар, AI баг илрүүлэхдээ маш хурдан болсон ч түүнийг засах автономит агентуудыг CI/CD пайплайндаа хүний хяналтгүйгээр интеграци хийх нь production орчинд асар том эрсдэл дагуулна. CI/CD дээрх автомажуулсан тестүүд даван туулж чадаж байгаа ч цаанаа шинэ вектор нээсэн AI патчууд нь хакеруудад шинэ боломж олгох аюултай юм.

Залруулга ба цаашдын шийдэл

Off-by-1 Labs баг өөрсдийн судалгааны үр дүнг ашиглан AI патчуудыг шалгах, аюулгүй байдлын хязгаарлалтыг тогтоох нээлттэй эх бүхий FLAWED фрэймворк болон датасетийг GitHub дээр нийтэллээ.

Багаараа AI кодинг агент ашиглаж буй хөгжүүлэгч болон инженерүүдэд дараах зөвлөмжийг өгч байна:

  • AI-ийн үүсгэсэн патч бүрд Senior инженер эсвэл Security Engineer заавал ручной код ревью (Human-in-the-loop) хийх.
  • Prompt бичихдээ зөвхөн "зас" гэж хэлэх биш, системийн архитектурын зааг хязгаар, нөхцөлүүдийг маш тодорхой зааж өгөх.
  • Код зассаны дараа Property-based testing болон Regression test-үүдийг заавал гүйцэтгэж, кодын логик хазайсан эсэхийг шалгах.

AI нь хөгжүүлэгчдийн ажлыг асар их хөнгөвчилж байгаа ч аюулгүй байдлын код засалтын хувьд "хүний туршлага, логик хяналтыг" орлох түвшинд хараахан хүрээгүй байна.

Эх сурвалж: 1Password Off-by-1 Labs Research

Сэтгэгдэл

Ачаалж байна...