AI-ийн бичсэн патчуудын 74% нь эмзэг байдлыг засаж чаддаггүй: 1Password-ийн шинэ судалгаа
AI код засаж чадах уу? 1Password-ийн бодит туршилт
Сүүлийн үед хөгжүүлэгчид ба DevSecOps багууд код дээрх аюулгүй байдлын эмзэг байдлыг (vulnerability) илрүүлэх болон автоматаар патч (patch) бичихэд AI моделиудыг өргөнөөр ашиглах болсон. Гэвч AI-ийн бичсэн код үнэхээр системд учрах эрсдэлийг бүрэн хааж чадаж байна уу?
1Password компанийн судалгааны салбар болох Off-by-1 Labs-ийн шинжээчид сүүлийн үеийн тэргүүлэх AI моделиудын (GPT-5.5 болон Claude Opus 4.8) аюулгүй байдлын код засах чадварыг туршсан томоохон судалгааны үр дүнг танилцууллаа. Тэд сүүлийн саруудад илэрсэн 6 өөр CVE (Common Vulnerabilities and Exposures) дээр үндэслэн AI-аар нийт 6,080 тусдаа засварын код (patch) генераци хийлгэж, тус бүрийг автоматижуулсан болон гар аргаар нарийвчлан шалгажээ.
Туршилтын дүнгээр AI моделиудын үүсгэсэн засваруудын дөнгөж 26% нь л аюулгүй байдлын эмзэг байдлыг амжилттай хааж, системийн ажиллагаанд сөрөг нөлөө үзүүлээгүй байна. Өөрөөр хэлбэл, AI-ийн бичсэн патчийн 74% нь ямар нэг байдлаар бүтэлгүйтсэн эсвэл далд аюул дагуулжээ.
AI-ийн бичсэн патчуудын 74% нь хаашаа очив?
Off-by-1 Labs-ийн баг AI-ийн гаргасан алдаануудыг дараах үндсэн ангилалд хуваасан байна:
- Эмзэг байдлыг дутуу хаасан (49%): Нийт засварын бараг тал хувь нь аюулгүй байдлын цоорхойг гүйцэд хааж чадаагүй буюу хөндлөнгийн халдагч өөр замаар тухайн exploit-ийг үргэлжлүүлэн ашиглах боломжийг нээлттэй үлдээжээ.
- Системийн логикийг эвдсэн (21%): Патч нь CVE-г хаасан боловч аппликейшний үндсэн функциональ болон бизнес логикийг гэмтээсэн байна. Жишээлбэл, системийн зөвшөөрлийн логик (allow list) эсрэгээрээ шууд хориглох логик (deny list) руу чимээгүй шилжиж, систем ажиллах боломжгүй болжээ.
- Шинэ эмзэг байдал нэмж үүсгэсэн (2.3%): AI нь анхны CVE-г засах үедээ кодонд огт өөр шинэ аюулгүй байдлын цоорхойг (new vulnerability) өөрөө бичиж үлдээсэн байна.
- Суурь асуудлыг засахгүйгээр аргацаасан засвар (2.2%): Анхны эмзэг байдлыг ч засаж чадаагүй, дээрээс нь шинэ эрсдэл нэмсэн тохиолдлууд гарчээ.
Бүр гайхалтай нь, "амжилттай" гэж үнэлэгдсэн 26%-ийн гуравны нэгээс илүү хувь нь хэврэг (fragile) патчууд байжээ. AI нь кодын архитектур болон асуудлын гүн дэх логик согогийг засахын оронд зөвхөн тодорхой Input тэмдэгтүүдийг escape хийх, эсвэл нэг тусгай стринг дээр нөхцөл (if-statement) тавих гэх мэт хөнгөн аргацаах хэлбэрээр зассан байв.
FLAWED фрэймворк: "Код зассан мэт боловч далд согогтой"
Судалгааны баг энэхүү үзэгдлийг нэрлэхийн тулд FLAWED (Fix-Like Artifacts with Embedded Defects) хэмээх тодорхойлолт болон үнэлгээний фрэймворкийг нээлттэй эхээр олон нийтэд зарлалаа.
"Хүний хяналтгүйгээр AI-аар шууд бичүүлсэн аюулгүй байдлын патч нь системд аюулгүй байдал авчрахаасаа илүүтэй сургуулилаагүй далд эрсдэл авчирдаг" хэмээн Off-by-1 Labs-ийн аюулгүй байдлын шинжээчид дүгнэжээ.
AI моделиуд нь кодын синтакс болон нийтлэг паттернуудыг сайн мэдэх боловч тухайн аппликейшний контекст, дата урсгал, архитектурын хамаарлыг (system context) бүрэн ойлгож чаддаггүй. Үүний улмаас "харахад код засагдсан мэт" харагдах боловч хэрэг дээрээ production орчинд асар том эрсдэл үүсгэдэг байна.
Хөгжүүлэгчид болон DevSecOps багт өгөх 3 чухал санамж
Энэхүү судалгаа нь AI-ийг хөгжүүлэлтэд ашиглахыг бүрэн хориглох биш, харин AI-ийн хязгаарлагдмал байдлыг ойлгож, зөв процесс нэвтрүүлэхийн чухлыг сануулж байна.
1. AI-ийн бичсэн кодыг заавал "Хүн" (Human Review) хянаж баталгаажуулах
AI-ийн автоматаар үүсгэсэн PR (Pull Request)-ийг аюулгүй байдлын болон старший хөгжүүлэгч заавал хянаж (code review), цаана нь ямар нэг бизнес логикийн өөрчлөлт эсвэл дутуу хаалт байгаа эсэхийг шалгах шаардлагатай.
2. Regression Testing ба Security Automated Integration
Патч засагдсаны дараа зөвхөн тухайн функц ажиллаж байгааг шалгахаас гадна, системийн бусад бүх модуль хэвийн ажиллаж байгааг баталгаажуулах Regression test-үүдийг заавал гүйцэтгэх ёстой.
3. FLAWED үнэлгээний хэрэгслийг CI/CD пайплайнд ашиглах
Off-by-1 Labs-аас нээлттэй эхээр гаргасан FLAWED хэрэгслийг ашиглан AI-аар үүсгэгдсэн патчуудын чанар болон бодит эрсдэлийг пайплайн дээрээ автоматаар үнэлэх боломжтой.
Эх сурвалж: 1Password Off-by-1 Labs Research
Сэтгэгдэл
Ачаалж байна...