AI Агентын Командыг Хянаж Буй Хөгжүүлэгчид Аюулын 33%-ийг Нэвтрүүлж Байна: 40,000 Тоглолтын Судалгаа
AI Агент ба Human-in-the-Loop Баталгаажуулалтын Бодит Байдал
Судалгаа болон сүүлийн үеийн туршлагуудаас харахад, Claude Code, Cursor, OpenAI Codex зэрэг AI кодинг агентууд (coding agents) хөгжүүлэгчдийн өдөр тутмын ажилд гүн шигдэн ажиллаж байна. Гэсэн хэдий ч AI агентад терминалын командаас эхлээд системд шууд нэвтрэх эрх өгөх нь аюулгүй байдлын хувьд ихээхэн эрсдэл дагуулдаг.
Уг эрсдэлийг бууруулах зорилгоор ихэнх AI системүүд Human-in-the-Loop (HITL) буюу хөгжүүлэгч тухайн тушаал (command)-ыг гүйцэтгэхээс өмнө "Approve / Deny" товч заавал дарах хамгаалалтын аргыг ашигладаг. Гэвч энэхүү "хүнээр хянуулах" арга нь үнэхээр аюулгүй байдлыг хангах хэмжээний баталгаа болж чадаж байна уу?
Uber компанийн экс-Staff Engineer Алекс Ваутерс (Scale X) энэхүү асуултад хариулт олох зорилгоор тусгай интерактив симуляци бүхий веб тоглоом (llmgame.scalex.dev) хөгжүүлэн туршиж, үр дүнгээ нийтэлжээ. Хөгжүүлэгч тоглоомд AI агентын терминалын тушаалуудыг 60 секундийн хугацаанд заавал хянаж зөвшөөрөх эсвэл цуцлах үүрэг гүйцэтгэдэг.
40,000 Тоглолт, 409,000 Шийдвэр: Тоо Баримтууд Юу Өгүүлж Байна Вэ?
Тус тоглоом нийтдээ 40,000 гаруй удаа тоглогдож, хөгжүүлэгчдийн 409,000 тусдаа "Approve/Deny" шийдвэрийг цуглуулжээ. Тоглоомын явцад git status, npm test гэх мэт энгийн тушаалуудаас гадна нууц токен, AWS credential, SSH key-ийг гадаад сервер рүү илгээх халдлагын тушаалууд шууд болон далд хэлбэрээр илэрч байв.
Туршилтын үр дүн аюулгүй байдлын мэргэжилтнүүдийн санааг зовоохоор гарчээ:
- Аюулын 33%-ийг алдсан: Хөгжүүлэгчид хэдийгээр аюул агуулсан тушаал ирнэ гэдгийг урьдчилан мэдэж, сэрэмжтэй байсан ч аюултай тушаалуудын 3-ын 1-ийг буюу 33%-ийг нь санамсаргүйгээр зөвшөөрсөн (Approve) байна.
- Сонгомол сэрэмж: Хөгжүүлэгчид зарим тодорхой файл руу халдахад илүү сонор сэрэмжтэй байв. Жишээ нь,
cat ~/.ssh/id_rsaтушаалыг тоглогчдын 82% нь шууд блокчилсон. Гэвч бусад адилхан чухал тохиргоо, credential файлууд руу хандсан тушаалуудын тал хувь (50%) нь ямар ч асуудалгүй шууд баталгаажжээ.
Хөгжүүлэгчдийн Хамгийн Том Алдаа: npm run ба Анхаарал Төвлөрлийн Ядарч Сульдах Үзэгдэл (Alert Fatigue)
Судалгааны хамгийн сонирхолтой бөгөөд аюултай далд сэдэв нь npm run тушаалын халхавч байв.
Халдлага үйлдэгч кодууд package.json файл дотор хортой скрипт шургуулж, тухайн скриптийг npm run analyze эсвэл npm run test гэх мэт хэвийн мэт харагдах тушаалаар далд ажиллуулахад хөгжүүлэгчдийн 65% нь шууд Approve товчлуур дээр дарснаа илгээжээ. Тэр ч байтугай ажиллах скриптийн түүх ба лог дээр хортой код харагдаж байхад хөгжүүлэгчид ажиглаагүй байна.
Уг судалгаа нь хөгжүүлэгчдэд тохиолддог Alert Fatigue буюу анхаарал сульдах үзэгдлийг бэлээхэн харууллаа:
- Цагийн дарамт ба хурд: Код бичих хурдаа сааруулахгүйн тулд хөгжүүлэгчид олон ирж буй "Approve" санамжуудыг тунгаан бодохгүйгээр автоматаар зөвшөөрдөг.
- Контекст дутагдах: Олон зуун мөр кодын өөрчлөлт дунд ямар скрипт, ямар зорилгоор ажиллаж байгааг тухай бүр нарийвчлан шалгах цаг зав ба нөөц хөгжүүлэгчид байдаггүй.
Хөгжүүлэгчид болон Багууд Аюулгүй Байдлаа Хэрхэн Хангах Вэ?
Судалгааг хийсэн Алекс Ваутерсын тэмдэглэснээр: "Зөвхөн хөгжүүлэгчийн сонор сэрэмжид даатгаж Human-in-the-Loop хэв маягийг ганц хамгаалалт болгон ашиглах нь аюулгүй байдлын хуурамч мэдрэмж олгодог".
Тиймээс AI агентуудыг хөгжүүлэлтийн явцад ашиглаж буй багууд дараах техникийн хамгаалалтуудыг заавал нэвтрүүлэх шаардлагатай:
- Strict Sandboxing (Бүрэн тусгаарласан орчин): AI агентын ажиллуулж буй CLI эсвэл скриптүүдийг локал машин дээр биш, Docker контейнер эсвэл түр хугацааны сандбокс (ephemeral sandbox) орчинд ажиллуулах.
- Credential & Environment Variables Isolation:
~/.aws/credentials, SSH түлхүүр,.envзэрэг нууц токенуудыг агентын нэвтрэх орчноос тусгаарлах. Агентад зөвхөн шаардлагатай scoped токенуудыг олгох. - Automated Command Filtering (Автомат шүүлтүүр):
Сүлжээний хүсэлт агуулсан (
curl,wget), эсвэл системийн нууц файл руу унших урсгал үүсгэх тушаалуудыг хүн хянахаас өмнө систем өөрөө автоматаар блокчлох эсвэл сэрэмжлүүлэх дүрэм (static analysis / rule-based checks) тохируулах.
Дүгнэлт
AI кодинг агентууд програм хөгжүүлэлтийн бүтээмжийг хэд зуу дахин нэмэгдүүлж байгаа ч тэдгээрийн аюулгүй байдлыг зөвхөн "хүний хяналт"-аар бүрэн шийдэх боломжгүй нь энэхүү 40,000 тоглолтын туршилтаар бэлхнээ нотлогдлоо. Багууд AI агентуудад даатгах ажлын урсгалдаа Sandboxing ба Scoped Permissions зарчмыг архитектурын түвшинд нь суурилуулж өгөх нь аюулгүй хөгжүүлэлтийн гол түлхүүр болоод байна.
Эх сурвалж: Scale X (scalex.dev) — Humans missed 1 in 3 threats approving AI agent commands across 40,000 plays
Сэтгэгдэл
Ачаалж байна...