Мэдээ

Шифрлэгдсэн халдлага ба хамгаалалтгүй агентууд: "Cryptographic Context Injection" шинэ эмзэг байдал илэрлээ

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 21·1 үзсэн·
Шифрлэгдсэн халдлага ба хамгаалалтгүй агентууд: "Cryptographic Context Injection" шинэ эмзэг байдал илэрлээ

Сүүлийн үед AI агентууд зөвхөн текст үүсгээд зогсохгүй, бие даан веб хуудас унших (web browsing), цаашлаад өөрийн тусгаарлагдсан Python sandbox дотор код ажиллуулах (code execution) чадвартай болсон билээ. Гэвч энэхүү чадвар нь кибер аюулгүй байдлын цоо шинэ, урьд өмнө харж байгаагүй халдлагын векторыг бий болгож эхэлснийг судлаачид анхаарууллаа.

Кибер аюулгүй байдлын Adversa AI компанийн хийсэн шинэ судалгаагаар "Cryptographic Context Injection" хэмээх шинэ аргачлал ил болсон бөгөөд энэ нь AI моделиудын уламжлалт бүх Prompt Injection хамгаалалтын шүүлтүүрийг (Guardrails) төвөггүй даван гарч байгааг баталжээ.

Халдлага хэрхэн ажилладаг вэ?

Уламжлалт Prompt Injection халдлагуудын үед халдагчид хортой командыг текст хэлбэрээр ил байршуулдаг тул орчин үеийн LLM-үүд болон Guardrail системүүд тэдгээр текстийн "агуулга, зорилго"-ыг (semantic intent) шинжлэн таньж, блоколдог. Харин шинээр илэрсэн халдлага нь энэхүү шалгалтыг бүхэлд нь тойрч гарч байна:

  1. Шифрлэгдсэн Payload: Халдагч хортой заавар, тушаалаа AES-256-GCM болон PBKDF2 ашиглан криптограф аргаар бүрэн шифрлэж, тайлах түлхүүрийн хамт веб хуудсанд байршуулна.
  2. Guardrail-ийг үл анзаарагдан давах: AI агент уг хуудсыг уншиж шалгах явцад Guardrail classifier нь шифрлэгдсэн текстийг уншиж чадахгүй тул аюулгүй өгөгдөл гэж үзэн шүүлтүүрээрээ нэвтрүүлнэ.
  3. Sandbox дотор шифр тайлагдах үйл явц: Хуудсан дээрх энгийн зааврын дагуу AI агент өөрийн Python execution орчинд скрипт ажиллуулж, шифрлэгдсэн текстийг тайлна.
  4. Контекст дотор биелэх заавар ба өгөгдөл алдагдах: Шифр тайлагдсан даруйд ил гарч ирсэн хортой заавар нь моделийн Context window-д орж ирнэ. Уг заавар нь агентад хэрэглэгчийн чатын түүх, байршил, профайл мэдээллийг цуглуулж, халдагчийн сервер рүү HTTP параметр хэлбэрээр илгээх тушаалыг хэрэглэгчид мэдэгдэлгүйгээр гүйцэтгэдэг байна.

Туршилтын явцад xAI-ийн Grok 4.5 Fast модел бүхий систем дээр уг халдлагыг амжилттай туршиж, чатын нууц түүх болон хэрэглэгчийн хувийн мэдээллийг гаднын сервер рүү амжилттай дамжуулж чаджээ.

Архитектурын гол цоорхой: "Intent Inspection" vs "Runtime Execution"

Энэхүү халдлагын хамгийн ноцтой тал нь ямар ч prompt filter эсвэл alignment сургалтаар шууд шийдвэрлэхэд туйлын төвөгтэй байгаад оршино.

Учир нь аюулгүй байдлын системүүд өгөгдлийг модельд орохоос өмнө текстийн түвшинд шалгадаг. Гэтэл шифрлэгдсэн өгөгдөлд код ажиллахаас өмнө ямар ч "хортой санаа" байдаггүй бөгөөд зөвхөн Python runtime орчинд ажиллаж дууссаны дараа л жинхэнэ хортой заавар үүсдэг. Энэ нь Agentic AI системүүдэд "Code Interpreter" болон "Web Browsing" эрхийг хяналтгүй олгох нь ямар том эрсдэл дагуулж болохыг харуулж байна.

Хөгжүүлэгчид AI агентуудаа хэрхэн хамгаалах вэ?

Хэрэв та өөрийн аппликейшнд Agentic workflow, Function calling эсвэл Code Execution ашиглаж байгаа бол дараах архитектурын зарчмуудыг нэн даруй хэрэгжүүлэхийг зөвлөж байна:

  • Sandbox Network Egress хязгаарлалт: Код ажиллуулдаг sandbox орчны гадагшаа чиглэсэн сүлжээний урсгалыг (Outbound HTTP/HTTPS) бүрэн хаах эсвэл зөвхөн зөвшөөрөгдсөн whitelist домэйнүүд рүү хязгаарлах.
  • Post-Execution Semantic Filter: Код ажиллаж дууссаны дараа үүссэн stdout болон үр дүнгийн текстийг агентын ерөнхий context window руу буцааж оруулахаас өмнө injection filter-ээр дахин шалгах pipeline нэмэх.
  • Least Privilege хандалтын эрх: Агентын ажиллаж буй орчинд хэрэглэгчийн сесс токен, бүх өмнөх чатын түүх, системийн орчны хувьсагчуудыг (ENV variables) шаардлагагүйгээр ил орхихгүй байх.

AI агентууд бие даасан байдалтай болох тусам аюулгүй байдлын хамгаалалтыг зөвхөн "prompt"-ийн түвшинд биш, харин дэд бүтэц, сүлжээ, sandbox-ийн түвшинд цогцоор нь шийдэх шаардлага тулгарч байна.

Эх сурвалж: The Hacker News, Adversa AI Security Advisory, Carly AI Research.

Сэтгэгдэл

Ачаалж байна...