OpenAI, Anthropic, Google-ийн Reasoning API-д Ноцтой Цоорхой Илэрлээ: AI-ийн "Нууц Бодол"-оос Түлхүүр болон Нууц Үг Тайлжээ
Сүүлийн үеийн дэвшилтэт reasoning (бодож шийдвэр гаргадаг) загварууд аливаа асуултад хариулахын өмнө өөрийн дотоод бодлын дараалал буюу Chain-of-Thought (CoT) үүсгэдэг. AI провайдерууд энэхүү дотоод бодлыг хэрэглэгчийн интерфейс дээр нууцлах эсвэл дараагийн API дуудлагад ашиглах зорилгоор тусгай шифрлэгдсэн "reasoning block" болгон төлөв (state) хадгалж дамжуулдаг практик нэвтрүүлсэн билээ.
Гэвч кибер аюулгүй байдлын судлаачид OpenAI, Anthropic, Google зэрэг салбарын тэргүүлэгчдийн Reasoning API-уудад үлэмж хэмжээний эмзэг байдал илрүүлснээ зарлалаа. Судлаачдын нийтэлсэн тайлангаар, шифрлэгдсэн гэгдэх энэхүү далд бодлын блокуудыг эвдэж, дотор нь нуугдсан хувийн өгөгдөл, API түлхүүрүүд, системд нэвтрэх нууц үгсийг бүрэн тайлж авах боломжтой байжээ.
Асуудлын гол: Шифрлэгдсэн "Reasoning Block"-ийг хэрхэн тайлсан бэ?
Хөгжүүлэгчид AI Agent эсвэл олон шатлалт API систем бүтээхдээ өмнөх сессийн контекст болон моделийн reasoning төлвийг дараагийн дуудлагадаа opaque reasoning block хэлбэрээр илгээдэг. Эдгээр блокууд нь хэрэглэгчийн нүдэнд ил харагдахгүй, зөвхөн API түвшинд "далд объект" болж ажилладаг байв.
Судлаачдын баг эдгээр далд блокуудыг өөр сесс рүү дамжуулах (replay attack хийх), эсвэл тухайн провайдерын илүү жижиг, сул загварт (weaker model) өгөөш болгон өгөх замаар хүчирхэг моделийн хийсэн бүх дотоод бодлыг энгийн текст (plaintext) болгон хөрвүүлж болохыг тогтоожээ. Өөрөөр хэлбэл, том модельд "нууцалсан" бодлыг жижиг модел нь ямар ч хамгаалалтгүйгээр дэлгэж орхисон байна.
315,000 гаруй бодлын блокоос API Key болон Passwords олджээ
Судалгааны баг нийтлэг нээлттэй хадгалагдсан (public) 6,708 agent trajectory буюу агентуудын ажилласан лог өгөгдлийг шинжилж, нийт 315,320 далд бодлын блокыг амжилттай задалж уншсан байна.
Үр дүнд нь бодит хэрэглэгчид болон хөгжүүлэгчдийн сессээс дараах эмзэг өгөгдлүүд шууд ил гарчээ:
- 62 ширхэг API түлхүүр
- 33 системийн нууц үг
- 24 хандалтын access token
- 7 хувийн private key
Энэ нь хөгжүүлэгчид агентдаа өгсөн нууц түлхүүр, мэдээллийн баазын холболт, хэрэглэгчийн хувийн мэдээллүүд reasoning хийх явцад CoT-д бүртгэгдэж, улмаар "далд" блокт шингэсэн ч аюулгүй хадгалагдаж чадахгүй байсныг нотолж байна.
Халдагчдын ашиглах 4 гол зам
Судлаачид уг цоорхойг ашиглан дараах 4 чиглэлээр халдлага үйлдэх боломжтойг баталсан:
- Model Distillation & IP Theft: Өндөр үнэтэй моделиудын reasoning логикийг хямд жижиг загваруудаар тайлж авснаар провайдеруудын оюуны өмч болох CoT өгөгдлийг үнэгүй хулгайлах.
- Credential & Data Extraction: Олон нийтийн лог, агентын түүхээс хэрэглэгчдийн нууц түлхүүр, хувийн эмзэг датаг шүүж авах.
- Hidden Prompt Injections: Халдагчид хортой заавруудыг шифрлэгдсэн reasoning block дотор нууж, аюулгүй байдлын шүүлтүүрүүдийг (guardrails) тойрч гарах.
- Concealed Harmful Content: Гаднаа аюулгүй, гэмгүй мэт харагдах хариултын цаана хортой логикийг нууцаар гүйцэтгүүлэх.
Хөгжүүлэгчид юуг анхаарах шаардлагатай вэ?
Энэхүү сул тал нь зөвхөн AI модель хөгжүүлэгчдийн бус, уг API-уудыг өдөр тутмын бүтээгдэхүүндээ ашиглаж буй нийт инженерүүдэд дараах анхааруулгыг өгч байна:
- Агентын логт итгэхгүй байх: Хэрэглэгчийн сессийн түүх, агентын дуудлагын логт
reasoning metadata-г ил задгай нийтлэхгүй байх, хадгалалтын түвшинд тусгаарлах. - Credential Leakage-аас сэргийлэх: Prompt эсвэл Tool Call дотор API key, connection string, authentication header-ийг шууд дамжуулахаас зайлсхийх. Үүний оронд dynamic credential injection эсвэл proxy архитектур ашиглах.
- Provider Patching: OpenAI, Anthropic, Google компаниуд уг тайлангийн мөрөөр API-ийн сесс хоорондын блокийн холболт, загвар хоорондын cross-model декодчиллыг хаах шинэчлэлтүүдийг хийж эхлээд байна.
AI агентууд бие даан ажиллах тусам API протоколын далд давхаргууд дахь аюулгүй байдал хамгийн эмзэг цэг болж хувирч байгааг энэхүү судалгаа тод харууллаа.
Эх сурвалж: The Hacker News ("OpenAI, Anthropic, Google API Flaw Let Weaker AI Models Decode Stronger Models' Reasoning"), Security Research Team "Stealing Reasoning Traces from Proprietary LLM APIs"
Сэтгэгдэл
Ачаалж байна...