OpenAI, Anthropic, Google-ийн Reasoning API-д эмзэг байдал илэрлээ: Шинжээчид "Нууц бодлын түүх"-ээс API түлхүүр, нууц үг тайлж уншив
Хиймэл оюуны салбарт "Reasoning" буюу асуудлыг алхам алхмаар эргэцүүлэн бодож шийдвэрлэдэг загварууд (OpenAI o-series, Claude Extended Thinking, Gemini Thinking) сүүлийн үеийн программ хөгжүүлэлтийн стандарт болоод буй. Гэвч саяхан нийтлэгдсэн аюулгүй байдлын томоохон судалгаагаар салбарын тэргүүлэгч гурван том тоглогч болох OpenAI, Anthropic, Google нарын Reasoning API бүтцэд системийн түвшний ноцтой цоорхой байсныг илрүүллээ.
Судлаачид хамгаалалттай гэж тооцогдож байсан "Reasoning traces" буюу AI-ийн далд эргэцүүллийн блокуудыг тайлан уншиж, бодит хөгжүүлэгчдийн лог дотроос 62 API түлхүүр, 33 нууц үг болон олон арван access token-ийг илрүүлсэн байна.
Асуудлын гол нь юу байв? Оньсого мэт "Reasoning Block"-ууд
Reasoning загварууд нь эцсийн хариултыг гаргахаасаа өмнө хэдэн мянган токен бүхий "Chain of Thought" (бодлын дараалал)-ийг дотроо боловсруулдаг. Аюулгүй байдал, өрсөлдөөний нууцлал болон хэрэглэгчийн туршлагыг бодон эдгээр бодлын процессыг бүрэн эхээр нь харуулдаггүй бөгөөд API түвшинд шифрлэгдсэн (opaque/encrypted reasoning object) хэлбэрээр буцаадаг.
Статлес (stateless) REST API орчинд олон үе шаттай харилцан яриа (multi-turn conversation) болон AI агентын ажлыг үргэлжлүүлэхийн тулд хөгжүүлэгчид уг шифрлэгдсэн бодлын блокийг дараагийн request-ийнхээ context болгон буцаан илгээх шаардлага гардаг.
Судлаачдын олж тогтоосноор эдгээр бодлын блокуудыг өөр өөр session хооронд дахин дамжуулах (replay attack), цаашлаад ижил экосистемийн сул загваруудад (weaker models) өгч доторх далд текстийг задлуулах боломжтой байжээ.
Халдлага хэрхэн хийгдсэн бэ: "Cross-Model Decoding"
Судалгааны баг уг архитектурын алдааг ашиглан дөрвөн үндсэн халдлагын векторыг баталгаажуулсан байна:
- Reasoning Distillation (Оюуны өмчийг хулгайлах): Хүчирхэг модел хэрхэн эргэцүүлснийг тайлж уншсанаар тухайн компанийн патентлагдсан бодлын бүтцийг хуулбарлах боломж үүссэн.
- Private Data Extraction (Хувийн өгөгдлийг шүүж авах): Хөгжүүлэгчид өөрсдийн agent trace болон логуудыг олон нийтэд нийтлэхдээ харагдах текстийг арилгасан ч далд шифрлэгдсэн бодлын блокийг хэвээр үлдээдэг. Энэ блокоос нууц түлхүүрүүд тайлагдсан.
- Hidden Prompt Injection (Далд халдлага нуух): Ил харагдахгүй бодлын блок дотор prompt injection кодыг нууж, дараагийн session-ий аюулгүй байдлын шүүлтүүрийг тойрч гарах.
- Censorship Bypass: Загварын харагдах хэсэгт цензурдэгдсэн хориотой мэдээллийг бодлын процесс дотроос бүрэн эхээр нь сэргээж авах.
Хамгийн сонирхолтой нь уг шифрлэгдсэн блокийг яг тэр өндөр түвшний загварт бус, харин ижил платформын жижиг, хямд загварт (жишээ нь мини загваруудад) дамжуулахад жижиг загвар нь уг блокийн далд агуулгыг шууд текст хэлбэрээр ил гаргаж өгч байжээ.
Бодит дүн шинжилгээ: 315,000 гаруй бодлын блокийг задалсан нь
Судлаачид олон нийтэд нээлттэй байсан 6,708 бодит AI агентын ажиллагааны түүхээс (agent trajectories) нийт 315,320 ширхэг "thinking block"-ийг амжилттай тайлж уншсан байна.
Эдгээрээс бенчмарк тестүүдийг хассаны дараа хөгжүүлэгчдийн бодит session-уудаас дараах эмзэг өгөгдлүүд шууд гарч иржээ:
- 62 ширхэг идэвхтэй API түлхүүр (AWS, GitHub, Stripe гэх мэт)
- 33 ширхэг системийн нууц үг
- 24 ширхэг хэрэглэгчийн Access token
- 7 ширхэг Private cryptographic key
AI агент кодын сантай ажиллах, орчны хувьсагчдыг унших үед эдгээр нууц мэдээллүүд бодлын процесст (reasoning trace) боловсруулагдаж, шифрлэгдсэн хэдий ч хадгалагдан үлддэг нь асуудлын үндэс болсон байна.
Агент бүтээгч, Backend хөгжүүлэгчид юуг анхаарах ёстой вэ?
Энэхүү судалгааны дүнг OpenAI, Anthropic, Google, Microsoft, Hugging Face нарт урьдчилан мэдээлж, үйлчилгээ үзүүлэгч талууд API түвшиндээ засваруудыг хийж эхлээд байна. Гэсэн хэдий ч AI систем хөгжүүлж буй инженерийн багууд өөрсдийн дэд бүтцэд дараах өөрчлөлтийг яаралтай хийхийг зөвлөж байна:
- Түүхий API Логуудыг (Raw Transcripts) бүү хадгал: Телеметри болон дебаг хийх зорилгоор LLM-ийн бүтэн response-ийг өгөгдлийн сан, логгер луу шууд бичихээс татгалз. Харагдах текстийг цэвэрлэсэн байсан ч
opaque reasoningталбарууд мэдээлэл алдах эрсдэлтэй. - Reasoning State-ийг хуваалцахгүй байх: Хэрэглэгчдэд зориулсан shareable link, олон нийтийн хэрэгсэлд AI session-ийн бүтэн түүхийг экспортлохдоо бодлын блокуудыг (thinking tokens/blocks) бүрэн тайрч (strip) хасах хэрэгтэй.
- Environment Secrets хамгаалалт: AI агентад шаардлагагүй системийн орчны хувьсагчид (ENV variables), нууц түлхүүрүүдийг унших эрх (read access) өгөхгүй байх архитектурын зарчмыг (Least Privilege) баримтлах.
Дүгнэлт
AI агент бие даан шийдвэр гаргаж, бүтэн кодын санг өөрчилдөг болсон энэ цаг үед "бодлын нууцлал" нь кибер аюулгүй байдлын цоо шинэ талбар болж байна. Шифрлэлт болон далд токенууд нь бүрэн хамгаалалт биш бөгөөд төвөгтэй системүүдийн хоорондын харилцаанд өгөгдлийг хамгийн бага түвшинд задлах (sanitization) зарчим хөгжүүлэгч бүрийн анхаарах ёстой нэн тэргүүний дүрэм хэвээр байна.
Эх сурвалж: The Hacker News, "OpenAI, Anthropic, Google API Flaw Let Weaker AI Models Decode Stronger Models' Reasoning" (August 2026).
Сэтгэгдэл
Ачаалж байна...