Нээлттэй эхийн "хуурмаг амжилт" төгсөв: Real-SWE бенчмарк AI агентуудыг бодит компаниудын кодоор шалгаж эхэллээ
Сүүлийн нэг жилийн хугацаанд томоохон AI лабораториуд өөрсдийн coding agent-уудыг танилцуулах бүртээ "Манай модель SWE-bench дээр 70%, 80% давлаа, удахгүй программ хангамжийн инженер шаардлагагүй болно" гэж сурталчилсаар ирсэн. Гэвч бодит амьдрал дээр тэдгээр моделиудыг компанийнхаа үндсэн систем дээр ажиллуулах үед хөгжүүлэгчид огт өөр бодит байдалтай нүүр тулдаг.
Яагаад нээлттэй benchmark дээр төгс ажилладаг AI бодит төсөл дээр гацаад байна вэ? Specific Labs судалгааны багаас танилцуулсан Real-SWE бенчмарк энэхүү оньсого мэт асуултад хатуу боловч бодитой хариулт өглөө.
SWE-bench яагаад биднийг төөрөгдүүлсэн бэ?
Одоогийн бүх нийтийн жишиг болоод байсан SWE-bench нь GitHub дээрх нийтэд нээлттэй (public) кодын сангууд дээр суурилдаг. Үүнд хоёр том дутагдал бий:
- Өгөгдлийн бохирдол (Data Contamination): Орчин үеийн LLM-үүдийг нээлттэй GitHub репозиторууд дээр сургасан байдаг тул тэд уг кодын бүтэц, тэр бүү хэл гарсан алдаануудыг (issue/PR) аль хэдийн "харчихсан", цээжилсэн байх магадлал маш өндөр.
- Нээлттэй төслийн цэвэр бүтэц: Олон нийтийн нээлттэй эхийн сангууд нь ихэвчлэн тодорхой стандарттай, бичиг баримт сайн бичигдсэн, цэвэр архитектуртай байдаг. Харин стартап болон аж ахуйн нэгжүүдийн бодит codebase бол олон жилийн турш өөр өөр багийнхны бичсэн legacy код, нууцлаг business logic, дутуу тайлбарлагдсан Jira ticket-үүдийн "ширэнгэ" юм.
Үүнийг шийдэхийн тулд Specific Labs бодит компаниудтай албан ёсны гэрээ байгуулж, 200,000+ хэрэглэгчтэй SaaS, сард 100,000+ гүйлгээ боловсруулдаг Fintech платформуудын хаалттай (private) кодын санг түрээслэн Real-SWE-г бүтээжээ.
Бодит туршилт: Загварууд яагаад "унав"?
Real-SWE нь бодит инженерүүдийн долоо хоног, сараар сууж шийдсэн бодит даалгавруудыг AI агентуудад өгч туршсан. Жишээ нь: "Олон улсын хэрэглэгчдийн татварын чөлөөлөлт болон нэхэмжлэх үүсгэх системийн зөрүүг шийдэж, холбогдох 3 дахь талын санхүүгийн API-тай уялдуулах" гэх мэт даалгавар байв.
Үр дүн хөгжүүлэгчдийг цочроолоо:
- Дээд оноо ердөө 38.8%: Frontier түвшний шилдэг модель хүртэл даалгавруудын 40 хүрэхгүй хувийг л бие даан амжилттай шийдэж чадсан.
- 70 гаруй хувийн бүтэлгүйтэл: Моделиудад хэчнээн их цаг, хязгааргүй compute power өгсөн ч оролдлогуудын дийлэнх нь амжилтгүй болжээ.
- Дунджаар 11 файл өөрчлөх шаардлага: Synthetic бенчмаркууд ихэвчлэн 1-2 файл засахад чиглэгддэг бол Real-SWE дээрх даалгаврууд медианаар 11 файлыг зэрэг хөндөж, системийн хэмжээнд refactoring хийхийг шаардсан байна.
AI агентууд хаана хамгийн их алдаж байна вэ?
Шинжилгээгээр тодорсон гол алдаа нь синтаксын бус, "Missed Requirements" буюу шаардлагыг дутуу ойлгох явдал байв.
- Хувьсах хязгаарлалт ба далд логик: Компанийн системд аливаа функц зөвхөн өөрийн логикоор биш, өгөгдлийн бааз, caching layer (Redis), төлбөрийн гарцтай зэрэгцэн ажилладаг. Агент локал орчинд өөрийн зассан unit test-ийг ногоон болгож байгаа ч enterprise системийн бусад холбоосыг эвдэж орхидог.
- Context-ийн дутагдал: Олон мянган мөр кодтой monorepo дотор хаана ямар хамаарал байгааг LLM бүрэн багтааж тунгааж чадахгүй гацдаг.
- Хэт итгэлтэй буруу шийдэл: Модель ямар нэг шийдлийг зөв ажилласан мэт дүгнэж PR үүсгэх боловч нарийн бизнесийн шаардлага (жишээ нь, тухайн улсын татварын хуулийн онцгой тохиолдол)-ыг орхигдуулсан байдаг.
Хөгжүүлэгчид үүнээс юу ойлгох ёстой вэ?
Энэхүү бенчмарк нь "Vibe coding"-оор бүхэл бүтэн системийг автоматжуулж болно гэсэн хэт өөдрөг төсөөллийг газарт буулгалаа.
- Инженерийн үнэ цэнэ өссөн хэвээр: Код бичих нь нийт инженерчлэлийн ердөө 20-30% нь байдаг. Хамгийн чухал нь системийн архитектур, өгөгдлийн урсгал, бизнесийн шаардлагыг зөв тайлбарлах, эрсдэлийг тооцоолох чадвар юм. Real-SWE-ийн үр дүн яг энэ талбарт хүн инженер зайлшгүй шаардлагатайг нотолж байна.
- Бенчмаркийн тоонд хууртахаа болих цаг: AI компаниудын зарладаг "90% SWE-bench accuracy" гэдэг нь танай компанийн production дээр тэр чигтээ ажиллана гэсэн үг биш. Хэрэв танай баг AI агент нэвтрүүлэхээр төлөвлөж байгаа бол нээлттэй датасет дээр бус, өөрсдийн хаалттай систем дээр хувийн eval (evaluation suite) бэлдэж хэмжих нь цорын ганц зөв зам юм.
AI агентууд хүчирхэг туслах хэвээр үлдэх боловч компанийн нарийн төвөгтэй системийг дангаараа нуруундаа үүрч явах хүртэл дахиад урт зам бий гэдгийг Real-SWE харууллаа.
Эх сурвалж: Specific Labs (realswe.withspecific.com), Hacker News Community Discussion (September 2026).
Сэтгэгдэл
Ачаалж байна...