Cognition SWE-2 загвараа цацлаа: Devin-ий шинэ тархи, 64% хямд зардал ба "Bench-maxxing"-ийн ширүүн маргаан
Программ хангамжийн автономит хөгжүүлэлтийн анхдагч гэгддэг Devin платформыг бүтээгч Cognition Labs өөрсдийн дараагийн үеийн бие даасан кодчиллын суурь загвар болох SWE-2-оо албан ёсоор олон нийтэд танилцууллаа.
Сүүлийн жилүүдэд хөгжүүлэгчдийн агент системүүдийн хамгийн том толгойн өвчин нь "Frontier" түвшний ухаалаг загваруудын хэт өндөр токен зардал, удаан хугацааны репозитор ухах явцад гардаг асар их үйл ажиллагааны төлбөр байсан юм. Харин Cognition-ий шинээр гаргасан SWE-2 нь салбарын тэргүүлэх түвшний гүйцэтгэлийг харуулахын сацуу өртгийг даруй 64%-иар танаж чадсанаараа зах зээлийг доргиож байна.
Гэвч энэхүү гайхалтай үзүүлэлтийн цаана хөгжүүлэгчдийн дунд "Бенчмарк ханалт" (Benchmark saturation) болон загварыг шалгалтад зориулж хэт тохируулсан (Bench-maxxing) байж болзошгүй гэх ширүүн маргаан Hacker News дээр өрнөж эхэллээ.
Архитектур: 2.8T Kimi K3 ба Агент түвшний RL
Cognition компани SWE-2 загвараа тэгээс нь биш, нээлттэй жинтэй (open-weight) аваргуудын нэг болох Moonshot AI-ийн Kimi K3 загвар дээр суурилуулан post-train хийжээ.
- Параметрийн бүтэц: Kimi K3 нь нийт 2.8 их наяд (2.8T) параметртэй Mixture-of-Experts (MoE) архитектур бөгөөд нэг токен боловсруулахад 104 тэрбум (104B) идэвхтэй параметрийг ажиллуулдаг. Энэ нь өмнөх SWE-1.7-ийн сууриас бараг гурав дахин том хэмжээ юм.
- Headroom RL (Reinforcement Learning): K3 өөрөө кодчилолд чиглэсэн хүчирхэг суурьтай хэдий ч Cognition-ийн инженерүүд үүн дээр бие даасан агентын олон шатлалт төлөвлөлт, репозиторын бүтэцтэй танилцах (codebase exploration), алдаа засах болон CLI тушаал биелүүлэх чадваруудыг агент-түвшний RL-ээр тусгайлан сайжруулснаар бенчмаркийн оноог нэмэлт 5-6 хувиар ахиулсан байна.
Өмнө нь зөвхөн API дуудаж код авах төдий байсан бол SWE-2 нь Devin-ийн терминал, браузер болон файлын системтэй харилцах бүхий л ажиллагааг эх хэл шигээ ойлгож хийхэд зориулагдан нарийвчлан тохируулагдсан нь энэ юм.
Парето фронтир: Бараг л Fable 5.1, гэхдээ 64% хямд
Cognition-ийн нийтэлсэн тайлангаар SWE-2 нь салбарын хамгийн хүнд сорилтууд дээр гайхалтай үр дүн үзүүлжээ:
| Бенчмарк сорилт | SWE-2 | Kimi K3 суурь | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 50.9% | 53.3% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.4% | 74.1% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 91.4% | 89.9% |
Эдгээр тоон үзүүлэлтээс харвал SWE-2 нь одоогийн кодчиллын хамгийн өндөр жишиг болох Claude Fable 5.1-ээс FrontierCode дээр ердөө 0.9%-ийн зөрүүтэй байгаа төдийгүй Terminal-Bench 2.1 дээр бүр давж гарсан байна.
Гэхдээ хамгийн гол ялгарал нь үнэ. Devin-ий ажлын урсгалд бие даан 30-40 минут код ухаж, тест бичиж, linting алдаа засахад хэдэн зуун мянган токен шатдаг. SWE-2 нь MoE бүтцийн үр ашигтай байдал болон өөрсдийн хостинг дэд бүтцийн ачаар агент ажиллуулах зардлыг зах зээлийн өрсөлдөгчдөөс даруй 64%-иар хямдруулсан байна.
Мөн SWE-2 нь хөгжүүлэгчийн тавьсан даалгаврын төвөгтэй байдлаас хамааруулан Medium, High, болон Max гэсэн 3 түвшний "Reasoning Effort" (эргэцүүлэлтийн хүчин чармайлт)-ийг сонгох боломжийг олгож эхэлжээ. Энгийн скрипт эсвэл UI засалтыг Medium дээр хурдан бөгөөд хямд хийх бол репозитор дамжсан нарийн рефакторинг хийхэд Max горим илүү олон шатлалт шалгалт хийж ажиллана.
"Bench-maxxing" маргаан: Terminal-Bench 4 дээрх 27.3%-ийн шок
Шинэ загвар гарах бүрд сэтгэл нь хөдөлдөг байсан инженерүүд энэ удаад сэрэмжтэй хандаж байна. Шалтгаан нь SWE-2-ийн үзүүлсэн хоёр сорилтын хоорондох тэнгэр газар шиг ялгаа юм.
SWE-2 нь олон нийтэд танигдсан Terminal-Bench 2.1 дээр 92.8% авсан атлаа, ердөө хоёрхон долоо хоногийн өмнө нийтийн хүртээл болсон шинэ үеийн Terminal-Bench 4 тест дээр ердөө 27.3% авч эрс унажээ.
Hacker News-ийн зарим хөгжүүлэгчид:
"Хэрвээ загвар нэг тест дээр 92%, гэтэл ижил төрлийн шинэ тест дээр 27% авч байвал энэ бол жинхэнэ 'Bench-maxxing' буюу сургалтын өгөгдлийг цээжилсний (overfitting) сонгодог жишээ" хэмээн шүүмжилж байна.
Харин Cognition-ий талынхан үүнийг үгүйсгэж байгаа юм. Terminal-Bench 2.1 аль хэдийн "ханасан" (saturated), харин шинэ TB4 нь даалгаврын төвөгтэй байдлын хувьд эрс өөр түвшин гэдгийг тэд сануулж буй. Түүнчлэн OpenAI-ийн саяхан гарсан GPT-5.6 Sol загвар ч мөн TB2.1 дээр 90% авсан ч TB4 дээр 37% хүртэл унаж байгаа тул энэ нь зөвхөн SWE-2-ийн биш, AI салбарын агентуудын бодит амьдрал дээрх ерөнхийлөх (generalization) чадварын нийтлэг сорилт гэж шинжээчид харж байна.
Хөгжүүлэгчдэд юу өөрчлөгдөх вэ?
SWE-2 нь өнөөдрөөс эхлэн Devin Desktop болон Devin CLI хэрэгсэлд шууд ашиглагдаж эхэлсэн бөгөөд тун удахгүй Devin Web болон Fusion-д бүрэн нэвтрэх аж. Cognition компани одоогийн Pro, Max болон Teams хэрэглэгчдэдээ эхний нэг сарын турш SWE-2-ийг үнэ төлбөргүй турших эрх олгож байна.
Энэхүү үйл явдлын хамгийн том сургамж бол: AI хөгжүүлэлтийн агент системүүд дан ганц proprietary аварга загваруудаас (Anthropic, OpenAI) хамааралтай байхаа больж, 2.8T түвшний нээлттэй MoE загваруудыг тусгайлсан RL-ээр боловсруулан хамаагүй хямд, бодит бүтээмж өндөртэй хэрэгсэл болгох чиглэл рүү бүрэн шилжиж буйг харууллаа.
Хөгжүүлэгчдийн хувьд өөрийн IDE эсвэл CLI орчиндоо бие даасан ажилтанг ажиллуулах өртөг анх удаа тооцоо хийхэд бодитой, өдөр тутам ашиглаж болохуйц хямд түвшинд бууж ирж байна.
Эх сурвалж: Cognition Research: Introducing SWE-2: Pushing the Pareto Frontier болон OrcaRouter Technical Analysis
Сэтгэгдэл
Ачаалж байна...