Google Кодчлол ба Агентуудад Зориулсан Gemini 3.7 Flash Загвараа Танилцууллаа: 50% Хямд Үнэ, Хүчирхэг SWE Үзүүлэлт
Хиймэл оюуны салбарын өрсөлдөөн "хэн хамгийн том загвар бүтээх вэ" гэдгээс "хэн бие даасан агентуудыг хамгийн хурдан бөгөөд зардал багатай ажиллуулах вэ" гэдэг чиглэл рүү эргэлт буцалтгүй шилжиж байна. Ялангуяа кодын сан (codebase) шинжлэх, олон алхамт агент loop ажиллуулах, автоматаар debug хийх зэрэг хөгжүүлэгчдийн өдөр тутмын ажилд хэт үнэтэй, удаан том загварууд бус, харин өндөр бүтээмжтэй "ажлын морь" (workhorse) загварууд ус агаар мэт шаардлагатай болсон билээ.
Энэхүү зах зээлийн эрэлтэд нийцүүлэн Google компани Gemini 3.6 Flash хувилбараас хойш ердөө гуравхан долоо хоногийн дараа програмчлал болон агент даалгавруудад зориулан тусгайлан сайжруулсан Gemini 3.7 Flash загвараа албан ёсоор танилцууллаа.
Програмчлалын Бенчмаркууд: Хурд ба Нарийвчлалын Үсрэлт
Шинэ Gemini 3.7 Flash нь зөвхөн хурдны хувьд бус, бодит программ хангамжийн инженерийн даалгавруудыг гүйцэтгэх чадвараараа мэдэгдэхүйц ахиц гаргажээ:
- DeepSWE v1.1 (Software Engineering Benchmark): Өмнөх 3.6 хувилбар 49.0%-ийн амжилт үзүүлж байсан бол Gemini 3.7 Flash 65.3% болж эрс өссөн байна.
- FrontierCode 1.1 Main: Үйлдвэрлэлийн түвшний (production-ready) код үүсгэх чадвараар 34.4%-иас 43.6% болж ахижээ.
- Arena.ai WebDev Arena: Вэб хөгжүүлэлтийн UI/UX болон бүрэн функционал бүтэц гаргах чадвараар 1588 Elo оноо авч, ангилалдаа тэргүүлэх түвшинд хүрчээ.
- Artificial Analysis Intelligence Index: Төвийг сахисан шинжилгээгээр 56 оноо авч, өмнөх үеийн Gemini 3.1 Pro Preview (48 оноо)-г гүйцэж түрүүлсэн нь "Flash" түвшний жижиг загвар том хувилбараа давсан онцлох үзүүлэлт болов.
Мөн хариу өгөх хугацаа (Time to First Token) 64%-иар буурч, гаралтын хурд нь секундэд ~340 токен хүрч байгаа нь код бичих CLI болон агент орчинд гацахгүй ажиллах нөхцөлийг бүрдүүлж байна.
"Агент Эдийн Засаг" (Agent Economics) ба 50%-ийн Хөнгөлөлт
AI агент бодит төсөл дээр ажиллахдаа хэдэн зуун удаа файл уншиж, terminal дээр тушаал ажиллуулж, алдаагаа засах эргэлт (multi-step loop) хийдэг. Ийм үед токен бүрийн үнэ болон caching үр ашиг төслийн төсөвт шийдвэрлэх нөлөө үзүүлдэг.
Google шинэ загвартаа дараах өрсөлдөх давуу талуудыг олгожээ:
- Үнийн түрэмгий бодлого: 1 сая input токен тутамд $0.75, 1 сая output токен тутамд $3.75 (өмнөх үндсэн үнээс 50% хямд).
- 1M Контекст Цонх: 1,048,576 токены урт контекст цонхтой бөгөөд нэг удаад 65,536 хүртэлх токен үүсгэх (output) чадвартай.
- ** сайжруулсан Caching & Tool Precision:** Browser Use болон Databricks-ийн хийсэн эхний туршилтаар Gemini 3.7 Flash нь Prompt Cache hit rate-ийг 8%-иар өсгөж, багаж дуудах (tool calling) алдааны түвшнийг мэдэгдэхүйц бууруулжээ.
GitHub Copilot болон Хөгжүүлэлтийн Орчны Дэмжлэг
Хөгжүүлэгчид зөвхөн API ашиглаад зогсохгүй, өөрсдийн дассан IDE дээрээ шинэ моделийг шууд сонгон ашиглах боломж нээгдлээ.
- GitHub Copilot интеграци: VS Code, Visual Studio, JetBrains IDEs, Xcode, Copilot CLI болон Cloud Agent дээр Gemini 3.7 Flash-ийг загвар сонгох цэснээс (model picker) шууд ашиглах боломжтой боллоо.
- Google Antigravity: Олон платформын (Flutter, React Native, Swift, Kotlin) UI дэлгэцийг эх кодоос симулятор дээр шууд ажиллуулж шалгах дэд агент системд нэгтгэгдсэн.
- Google AI Studio ба Vertex AI: Хөгжүүлэгчид шинэ API түлхүүр авч, системийн промпт болон бүтцэд өөрчлөлт хийлгүйгээр шууд
gemini-3.7-flashнэршлээр ашиглаж эхлэх боломжтой.
Монгол Хөгжүүлэгчдэд: Юунд Анхаарах Вэ?
- Agent Loops & CI/CD Автоматжуулалт: Хэрэв танай баг Pull Request-ийг автоматаар хянах, automated unit test үүсгэх, эсвэл репо дотор хайлт хийдэг дотоод туслах (internal bot) хөгжүүлж байгаа бол Gemini 3.7 Flash нь үнэ болон чанарын харьцаагаар хамгийн оновчтой үндсэн загвар (default engine) болж чадна.
- Frontend & UI Prototype хийх: Figma дизайн эсвэл дэлгэцийн агшинг (screenshot) шууд бүрэн ажиллах React/Tailwind эсвэл Mobile компонент болгон хөрвүүлэх чадвар нь сайжирсан тул загварчлалын хурдыг 2-3 дахин өсгөх боломжтой.
- Local Docs & Enterprise RAG: Том хэмжээний PDF, техникийн баримт бичиг боловсруулах GDP.pdf бенчмарк дээр 34.0% хүрсэн нь дата баримттай ажилладаг RAG системүүдийн нарийвчлалыг мэдэгдэхүйц нэмэгдүүлнэ.
Google-ийн энэхүү алхам нь зөвхөн Anthropic болон OpenAI-ийн төлбөртэй модельуудтай өрсөлдөөд зогсохгүй, нээлттэй эхийн (open-weights) жижиг загваруудыг өөрийн хямд үнэ, өндөр дэд бүтцийн хурдаар хүчтэй шахаж эхэлснийг харуулж байна.
Эх сурвалж:
Сэтгэгдэл
Ачаалж байна...