Blog

LLM-ийн бодит хурдыг хэмжих цаг ирлээ: NVIDIA "GenAI-Perf"-ийг халж, шинэ "AIPerf" фрэймворкоо цацлааBlog
Мэдээ

LLM-ийн бодит хурдыг хэмжих цаг ирлээ: NVIDIA "GenAI-Perf"-ийг халж, шинэ "AIPerf" фрэймворкоо цацлаа

Өндөр ачааллын үед бенчмарк хийж буй клайент өөрөө гацаж, хуурамч латенси үүсгэдэг байсан асуудлыг шийдэхээр NVIDIA олон процесст шинэ "AIPerf" хэрэгслээ нээлттэй эхээр зарлалаа.

TOGTOKHTOGTOKH2026 оны есдүгээр сарын 20
Нээлттэй эхийн "хуурмаг амжилт" төгсөв: Real-SWE бенчмарк AI агентуудыг бодит компаниудын кодоор шалгаж эхэллээBlog
Мэдээ

Нээлттэй эхийн "хуурмаг амжилт" төгсөв: Real-SWE бенчмарк AI агентуудыг бодит компаниудын кодоор шалгаж эхэллээ

SWE-bench дээр 80%-ийн үнэлгээ авч байсан шилдэг AI агентууд бодит компаниудын хувийн codebase дээр очиход амжилт нь 38.8% хүртэл унав. Шинээр гарсан Real-SWE бенчмаркийн үр дүн яагаад инженерүүдийн анхаарлыг татаж байна вэ?

TOGTOKHTOGTOKH2026 оны есдүгээр сарын 13