LLM инференсийн том толгойн өвчин шийдэгдэв: SGLang v0.5.18 загвар ачаалах хугацааг (Cold Start) 2.4 дахин буурууллаа
Нээлттэй эхийн шилдэг LLM инференс фрэймворк болох SGLang шинэ хувилбараа гаргаж, жингүүдийг унших болон CUDA graph capture-ийг зэрэгцүүлснээр загвар ачаалах хугацааг 85 секундээс 35 секунд болгон буурууллаа.