Мэдээ

Текст биш, зөвхөн код шийдвэр гаргадаг: Jared Palmer нээлттэй эх бүхий System-1 загвар "Kev"-ийг цацлаа

TOGTOKHTOGTOKH·2026 оны есдүгээр сарын 21·1 үзсэн·
Текст биш, зөвхөн код шийдвэр гаргадаг: Jared Palmer нээлттэй эх бүхий System-1 загвар "Kev"-ийг цацлаа

Сүүлийн хоёр жил программ хангамжийн салбар бүхэлдээ нэгэн хачирхалтай зуршилд автсан: Бид backend систем дээрээ энгийн "Тийм/Үгүй" эсвэл 3-4 сонголтоос нэгийг нь сонгох ангиллын шийдвэр гаргахын тулд 70 тэрбум параметр бүхий нүсэр LLM (Large Language Model) дуудаж, хэдэн мянган токен шатаан, 2-3 секунд хүлээж байна.

Хэрэглэгчийн хүсэлт аюулгүй эсэх, ирсэн тусламжийн хүсэлтийг (ticket) санхүү рүү шилжүүлэх үү, техникийн баг руу шилжүүлэх үү гэх мэт энгийн шийдвэрүүдэд бүтэн текстийн генератор ашиглах нь үнэндээ "хумсны хутгаар мод тайрах"-тай адил үрэлгэн зардал юм.

Энэ гажуудлыг засахаар саяхан TypeSafe AI компани текст огт үүсгэдэггүй, зөвхөн шууд шийдвэр гаргадаг proprietary "Jev" хэмээх System One Model-ийг танилцуулсан бол үүнээс ердөө хэдхэн хоногийн дараа Turborepo болон Formik-ийг үндэслэгч гэдгээрээ хөгжүүлэгчдийн эчнээ танил Jared Palmer түүнийг нээлттэй эхээр бүрэн хуулбарласан Kev загваруудын багцаа GitHub болон Hugging Face дээр нээлттэй болголоо.

Бид яагаад 1-битийн шийдвэрт бүтэн LLM түрээсэлж байв?

Нобелийн шагналт сэтгэл судлаач Даниэль Канеманы тодорхойлсноор хүний тархи хоёр системээр ажилладаг:

  1. System 1 (Зөн совин, рефлекс): Маш хурдан, шууд, автомат үйлдэл (жишээ нь: гэнэтийн дуу чимээ сонсоод толгой эргүүлэх, улаан гэрлээр зогсох).
  2. System 2 (Логик сэтгэлгээ): Удаан, дүн шинжилгээтэй, учир шалтгааны дараалалтай бодох (жишээ нь: 17 × 24-ийг бодох, код бичих).

Өнөөгийн GPT-4o, Claude 3.5 Sonnet зэрэг бүх frontier LLM-үүд нь мөн чанартаа System 2-ын удаан, үгийн араас үг таамаглан хэлхдэг (autoregressive) хөдөлгүүрүүд юм. Гэтэл бодит production системд ажиллаж буй AI пайплайнуудын 90 хувь нь шүлэг бичих биш, харин системийн рефлекс гаргах даалгавартай байдаг:

  • "Энэ API хүсэлт халдлагын шинжтэй байна уу? (boolean)"
  • "Энэ имэйл худалдан авах сонирхол хэр өндөр байна вэ? (score)"
  • "Энэ хэрэглэгчийн алдааны бүртгэл Аль сервис рүү хамаарах вэ? (enum choice)"

Хөгжүүлэгчид үүнийг хийхийн тулд LLM-д "Зөвхөн дараах JSON форматаар хариул, тайлбар битгий бич" хэмээн prompt engineering хийж, загвар нь галлюцинацидаж буруу бүтэц буцаах вий гэж JSON mode залгаж, хүсэлт бүрд хэдэн арван цент зарцуулж ирсэн.

"Kev" гэж юу вэ? Үг биш, өгөгдлийн төрөл (Type) буцаадаг AI

Jared Palmer-ийн танилцуулсан Kev нь уламжлалт чатбот биш. Тэрээр текст хэлхэх алгоритмыг бүрэн хаяж, зөвхөн програмын төлөв (state) болон асуултуудыг хүлээн аваад, нэг удаагийн тооцооллоор шууд математик магадлалтай Typed үр дүн өгдөг "Non-autoregressive decision model" юм.

Kev гурван үндсэн примитивтэй ажилладаг:

  1. Choice: Өгөгдсөн сонголтуудаас нэгийг сонгох ба сонголт тус бүрийн итгэлцлийг (calibrated probability) буцаана.
  2. Score: Тодорхой хэмжүүрээр 0-оос 1-ийн хооронд тоон үнэлгээ өгнө.
  3. Boolean: Үнэн эсвэл худлыг магадлалын хамт илгээнэ.
// Жишээ нь Kev рүү илгээх хүсэлт:
const decision = await client.evaluate({
  state: "User SQL query: DROP TABLE users; -- without WHERE clause",
  questions: {
    is_safe_to_execute: "boolean",
    risk_level: ["low", "medium", "critical"]
  }
});

// Kev-ийн шууд буцаах хариу (текст байхгүй, зөвхөн магадлал):
// {
//   is_safe_to_execute: { value: false, probability: 0.994 },
//   risk_level: { value: "critical", probability: 0.988 }
// }

Kev-ийн гайхамшиг нь хэзээ ч галлюцинацидах боломжгүй. Учир нь түүний буцаах боломжит утгуудын хүрээ (schema space) нь моделийн гаралтын толгойд урьдчилан хязгаарлагдсан байдаг тул өгөгдөөгүй ангилал зохиох, JSON синтаксийн алдаа гаргах ямар ч математик магадлал байхгүй.

Архитектур ба Гүйцэтгэл: LoRA ба M-цуврал Mac дээр 40мс

Kev-ийг Jared Palmer нээлттэй жинтэй Qwen3/Qwen3.5 загварууд дээр суурилан сургажээ. Моделийн хүнд хэсгийг өөрчлөхгүйгээр дээр нь тусгай LoRA adapter (rank=16) болон ангиллын вектор шийдвэрлэх pointer head залгасан байна.

Ингэснээр загварын дараагийн үгийг үүсгэдэг декодер циклийг алгасаж, нэг удаагийн forward pass-аар (нэг мөчлөгт) бүх асуултад зэрэг хариулдаг:

  • Kev-0.8B, Kev-4B, Kev-9B: Төрөл бүрийн хэрэгцээнд зориулсан 3 сонголттойгоор гарсан.
  • Хурд: Kev-4B нь энгийн Apple Silicon бүхий 32GB Mac дээр bf16 форматаар ажиллахад 5 асуултад ердөө ~300 миллисекундэд хариулж байна. Харин сервер талын H100 GPU дээр энэ үзүүлэлт ердөө 40 миллисекунд болж буурдаг.
  • Зардал: Гаралтын токен гэж байхгүй тул гаралтын зардал 0 доллар. Харин локал сервер дээр өөрсдөө ажиллуулбал API-ийн ямар ч төлбөргүй.

Kev нь TypeSafe-ийн албан ёсны SDK-тэй бүрэн нийцтэй API сервертэй тул хөгжүүлэгчид коддоо ганцхан base_url="http://localhost:8008" гэж солиод л дотоод сүлжээндээ ажиллуулах боломжтой.

Хөгжүүлэгчид үүнийг хаана ашиглах вэ?

  1. AI Агентын Guardrails (Аюулгүй байдлын шалгуур): AI агент өгөгдлийн сан устгах, гадаад API дуудах, захиалга цуцлах зэрэг эрсдэлтэй үйлдэл хийхээс өмнө Kev-ээр 50 миллисекундэд хянуулах.
  2. Microservice Routing (Хүсэлтийн чиглүүлэлт): Хэрэглэгчийн хүсэлт ирэх үед хүнд LLM рүү явуулах уу, шууд хариулах уу, эсвэл тусгай бааз руу хандах уу гэдгийг microservice түвшинд маш хурдан шийдвэрлэх.
  3. Big Data / Log ангилал: Өдөрт сая саяар үйлдвэрлэгдэх системийн логуудыг үнэтэй клауд API дуудалгүйгээр дотоод серверийнхээ GPU дээр sub-second хурдаар ангилах.

Дүгнэлт

AI хөгжүүлэлтийн чиг хандлага 2026 онд шинэ шатанд гарч байна: Бүх зүйлийг нэг том "Бүхнийг чадагч чатбот"-оор шийдэх биш, харин тусгай зориулалтын хурдан, хямд, алдаа гаргадаггүй System-1 рефлекс модулиудыг кодынхоо урсгалд шигтгэж өгөх архитектур хүчээ авч байна. Jared Palmer-ийн Kev нь хөгжүүлэгчдэд энэ боломжийг бүрэн нээлттэй эхээр, өөрийн зөөврийн компьютер дээрээ ашиглах замыг нээж өглөө.

Эх сурвалж:

  • Jared Palmer GitHub Repository (jaredpalmer/kev)
  • Hugging Face Model Hub: jaredpalmer/kev-4b
  • TypeSafe AI: System One Models & Architecture Specification

Сэтгэгдэл

Ачаалж байна...