Мэдээ

Ердөө 14MB хэмжээтэй, 28MB RAM-д ажилладаг AI агент: Cactus Compute "Needle 2" нээлттэй загвараа танилцууллаа

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 15·1 үзсэн·
Ердөө 14MB хэмжээтэй, 28MB RAM-д ажилладаг AI агент: Cactus Compute "Needle 2" нээлттэй загвараа танилцууллаа

Хиймэл оюуны салбарт хэдэн зуун тэрбум параметр бүхий аварга том Frontier загваруудын уралдаан ширүүсч буй энэ үед Cactus Compute баг эсрэг чиглэлд цоо шинэ хувьсгал хийлээ. Тэд хэт хязгаарлагдмал техник хангамж бүхий төхөөрөмжүүдэд (Edge & IoT) зориулсан Needle 2 нэртэй, 45 сая (45M) параметртэй, нээлттэй эхийн Tool-Calling загвараа албан ёсоор цацлаа.

Needle 2-ийн хамгийн онцлох зүйл нь ердөө 14MB хэмжээтэй бие даасан C++ binary бөгөөд ажиллах үедээ нийт 28MB RAM л ашигладагт оршино. Энэ нь үүлэн тооцоолол (Cloud API), тусдаа runtime суулгах шаардлагагүйгээр Raspberry Pi, хуучин ухаалаг утас, тэр ч байтугай микроконтроллер дээр local AI agent ажиллуулах боломжийг нээж өглөө.


45M параметр яагаад хангалттай гэж?

Орчин үеийн LLM-үүдийг энгийн хэрэглэгчийн хүсэлтийг API дуудах функц рүү хөрвүүлэх (Tool calling/Function calling) зорилгоор ашиглахад үүлэн дэд бүтцийн зардал болон саатал (latency) асар өндөр гардаг. Хэрэглэгчийн оруулсан замбараагүй текстээс параметрийг нь ялгаж, typed function signature буюу бүтэцлэгдсэн JSON формат руу хөрвүүлэхэд дэлхийн бүх мэдлэгийг агуулсан 70B+ загвар заавал шаардлагагүй.

Needle 2 нь зөвхөн дараах 3 зорилгод төвлөрч бэлтгэгдсэн:

  1. Tool Calling & Device Use: Хэрэглэгчийн байгалийн хэлийг тодорхойлсон API эсвэл функцийн дуудалт руу шууд хөрвүүлэх.
  2. Structured Data Extraction: Баримт, төлбөрийн баримт эсвэл мэдээллээс шаардлагатай талбаруудыг JSON схемээр найдвартай ялгах.
  3. Local Intent Routing: Оролтын өгөгдлийг орон нутагт шийдэж чадах эсэхээ үнэлж, эргэлзээтэй үед л үүлэн том загвар руу дамжуулах (Escalation).

Техникийн онцлог ба архитектур

Needle 2 загвар нь Cactus-ийн өөрсдийн боловсруулсан Simple Attention Network архитектур дээр суурилсан. Уламжлалт том FFN (Feed-Forward Network) давхаргыг Hadamard MLP бүтцээр сольж, Cactus Quants CQ2-bit квантчлалаар 2-bit түвшинд шахаж C++ хөдөлгүүрт багцалсан байна.

  • Self-contained Single Binary: Тусад нь gguf, safetensors эсвэл Python орчин, CUDA сан татах шаардлагагүй. 14MB-ийн нэг binary шууд ажиллана.
  • Constrained Grammar Decoding: Тодорхойлсон JSON Schema-д нийцэхгүй алдаатай тэмдэгт үүсгэхээс сэргийлж, byte-level grammar түвшинд хязгаарлалт тавьж үнэн зөв гаралтыг хангадаг.
  • Calibrated Confidence Score: Загварын толгой хэсэгт тусгай head суурилуулсан тул дуудалтын алхам бүрдээ итгэлцлийн хувийг (0.0-1.0) хамт буцаана. Энэ нь threshold зааж, итгэлгүй үед Cloud AI руу аюулгүй шилжүүлэх боломжийг олгодог.
  • Bounded 28MB RAM Window: 256-token sliding window болон KV sink механизмыг ашигладаг тул яриа хэчнээн урт үргэлжилсэн ч санах ойн хэрэглээ нь 28MB-аас хэтрэхгүй тогтмол байна.

Гүйцэтгэл ба Хурдны үзүүлэлт

Төхөөрөмжүүд дээрх decode хурдны туршилтууд:

  • Raspberry Pi 5: 500 tokens/sec
  • Meta Quest 3S / Apple Vision Pro: 400 – 1,500 tokens/sec
  • Хямд ангиллын ухаалаг утас (төсвийн Android): 300 – 700 tokens/sec
  • ESP32-P4 / ESP32-S3 микроконтроллер: Ердөө 11MB – 28MB санах ойд бүрэн ажиллаж байна.

Function calling бенчмаркууд дээр FunctionGemma (270M) болон LFM2.5 (230M) зэрэг 5-70 дахин том загваруудтай эн зэрэгцэхүйц нарийвчлалыг үзүүлжээ.


Хөгжүүлэгчид хэрхэн ашиглах вэ?

Needle 2 нь macOS, Linux (x86-64, ARM64, RISC-V), Windows, Android, iOS, тэр ч байтугай WebAssembly (WASM) дэмждэг.

Python хөгжүүлэгчид санг суулгаад өөрийн tool-үүдээ шууд тодорхойлж ажиллуулах боломжтой:

pip install cactus-needle
from cactus_needle import NeedleAgent

# Функцийн схем тодорхойлох
tools = [
    {
        "name": "set_device_volume",
        "description": "Adjust the smart speaker volume level",
        "parameters": {
            "type": "object",
            "properties": {
                "level": {"type": "integer", "minimum": 0, "maximum": 100}
            },
            "required": ["level"]
        }
    }
]

agent = NeedleAgent(tools=tools)

# Төхөөрөмж дээр орон нутагт гүйцэтгэх
response = agent.run("Хөгжмийн дууг 60 хувь болгоод өгөөч")

print(response.tool_call)
# Гаралт: {'name': 'set_device_volume', 'arguments': {'level': 60}}
print(response.confidence)
# Гаралт: 0.984

Мөн хөгжүүлэгчид өөрсдийн бүтээгдэхүүний өвөрмөц API болон тушаалуудад зориулан Needle 2-ийг өөрийн Mac эсвэл PC дээр хэдхэн минутын дотор LoRA ашиглан fine-tune хийх script-үүдийг нээлттэй нийтэлжээ.


Дүгнэлт: Edge AI хөгжүүлэлтийн шинэ шат

Ухаалаг гэр, робот техник, мобайл апп болон интернетгүй офлайн орчинд ажилладаг системүүдэд аварга том LLM ажиллуулах нь хэт өндөр өртөгтэй байсан бол Needle 2 нь "хэрэгцээндээ тохирсон авсаархан загвар"-ын хүчийг тод харууллаа. Цаашид том моделууд төлөвлөлтийг хийж, захын бичил агент загварууд төхөөрөмж дээр үүрэг гүйцэтгэх Hybrid архитектур стандарт болж байна.

Эх сурвалж: MarkTechPost, Cactus Compute GitHub Repo, Hugging Face Cactus-Compute/needle2

Сэтгэгдэл

Ачаалж байна...