Мэдээ

AMD AI-ийн санах ойн хязгаарлалтыг шийдэхээр Taalas стартапыг худалдан авлаа: Загварын жинг цахиурт шууд сийлдэг шинэ эрин

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 7·2 үзсэн·
AMD AI-ийн санах ойн хязгаарлалтыг шийдэхээр Taalas стартапыг худалдан авлаа: Загварын жинг цахиурт шууд сийлдэг шинэ эрин

AI технологийн хөгжлийн дараагийн том давалгаа нь зөвхөн сургах (training) систем дээр биш, харин бэлэн болсон загваруудыг асар их хэмжээгээр, бага зардлаар ажиллуулах буюу инференс (inference) архитектур дээр төвлөрч байна. Үүний тод илрэл болж, AMD корпораци AI загварын жинг (model weights) цахиур чип дээр шууд "сийлж" суулгадаг, Канадын Торонто хотод төвтэй Taalas стартапыг худалдан авахаар болсноо албан ёсоор зарлалаа.

Энэхүү хэлцэл нь AI аппарат хангамжийн салбарт уламжлалт GPU болон өндөр хурдны санах ойн (HBM - High Bandwidth Memory) физик хязгаарлалтыг даван туулах шинэ эрин үе эхэлснийг харуулж байна.

AI инференсийн хамгийн том саад: Санах ойн хязгаарлалт

Одоогийн байдлаар Nvidia H100, B200 эсвэл AMD MI300 зэрэг ерөнхий зориулалтын GPU-ууд дээр Large Language Model (LLM) ажиллуулахад боловсруулалтын хурд нь чипний тооцоолох чадвар (compute)-аас илүү санах ойн зурвасын өргөнөөс (memory bandwidth) шууд хамаарч байна. Токен бүрийг үүсгэх бүрд сая сая, тэрбум тэрбум параметрийн жингүүдийг гадаад HBM санах ойгоос чипний процессор руу тасралтгүй зөөвөрлөх шаардлагатай болдог.

Энэхүү санах ойн саатал (memory bottleneck) нь:

  • Асар их эрчим хүч зарцуулдаг,
  • Токен үүсгэх хурдыг (tokens per second) хязгаарладаг,
  • AI дата төвүүдийн ашиглалтын зардлыг (OpEx) туйлдаа хүртэл нэмэгдүүлдэг.

Taalas компани яг энэ бэрхшээлийг огт өөр өнцгөөс буюу ASIC (Application-Specific Integrated Circuit) ба "Hardcore Models" гэх концепцоор шийдвэрлэхийг зорилго болгожээ.

Taalas-ийн технологи: Загварыг чипний физик бүтэц болгох нь

Taalas-ийн үүсгэн байгуулагчдын дэвшүүлсэн шийдэл нь тун өвөрмөц: Загварын параметрийн жингүүдийг (weights) программчлагдах санах ойд хадгалахын оронд, чип үйлдвэрлэх явцад цахиурын дотоод металл үе буюу Mask-ROM дээр физик хэлбэрээр "хийцэлж" өгдөг.

Ингэснээр:

  1. HBM санах ой ашиглах шаардлагагүй болно: Загварын жин нь чип дотроо шууд оршин байх тул гадаад санах ой руу өгөгдөл зөөх шаардлагагүй. Контекстийн KV cache-д зориулж зөвхөн чип дээрх SRAM-ийг ашиглана.
  2. Асар өндөр хурд ба хэмнэлт: Taalas-ийн TSMC 6nm технологиор үйлдвэрлэсэн анхны HC1 туршилтын чип Meta-ийн Llama 3.1 8B загварыг секундэд 16,960 токены (TPS) хурдтайгаар ажиллуулж чадсан байна. Энэ нь одоогийн хамгийн шинэлэг GPU системүүдээс бараг 48 дахин хурдан бөгөөд эрчим хүчний зарцуулалт болон хэмжээний хувьд хэд дахин бага юм.

"Загвар өөрчлөгдвөл чипийг яах вэ?": Патентжуулсан уян хатан шийдэл

Ийм архитектурын талаар сонссон хөгжүүлэгч болон инженерүүдийн хувьд хамгийн эхэнд "AI загварууд сар бүр шинэчлэгдэж байхад цахиур дээр хатуу суулгачихвал ашиглах боломжгүй болох бус уу?" гэсэн асуулт гардаг.

Taalas энэ асуудлыг патентжуулсан тусгай аргачлалаар шийдсэн байна. Чипний үндсэн архитектур, логик хэлхээ, SRAM санах ойн бүтцийг өөрчлөхгүйгээр, зөвхөн хамгийн дээд талын 1-2 металл маскийн (metal mask layer) ROM тохиргоог өөрчлөх замаар шинэ загварын жинг суулгадаг. Ингэснээр чипийг шинээр эхнээс нь төлөвлөх (tape-out) шаардлагагүй бөгөөд шинэ загварт зориулсан чипийг ерөөсөө 2 орчим сарын дотор маш хямд зардлаар үйлдвэрлэх боломжтой болжээ.

Llama, Qwen зэрэг нээлттэй эх бүхий стандарт загварууд салбарт өндөр ашиглалттай, тогтвортой суурь загвар (base models) болж чадсан өнөө үед ийм төрлийн чип үйлдвэрлэх эдийн засгийн ашигтай байдал маш өндөр болж байна.

AMD-ийн стратеги ба хөгжүүлэгчдэд үзүүлэх нөлөө

Nvidia компани өмнө нь Groq компанийг худалдан авч, специализирован инференс чипний чиглэлд томоохон алхам хийж байсан бол AMD-ийн Taalas-ийг авч буй алхам нь энэ өрсөлдөөнийг улам ширүүн болгож байна.

AMD Taalas-ийн технологийг өөрийн Instinct GPU, EPYC процессор болон Helios rackscale системүүддээ нэгтгэхээр төлөвлөж байна.

Ирээдүйн дата төвийн архитектур нь дараах байдлаар хуваарилагдаж магадгүй юм:

  • Ерөнхий зориулалтын GPU-ууд: Томоохон Prompt болон санамсаргүй, олон төрлийн контекст боловсруулалтыг хийнэ.
  • Taalas ASIC хурдасгуурууд: Тогтмол загвар дээр суурилсан масс токен генерацийг асар өндөр хурдтай, туйлын хямд зардлаар гүйцэтгэнэ.

Хөгжүүлэгчийн хувьд энэ нь юу гэсэн үг вэ?

  1. LLM API зардлын бууралт: Загварын жинг цахиурт суулгаснаар дата төвүүдийн цахилгаан болон аппарат хангамжийн зардал асар ихээр буурч, API токен тутамд төлөх зардал одоогийнхоос хэд дахин хямдрах нөхцөл бүрдэнэ.
  2. Real-time ба Edge AI системүүд: Секундэд 15,000+ токен боловсруулах боломжтой болсноор Voice AI агентууд, роботик ба real-time кодинг туслахууд ямар ч сааталгүй (zero latency) хариу үйлдэл үзүүлэх боломжтой болно.
  3. Dedicated Inference Infrastructure: Томоохон компаниуд өөрсдийн fine-tune хийсэн загвартаа зориулж хямд зардлаар тусгай чип захиалан хийлгэж, өөрийн сервер дээр найдвартай, хурдан ажиллуулах эрин үе хаяанд ирлээ.

Дүгнэлт

AMD Taalas-ийг худалдан авсан нь AI чипний өрсөлдөөн "хэн хамгийн том GPU хийх вэ" гэдэг үзүүлэлтээс "хэн инференсийг хамгийн хурдан, хямд, эрчим хүчний хэмнэлттэй ажиллуулах вэ" гэсэн шинэ шат руу шилжиж байгааг илтгэж байна. Силикон дээр AI загварыг шууд сийлж суулгах энэхүү чиглэл нь хөгжүүлэгчдэд илүү боломжийн зардлаар, илүү хурдан AI агентуудыг бүтээх боломжийг олгох болно.

Эх сурвалж: AMD Press Release - AMD Acquires Taalas, ServeTheHome Report

Сэтгэгдэл

Ачаалж байна...