Мэдээ

AMD Моделийн Жинг Цахиур Дээр "Сийлдэг" Taalas Стортапыг Худалдан Авлаа: AI Inference-ийн Шинэ Архитектур

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 9·2 үзсэн·
AMD Моделийн Жинг Цахиур Дээр "Сийлдэг" Taalas Стортапыг Худалдан Авлаа: AI Inference-ийн Шинэ Архитектур

Оршил: RAM-аас Цахиур Руу Шижигнэсэн Үсрэлт

Сүүлийн жилүүдэд AI загваруудын хөгжилд гол тулгамдаж буй саад бэрхшээл нь сургалт (training) гэхээсээ илүүтэйгээр бэлэн болсон моделийг бодит орчинд ажиллуулах буюу Inference үйл явц болоод байна. Ялангуяа санамжийн зурвасын өргөн (memory bandwidth bottleneck) болон дата төвүүдийн эрчим хүчний асар их хэрэглээ нь AI агентууд, real-time код туслахууд болон дуу хоолойгоор ажилладаг системүүдийн хурдыг хязгаарлаж байгаа юм.

Энэхүү асуудлыг сууриар нь шийдвэрлэх зорилгоор AMD компани AI inference-д зориулсан тусгай цахиур чип (specialized inference silicon) хөгжүүлэгч Taalas стартапыг худалдан авч байгаагаа албан ёсоор зарлалаа. Тохиролцооны санхүүгийн нөхцөлийг нийтлээгүй ч, технологийн хувьд энэ нь AI салбарт асар том өөрчлөлт авуулах алхам болж байна.

Taalas-ийн гол давуу тал нь юу вэ? Тэд LLM моделийн жин буюу model weights-ийг DRAM эсвэл HBM санамжид ачаалахын оронд, чипний дотоод транзисторын металл холбоос дээр шууд "сийлж" хэвлэдэг (etching model weights into silicon) шинэ архитектурыг бүтээсэн юм.

Taalas ба HC1 Чип: Архитектурын Гүнзгий Задлан Шинжилгээ

Taalas стартапыг 2023 онд Tenstorrent болон AMD-ийн микроархитектурч асан Любиша Бажич (Ljubisa Bajic) нарын туршлагатай инженерүүд үүсгэн байгуулжээ. Тэдний хандлага нь маш энгийн хэрнээ эрс тэс: "Генерал зориулалттай чип дээр модель ажиллуулах биш, моделийнхоо физик бүтэц дээр үндэслэн чипээ бүтээе".

Тэдний анхны туршилтын HC1 чип нь TSMC-ийн N6 процессоор цутгагдсан бөгөөд 53 тэрбум транзистор дээр Llama 3.1 8B моделийн бүх жинг Mask ROM бүтцээр металл үеүүдэд сийлэн байрлуулсан байна. Энэхүү архитектурын үр дүн хөгжүүлэгчдийн сонирхлыг татахаас өөр аргагүй:

  • Асар өндөр хурд (Throughput): Нэг хэрэглэгчид секундэд орчим 17,000 токен (17,000 tokens/sec) боловсруулах чадалтай.
  • Асар бага эрчим хүч: Ердөө 200 Ватт (200W) чадал шаардана.
  • Memory Bottleneck-ийг устгасан: Моделийн параметрүүд RAM эсвэл SRAM-аас процессор руу зөөгдөх шаардлагагүй тул Bus latency болон санамжийн халалт байхгүй болно.

Энгийн GPU дээр Llama 3.1 8B моделийг ажиллуулахад санамж ба процессорын хооронд өгөгдөл тасралтгүй зөөвөрлөгддөг тул хугацааны ихэнх хэсэг өгөгдөл хүлээхэд зарцуулагддаг. Харин Taalas-ийн чип дээр математик үйлдэл болон өгөгдөл нэг дор физик түвшинд тусгагдсан тул тооцоолол агшин зуур хийгддэг.

Hardware vs Software: Сул тал ба Давуу талын Тэнцвэр

Яагаад бүх чип үйлдвэрлэгчид моделийн жинг цахиур дээр шууд сийлдэггүй вэ? Гол шалтгаан нь уян хатан байдал (flexibility) юм.

Давуу талууд:

  1. Ultra-Low Latency: Моделийн хариу өгөх хугацаа миллисекундээс ч бага болох тул AI агентууд хоорондоо тасралтгүй харилцах, кодын компиляцийг шууд хийх боломж үүснэ.
  2. Дата төвийн эрчим хүчний хэмнэлт: Өнөөдөр Microsoft, Meta зэрэг компаниудад хамгийн том хязгаарлалт нь чипний тоо биш, дата төвийн цахилгааны эх үүсвэр болоод байна. 200W дээр 17,000 token/sec гаргана гэдэг нь цахилгааны зардлыг асар их хэмгэнэ.
  3. Inference зардлын уналт: Үүлэн үйлчилгээ үзүүлэгчид API-ийн үнийг хэдэн зуу дахин бууруулах боломжтой болно.

Сорилт ба шийдэл:

  • Fixed Weights (Хөдөлгөөнгүй жин): Моделийг fine-tune хийх, эсвэл prompt системд суурилж алгоритмыг солиход чипний физик бүтцийг өөрчилж чадахгүй. Энэ нь чипийг ердөө ганцхан загварт зориулагдсан хэрэгсэл болгодог.
  • Шинэчлэгдэх хурд: AI-ийн салбарт долоо хоног бүр шинэ модель гарч байхад, чип цутгах (tape-out) үйл явц хэдэн сар үргэлжлэх нь эрсдэлтэй.

Гэсэн хэдий ч Taalas болон AMD энэ асуудлыг шийдэхдээ Agentic EDA (Electronic Design Automation) хэрэгслийг ашиглаж байна. Чипний 100 орчим металл үеийн ердөө 2 үеийг л тухайн моделд зориулан өөрчилдөг бөгөөд AI агент ашиглан чипний зураглалыг автоматжуулснаар шинэ модельд зориулсан чипийг ердөө 2 орчим сарын дотор TSMC дээр үйлдвэрлэн гаргах боломжтой болсон юм.

Хөгжүүлэгчдэд ба AI Инженерүүдэд Юу Өөрчлөгдөх Вэ?

Энэхүү худалдан авалт нь програм хангамжийн хөгжүүлэгчдэд хэд хэдэн чухал дохиог өгч байна:

  1. Inference API асар хямд бөгөөд хурдан болно: OpenAI, Anthropic эсвэл Open-source моделиудыг ашиглаж буй бүтээгдэхүүнүүдийн арын серверүүд маш бага зардлаар ажиллах боломжтой болно.
  2. AI Агентуудын "Шинэ стандарт": Одоогийн байдлаар AI агентууд олон алхамтай даалгавар шийдвэрлэхэд latency болон зардлаас болж удааширдаг. Моделийн хурд секундэд 10,000+ токен болоход AI агент секундийн дотор хэдэн арван тестийг ажиллуулж, кодоо өөрөө засаж чаддаг болно.
  3. Edge AI болон On-Premise шийдлүүд: Бэлэн Llama, Qwen зэрэг нээлттэй моделиудыг тусгай чип дээр байрлуулан интернэтгүй эсвэл нууцлал өндөртэй локал серверүүдэд шууд ажиллуулах шинэ архитектурууд гарч ирнэ.

Дүгнэлт

AMD-ийн Taalas-ийг худалдан авсан алхам нь Nvidia-ийн GPU монополийг задрахад чиглэсэн стратегийн том нүүдэл юм. Нэгэнт салбарын стандартыг тогтоосон Llama 3.1 зэрэг томоохон суурь моделиудыг програм хангамж дээр биш, микрочипний түвшинд компиляци хийн ажиллуулдаг шинэ эрин үе эхэлж байна.

Хөгжүүлэгчдийн хувьд ирээдүйн AI веб эпп, агент, микросервисүүдийн ард ажиллах дэд бүтэц илүү агшин зуурын хурдтай, бага зардлаар ажиллах таатай нөхцөл бүрдэж байна.

Эх сурвалж: AMD Press Release, Futurum Research, The Register / Hacker News

Сэтгэгдэл

Ачаалж байна...