Мэдээ

OpenAI ба Cerebras хамтран "GPT-5.6 Sol Ultrafast" горимыг зарлалаа: Секундэд 750 токен буюу 14 дахин өндөр хурдны эрин үе

TOGTOKHTOGTOKH·2026 оны наймдугаар сарын 14·1 үзсэн·
OpenAI ба Cerebras хамтран "GPT-5.6 Sol Ultrafast" горимыг зарлалаа: Секундэд 750 токен буюу 14 дахин өндөр хурдны эрин үе

AI-ийн суурь моделиудын чадвар сүүлийн жилүүдэд үсрэнгүй хөгжсөн хэдий ч том хэмжээний reasoning болон кодчиллын агентууд (Agentic workflows) ажиллуулахад тулгардаг хамгийн том даваа нь latency буюу хүлээлтийн хугацаа байсаар ирсэн. Нэг даалгаврыг гүйцэтгэхийн тулд олон арван алхам бодож, туршиж, код засдаг агентууд хэдэн минут, бүр цагаар хүлээлгэдэг билээ.

Тэгвэл OpenAI болон чип үйлдвэрлэгч Cerebras компаниуд хамтран энэхүү гацааг арилгах түүхэн алхам хийж, OpenAI API-д "GPT-5.6 Sol Ultrafast" шинэ түвшнийг (service tier) албан ёсоор танилцууллаа.


750 токен/сек: Уламжлалт GPU-ээс 14 дахин хурдан

Cerebras-ийн аварга том Wafer-Scale Engine (WSE) процессоруудаар тоноглогдсон дэд бүтэц дээр ажиллах тус Ultrafast горим нь секундэд 750 гаралтын токен (output tokens/sec) боловсруулах чадалтай. Энэ нь уламжлалт NVIDIA H100/B200 кластерууд дээр ажилладаг стандарт GPT-5.6 Sol-оос даруй 14 дахин хурдан үзүүлэлт юм.

Хамгийн гол нь загварын чадвар (intelligence), reasoning логик болон үр дүнгийн нарийвчлалд огт гарз гараагүй. Өөрөөр хэлбэл, жижиг, дутуу загваруудыг хурдан ажиллуулах биш, харин хамгийн хүчирхэг frontier моделийг бодит цагийн (real-time) хурдаар ажиллуулж эхэлж байна.

Хурдны харьцуулалт (HLE Benchmark 2,500 асуулт):
┌───────────────────────────────┬────────────────────────┐
│ Модель                        │ Нийт зарцуулсан хугацаа│
├───────────────────────────────┼────────────────────────┤
│ Claude Fable 5                │ 78 цаг 27 минут        │
│ GPT-5.6 Sol (Standard)        │ ~150 цаг               │
│ GPT-5.6 Sol (Ultrafast Mode)  │ 11 цаг 11 минут        │
└───────────────────────────────┴────────────────────────┘

(OpenAI ба Cerebras-ийн туршилтын үр дүнгээс)


Программ хангамжийн хөгжүүлэгчдэд юу өөрчлөгдөх вэ?

Энэхүү хурдны өөрчлөлт нь зүгээр нэг чатбот илүү хурдан хариулах тухай асуудал биш юм. Программ хангамжийн инженерчлэлд агентын бүтэц суурь түвшиндээ өөрчлөгдөнө:

1. Бодит цагийн AI Debugging ба Рефакторинг

Өмнө нь IDE дотроо том репозиторын архитектурын шинжилгээ хийлгэхэд 30–60 секунд хүлээж суудаг байсан бол секундэд 750 токен хурдаар хэдэн зуун мөр кодын өөрчлөлтийн санал (diff) хэдхэн хоромд (1-2 секунд) дэлгэцэнд бууж ирнэ. Хөгжүүлэгчийн сэтгэх хэмнэл (flow state) тасалдахгүй.

2. Олон давхаргат Агентуудын "Chain-of-Thought" хурд

Cursor, Claude Code, GitHub Copilot CLI зэрэг агентлаг системүүд код бичихдээ цаанаа 5-10 удаа өөрөө өөрийгөө шалгах (reflection loop), тестийг ажиллуулах, алдаагаа засах дарааллыг хийдэг. Хэрэв хүсэлт бүр 14 дахин хурдасвал 5 минутын даалгавар 20 секундэд бүрэн дуусна.

3. CI/CD дээрх шуурхай туршилтууд

Pull Request үүсэх бүрт зөвхөн линтер ажиллуулах биш, GPT-5.6 Sol түвшний reasoning загвараар аюулгүй байдлын аудит, интеграцийн тестийн генераци хийх боломж бодит хэрэглээ болж байна.


Wafer-Scale архитектур хэрхэн ийм хурдыг бий болгов?

GPU-үүдийн хамгийн том сул тал бол том моделиудыг ажиллуулах үед олон тусдаа чип хооронд өгөгдөл солилцох (inter-GPU memory bandwidth) үед саатал үүсдэг явдал юм.

Харин Cerebras нь силикон хавтанг бүхэлд нь нэг процессор болгон хувиргасан Wafer-Scale чип ашигладаг тул:

  • 40GB+ багтаамжтай SRAM санах ой нь тооцоолох цөмүүдийнхээ яг хажууд байрладаг.
  • Санах ойн зурвасын өргөн (memory bandwidth) уламжлалт GPU кластераас хэдэн арав дахин өндөр.
  • Үүний ачаар auto-regressive токен үүсгэлтийн үед memory-bound хязгаарлалт бараг үүсдэггүй тул ийм өндөр tokens-per-second (TPS) гарч байна.

Хэрхэн ашиглах вэ?

OpenAI тус "Ultrafast" горимыг одоогоор хязгаарлагдмал хүрээнд API preview байдлаар сонгогдсон байгууллагуудад олгож эхэлсэн бөгөөд ойрын хугацаанд нийт төлбөртэй API хэрэглэгчдэд үе шаттайгаар нээнэ гэдгээ мэдэгдлээ.

Хэрэглээний хувьд стандарт OpenAI SDK-д ердөө шинэ параметр буюу service_tier: "ultrafast" зааж өгөхөд л хангалттай байхаар төлөвлөгджээ.

import openai

client = openai.OpenAI()

response = client.chat.completions.create(
    model="gpt-5.6-sol",
    service_tier="ultrafast", # Шинэ өндөр хурдны горим
    messages=[
        {"role": "system", "content": "You are a lead systems architect."},
        {"role": "user", "content": "Audit this distributed locking implementation for race conditions..."}
    ]
)
print(response.choices[0].message.content)

AI загваруудын хөгжил зөвхөн "ухаантай болох" биш, харин "агшин зуурт хариулдаг болох" чиглэл рүү эрчимтэй шилжиж буйн тод жишээ энэ болж байна.


Эх сурвалж: Cerebras Official Announcement & OpenAI API Updates

Сэтгэгдэл

Ачаалж байна...