Мэдээ

Зураг үүсгэлт ба засварыг 7B-д нэгтгэв: Alibaba тунгалаг дэвсгэртэй "Qwen-Image-2.1"-ийг нээлттэй болголоо

TOGTOKHTOGTOKH·2026 оны есдүгээр сарын 21·1 үзсэн·
Зураг үүсгэлт ба засварыг 7B-д нэгтгэв: Alibaba тунгалаг дэвсгэртэй "Qwen-Image-2.1"-ийг нээлттэй болголоо

Visual AI болон generative загваруудын салбарт хамгийн том толгойны өвчин бол "зураг үүсгэх" (text-to-image) болон түүнийг дараа нь "нарийн засварлах" (image editing) процессыг тусдаа модель, ялгаатай pipeline-аар шийддэг явдал байв. Үүн дээр нэмээд вэб, аппликейшн, UI ассет, стикер хийхэд зориулж арын дэвсгэрийг нь таслахын тулд rembg зэрэг matting загваруудыг тусад нь залгаж, ирмэг бүрэлзэх алдаатай тулгардаг байсан билээ.

Эдгээр бүх асуудлыг нэгэн зэрэг шийдэхээр зорьсон шинэ үеийн нээлттэй эх бүхий загвар болох Qwen-Image-2.1-ийг Alibaba-ийн Qwen баг албан ёсоор танилцууллаа. Өмнөх 20B параметртэй нүсэр бүтцийг хаяж, ердөө 7B параметртэй visual generation суурьтай болсон хэрнээ гүйцэтгэл, нарийвчлал болон хурдаараа хаалттай томоохон системүүдтэй өрсөлдөхүйц түвшинд хүрсэн нь хөгжүүлэгчдийн анхаарлыг татаж байна.


7B Single-Stream DiT ба Mixed-Granularity Attention

Qwen-Image-2.1 загварын цөмд 32 давхарга бүхий Single-Stream Diffusion Transformer (DiT) бүтэц ажиллаж байна. Текст болон нөхцөлт зургийн өгөгдлийг кодлоход Qwen3-VL (8B) загварыг ашигладаг. Өмнөх загварууд олон зураг дээр зэрэг ажиллах үед санах ой дүүрч, хэт удааширдаг байсан бол инженерүүд архитектурт хоёр чухал шинэчлэл хийжээ:

  1. Mixed-Granularity Attention: Промпт болон засварлах зааврын текстүүдийг token-level causal mask-аар нарийн тооцоолж, утгын уялдаа холбоог чанд хадгалдаг. Харин үүсгэгдэж буй зургийн токенуудыг chunk-level mask-аар параллель байдлаар боловсруулдаг байна.
  2. Prefix KV Cache Reuse: Image editing хийх үед хамгийн их цаг авдаг зүйл бол denoising алхам бүрд лавлах зураг болон системийн зааврыг дахин тооцоолох явдал байдаг. Qwen-Image-2.1 нь эдгээр тогтмол контекстийг эхний алхамд нэг л удаа тооцоолж, KV Cache болгон хадгалдаг. Үүний үр дүнд 2K нягтралтай, олон зурагтай засвар хийх нийт хугацаа 79.5 секундээс 1.59 секунд болж эрс буурсан нь үйлдвэрлэлийн түвшний (production) API боловсруулахад хувьсгалт дэвшил болж байна.

Native RGBA Transparency: Арын дэвсгэр таслах matting-ийн эрин үе дуусав

Энэ загварын хамгийн онцлох давуу тал бол жинхэнэ тунгалаг (RGBA) сувагтай зураг шууд үүсгэх чадвар юм.

Өмнө нь ямар нэгэн тунгалаг ассет үүсгэхийн тулд зургийг ногоон эсвэл цагаан дэвсгэр дээр генерэйт хийж, дараа нь сегментчлэлийн загвараар салгадаг байсан нь бүтээгдэхүүний ирмэг, үс, шил зэрэг нарийн хэсгүүдийг эвдэх гол шалтгаан болдог байв. Харин Qwen-Image-2.1 нь 16x spatial compression бүхий 64-сувагт RGBA autoencoder-ийг өөртөө нэгтгэсэн.

Хөгжүүлэгч системд:

This is an RGBA image with transparency. A high-tech glowing drone badge, metallic finish.

хэмээн заахад л файл нь өөрөө шууд 4 сувагт альфа (alpha channel) масктайгаа гарч ирнэ. Цаашлаад бодит гэрэл зураг өгөөд гол дүрсийг нь ялган авч тунгалаг давхарга (layer) болгох, эсвэл альфа суваг дээрх текстийг дэвсгэрийг нь хөндөхгүйгээр өөрчлөн засварлах бүрэн боломжтой.


10 хүртэлх Reference зураг болон нарийвчилсан локал засвар

Тус загвар нь олон зургийн контекстийг маш өндөр түвшинд хадгалдаг болсон.

  • 10 Reference Image: Нэгэн зэрэг 10 хүртэлх туслах зураг хүлээн авч, тухайлбал олон хүний гэрэл зургийг нийлүүлж нэг хамт олны зураг үүсгэх, эсвэл загвар өмсөгчийн зураг дээр тодорхой хувцас, гутал, цүнхийг нарийн нийцүүлэн өмсгөх (virtual try-on) боломжтой.
  • Уян хатан масклалт: Зургийн аль хэсгийг өөрчлөхөө тойрог зурж заах, багсаар будах, эсвэл тусдаа маск файл өгөх зэргээр чөлөөтэй тодорхойлж болно. Гол дүр болон бүтээгдэхүүний онцлог (facial identity, logo) өөрчлөгдөхгүй хадгалагдана.
  • Prompt Rewriting туслахууд: Аливаа зураг засварлах үед хэрэглэгчийн товч зааврыг загварт ойлгомжтой, бүтцийн дагуу дэлгэрүүлж өгдөг Qwen-Image-2.1-PE-I2I болон PE-T2I (Qwen3.5-VL 9B дээр нарийн тааруулсан) загваруудыг хамтад нь гаргасан.

Day-0 дэмжлэг: Өнөөдрөөс шууд хэрэглэх боломж

Хөгжүүлэгчийн экосистемийн бэлэн байдал тун өндөр байна:

  • Diffusers: Hugging Face-ийн diffusers сангаас QwenImage21Pipeline классыг ашиглан ердөө 4-5 мөр Python кодоор дуудах боломжтой.
  • ComfyUI: Comfy-Org-оос албан ёсны native node болон Text-to-Image, Image Editing-д зориулсан ажлын урсгалууд (workflows)-ыг шууд нийтэлсэн.
  • Inference Runtimes: vLLM-Omni болон SGLang сангууд эхний өдрөөсөө эхлэн prefix caching, FP8 квантчлал, TP (Tensor Parallelism) дэмжлэгийг баталгаажуулжээ.
  • GGUF хувилбарууд: 7.2GB (Q8_0)-ээс 4.6GB (Q5_K_M) хүртэлх шахсан жингүүд бэлэн болсон тул хэрэглэгчийн түвшний ердийн 8GB–12GB VRAM-тай график карт дээр ч орон нутагтаа (locally) төвөггүй ажиллана.

Qwen-Image-2.1 нь generative visual системийг хөгжүүлэгчдэд олон тусдаа модель (T2I, I2I, Background Matting) холбож зовохгүйгээр, ганцхан 7B загварын хүрээнд бүх төрлийн дизайн, контент генераторыг хямд зардлаар байгуулах бодит боломжийг олгож байна.


Эх сурвалж:

Сэтгэгдэл

Ачаалж байна...