roko.fans суббота, 10 октября 2026
Главное за день и комментарии — в Telegram-канале @rokofanclub.

Qwen выпустила Qwen-Image-2.1-Turbo, которой для генерации изображения хватает 8 шагов вместо 40

Базовой модели Qwen-Image-2.1 по умолчанию нужно 40 шагов шумоподавления, чтобы получить изображение. Новой версии Turbo хватает восьми, то есть в пять раз меньше, пишет MarkTechPost.[1]

Qwen-Image-2.1-Turbo, по описанию в карточке модели на Hugging Face, — ускоренный чекпойнт Qwen-Image-2.1. Он умеет создавать изображения по тексту и редактировать их. Архитектура у него та же, что у базовой модели, на 7 млрд параметров, и загружается он напрямую через QwenImage21Pipeline в библиотеке Diffusers.[2][3]

MarkTechPost описывает устройство модели подробнее. В основе лежит single-stream DiT из 32 слоёв с block-causal attention. Инструкции и условные изображения кодирует Qwen3-VL 8B. VAE представляет собой 64-канальный RGBA-автоэнкодер с 16-кратным пространственным сжатием, и благодаря ему модель нативно работает с прозрачностью. Шаги шумоподавления задаёт планировщик Flow Matching с дискретным Euler и динамическим сдвигом.[4][5][6][7]

Чекпойнт, как сказано в карточке, включает рекомендованное расписание сэмплинга. Генерация по умолчанию идёт с CFG=1. Механизм prefix KV caching переиспользует контекст текста и референсного изображения между шагами шумоподавления.[8]

Если задать только параметр num_inference_steps, сохранённое расписание не изменится. Заменить его можно явным аргументом sigmas при вызове, но, как предупреждает Qwen, другие расписания для этого чекпойнта не оценивались. Нужна версия Diffusers, где появились настраиваемые в пайплайне sigmas (PR #14950), и transformers не ниже 5.17.0.[9][10]

Пресеты разрешений Turbo взяла у Qwen-Image-2.1: от 2048×2048 для квадрата до 2752×1536 для формата 16:9 и 1536×2752 для 9:16. По данным MarkTechPost, базовая модель принимает до 10 референсных изображений и вносит локальные правки по кругам, нарисованным пометкам или маскам. Витрина примеров Turbo охватывает 8 категорий, среди них портреты, позы людей, прозрачные изображения, типографика и постеры, макеты интерфейсов.[11][12][13]

Модель можно взять и через облако. В Alibaba Cloud Model Studio qwen-image-2.1-turbo в большинстве регионов стоит 0,1 юаня за изображение при лимите 120 запросов в минуту. Версия qwen-image-2.1-pro обходится в 0,25 юаня за изображение, и лимит у неё 20 запросов в минуту, сообщает MarkTechPost.[14]

У самостоятельного хостинга есть ограничения. Веса вышли под исследовательской лицензией Qwen Research License, и для коммерческого использования на своих серверах нужно отдельное разрешение. Минимальных требований к видеопамяти для Turbo Qwen не публикует. Unsloth оценивает базовую модель в 11 ГБ VRAM с GGUF и 24 ГБ с INT8/FP8.[15][16]

Базовая Qwen-Image-2.1 набирает на Qwen-Image-Bench 60,28 балла, и это лучший результат среди моделей с открытыми весами, о котором сообщает Qwen. Отдельного бенчмарка для Turbo, по словам MarkTechPost, пока нет.[17][18]

Объекты:

Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.

  1. 1 MarkTechPost — Alibaba Qwen Releases Qwen-Image-2.1-Turbo, an 8-Step 7B Image Model ↗ вчера, 23:33 · сноски 1, 4, 5, 6, 7, 12, 13, 14, 15, 16, 17, 18
  2. 2 Hugging Face Blog — Qwen/Qwen-Image-2.1-Turbo · Hugging Face ↗ вчера, 23:46 · сноски 2, 3, 8, 9, 10, 11

Запись полезная?

Войдите, чтобы ответить

Главное за день и комментарии — в Telegram-канале @rokofanclub.
FT предупреждает, что нечёткие данные о выручке могут завысить оценку компаний при выходе на биржу