The Decoder→ оригинал

Qwen-Image-3.0 от Alibaba: читаемый текст в 10 пикселей и инфографика за один проход

Команда Qwen (Alibaba) представила Qwen-Image-3.0 — генератор изображений, который разборчиво рендерит текст размером от 10 пикселей, принимает промпты до 4500 токенов и поддерживает 12 языков. За один проход модель собирает инфографику, LaTeX-статьи и газетные полосы — правда, на выходе плоская картинка, а не редактируемый макет.

AI-обработка оригинала The Decoder; редакция Hamidun News
Qwen-Image-3.0 от Alibaba: читаемый текст в 10 пикселей и инфографика за один проход
Источник: The Decoder. Коллаж: Hamidun News.
◐ Слушать статью

Команда Qwen (Alibaba) в июле 2026 года представила Qwen-Image-3.0 — генератор изображений, который принимает промпты длиной до 4500 токенов, рендерит читаемый текст размером от 10 пикселей и нативно поддерживает 12 языков.

Что умеет Qwen-Image-3.0

Qwen-Image-3.0 генерирует сложные макеты за один проход: инфографику, страницы в стиле научных LaTeX-статей и целые газетные полосы. Главное отличие от прошлых генераторов — читаемость мелкого шрифта: модель выводит разборчивые надписи высотой всего 10 пикселей, тогда как большинство диффузионных моделей превращают такой текст в нечитаемую кашу.

Ключевые характеристики от команды Qwen:

  • Длина промпта — до 4500 токенов
  • Минимальный читаемый текст — от 10 пикселей
  • Нативная поддержка 12 языков
  • За один проход — инфографика, LaTeX-статьи, газетные полосы

В чём подвох сложных макетов

Практическая ценность таких макетов остаётся под вопросом. Qwen-Image-3.0 выдаёт готовую картинку, а не редактируемый документ: сгенерированную инфографику или газетную полосу нельзя открыть и поправить — только перерисовать новым промптом. Для реальных задач вёрстки, где текст правят десятки раз, это ограничение важнее, чем сам факт читаемости 10-пиксельного шрифта.

«Практическая ценность таких макетов под вопросом, когда на выходе — пиксельное изображение, а не редактируемый формат», — отмечает издание

The Decoder.

Поддержка 4500-токенных промптов при этом реально расширяет контроль: в одном запросе можно описать структуру страницы, тексты блоков и стиль сразу, не разбивая задачу на несколько шагов.

Как это выглядит на фоне рынка

Qwen-Image-3.0 продолжает линию открытых моделей Alibaba, которые конкурируют с закрытыми генераторами вроде Google Nano Banana и решений OpenAI. Ставка на текст внутри картинки и многоязычность на 12 языках — прямой ответ на слабое место большинства image-моделей: до сих пор надписи на сгенерированных изображениях приходилось править вручную или вставлять поверх в редакторе.

Что это значит

Генераторы изображений подбираются к нише, где раньше работали только дизайнеры и вёрстка: плакаты, инфографика, обложки с плотным текстом. Пока выход остаётся «плоской» картинкой без слоёв, Qwen-Image-3.0 — скорее инструмент для черновиков и превью, чем замена редактируемому макету, но планку читаемости мелкого текста модель поднимает заметно.

Частые вопросы

Что умеет Qwen-Image-3.0 из коробки?

Модель за один проход генерирует инфографику, страницы в стиле LaTeX-статей и газетные полосы, принимает промпты до 4500 токенов и рендерит читаемый текст от 10 пикселей на 12 языках.

Почему генерацию сложных макетов критикуют?

Потому что результат — пиксельное изображение, а не редактируемый файл. Готовую инфографику или газетную страницу нельзя отредактировать как документ, только перегенерировать целиком новым промптом.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…