Пока другие ИИ рисуют красивых котиков, этот верстает целые учебники.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/676;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">Команда Alibaba представила Qwen-Image-3.0 — третье поколение базовой модели для генерации и редактирования изображений . Разработчики сделали упор не столько на зрелищные иллюстрации, сколько на материалы, которые можно использовать в работе: сложные инфографики, учебные схемы, газетные полосы, раскадровки, интерфейсы и документы с большим количеством мелкого текста.
Одним из главных изменений стала поддержка инструкций длиной до 4500 токенов. Предыдущая версия принимала около 1000, поэтому теперь пользователь может подробно описать композицию, расположение объектов, подписи, формулы и оформление каждого фрагмента на одном холсте.
В демонстрации Alibaba модель за один проход создала сетку из девяти самостоятельных блоков. В неё вошли комикс о безопасности в тоннеле, уроки по геометрии и физике, медицинская схема, материалы по биологии и теории групп, банковская инфографика и сравнение структуры ДНК. Для описания всей композиции потребовалась инструкция объёмом примерно 3700 токенов.
Qwen-Image-3.0 должна не только размещать множество параллельных элементов, но и сохранять вложенную структуру сцены. В другом примере система последовательно изобразила интерфейс Visual Studio Code, открытый внутри него Qwen Chat, затем окно WeChat и размещённый ещё глубже рекламный плакат. Каждая область получила собственное оформление и не смешалась с соседними слоями.
Вторая группа улучшений касается мелких деталей. По заявлению разработчиков, новинка способна воспроизводить разборчивые символы размером около десяти пикселей, включая формулы LaTeX, индексы, греческие буквы, номера теорем и многострочные выкладки. В опубликованных примерах система формирует страницу научной статьи, газетную полосу и информационный плакат с большим количеством подписей.
Alibaba также показывает более точную передачу фактур. На портретах нейросеть прорисовывает отдельные волоски, поры и неровности кожи, а при восстановлении повреждённых картин дорисовывает утраченные участки, стараясь сохранить исходные мазки, градиенты туши и общую композицию. Отдельный режим позволяет добавлять на отсканированные страницы рукописные пометки, подчёркивания, стрелки и короткие комментарии.
Модель поддерживает текст на 12 языках, более 20 шрифтов и свыше 100 художественных направлений. Среди представленных образцов встречаются изображения с китайскими, английскими, японскими, корейскими и испанскими надписями. Кроме того, система умеет воспроизводить интерфейсы сайтов, приложений, игр и трансляций, опираясь на знания о привычной структуре подобных экранов.
Отдельно разработчики заявили о подключении к интернету для получения актуальных сведений. При запросе прогноза погоды для определённого города и даты Qwen-Image-3.0 может сначала найти необходимые данные, а затем оформить их в виде готовой карточки. Такая схема должна снизить вероятность появления вымышленных температур и других быстро меняющихся показателей, хотя точность результата всё равно зависит от найденного источника и правильной интерпретации информации.
Возможности также распространяются на редактирование исходных изображений. В одном из примеров модель превратила фотографию насекомого в научную иллюстрацию, добавив классификацию, подписи к частям тела, увеличенные фрагменты и масштабную линейку. Подобные материалы разработчики предлагают использовать в образовании, научных публикациях, дизайне, электронной коммерции и производстве контента.
При этом оценить реальные возможности Qwen-Image-3.0 пока сложно. Alibaba не опубликовала технический отчёт, результаты независимых испытаний, карточку модели, число параметров и лицензию. В официальной коллекции Qwen на Hugging Face доступны открытые версии предыдущего поколения , включая двадцатимиллиардную Qwen-Image-2512, однако файлов Qwen-Image-3.0 для локального запуска там пока нет.
Поэтому заявления о безошибочном воспроизведении мелких формул, плотных газетных полос и сложных композиций пока основаны на примерах, отобранных самой компанией. Генераторы изображений нередко показывают убедительные результаты на демонстрационных запросах, но допускают пропуски, искажения символов и нарушения структуры при систематическом тестировании.
Попробовать модель можно через Qwen Studio в браузере и официальных мобильных приложениях. Она также появилась в документации платформы Alibaba Cloud Model Studio под идентификатором <code>qwen-image-3.0-pro</code>. Облачная версия поддерживает генерацию и редактирование, выдаёт до шести вариантов за один запрос и работает с разрешением до 2048 × 2048 пикселей, однако доступ к ней пока предоставляется в режиме закрытого тестирования.
Публичной цены для Qwen-Image-3.0 и свободно загружаемых весов на момент публикации нет. Так что новый релиз пока остаётся облачным сервисом, возможности которого пользователи смогут полноценно проверить лишь после расширения доступа, появления документации и независимых сравнений с другими генераторами.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/676;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">Команда Alibaba представила Qwen-Image-3.0 — третье поколение базовой модели для генерации и редактирования изображений . Разработчики сделали упор не столько на зрелищные иллюстрации, сколько на материалы, которые можно использовать в работе: сложные инфографики, учебные схемы, газетные полосы, раскадровки, интерфейсы и документы с большим количеством мелкого текста.
Одним из главных изменений стала поддержка инструкций длиной до 4500 токенов. Предыдущая версия принимала около 1000, поэтому теперь пользователь может подробно описать композицию, расположение объектов, подписи, формулы и оформление каждого фрагмента на одном холсте.
В демонстрации Alibaba модель за один проход создала сетку из девяти самостоятельных блоков. В неё вошли комикс о безопасности в тоннеле, уроки по геометрии и физике, медицинская схема, материалы по биологии и теории групп, банковская инфографика и сравнение структуры ДНК. Для описания всей композиции потребовалась инструкция объёмом примерно 3700 токенов.
Qwen-Image-3.0 должна не только размещать множество параллельных элементов, но и сохранять вложенную структуру сцены. В другом примере система последовательно изобразила интерфейс Visual Studio Code, открытый внутри него Qwen Chat, затем окно WeChat и размещённый ещё глубже рекламный плакат. Каждая область получила собственное оформление и не смешалась с соседними слоями.
Вторая группа улучшений касается мелких деталей. По заявлению разработчиков, новинка способна воспроизводить разборчивые символы размером около десяти пикселей, включая формулы LaTeX, индексы, греческие буквы, номера теорем и многострочные выкладки. В опубликованных примерах система формирует страницу научной статьи, газетную полосу и информационный плакат с большим количеством подписей.
Alibaba также показывает более точную передачу фактур. На портретах нейросеть прорисовывает отдельные волоски, поры и неровности кожи, а при восстановлении повреждённых картин дорисовывает утраченные участки, стараясь сохранить исходные мазки, градиенты туши и общую композицию. Отдельный режим позволяет добавлять на отсканированные страницы рукописные пометки, подчёркивания, стрелки и короткие комментарии.
Модель поддерживает текст на 12 языках, более 20 шрифтов и свыше 100 художественных направлений. Среди представленных образцов встречаются изображения с китайскими, английскими, японскими, корейскими и испанскими надписями. Кроме того, система умеет воспроизводить интерфейсы сайтов, приложений, игр и трансляций, опираясь на знания о привычной структуре подобных экранов.
Отдельно разработчики заявили о подключении к интернету для получения актуальных сведений. При запросе прогноза погоды для определённого города и даты Qwen-Image-3.0 может сначала найти необходимые данные, а затем оформить их в виде готовой карточки. Такая схема должна снизить вероятность появления вымышленных температур и других быстро меняющихся показателей, хотя точность результата всё равно зависит от найденного источника и правильной интерпретации информации.
Возможности также распространяются на редактирование исходных изображений. В одном из примеров модель превратила фотографию насекомого в научную иллюстрацию, добавив классификацию, подписи к частям тела, увеличенные фрагменты и масштабную линейку. Подобные материалы разработчики предлагают использовать в образовании, научных публикациях, дизайне, электронной коммерции и производстве контента.
При этом оценить реальные возможности Qwen-Image-3.0 пока сложно. Alibaba не опубликовала технический отчёт, результаты независимых испытаний, карточку модели, число параметров и лицензию. В официальной коллекции Qwen на Hugging Face доступны открытые версии предыдущего поколения , включая двадцатимиллиардную Qwen-Image-2512, однако файлов Qwen-Image-3.0 для локального запуска там пока нет.
Поэтому заявления о безошибочном воспроизведении мелких формул, плотных газетных полос и сложных композиций пока основаны на примерах, отобранных самой компанией. Генераторы изображений нередко показывают убедительные результаты на демонстрационных запросах, но допускают пропуски, искажения символов и нарушения структуры при систематическом тестировании.
Попробовать модель можно через Qwen Studio в браузере и официальных мобильных приложениях. Она также появилась в документации платформы Alibaba Cloud Model Studio под идентификатором <code>qwen-image-3.0-pro</code>. Облачная версия поддерживает генерацию и редактирование, выдаёт до шести вариантов за один запрос и работает с разрешением до 2048 × 2048 пикселей, однако доступ к ней пока предоставляется в режиме закрытого тестирования.
Публичной цены для Qwen-Image-3.0 и свободно загружаемых весов на момент публикации нет. Так что новый релиз пока остаётся облачным сервисом, возможности которого пользователи смогут полноценно проверить лишь после расширения доступа, появления документации и независимых сравнений с другими генераторами.
- Источник новости
- www.securitylab.ru