На WAIC 2026 компания SenseTime представила SenseNova U1 Pro — свою новую флагманскую мультимодальную модель для сложных задач визуального т...

На WAIC 2026 компания SenseTime представила SenseNova U1 Pro — свою новую флагманскую мультимодальную модель для сложных задач визуального творчества.
Демонстрация была сосредоточена на сверхшироком восточном городском свитке под названием «Мир встречается через интеллект». Изображение было создано для девятой Всемирной конференции по искусственному интеллекту и сжимало развитие мероприятия с 2018 по 2026 год в единое непрерывное визуальное повествование.
Свиток объединял городские достопримечательности, реки, горы, толпы людей, архитектуру, надписи и насыщенные исторические детали на необычно широком полотне. SenseTime заявила, что изображение было создано непосредственно U1 Pro в нативном высоком разрешении, а не собрано через отдельный ручной дизайнерский конвейер.
Более широкая цель модели важнее, чем одна демонстрация.
SenseNova U1 Pro позиционируется как фундаментальная модель мультимодального агента профессионального уровня. Вместо того чтобы создавать одно изображение сразу после получения запроса, она предназначена для обдумывания компоновки, генерации черновиков, проверки промежуточных результатов, доработки локальных областей и улучшения финальной композиции через более длительный процесс генерации.
Другими словами, SenseTime пытается перевести генерацию изображений ИИ от «создать что-то визуально впечатляющее» к «создать актив, который можно использовать в реальном дизайнерском процессе».

Конференционный свиток использует панорамный формат, более близкий к традиционному китайскому ручному свитку, чем к стандартному плакату или изображению для социальных сетей.
Он связывает девять лет WAIC через один непрерывный пейзаж. Композиция включает:
Создание большого изображения такого типа затруднительно по нескольким причинам.
Во-первых, сверхширокая композиция должна оставаться связной от одного края до другого. Модель может генерировать привлекательные локальные области, теряя при этом глобальную структуру сцены.
Во-вторых, изображение содержит множество мелких объектов и надписей. Ошибки, которые едва заметны в стандартном предпросмотре, становятся очевидными, когда изображение отображается на большой стене.
В-третьих, композиция требует непрерывности. Здания, реки, дороги, горы и текст не должны ощущаться как несвязанные фрагменты, склеенные вместе.
SenseTime заявляет, что U1 Pro поддерживает вывод до разрешения 8K и нестандартные соотношения сторон. Официальная страница продукта представляет это как производственную функцию, предназначенную для материалов высокого разрешения и детальной визуальной доставки.
Онлайн-версия свитка WAIC сжата, поэтому она не сохраняет полного качества исходного демонстрационного актива.
Презентационная статья представила U1 Pro в нескольких
визуальные категории, а не ограничение модели одним фирменным стилем.
Примеры включали:
Этот диапазон важен, потому что коммерческий дизайн — это не единая задача.
Полезная модель должна адаптировать свою композицию, типографику, визуальную иерархию, рендеринг материалов, цветовую систему и информационную плотность под заданный формат.
Один из примеров воссоздал Западный рынок Чанъаня времен династии Тан в композиции 21:9.

Изображение содержит большую толпу, множество магазинов, лошадей, музыкантов, торговцев, детей, фонари и многослойную архитектуру.
Сцены с большими группами — частый сбой для моделей изображений. Повторяющиеся лица, одинаковая одежда, деформированные руки, несоответствие масштаба и скопированные позы делают сцену неестественной.
Пример U1 Pro пытается сохранить визуальную индивидуальность каждого персонажа, сохраняя при этом общую уличную композицию. Теплый свет фонарей, холодные ночные тона, отражения и архитектурная глубина обрабатываются в одной сцене.
Это все еще избранная демонстрация компании, а не независимый тест. Однако она показывает тип плотной композиции, который SenseTime считает ключевым для модели.
В презентационных материалах также был постер к фильму о Шанхае эпохи Республики в жанре триллер/нуар.

Композиция использует дождь, отражения в стекле, туман, уличное освещение и несколько персонажей на разной глубине.
Смысл примера не просто в фотореализме. Модель должна понимать, как визуальные элементы поддерживают повествование:
Другой пример, «Чанъань никогда не спит», использует пять музыкантов, пять инструментов, разные костюмы и золотисто-красную сцену.

Эти образцы показывают, что U1 Pro используется больше как система компоновки и арт-дирекции, а не просто как рендерер по текстовому запросу.
Коммерческая реклама предъявляет к модели другие требования.
Визуализация продукта должна сохранять:
Реклама чая, показанная в исходном материале, сочетает матовую упаковку, золотое тиснение, белый фарфор, дерево, чайные листья и пар.

Несоответствие материалов легко заметить в рекламе. Бумажная коробка, выглядящая как пластик, или керамическая чашка с неправильными отражениями могут сделать весь результат непригодным.
Компания SenseTime представляет U1 Pro как устройство, способное сочетать несколько типов материалов, сохраняя при этом контролируемый визуальный стиль и читаемый китайский текст.
Выставочный постер «Горы и реки входят в картину» сочетает формы туши с трехмерными горами и облаками.

Нижняя часть начинается как расплывающаяся по бумаге тушь. Те же формы постепенно переходят в горы с реалистичным светом и объемом.
Красная лента проходит через пейзаж и ведет взгляд к маленькой человеческой фигурке.
Этот пример демонстрирует несколько дизайнерских возможностей:
Для производственного актива точность текста так же важна, как и визуальное качество. Постер с одной неверной датой или символом нельзя просто оценить как «в основном правильный».
Изображения с большим количеством текста остаются одной из самых сложных областей для систем генерации изображений.
Модель должна решать две задачи одновременно:
Инфографика о фазах Луны, показанная на запуске, содержит заголовок, пояснительные абзацы, подписи, диаграммы и образовательные карточки.

Также требуется физически осмысленно отобразить взаимосвязь Солнца, Земли и Луны.
Визуально отшлифованная инфографика все еще может провалиться, если научная связь неверна. По этой причине образовательная графика с большим количеством текста проверяет не только распознавание символов, похожее на OCR. Она также проверяет организацию информации и логику предметной области.
Другой пример с запуска представляет шесть основных категорий
радиальная компоновка китайского чая.

Композиция объединяет:
Официальная страница продукта SenseNow использует аналогичную информационную графику высокой плотности для демонстрации возможности U1 Pro «точного выражения содержания».
SenseTime описывает U1 Pro как систему для сложных мультимодальных задач сдачи.
Это различие важно.
Традиционный генератор изображений обычно следует этому процессу:
Подсказка → Изображение
Пользователь решает, подходит ли результат. Если нет, пользователь меняет подсказку или применяет другой инструмент редактирования.
U1 Pro представлен как использующий более длительный внутренний процесс создания:
Понять запрос
→ спланировать макет
→ сгенерировать начальную композицию
→ проверить результат
→ исправить локальные области
→ объединить элементы
→ уточнить типографику и детали
→ сдать готовый актив
В официальных и рекламных материалах это называется Агентским циклом генерации.
Модель может использовать несколько визуальных действий, а не полагаться на один непрерывный проход генерации:
Эта конструкция напоминает эволюцию систем кодирования.
Модель завершения кода предсказывает следующие строки. Агентская система кодирования может проверить репозиторий, спланировать изменение, отредактировать файлы, запустить тесты, прочитать ошибки и продолжить до завершения задачи.
Аргумент SenseTime заключается в том, что визуальное создание движется в том же направлении.
Средние визуальные показатели могут скрывать производственный сбой.
Предположим, изображение содержит 100 китайских иероглифов, и 99 верны. Бенчмарк, основанный на средней точности символов, может присвоить высокий балл.
Плакат для клиента — другое дело.
Если неверный символ появляется в названии продукта, дате, адресе, научном утверждении или юридическом уведомлении, актив может потребоваться отклонить.
Это приводит к более строгому определению качества:
Производственное изображение оценивается не по тому, выглядят ли большинство элементов правильно. Оно оценивается по тому, можно ли сдать готовый актив целиком.
По сообщениям, SenseTime собрала внутреннюю оценочную комиссию из 200 студентов художественных школ и профессиональных дизайнеров.
Вопрос был практическим:
Готовы ли вы сдать это изображение клиенту?
В статье-источнике говорится, что модель считалась квалифицированной, когда не менее 60% оцененных результатов были признаны непосредственно пригодными к сдаче. SenseTime сообщила, что U1 Pro и GPT Image 2 были единственными системами в её сравнении, достигшими этого порога.
Компания также сообщила, что U1 Pro особенно хорошо показал себя в:
детали.
Эти результаты получены по внутренней методологии оценки SenseTime. Они могут служить доказательством качества продукта, но их не следует рассматривать как независимо воспроизведённый публичный бенчмарк.
U1 Pro построен на архитектуре SenseTime NEO-unify.
Более ранние модели SenseNova U1 были представлены и опубликованы в открытом доступе в апреле 2026 года. В их исследовательской статье описывается нативный унифицированный подход к мультимодальному пониманию, рассуждению и генерации.
Многие мультимодальные системы собираются из отдельных компонентов:
Такая архитектура может работать хорошо, но разные модули могут изучать несовместимые внутренние пространства.
NEO-unify использует другой подход.
SenseTime утверждает, что эта архитектура устраняет отдельный визуальный кодировщик и VAE из ядра системы, позволяя текстовой и графической информации совместно использовать одно представление и один вычислительный путь на основе трансформера.

Упрощённо:
Системе не нужен отдельный внешний планировщик, чтобы решить, когда один модуль должен остановиться, а другой — начать.
Модель предсказывает, что будет дальше. Она может продолжить текст, переключиться на токены изображений, а затем вернуться к тексту.
SenseTime описывает это как переход от мультимодальной интеграции к нативной мультимодальной унификации.
До U1 Pro SenseTime выпустила два основных варианта SenseNova U1:
| Модель | Базовая структура | Основная роль |
|---|---|---|
| SenseNova-U1-8B-MoT | Плотная основа понимания 8B | Унифицированное понимание, рассуждение и генерация |
| SenseNova-U1-A3B-MoT | Всего 30B, около 3B активная MoE-основа | Более крупная разрежённая унифицированная модель |
Исследовательский проект охватывает:
Позже SenseTime выпустила версии с улучшенной инфографикой. Официальный репозиторий в настоящее время рекомендует Infographic V3 для интегрированного рабочего процесса генерации и редактирования.
Семейство открытых моделей U1 предоставляет публичные доказательства направления унифицированной модели. U1 Pro — это более крупный проприетарный флагман, ориентированный на высокопроизводительную производственную разработку.
Процесс дизайна промышленного уровня обычно включает промежуточные суждения.
Дизайнер может решить:
самое важное.
2. Какая сетка или композиция подходит под формат.
3. Где должна находиться главная тема.
4. Какие цвета должны доминировать.
5. Сколько места занимает заголовок.
6. Какие детали следует упростить.
7. Сбалансирована ли первая версия.
8. Какую область нужно локально исправить.
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Компания SenseTime утверждает, что U1 Pro усваивает аналогичную последовательность с помощью перемежающегося визуально-текстового рассуждения.
Модели не нужно завершать все изображение за один проход. Она может чередовать внутренний анализ и визуальные действия, многократно проверяя текущее состояние.
Процесс обучения, описанный в публичных интервью, состоит из двух основных этапов.
Сначала команда структурирует профессиональные дизайнерские решения в примеры для рассуждения.
Эти примеры обучают таким принципам последовательности, как:
Затем модель получает обратную связь по множеству параметров, включая:
Система вознаграждений призвана помочь модели узнать, какое действие должно быть следующим во время длительной задачи визуального творения.
В этом заключается ключевое различие между «сгенерировать один раз» и «создать через цикл».
Высокое разрешение создает прямую вычислительную проблему.
Когда изображение представлено в виде визуальных токенов, увеличение разрешения ведет к увеличению количества токенов. Стандартное внимание трансформера становится дороже по мере роста последовательности.
Если количество токенов удваивается, базовые вычисления полного внимания могут увеличиться примерно в четыре раза.
Поэтому изображение 8K может создать контекст и вычислительную нагрузку, значительно превышающую стандартный вывод 1K или 2K.
В публичных интервью с командой SenseTime описываются два метода, используемых в U1 Pro.
Многие модели изображений используют патчи размером 16×16.
U1 Pro, по имеющимся данным, использует патчи 32×32 для генерации высокого разрешения. Каждый токен охватывает большую область изображения, уменьшая количество визуальных токенов примерно до четверти от количества патчей 16×16 при том же разрешении.
Это делает длинные выходные данные высокого разрешения более управляемыми.
Более крупные патчи создают другую проблему: каждый токен должен представлять больше пикселей, что может снизить контроль над мелким текстом, текстурой и тонкими краями.
Компания SenseTime утверждает, что компенсирует это адаптивным иерархическим контролем шума.
Области, требующие большей детализации, получают более целенаправленные усилия по генерации, что помогает модели восстановить контроль над типографикой и текстурой без возврата к исходному количеству токенов.
Результат, по словам компании, — поддержка нативного вывода до 8K и специальных соотношений сторон без неконтролируемого роста последовательности визуальных токенов.
Эти детали взяты из статьи о запуске и публичных интервью, а не из полной документации U1
Профессиональный отчет. Полная архитектура производственной модели, количество параметров, обучающие данные и требования к выводу еще не были раскрыты публично.
Конкуренция в области генерации изображений традиционно концентрируется на нескольких этапах.
Ранние системы с трудом генерировали узнаваемые объекты и связные сцены.
Последующие улучшения системы затронули освещение, текстуры, структуру, рендеринг материалов и детализацию съёмки.
Доступные изображения должны быть не только реалистичными.
Оно может потребовать:
Компания SenseTime называет этот переход от визуальной генерации к генерации на основе рассуждений и агентному творчеству.
Суть его аргументации не в том, что какая-то одна модель уже решила все проблемы дизайна, а в том, что критерии оценки меняются.
Красивое изображение все еще может быть некачественным результатом.
Исходная статья сравнивает U1 Pro с GPT Image 2 в создании плакатов с рецептами.
Статья утверждает, что композиция U1 Pro более лаконична, иерархия более прямая, а рендеринг китайского текста более качественный, в то время как результаты GPT описываются как более перегруженные, с псевдосимволами в мелких декоративных шрифтах.
С этим сравнением следует обращаться осторожно.
Одного подсказывающего слова и выбранной пары вывода недостаточно для установления всестороннего превосходства модели. Изображения систем дают разные результаты при различных случайных сидах, настройках, версиях подсказок и процессах редактирования.
Полезное сравнение должно проверять:
Hodnocení interních designérů společnosti SenseTime je smysluplnější než jednorázově vybrané srovnání, avšak i toto hodnocení provádí sama společnost.
Самый сильный вывод, подтвержденный имеющимися доказательствами, заключается в том, что U1 Pro чрезвычайно конкурентоспособен в китайской типографике, дизайне плотной информации, восточных визуальных деталях и нативной композиции с высоким разрешением.
SenseNova U1 Pro официально выпущен, и SenseTime также опубликовала официальную страницу демонстрации продукта.
Однако он ещё не полностью открыт для общего доступа в качестве законченного публичного API-продукта.
Официальное объявление в социальных сетях компании SenseTime Technology гласит:
По состоянию на 22 июля 2026 года на открытой странице продукта представлены возможности модели, но не указаны полные цены на API, ограничения по пропускной способности или руководство по самостоятельному развертыванию.
Не следует путать U1 Pro с открытой моделью SenseNova U1.
| Продукт | Доступность |
|---|---|
| Базовая модель SenseNova U1 | Открытые веса, код и статья уже доступны |
| SenseNova U1 Infographic V2/V3 | Открытое расширение |
| инфографические модели доступны |
| SenseNova U1 Pro | Предварительный просмотр только по приглашениям; официальный API и цены запланированы на август 2026 года |
| SenseNova-Vision | Доступны открытая унифицированная модель компьютерного зрения и исследовательские материалы |
Разработчики, желающие немедленно приступить к экспериментам, могут начать с публичного репозитория SenseNova U1 и релизов на Hugging Face.
Ряд важных деталей U1 Pro остаётся недоступным для публики:
Текущие доказательства в основном состоят из демонстраций компании, официальной галереи продуктов, внутренних оценок, публичных интервью и технической основы, заложенной открытым семейством U1.
Командам, рассматривающим использование в производстве, следует дождаться документации API и провести собственную оценку.
Когда публичный доступ станет возможным, практическая оценка должна использовать реальные результаты, а не только художественные промпты.
Включите:
Используйте известный текст и проверяйте каждый символ.
Измеряйте:
Модель, которая выдаёт одно отличное изображение и девять непригодных, может быть менее ценной, чем чуть более слабая модель со стабильным результатом.
Отслеживайте процент успешных результатов, а не только лучший образец.
Попросите модель изменить один элемент, сохранив всё остальное.
Примеры:
Не оценивайте актив в 8K только по уменьшенному предпросмотру в браузере.
Увеличьте:
Включите:
Самая дешёвая генерация — не обязательно самый дешёвый результат.
Сейчас U1 Pro сосредоточен на визуальном творчестве, но SenseTime представляет NEO-unify как более широкую основу.
Дорожная карта компании включает:
Промышленный дизайн.
Компания SenseTime уже выпустила SenseNova-Vision, которая реализует традиционные задачи компьютерного зрения через единую мультимодальную структуру генерации.
Модель охватывает такие задачи, как:
Вместо добавления отдельной прогнозирующей головки для каждой задачи SenseNova-Vision генерирует текст, изображения или смешанные выходные данные в зависимости от запрошенной визуальной задачи.
Это поддерживает более широкое направление SenseTime «От слов к мирам»: язык и зрение не должны оставаться отдельными системами, соединенными через адаптеры. Они должны развиваться внутри одной модели, способной понимать, генерировать и в конечном итоге действовать.
Сообщение о запуске можно свести к одному практическому утверждению:
«Выглядит хорошо» не должно быть окончательным стандартом для визуального контента, созданного ИИ. «Может быть использовано» должно быть стандартом.
U1 Pro пытается достичь этого стандарта через пять взаимосвязанных идей:
Будет ли модель последовательно достигать этой планки, станет яснее после более широкого доступа к API, независимого тестирования и реальных рабочих процессов клиентов.
Тем не менее, запуск знаменует собой важное изменение в том, как позиционируются модели изображений.
Они больше не представляются только как генераторы изображений.
Они представляются как агенты визуального производства.
SenseNova U1 Pro — это флагманская нативная мультимодальная модель SenseTime для сложных задач визуального творчества. Она объединяет понимание, генерацию и действие и предназначена для создания визуальных активов с более высоким разрешением, богатым текстом и более готовых к передаче.
На официальной странице продукта SenseTime указано, что U1 Pro поддерживает вывод до 8K и специальные соотношения сторон. Фактические параметры разрешения, задержка, форматы файлов и ограничения API следует уточнить, когда станет доступна публичная документация API.
Публичные веса U1 Pro не были выпущены. Более ранние базовая модель SenseNova U1 и модели для инфографики являются открытыми, в то время как U1 Pro в настоящее время является проприетарной флагманской моделью, доступной через предварительный просмотр только по приглашениям.
В официальном объявлении SenseTime говорится, что API и цены запланированы на август 2026 года. По состоянию на 22 июля публичная страница продукта активна, но полный доступ к публичному API и цены еще не опубликованы.
NEO-unify — это нативная мультимодальная архитектура SenseTime для унифицированного понимания и генерации. Она устраняет традиционное разделение между визуальным кодировщиком, языковой моделью и VAE изображений, чтобы токены текста и изображения могли обрабатываться в одной системе на основе Transformer.
Это многошаговый процесс творчества, в котором модель планирует, генерирует, проверяет,
редактирует, перекрашивает, компонует и дорабатывает изображение перед сдачей. Модель предназначена для выбора следующего визуального действия на основе текущего промежуточного результата.
SenseTime сообщает, что U1 Pro был конкурентоспособен с GPT Image 2 во внутренней оценке и показал высокие результаты в работе с китайским текстом, качестве дизайна и деталях восточной культуры. Независимое широкое тестирование всё ещё необходимо, и производительность будет варьироваться в зависимости от промпта, рабочего процесса и метода оценки.
Да. SenseTime выпустила исследовательскую статью SenseNova U1, репозиторий GitHub, веса на Hugging Face и модели для улучшения инфографики. Они не идентичны U1 Pro, но предоставляют доступ к базовому направлению унифицированной модели.
SenseNova U1 Pro — это попытка SenseTime перевести генерацию изображений в более требовательную категорию: производственную сдачу. Она объединяет нативную мультимодальную унификацию, перемежающиеся визуально-текстовые рассуждения, агентный цикл создания, плотный рендеринг китайского текста и вывод до 8K.
Примеры свитка и запуска WAIC
демонстрируют нестандартно сложные макеты, крупные группы, китайскую типографику, научную инфографику, продуктовую рекламу и восточные визуальные стили. Это избранные примеры компании, а сообщаемое сравнение с GPT Image 2 основано на собственной оценке SenseTime, а не на полностью независимом публичном бенчмарке.
U1 Pro в настоящее время доступен в режиме предварительного просмотра по приглашениям, публичный доступ к API и цены запланированы на август 2026 года. Разработчики уже могут изучать открытые модели SenseNova U1 и инфографики, однако эти релизы не являются версией Pro.
Ключевой сдвиг заключается в переходе от вопроса "может ли ИИ создать красивое изображение?" к вопросу "может ли он надежно предоставить готовый визуальный актив?".
Начните с одной фразы и получите полноценный сайт за считанные минуты.