Na WAIC 2026, a SenseTime apresentou o SenseNova U1 Pro , seu mais novo modelo multimodal para tarefas complexas de criação visual.

Na WAIC 2026, a SenseTime apresentou o SenseNova U1 Pro, seu mais novo modelo multimodal para tarefas complexas de criação visual.
A demonstração de lançamento centrou-se em um pergaminho urbano de estilo oriental ultra-amplo intitulado O Mundo se Encontra Através da Inteligência. A imagem foi criada para a nona Conferência Mundial de Inteligência Artificial e comprimiu o desenvolvimento do evento de 2018 a 2026 em uma única narrativa visual contínua.
O pergaminho combinava marcos urbanos, rios, montanhas, multidões, arquitetura, rótulos e detalhes históricos densos em uma tela excepcionalmente ampla. A SenseTime afirmou que a imagem foi produzida diretamente pelo U1 Pro em alta resolução nativa, em vez de ser montada por meio de um pipeline de design manual separado.
O objetivo mais amplo do modelo é mais importante do que a demonstração isolada.
O SenseNova U1 Pro é posicionado como um modelo de fundação de agente multimodal nativo com nível de entrega. Em vez de produzir uma imagem imediatamente após receber um prompt, ele é projetado para raciocinar sobre o layout, gerar rascunhos, inspecionar resultados intermediários, revisar áreas locais e refinar a composição final por meio de um processo de geração mais longo.
Em outras palavras, a SenseTime está tentando mover a geração de imagens por IA de "criar algo visualmente impressionante" para "produzir um ativo que possa ser usado em um fluxo de trabalho de design real".

O pergaminho da conferência usa um formato panorâmico mais próximo de um pergaminho manual chinês tradicional do que de um pôster padrão ou imagem de mídia social.
Ele conecta nove anos da WAIC por meio de uma paisagem contínua. A composição inclui:
Criar uma imagem grande desse tipo é difícil por vários motivos.
Primeiro, uma composição ultra-ampla deve permanecer coerente de um lado ao outro. Um modelo pode gerar regiões locais atraentes enquanto perde a estrutura global da cena.
Segundo, a imagem contém muitos objetos e rótulos pequenos. Erros que são quase invisíveis em uma prévia padrão tornam-se óbvios quando a imagem é exibida em uma parede grande.
Terceiro, a composição precisa de continuidade. Prédios, rios, estradas, montanhas e texto não podem parecer fragmentos não relacionados colados juntos.
A SenseTime afirma que o U1 Pro suporta saída de até resolução 8K e proporções de aspecto incomuns. A página oficial do produto apresenta isso como um recurso de produção destinado a materiais de alta resolução e entrega visual detalhada.
A versão online do pergaminho da WAIC é comprimida, portanto não preserva a qualidade total do ativo de exibição original.
O artigo de lançamento apresentou o U1 Pro em várias
categorias visuais, em vez de limitar o modelo a um único estilo característico.
Os exemplos incluídos:
Essa variedade é importante porque o design comercial não é uma tarefa única.
Um modelo útil precisa adaptar sua composição, tipografia, hierarquia visual, renderização de materiais, sistema de cores e densidade de informação ao formato pretendido.
Um exemplo recriou o Mercado Ocidental de Chang'an durante a dinastia Tang em uma composição 21:9.

A imagem contém uma grande multidão, várias lojas, cavalos, músicos, comerciantes, crianças, lanternas e arquitetura em camadas.
Cenas com grandes grupos são um ponto comum de falha para modelos de imagem. Rostos repetidos, roupas duplicadas, mãos malformadas, escala inconsistente e poses copiadas podem fazer a cena parecer sintética.
O exemplo do U1 Pro tenta manter cada personagem visualmente distinto, preservando a composição maior da rua. Luz quente de lanternas, tons noturnos frios, reflexos e profundidade arquitetônica são tratados dentro de uma única cena.
Isso ainda é uma demonstração selecionada pela empresa, e não um benchmark independente. No entanto, mostra o tipo de composição densa que a SenseTime considera central para o modelo.
Os materiais de lançamento também incluíram um cartaz de filme de suspense da era republicana de Xangai.

A composição usa chuva, reflexos de vidro, névoa, iluminação de rua e múltiplos personagens em diferentes profundidades.
O objetivo do exemplo não é apenas o fotorrealismo. O modelo precisa entender como os elementos visuais apoiam uma narrativa:
Outro exemplo, Chang'an Nunca Dorme, usa cinco músicos, cinco instrumentos, figurinos distintos e uma composição de palco em dourado e vermelho.

Essas amostras mostram o U1 Pro sendo usado mais como um sistema de layout e direção de arte do que como um simples renderizador de prompt para imagem.
A publicidade comercial impõe diferentes demandas a um modelo.
A representação visual de um produto deve preservar:
O anúncio de chá mostrado no material de referência combina embalagem fosca, letras douradas, porcelana branca, madeira, folhas de chá e vapor.

A inconsistência de materiais é fácil de notar em publicidade. Uma caixa de papel que parece plástico ou um copo de cerâmica com reflexos incorretos pode tornar todo o resultado inutilizável.
A SenseTime apresenta o U1 Pro como capaz de combinar vários tipos de materiais, mantendo um estilo visual controlado e texto em chinês legível.
O cartaz de exposição Montanhas e Rios Entram na Pintura combina formas de aguada com montanhas e nuvens tridimensionais.

A parte inferior começa como tinta se espalhando sobre o papel. As mesmas formas gradualmente se transformam em montanhas com luz e volume realistas.
Uma fita vermelha percorre a paisagem e guia o olhar em direção a uma pequena figura humana.
O exemplo demonstra várias capacidades de design:
Para um ativo de produção, a precisão do texto é tão importante quanto a qualidade visual. Um cartaz com uma data ou caractere incorreto não pode simplesmente ser classificado como "quase correto".
Imagens com muito texto continuam sendo uma das áreas mais difíceis para sistemas de geração de imagem.
O modelo deve resolver dois problemas ao mesmo tempo:
O infográfico das fases da lua mostrado no lançamento contém um título, parágrafos explicativos, rótulos, diagramas e cartões educativos.

Também precisa representar a relação Sol-Terra-Lua de forma fisicamente significativa.
Um infográfico visualmente polido ainda pode falhar se a relação científica estiver errada. Por esse motivo, gráficos educativos com muito texto testam mais do que a renderização de caracteres semelhante a OCR. Eles também testam a organização da informação e o raciocínio de domínio.
Outro exemplo de lançamento apresenta as seis grandes categorias
de chá chinês em um layout radial.

A composição combina:
A página oficial de produtos da SenseTime agora usa infográficos de alta densidade semelhantes para demonstrar a capacidade de "expressão de conteúdo precisa" do U1 Pro.
A SenseTime descreve o U1 Pro como um sistema para tarefas complexas de entrega multimodal.
A distinção é importante.
Um gerador de imagens tradicional geralmente segue este processo:
Prompt → Imagem
O usuário decide se o resultado funciona. Se não funcionar, o usuário altera o prompt ou aplica outra ferramenta de edição.
O U1 Pro é apresentado como usando um processo interno de criação mais longo:
Entender a solicitação
→ planejar o layout
→ gerar uma composição inicial
→ inspecionar o resultado
→ revisar regiões locais
→ combinar elementos
→ refinar tipografia e detalhes
→ entregar o ativo final
Os materiais oficiais e de lançamento se referem a isso como um Loop de Geração Agêntica.
O modelo pode usar várias ações visuais, em vez de depender de uma única passagem de geração ininterrupta:
Este design se assemelha à evolução dos sistemas de codificação.
Um modelo de conclusão de código prevê as próximas linhas. Um sistema de codificação agêntico pode inspecionar um repositório, planejar uma alteração, editar arquivos, executar testes, ler erros e continuar até que a tarefa seja concluída.
O argumento da SenseTime é que a criação visual está se movendo na mesma direção.
Pontuações visuais médias podem esconder falhas de produção.
Suponha que uma imagem contenha 100 caracteres chineses e 99 estejam corretos. Um benchmark baseado na precisão média de caracteres pode atribuir uma pontuação alta.
Um pôster voltado para o cliente é diferente.
Se o caractere incorreto aparecer em um nome de produto, data, endereço, declaração científica ou aviso legal, o ativo pode precisar ser rejeitado.
Isso leva a uma definição mais rigorosa de qualidade:
Uma imagem de produção não é julgada pela aparência da maioria dos elementos. É julgada pela capacidade de entrega do ativo completo.
A SenseTime supostamente montou um painel interno de avaliação com 200 estudantes de arte e designers profissionais.
A questão era prática:
Você estaria disposto a entregar esta imagem a um cliente?
O artigo de origem diz que um modelo era considerado qualificado quando pelo menos 60% das saídas avaliadas eram julgadas diretamente entregáveis. A SenseTime relatou que o U1 Pro e o GPT Image 2 foram os únicos sistemas em sua comparação a atingir esse limite.
A empresa também relatou que o U1 Pro teve um desempenho particularmente bom em:
detalhe.
Esses resultados vêm da metodologia de avaliação interna da SenseTime. Eles são úteis como evidência de produto, mas não devem ser tratados como um benchmark público reproduzido de forma independente.
O U1 Pro é construído sobre a arquitetura NEO-unify da SenseTime.
Os modelos anteriores da SenseNova U1 foram introduzidos e disponibilizados como código aberto em abril de 2026. Seu artigo de pesquisa descreve uma abordagem nativa unificada para compreensão, raciocínio e geração multimodal.
Muitos sistemas multimodais são montados a partir de componentes distintos:
Essa arquitetura pode funcionar bem, mas os diferentes módulos podem aprender espaços internos incompatíveis.
O NEO-unify adota uma abordagem diferente.
A SenseTime afirma que ele remove o codificador visual separado e o VAE da arquitetura central, permitindo que informações de texto e imagem compartilhem uma representação e um caminho de computação baseado em Transformer.

Em uma visão simplificada:
O sistema não precisa de um escalonador externo separado para decidir que um módulo deve parar e outro deve começar.
O modelo prevê o que vem a seguir. Pode continuar em texto, alternar para tokens de imagem e, posteriormente, retornar ao texto.
A SenseTime descreve isso como uma mudança da integração multimodal para a unificação multimodal nativa.
Antes do U1 Pro, a SenseTime lançou duas principais variantes do SenseNova U1:
| Modelo | Estrutura base | Função principal |
|---|---|---|
| SenseNova-U1-8B-MoT | Fundação densa de 8B para compreensão | Compreensão, raciocínio e geração unificados |
| SenseNova-U1-A3B-MoT | Fundação MoE de 30B no total, aproximadamente 3B ativos | Modelo unificado esparso maior |
O projeto de pesquisa abrange:
A SenseTime posteriormente lançou versões aprimoradas para infográficos. O repositório oficial atualmente recomenda o Infographic V3 para um fluxo de trabalho integrado de geração e edição.
A família U1 de código aberto fornece evidências públicas para a direção subjacente do modelo unificado. O U1 Pro é o principal proprietário maior, focado em entrega de produção de ponta.
Um processo de design de nível de entrega geralmente envolve julgamento intermediário.
Um designer pode decidir:
o mais importante.
2. Qual grade ou composição se encaixa no formato.
3. Onde o assunto principal pertence.
4. Quais cores devem predominar.
5. Quanto espaço o título precisa.
6. Quais detalhes devem ser simplificados.
7. Se a primeira versão parece equilibrada.
8. Qual área requer correção local.
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
A SenseTime afirma que o U1 Pro internaliza uma sequência semelhante por meio de raciocínio visual-textual intercalado.
O modelo não precisa concluir a imagem inteira de uma só vez. Ele pode alternar entre análise interna e ações visuais, inspecionando repetidamente o estado atual.
O processo de treinamento descrito em entrevistas públicas contém duas grandes etapas.
A equipe primeiro organiza julgamentos profissionais de design em exemplos de raciocínio estruturados.
Esses exemplos ensinam princípios de ordenação, como:
Em seguida, o modelo recebe feedback em várias dimensões, incluindo:
Espera-se que o sistema de recompensa ajude o modelo a aprender qual ação deve vir a seguir durante uma longa tarefa de criação visual.
Esta é a diferença central entre "gerar uma vez" e "criar por meio de um ciclo".
A geração em alta resolução cria um problema computacional direto.
Quando uma imagem é representada como tokens visuais, aumentar a resolução aumenta o número de tokens. A atenção padrão do Transformer se torna mais cara à medida que a sequência cresce.
Se o número de tokens dobrar, a computação básica de atenção total pode aumentar aproximadamente quatro vezes.
Uma imagem 8K pode, portanto, criar um contexto e um custo computacional muito além de uma saída padrão de 1K ou 2K.
Entrevistas públicas com a equipe da SenseTime descrevem duas técnicas usadas pelo U1 Pro.
Muitos modelos de imagem usam patches de 16×16.
Diz-se que o U1 Pro usa patches de 32×32 para geração em alta resolução. Cada token cobre uma região maior da imagem, reduzindo o número de tokens visuais para cerca de um quarto da contagem de patches de 16×16 na mesma resolução.
Isso torna as saídas longas e de alta resolução mais gerenciáveis.
Patches maiores criam outro problema: cada token deve representar mais pixels, o que pode reduzir o controle sobre texto pequeno, textura e bordas finas.
A SenseTime afirma compensar com controle de ruído hierárquico adaptativo.
Regiões que precisam de mais detalhes recebem um esforço de geração mais focado, ajudando o modelo a recuperar o controle sobre tipografia e textura sem retornar à contagem original de tokens.
O resultado, de acordo com a empresa, é o suporte para saída nativa de até 8K e proporções de tela especiais sem permitir que a sequência de tokens visuais cresça descontroladamente.
Esses detalhes vêm do artigo de lançamento e de entrevistas públicas, e não de um U1 completo.
Relatório técnico profissional. A arquitetura completa do modelo de produção, a contagem de parâmetros, os dados de treinamento e os requisitos de inferência ainda não foram divulgados publicamente.
Historicamente, a competição em geração de imagens tem se concentrado em vários estágios.
Os primeiros sistemas lutavam para criar objetos reconhecíveis e cenas coerentes.
Sistemas posteriores melhoraram iluminação, textura, anatomia, renderização de materiais e detalhes fotográficos.
Uma imagem utilizável exige mais do que realismo.
Pode ser necessário:
A SenseTime chama essa transição de um movimento da geração visual para a Geração de Raciocínio e a Criação Agêntica.
O argumento não é que um único modelo resolveu todos os problemas de design. É que o alvo de avaliação está mudando.
Uma imagem bonita ainda pode ser uma entrega falha.
O artigo de origem inclui uma comparação de pôster de receita entre o U1 Pro e o GPT Image 2.
O artigo preferiu a composição mais limpa do U1 Pro, a hierarquia mais direta e a renderização de texto chinês mais forte, enquanto descreveu o resultado do GPT como mais cheio e contendo pseudocaracteres em textos decorativos pequenos.
Essa comparação deve ser lida com cuidado.
Um único prompt e um par selecionado de saídas não estabelecem liderança universal de modelo. Sistemas de imagem podem produzir resultados diferentes entre sementes, configurações, versões de prompt e fluxos de edição.
Uma comparação útil deve testar:
A avaliação interna de designers da SenseTime é mais significativa do que um par selecionado, mas ainda é administrada pela empresa.
A conclusão mais forte apoiada pelas evidências disponíveis é que o U1 Pro parece altamente competitivo em tipografia chinesa, design de informações densas, detalhes visuais orientais e composição nativa de alta resolução.
O SenseNova U1 Pro foi oficialmente apresentado, e a SenseTime publicou uma galeria oficial de produtos.
No entanto, ainda não está geralmente disponível como um produto de API pública completo.
O anúncio oficial da SenseTime nas redes sociais afirma:
Em 22 de julho de 2026, a página pública do produto demonstra as capacidades do modelo, mas não fornece preços completos da API, limites de throughput ou instruções de auto-hospedagem.
O U1 Pro não deve ser confundido com os modelos open-source SenseNova U1.
| Produto | Disponibilidade |
|---|---|
| Modelos base SenseNova U1 | Pesos open-source, código e artigo estão disponíveis |
| SenseNova U1 Infographic V2/V3 | Aprimorado open-source |
infographic models are available |
| SenseNova U1 Pro | Pré-visualização exclusiva por convite; API oficial e preços previstos para agosto de 2026 |
| SenseNova-Vision | Modelo unificado de visão computacional de código aberto e pesquisa disponíveis |
Desenvolvedores que desejam experimentar imediatamente podem começar com o repositório público SenseNova U1 e os lançamentos no Hugging Face.
Vários detalhes importantes do U1 Pro permanecem indisponíveis publicamente:
As evidências atuais consistem principalmente em demonstrações da empresa, galeria oficial de produtos, resultados de avaliações internas, entrevistas públicas e a base técnica estabelecida pela família U1 de código aberto.
Equipes que consideram o uso em produção devem aguardar a documentação da API e realizar sua própria avaliação.
Quando o acesso público estiver disponível, uma avaliação prática deve usar entregáveis reais em vez de apenas prompts artísticos.
Inclua:
Use texto conhecido e verifique cada caractere.
Meça:
Um modelo que produz uma imagem excelente e nove inutilizáveis pode ser menos valioso do que um modelo ligeiramente mais fraco com resultados consistentes.
Acompanhe a taxa de aprovação, não apenas a melhor amostra.
Peça ao modelo para alterar um elemento enquanto preserva todo o resto.
Exemplos:
Não julgue um ativo em 8K apenas por uma prévia reduzida no navegador.
Amplie para:
Inclua:
A geração mais barata não é necessariamente o entregável mais barato.
O U1 Pro está atualmente focado na criação visual, mas a SenseTime apresenta o NEO-unify como uma base mais ampla.
O roteiro da empresa inclui:
design industrial.
A SenseTime já lançou o SenseNova-Vision, que expressa tarefas tradicionais de visão computacional por meio de uma estrutura de geração multimodal.
O modelo abrange tarefas como:
Em vez de adicionar uma cabeça de previsão separada para cada tarefa, o SenseNova-Vision gera texto, imagens ou saídas mistas de acordo com a tarefa visual solicitada.
Isso apoia a direção maior "Words to Worlds" da SenseTime: linguagem e visão não devem permanecer sistemas separados conectados por adaptadores. Elas devem se desenvolver dentro de um único modelo capaz de entender, gerar e, eventualmente, agir.
A mensagem de lançamento pode ser resumida em uma afirmação prática:
"Parece bom" não deve ser o padrão final para conteúdo visual gerado por IA. "Pode ser usado" deve ser o padrão.
O U1 Pro tenta alcançar esse padrão por meio de cinco ideias interligadas:
Se o modelo atinge consistentemente esse padrão ficará mais claro após acesso mais amplo à API, testes independentes e fluxos de trabalho reais de clientes.
O lançamento, no entanto, marca uma mudança importante em como os modelos de imagem estão sendo posicionados.
Eles não estão mais sendo apresentados apenas como geradores de imagem.
Eles estão sendo apresentados como agentes de produção visual.
O SenseNova U1 Pro é o principal modelo multimodal nativo da SenseTime para tarefas complexas de criação visual. Ele unifica compreensão, geração e ação e é projetado para produzir ativos visuais de maior resolução, ricos em texto e mais prontos para entrega.
A página oficial do produto da SenseTime diz que o U1 Pro suporta saída de até 8K e proporções especiais. As opções reais de resolução, latência, formatos de arquivo e limitações da API devem ser confirmadas quando a documentação pública da API estiver disponível.
Nenhum peso público do U1 Pro foi lançado. Os modelos base anteriores do SenseNova U1 e de infográficos são de código aberto, enquanto o U1 Pro é atualmente um modelo proprietário principal disponível por meio de uma pré-visualização somente para convidados.
O anúncio oficial da SenseTime diz que a API e os preços estão planejados para agosto de 2026. A partir de 22 de julho, a página pública do produto está ativa, mas o acesso completo à API pública e os preços ainda não foram publicados.
NEO-unify é a arquitetura multimodal nativa da SenseTime para compreensão e geração unificadas. Ela remove a separação convencional entre um codificador visual, um modelo de linguagem e um VAE de imagem, para que tokens de texto e imagem possam ser processados dentro de um sistema baseado em Transformer.
É um processo de criação de múltiplas etapas no qual o modelo planeja, gera, inspeciona,
edita, repinta, compõe e refina uma imagem antes da entrega. O modelo é projetado para escolher a próxima ação visual com base no resultado intermediário atual.
A SenseTime relata que o U1 Pro foi competitivo com o GPT Image 2 em uma avaliação interna e teve bom desempenho em texto em chinês, qualidade de design e detalhes culturais orientais. Testes amplos e independentes ainda são necessários, e o desempenho varia de acordo com o prompt, fluxo de trabalho e método de avaliação.
Sim. A SenseTime lançou o artigo de pesquisa do SenseNova U1, o repositório no GitHub, os pesos no Hugging Face e os modelos aprimorados com infográficos. Eles não são idênticos ao U1 Pro, mas fornecem acesso à direção subjacente do modelo unificado.
O SenseNova U1 Pro é a tentativa da SenseTime de levar a geração de imagens para uma categoria mais exigente: entrega de produção. Ele combina unificação multimodal nativa, raciocínio visual-textual intercalado, um loop de criação agentivo, renderização densa de texto em chinês e saída de até 8K.
O scroll da WAIC e os exemplos de lançamento
demonstram layouts excepcionalmente complexos, grandes grupos, tipografia chinesa, infográficos científicos, publicidade de produtos e estilos visuais orientais. Estes são exemplos selecionados da empresa, e a comparação relatada com o GPT Image 2 vem da própria avaliação da SenseTime, e não de um benchmark público totalmente independente.
O U1 Pro está atualmente em pré-visualização por convite, com acesso público à API e precificação previstos para agosto de 2026. Desenvolvedores já podem explorar os modelos开源 SenseNova U1 e de infográficos, mas esses lançamentos não são os mesmos que o sistema Pro.
A mudança central é passar de perguntar se uma IA pode gerar uma bela imagem para perguntar se ela pode entregar de forma confiável um ativo visual completo.
Comece com uma frase e tenha um site completo em minutos.