引言
在2026年世界人工智能大会上,商汤科技推出了SenseNova U1 Pro,这是其针对复杂视觉创作任务的下一代旗舰多模态模型。
发布会演示聚焦于一幅名为《智联世界》的超宽幅东方城市画卷。这幅图像是为第九届世界人工智能大会创作的,将2018年至2026年大会的发展历程浓缩为一个连续的视觉叙事。
这幅画卷在异常宽广的画布上融合了城市地标、河流、山峦、人群、建筑、标签和密集的历史细节。商汤科技表示,该图像由U1 Pro以原生高分辨率直接生成,而非通过单独的人工设计流程拼接而成。
该模型更广泛的目标比单次演示更为重要。
SenseNova U1 Pro被定位为一个交付级的原生多模态智能体基础模型。它并非在收到提示后立即生成一张图像,而是通过更长的生成过程来规划布局、生成草稿、检查中间结果、修正局部区域,并最终完善构图。
换句话说,商汤科技正试图将AI图像生成从"制作视觉上令人印象深刻的图像"推向"产出可在真实设计工作流程中使用的资产"。

为WAIC打造的8K东方画卷
大会使用的这幅画卷采用全景格式,更接近传统的中国手卷,而非标准海报或社交媒体图像。
它通过一幅连续的长卷连接了九届WAIC。构图包括:
- 山峦与水系
- 城市地标
- 会议场馆
- 人群与公共场景
- 小型标签与注释
- 不同年份间视觉基调的变化
- 贯穿全卷的协调水墨色彩美学
创作此类大型图像存在多重挑战。
首先,超宽幅构图必须从一端到另一端保持连贯。模型可以生成吸引人的局部区域,但可能会丢失场景的整体结构。
其次,图像包含许多小物体和标签。在标准预览中几乎不可见的错误,当图像在大型墙面展示时会变得显而易见。
第三,构图需要连续性。建筑、河流、道路、山峦和文字不能让人感觉是随意拼贴的无关碎片。
商汤科技表示,U1 Pro支持最高8K分辨率的输出和非常规宽高比。官方产品页面将其作为一项面向高分辨率材料和精细视觉交付的生产特性进行介绍。
WAIC画卷的在线版本经过压缩,因此未能保留原始展示素材的全部质量。
不同场景,同一创作模型
发布文章展示了U1 Pro在多个
视觉类别,而非将模型局限于单一标志性风格。
示例包括:
- 历史全景场景
- 悬疑电影海报
- 动漫表演海报
- 高端产品广告
- 博物馆与展览海报
- 科学信息图表
- 茶类信息设计
- 角色设定图
- 食谱插画
这些多样性之所以重要,是因为商业设计并非单一任务。
一个有用的模型需要能够根据目标格式,灵活调整其构图、排版、视觉层级、材质渲染、色彩体系及信息密度。
历史全景与大规模人物组图
其中一个示例以21:9的构图再现了唐代长安西市。

画面中包含大量人群、多家商铺、马匹、乐师、商贩、孩童、灯笼以及层层叠叠的建筑。
大规模群组场景通常是图像模型的失败高发区。重复的面孔、雷同的服饰、变形的手部、不一致的比例以及复制粘贴的姿势,都会让画面显得虚假。
U1 Pro的示例试图让每个角色在视觉上保持独特,同时维护整体街景构图。暖色灯笼光、冷色夜色、倒影以及建筑纵深感都在同一场景中得到了处理。
这仍然是公司挑选的演示,而非独立的基准测试。但它确实展现了商汤认为模型核心所在的高密度构图类型。
叙事空间与排版并重的海报
发布材料中还包含一张民国时期上海悬疑电影海报。

构图运用了雨水、玻璃反光、雾气、街灯以及处于不同景深的多个人物。
这个例子的重点并不仅仅是照片级真实感。模型需要理解视觉元素如何服务于叙事:
- 哪个角色是焦点主体。
- 哪些角色应该保持半隐半现。
- 倒影与现实空间的关系。
- 标题应置于何处。
- 环境如何营造悬疑感。
- 辅助文字如何保持次要地位。
另一个例子《长安不夜城》采用了五位乐师、五种乐器、各色服饰以及金红色舞台构图。

这些样本显示,U1 Pro 的使用方式更像是一个布局与艺术指导系统,而非简单的文字到图片的渲染器。
产品广告与材质渲染
商业广告对模型提出了不同的需求。
产品视觉图必须保留以下要素:
- 包装结构
- 品牌层级
- 清晰可辨的产品名称
- 统一的材质感
- 可控的光影反射
- 准确的透视关系
- 营销文案的预留空间
- 引导视线聚焦产品的构图
源素材中展示的茶叶广告融合了哑光包装、烫金文字、白瓷、木材、茶叶与蒸汽。

广告中最容易察觉的瑕疵就是材质不统一。纸盒看起来像塑料,或陶瓷杯的反射效果有误,都会让整个成品无法使用。
商汤科技推出的U1 Pro能够融合多种材质类型,同时保持统一的视觉风格与清晰的中文文案。
展览海报与二维转三维设计
展览海报《山河入画》将水墨形态与立体山川云雾相结合。

画面下半部分始于水墨在宣纸上的晕染效果。同样的形态逐渐过渡为具有真实光照和立体感的山脉。
一条红色飘带穿行于山水之间,引导视线聚焦于画面中的小人影。
该示例展现了多项设计能力:
- 整张海报保持统一的视觉概念。
- 融合平面与立体渲染。
- 保留强烈的尺度对比关系。
- 将活动信息融入构图之中。
- 确保中文标题与辅助细节清晰可读。
对于交付级素材而言,文字准确度与视觉质量同等重要。一张海报若出现日期或文字错误,绝不能以"基本正确"来评判。
长文本中文与科学逻辑
图文混排一直是图像生成系统最难的领域之一。
模型必须同时解决两大难题:
- 准确渲染所要求的文字字符。
- 将文字组织成清晰的信息结构。
发布会上展示的月相信息图包含标题、说明段落、标注、图表和科普卡片。

它还需要以符合物理规律的方式呈现日-地-月关系。
即使信息图视觉精美,如果科学关系表达错误依然算作失败。正因如此,图文混排的科普类素材考验的不仅是类似OCR的文字渲染能力,更是信息组织与领域推理能力。
另一发布案例展示了六大类别
以径向布局呈现的中国茶。

该构图结合了:
- 类别名称。
- 茶叶图像。
- 液体色彩。
- 产地信息。
- 辅助景观插图。
- 中心视觉锚点。
- 间距一致的重复模块。
商汤科技官方产品页面现已采用类似的高密度信息图,以展示U1 Pro的“精准内容表达”能力。
为交付而生,而非仅为生成而设计
商汤科技将U1 Pro描述为一套用于复杂多模态交付任务的系统。
这一区别至关重要。
传统图像生成器通常遵循以下流程:
提示词 → 图像
用户自行判断结果是否可用。若不可用,则修改提示词或使用其他编辑工具。
U1 Pro被呈现为使用更长的内部创作流程:
理解请求
→ 规划布局
→ 生成初始构图
→ 检查结果
→ 修改局部区域
→ 组合元素
→ 优化排版与细节
→ 交付最终成品
官方及发布材料将此称为**智能体生成循环**。
该模型可使用多种视觉操作,而非依赖单次无中断的生成过程:
- 生成。
- 编辑。
- 重绘选定区域。
- 组合多个元素。
- 检查已创建内容。
- 决定下一步操作。
这一设计类似于编码系统的演进。
代码补全模型预测后续代码行。智能体编码系统则可审查代码仓库、规划修改、编辑文件、运行测试、读取错误信息,并持续迭代直至任务完成。
商汤科技认为,视觉创作正朝着同样的方向发展。
## 一字之错,全图作废
平均视觉分数可能掩盖生产故障。
假设一张图像包含100个汉字,其中99个正确。基于平均字符准确率的基准测试可能给出高分。
但面向客户的宣传海报则不同。
若错误字符出现在产品名称、日期、地址、科学声明或法律声明中,则该成品可能需被废弃。
这引出了更严格的质量定义:
> 生产级图像并非以“大部分元素看起来不错”为标准评判,而是以“完整成品能否交付”为准则。
据称,商汤科技组建了一支由200名艺术院校学生和专业设计师组成的内部评估小组。
问题非常实际:
> 你是否愿意将此图像交付给客户?
源文章指出,当评估输出中至少60%被认为可直接交付时,该模型才算合格。商汤科技报告称,在其对比测试中,仅U1 Pro和GPT Image 2达到了这一门槛。
该公司进一步报告称,U1 Pro在以下方面表现尤为出色:
- 中文文本渲染。
- 平面设计质量。
- 东方文化。
细节说明。
- 高信息密度布局。
上述结果来自商汤内部评估方法。这些结果可作为产品参考,但不应当作独立复现的公开基准。
## NEO-unify:原生统一架构
U1 Pro 基于商汤 **NEO-unify** 架构构建。
早期的 SenseNova U1 模型于 2026 年 4 月发布并开源。其研究论文提出了一种原生统一的方法,用于多模态理解、推理与生成。
许多多模态系统由不同组件拼接而成:
- 视觉编码器将图像转换为可供理解的表征。
- 语言模型处理文本与推理。
- 变分自编码器或类似图像解码器负责生成。
- 额外适配器连接各组件。
这种架构可以运作良好,但不同模块可能学习到不兼容的内部空间。
NEO-unify 采用了不同方法。
商汤表示,该架构移除了核心架构中的独立视觉编码器和 VAE,让文本和图像信息共享同一表征空间及基于 Transformer 的计算路径。

简而言之:
- 文本以词嵌入形式输入。
- 图像以图像块嵌入形式输入。
- 两者在同一模型内处理。
- 模型可在单个自回归序列中解码文本 token 或图像块 token。
该系统无需额外外部调度器来决定某个模块应停止、另一模块应启动。
模型预测下一步内容。它可能继续生成文本,切换到图像 token,之后又回到文本。
商汤将此描述为从多模态集成迈向原生多模态统一。
## 开源 SenseNova U1 模型确立的基础
在 U1 Pro 之前,商汤发布了两个主要 SenseNova U1 变体:
| 模型 | 基础结构 | 主要作用 |
|-|-|-|
| SenseNova-U1-8B-MoT | 密集 8B 理解基础模型 | 统一理解、推理与生成 |
| SenseNova-U1-A3B-MoT | 总计 30B,约 3B 激活 MoE 基础模型 | 更大的稀疏统一模型 |
研究项目涵盖:
- 文本理解。
- 视觉语言感知。
- 知识推理。
- 智能体决策。
- 空间智能。
- 图像生成。
- 富文本信息图生成。
- 交错图像与文本生成。
- 早期视觉-语言-动作及世界模型任务。
商汤后续发布了增强版信息图版本。官方仓库目前推荐使用 **Infographic V3** 实现集成交互式生成与编辑流程。
开源 U1 家族为底层统一模型方向提供了公开证据。U1 Pro 是更大规模的专有旗舰模型,面向高端生产交付。
## 交错视觉-文本推理
交付级设计流程通常涉及中间判断。
设计师可能需要决定:
1. 应呈现哪些信息。
最重要。
2. 哪种网格或构图适合版式。
3. 主体应该放在哪里。
4. 哪些颜色应该占主导地位。
5. 标题需要多少空间。
6. 哪些细节应该简化。
7. 第一个版本是否感觉平衡。
8. 哪个区域需要局部修正。
商汤表示,U1 Pro 通过**交错视觉-文本推理**内化了类似的序列。
该模型无需一次完成整张图像。它可以在内部分析与视觉动作之间交替,反复检查当前状态。
公开采访中描述的训练过程包含两个主要阶段。
### 基于指令的冷启动
团队首先将专业设计判断组织成结构化的推理示例。
几分钟搭建展示站并增长获客
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
这些示例教授排序原则,例如:
- 先确定布局,再细化装饰。
- 先设定主色调,再处理小纹理。
- 先稳定主要视觉层级,再添加次要文本。
- 先核对信息准确性,再最终渲染。
带有多维奖励的强化学习
然后,模型会接收来自多个维度的反馈,包括:
- 构图。
- 文本正确性。
- 视觉美学。
- 一致性。
- 信息层级。
- 主体准确性。
- 材质质量。
- 局部细节。
- 整体可交付性。
奖励系统旨在帮助模型学习在较长的视觉创作任务中下一个应该执行的动作。
这是“一次生成”与“循环创建”之间的核心区别。
原生 8K,无失控的 Token 增长
高分辨率生成直接带来计算难题。
当图像表示为视觉 Token 时,提高分辨率会增加 Token 数量。随着序列增长,标准的 Transformer 注意力机制计算成本会越来越高。
如果 Token 数量翻倍,基本的全注意力计算量大约会增加四倍。
因此,一张 8K 图像所产生的上下文和计算负担可能远超标准的 1K 或 2K 输出。
商汤团队的公开采访描述了 U1 Pro 使用的两种技术。
更大的 32×32 图像块
许多图像模型使用 16×16 的图像块。
据报道,U1 Pro 在高分辨率生成中使用 32×32 的图像块。每个 Token 覆盖更大的图像区域,在相同分辨率下,视觉 Token 数量减少到 16×16 图像块数量的约四分之一。
这使得长序列和高分辨率输出更易于管理。
自适应分层噪声控制
更大的图像块带来了另一个问题:每个 Token 必须代表更多像素,这可能会降低对小文本、纹理和精细边缘的控制。
商汤表示,他们通过自适应分层噪声控制来弥补这一点。
需要更多细节的区域会获得更专注的生成处理,帮助模型在不回到原始 Token 数量的情况下恢复对排版和纹理的控制。
据该公司称,结果是支持原生输出高达 8K 及特殊宽高比,同时防止视觉 Token 序列失控式增长。
这些细节来自发布文章和公开采访,而非完整的 U1
专业技术报告。生产模型的完整架构、参数数量、训练数据及推理需求尚未公开披露。
生成质量与交付质量
图像生成领域的竞争历来聚焦于几个阶段。
第一阶段:让图像符合要求
早期系统难以生成可识别的物体与连贯的场景。
第二阶段:让图像看起来真实
后续系统改进了光照、纹理、人体结构、材质渲染及摄影级细节。
第三阶段:让图像可用
可用的图像不仅需要真实感。
它可能需要具备以下特性:
- 正确文本
- 精确信息
- 专业排版
- 统一品牌标识
- 合适尺寸
- 可编辑结构或可靠的局部修改
- 多次生成结果稳定
- 印刷级细节
- 清晰的审批流程
商汤科技将这一转变称为从视觉生成向推理生成与智能体创作的跃迁。
该论点并非声称某个模型解决了所有设计问题,而是指出评估标准正在改变。
一张精美的图像仍可能是一份失败的交付物。
与 GPT Image 2 的对比
原文呈现了 U1 Pro 与 GPT Image 2 在食谱海报生成上的对比。
该文章更青睐 U1 Pro 更简洁的构图、更直接的层级结构以及更精准的中文文本渲染,同时认为 GPT 生成的结果更拥挤,且小装饰文字中包含伪字符。
对此对比需要审慎看待。
单一提示词与一组选定的输出不足以确立模型的领先地位。图像系统在不同种子、设置、提示词版本及编辑流程下可能产生迥异的结果。
有效的对比应测试以下维度:
- 多种提示词类别
- 每类提示词的多次生成
- 文本准确性
- 布局一致性
- 可编辑性
- 参考图像遵循度
- 使用成本
- 响应延迟
- 输出分辨率
- 失败率
- 人类偏好
- 最终资产是否可直接交付
商汤内部设计师的评估比一组选定样本更有意义,但终究由公司自身主导。
基于现有证据最有力的结论是:U1 Pro 在中文字体排印、密集信息设计、东方视觉细节、原生高分辨率构图方面展现出极强的竞争力。
可用性与发布状态
SenseNova U1 Pro 已正式发布,商汤科技亦公布了官方产品展示页。
然而,该模型目前尚未作为完整的公开 API 产品全面开放。
商汤官方社交媒体公告显示:
- 仅提供邀请制预览
- 计划于 2026 年 8 月正式发布 API 并公布定价
截至 2026 年 7 月 22 日,公开产品页面展示了模型能力,但未提供完整的 API 定价、吞吐量限制或自部署说明。
请勿将 U1 Pro 与开源的 SenseNova U1 系列模型混淆。
| 产品 | 可用性 |
|---|---|
| SenseNova U1 基础模型 | 开源权重、代码及论文已发布 |
| SenseNova U1 Infographic V2/V3 | 开源的增强版本 |
信息图模型可供使用 |
| SenseNova U1 Pro | 仅限受邀预览;官方API及定价计划于2026年8月公布 |
| SenseNova-Vision | 开源统一计算机视觉模型及研究资料已开放 |
想要立即尝试的开发者可从公开的SenseNova U1代码库和Hugging Face发布版本入手。
尚未披露的信息
U1 Pro的多项重要细节仍未公开:
- 参数数量
- 活跃参数数量
- 完整训练数据描述
- 硬件要求
- 8K生成延迟
- API速率限制
- API定价
- 支持的编辑界面
- 商业数据保留政策
- 安全过滤器行为
- 是否开放模型权重
- 广泛提示词集的独立基准测试结果
目前证据主要来自公司演示、官方产品图库、内部评估结果、公开访谈以及开源U1系列建立的技术基础。
考虑投入生产使用的团队应等待API文档并自行评估。
如何评估U1 Pro的实际设计能力
公开访问权限开放后,实用评估应使用真实交付物而非仅限艺术类提示词。
- 构建代表性提示词集
包含:
- 产品广告
- 活动海报
- 教育信息图
- 角色设定图
- 社交媒体封面
- 杂志版面
- 科学图解
- 品牌密集型素材
- 超宽幅图片
- 长段中文文案
- 测试精确文本要求
使用已知文本并校验每个字符。
测量:
- 标题准确度
- 正文准确度
- 数字
- 日期
- 地址
- 产品名称
- 标点符号
- 重复标签
- 生成多份结果
能生成一张优质图像但其余九张无法使用的模型,可能不如输出稳定但稍逊色的模型有价值。
关注通过率,而非仅最佳样本。
- 测试局部修改
要求模型在保留其余内容的前提下更改单一元素。
示例:
- 修正一个日期
- 更换产品颜色
- 移动标题位置
- 移除一个角色
- 更改背景
- 更新场地信息
- 保持版面布局的同时翻译文案
- 以最终输出尺寸检查
切勿仅通过缩小的浏览器预览判断8K素材。
放大查看:
- 小字号文字
- 手部与面部
- 边缘质量
- 产品标识
- 重复图案
- 精细纹理
- 图解标签
- 透视关系
- 对比完整工作流成本
包含:
- 生成时间
- API费用
- 尝试次数
- 人工修正时间
- 外部编辑
- 放大处理
- 排版修复
- 审核与导出
最便宜的生成方案未必意味着最实惠的交付成果。
从单张图像到统一视觉系统
U1 Pro目前专注于视觉创作,但商汤科技将NEO-unify定位为更广泛的基础平台。
该公司的路线图包括:
- 通用视觉感知
- 空间智能
- 视觉-语言-动作系统
- 具身智能
- 世界模型
- 城市规划
- 建筑与
工业设计。
商汤科技已发布 SenseNova-Vision,该模型通过一个多模态生成框架实现传统计算机视觉任务。
该模型涵盖以下任务:
- 目标检测
- 光学字符识别
- 关键点估计
- 图像分割
- 深度预测
- 表面法线
- 点图
- 相机姿态估计
- 多视角视觉几何
与为每项任务单独添加预测头不同,SenseNova-Vision 会根据用户请求的视觉任务生成文本、图像或混合输出。
这支撑了商汤科技更大的“万物皆语”方向:语言和视觉不应通过适配器连接成独立系统,而应发展成能理解、生成并最终执行动作的统一模型。
U1 Pro 的核心理念
其发布信息可归结为一条实用主张:
“看起来不错”不应成为AI生成视觉内容的最终标准。“具备可用性”才是标准。
U1 Pro 通过五大关联理念尝试达到该标准:
- 文本与图像的原生统一架构
- 交错的推理与视觉行动
- 长程智能体生成循环
- 高达8K的高分辨率输出
- 基于完整交付能力而非孤立美感进行评估
在API广泛开放、独立测试和真实客户应用后,该模型能否持续达到该标准将更加清晰。
尽管如此,此次发布标志着图像模型定位的重要转变。
它们不再仅被视为图像生成器。
而是被定位为视觉生产智能体。
常见问题
什么是 SenseNova U1 Pro?
SenseNova U1 Pro 是商汤科技面向复杂视觉创作任务的旗舰原生多模态模型。它统一了理解、生成与行动三大能力,旨在产出更高分辨率、文本丰富且更接近交付效果的视觉内容。
SenseNova U1 Pro 能生成原生8K图像吗?
商汤科技官方产品页面显示 U1 Pro 支持最高8K输出及特殊宽高比。实际分辨率选项、延迟、文件格式及API限制需待公开API文档发布后确认。
SenseNova U1 Pro 是否开源?
目前未公开发布 U1 Pro 权重。早期 SenseNova U1 基座模型和图表生成模型已开源,U1 Pro 作为专属旗舰产品目前仅限邀请预览。
SenseNova U1 Pro API何时开放?
商汤科技官方公告显示API及定价计划于2026年8月推出。截至7月22日,公开产品页面已上线,但完整API访问权限和定价尚未公布。
什么是NEO-unify?
NEO-unify 是商汤科技用于统一理解与生成的原生多模态架构。它打破了传统视觉编码器、语言模型和图像VAE之间的分离,使文本和图像令牌能在同一个基于Transformer的系统内处理。
什么是智能体生成循环?
这是一个多步骤的创作流程,模型在其中进行规划、生成、检查、
在交付前对图像进行编辑、重绘、合成与精修。该模型旨在根据当前中期结果选择下一个视觉操作。
U1 Pro 比 GPT Image 2 更强吗?
商汤科技报告称,U1 Pro 在内部评估中与 GPT Image 2 具有竞争力,并在中文文本、设计质量和东方文化细节方面表现强劲。仍需进行独立的广泛测试,实际表现会因提示词、工作流程和评估方法而异。
开发者现在可以试用 SenseNova U1 技术吗?
可以。商汤科技已发布 SenseNova U1 研究论文、GitHub 仓库、Hugging Face 权重以及信息图增强模型。这些版本与 U1 Pro 不完全相同,但提供了底层统一模型方向的访问途径。
相关工具
- SenseNova U1 Pro:商汤科技旗舰创作模型的官方产品图库与能力概览。
- SenseNova U1 GitHub 仓库:官方开源代码、文档、模型信息及信息图发布资源。
- SenseNova 在 Hugging Face 上的页面:官方模型权重、模型卡片及研究资源。
- SenseNova U1 信息图 V3:推荐用于信息图生成与编辑的开源 U1 版本。
- SenseNova-Vision:商汤科技开源统一计算机视觉模型与语料库。
- SenseNova 平台:商汤科技官方模型控制台与开发者平台。
相关链接
- SenseNova U1 Pro 官方产品页面:覆盖 8K 输出、复杂信息、专业设计及多种视觉场景的官方示例。
- 商汤科技 WAIC 2026 预告:商汤科技官方公告,预览 U1 Pro 及其在 WAIC 的发布信息。
- SenseNova U1 官方开源公告:官方介绍开源统一理解与生成模型系列。
- SenseNova U1 研究论文:描述 NEO-unify 架构及原始 U1 模型的技术论文。
- NEO-unify 技术博客:商汤科技关于原生统一架构的技术概述。
- SenseNova U1 GitHub 仓库:官方代码、模型链接、架构详情及信息图文档。
- SenseNova-Vision 研究论文:关于通过统一多模态生成表达传统计算机视觉任务的研究。
总结
SenseNova U1 Pro 是商汤科技将图像生成推进至更严苛类别——生产交付——的一次尝试。它融合了原生多模态统一、交错视觉-文本推理、智能体创作循环、密集中文文本渲染以及最高 8K 的输出能力。
WAIC 滚动展示及发布示例
展示极其复杂的版式、大规模群组、中文字体排印、科学信息图、产品广告以及东方视觉风格。这些是精选的企业示例,报告中与GPT Image 2的对比来自商汤自身评估,并非完全独立的公开基准测试。
U1 Pro目前仅限邀请预览,公开API访问及定价计划于2026年8月上线。开发者现已可探索开源版SenseNova U1及信息图模型,但上述发布内容与Pro系统并不等同。
核心转变在于:从追问AI能否生成精美图像,转向追问AI能否可靠交付完整的视觉资产。



