WAIC 2026において、商湯科技(SenseTime)は次世代のマルチモーダルモデル SenseNova U1 Pro を発表しました。これは複雑な視覚的創造タスクのために設計されたフラッグシップモデルです。

WAIC 2026において、商湯科技(SenseTime)は次世代のマルチモーダルモデル SenseNova U1 Pro を発表しました。これは複雑な視覚的創造タスクのために設計されたフラッグシップモデルです。
発表デモでは、知能が世界を紡ぐ と題された超ワイドな東洋風都市巻物が披露されました。この画像は第9回世界人工知能会議のために作成され、2018年から2026年までのイベントの進化を一つの連続したビジュアルストーリーに凝縮しています。
この巻物は、都市のランドマーク、川、山々、群衆、建築物、ラベル、そして密度の高い歴史的詳細を、極めてワイドなキャンバス上に組み合わせたものです。商湯科技によると、この画像は別途手動のデザインパイプラインで組み立てられたものではなく、U1 Proによってネイティブの高解像度で直接生成されたとのことです。
このモデルのより広範な目標は、単一のデモンストレーションよりも重要です。
SenseNova U1 Proは、デリバリーグレードのネイティブマルチモーダルエージェント基盤モデルとして位置づけられています。プロンプトを受け取った直後に一枚の画像を生成するのではなく、レイアウトを推論し、ドラフトを生成し、中間結果を検査し、局所的な領域を修正し、より長い生成プロセスを通じて最終的な構図を洗練するように設計されています。
言い換えれば、商湯科技はAI画像生成を、「視覚的に印象的なものを作る」から「実際のデザインワークフローで使用できるアセットを生成する」へと移行させようとしているのです。

会議の巻物は、標準的なポスターやソーシャルメディア画像というよりも、伝統的な中国の手巻きに近いパノラマ形式を使用しています。
9年間のWAICを一つの連続した風景でつなげています。構成には以下のものが含まれます:
このタイプの大きな画像を作成することは、いくつかの理由で困難です。
第一に、超ワイドな構図は、端から端まで首尾一貫していなければなりません。モデルは局所的に魅力的な領域を生成できる一方で、シーンの全体的な構造を失う可能性があります。
第二に、画像には多くの小さな物体やラベルが含まれています。標準的なプレビューではほとんど見えないエラーも、大きな壁に画像が表示されると明らかになります。
第三に、構成には連続性が必要です。建物、川、道路、山、テキストが、無関係な断片を貼り合わせたように感じられてはなりません。
商湯科技によると、U1 Proは最大 8K解像度 と特殊なアスペクト比での出力をサポートしています。公式製品ページでは、これを高解像度素材や詳細なビジュアルデリバリーを目的としたプロダクション機能として提示しています。
WAIC巻物のオンラインバージョンは圧縮されているため、元のディスプレイアセットの完全な品質は保持されていません。
発表記事では、U1 Proがいくつかの
視覚カテゴリーであり、モデルを1つの特徴的なスタイルに限定するものではない。
含まれていた例:
この幅広さが重要なのは、商業デザインが単一のタスクではないからだ。
有用なモデルは、その構成、タイポグラフィ、視覚的階層、素材の表現、色彩システム、情報密度を、意図されたフォーマットに適応させる必要がある。
一例として、唐代の長安・西市を21:9の構図で再現したものがある。

この画像には、大勢の人混み、複数の商店、馬、楽師、商人、子供、提灯、そして重層的な建築物が含まれている。
大規模な群衆シーンは、画像生成モデルにとって共通の失敗ポイントである。顔の重複、服装の重複、手の描写の崩れ、スケールの不一致、ポーズのコピーなどにより、シーンが合成的に感じられる原因となる。
U1 Proの例では、より広い街路の構図を保ちつつ、各キャラクターを視覚的に個別化しようと試みている。暖かい提灯の光、涼しげな夜のトーン、反射、そして建築物の奥行きが、1つのシーンの中で処理されている。
これは依然として、選定された企業によるデモであり、独立したベンチマークではない。しかし、商湯科技がモデルの核心と考える、密度の高い構図のタイプを示している。
発表資料には、民国時代の上海を舞台にしたサスペンス映画のポスターも含まれていた。

構図は、雨、硝子の反射、霧、街灯、そして異なる奥行きに配置された複数のキャラクターを用いている。
この例のポイントは、単なるフォトリアリズムではない。モデルは、視覚的要素がどのように物語を支えるかを理解する必要がある:
別の例である『長安不眠』は、5人の楽師、5つの楽器、個性的な衣装、そして金と赤の舞台構成を用いている。

これらのサンプルは、U1 Proが単なるプロンプトから画像を生成するレンダラーではなく、レイアウトとアートディレクションのシステムとしてより多く使用されていることを示している。
商業広告は、モデルに異なる要求を突きつける。
製品のビジュアルは以下を保持しなければならない:
ソース素材に示された紅茶の広告は、マットなパッケージ、金色の文字、白磁、木、茶葉、湯気を組み合わせている。

広告では素材の不整合が簡単に目立つ。プラスチックのように見える紙箱や、反射が不正確な陶器のカップは、結果全体を使い物にできなくさせる。
商湯科技は、U1 Proが複数の素材タイプを組み合わせつつ、コントロールされたビジュアルスタイルと読みやすい中国語のコピーを維持できると紹介している。
展示ポスター『山河入画(山河が絵画に入る)』は、水墨のフォルムと立体的な山々や雲を組み合わせている。

下部は紙の上に墨が広がるように始まる。同じフォルムが徐々に、リアルな光とボリュームを備えた山々へと移行する。
赤いリボンが風景の中を進み、小さな人物像へと視線を誘導する。
この例は、いくつかのデザイン能力を示している:
プロダクションアセットにおいては、テキストの正確性はビジュアル品質と同様に重要である。日付や文字が一つ間違っているポスターは、「ほぼ正しい」と評価することはできない。
テキストの多い画像は、画像生成システムにとって最も難しい領域の一つであり続けている。
モデルは二つの問題を同時に解決しなければならない:
発表時に示された月相のインフォグラフィックは、タイトル、説明文、ラベル、図、教育的なカードを含んでいる。

また、太陽・地球・月の関係を物理的に意味のある形で表現する必要もある。
見た目に洗練されたインフォグラフィックでも、科学的な関係が間違っていれば失敗となり得る。このため、テキストの豊富な教育用グラフィックは、OCR的な文字レンダリング以上のものを試すことになる。それらは情報の構成と領域推論もテストするのだ。
別の発表例では、六大カテゴリーを提示している。
中国茶を放射状に配置したレイアウト。

この構成は以下の要素を組み合わせています。
現在、商湯科技(SenseTime)の公式プロダクトページでは、同様の高密度インフォグラフィックを用いて、U1 Proの「精密なコンテンツ表現能力」を紹介しています。
商湯科技はU1 Proを、複雑なマルチモーダル納品タスクのためのシステムと説明しています。
この区別は重要です。
従来の画像生成器は、一般的に以下のプロセスをたどります。
プロンプト → 画像
ユーザーが結果の良し悪しを判断します。良くなければ、プロンプトを変更するか、別の編集ツールを使用します。
U1 Proは、より長い内部生成プロセスを使用するものとして提示されています。
リクエストを理解する
→ レイアウトを計画する
→ 初期構成を生成する
→ 結果を検査する
→ 局所領域を修正する
→ 要素を結合する
→ タイポグラフィと詳細を洗練する
→ 最終アセットを納品する
公式およびローンチ資料では、これをエージェンティック生成ループと呼んでいます。
このモデルは、1回の中断のない生成パスに依存するのではなく、複数の視覚的アクションを使用できます。
この設計は、コーディングシステムの進化に似ています。
コード補完モデルは次の行を予測します。エージェンティックコーディングシステムは、リポジトリを検査し、変更を計画し、ファイルを編集し、テストを実行し、エラーを読み取り、タスクが完了するまで継続できます。
商湯科技の主張は、視覚的創造も同じ方向に進んでいるというものです。
平均的な視覚スコアは、プロダクションでの失敗を隠蔽する可能性があります。
画像に100文字の中国語が含まれ、99文字が正しいとします。平均的な文字精度に基づくベンチマークは高いスコアを割り当てるかもしれません。
しかし、顧客向けのポスターは別物です。
誤った文字が製品名、日付、住所、科学的記述、または法的通知に現れた場合、そのアセットは却下される必要があるかもしれません。
これにより、より厳格な品質定義が導かれます。
プロダクション画像は、ほとんどの要素が正しく見えるかどうかで判断されるのではありません。完全なアセットが納品可能かどうかで判断されるのです。
商湯科技は、200名の美術学校の学生とプロのデザイナーからなる内部評価パネルを組織したと報じられています。
質問は実用的なものでした。
この画像をクライアントに納品しても構わないと思いますか?
情報源の記事によると、評価された出力の少なくとも60%が直接納品可能と判断された場合、モデルは適格とみなされました。商湯科技は、その比較において、U1 ProとGPT Image 2のみがこの基準を満たしたと報告しました。
同社はさらに、U1 Proが以下の点で特に優れたパフォーマンスを示したと報告しています。
詳細情報:
これらの結果は、SenseTime社の内部評価方法に基づくものです。製品エビデンスとして有用ですが、独立して再現可能な公開ベンチマークとして扱うべきではありません。
U1 Proは、SenseTimeの NEO-unify アーキテクチャを基に構築されています。
初期のSenseNova U1モデルは、2026年4月に発表・オープンソース化されました。その研究論文では、マルチモーダルな理解、推論、生成に対するネイティブ統合アプローチについて説明されています。
多くのマルチモーダルシステムは、異なるコンポーネントから構成されています。
このアーキテクチャはうまく機能しますが、異なるモジュール間で内部空間に非互換性が生じる可能性があります。
NEO-unifyは異なるアプローチを採用しています。
SenseTimeによると、コアアーキテクチャから別個のビジュアルエンコーダーとVAEを排除し、テキストと画像情報が1つの表現と1つのTransformerベースの計算パスを共有できるようにしています。

簡略化して説明すると:
このシステムは、どのモジュールが停止し、どのモジュールが開始すべきかを決定するための、別個の外部スケジューラーを必要としません。
モデルは次に来るものを予測します。テキストを続けることも、画像トークンに切り替えることも、後でテキストに戻ることもあります。
SenseTimeはこれを、マルチモーダル統合からネイティブマルチモーダル統一への移行と表現しています。
U1 Pro以前に、SenseTimeは2つの主要なSenseNova U1バリエーションをリリースしました。
| モデル | 基本構造 | 主な役割 |
|---|---|---|
| SenseNova-U1-8B-MoT | Dense 8B理解基盤 | 統合された理解、推論、生成 |
| SenseNova-U1-A3B-MoT | 合計30B、約3BアクティブなMoE基盤 | より大規模なスパース統合モデル |
この研究プロジェクトは以下をカバーしています。
SenseTimeは後に、インフォグラフィック強化版をリリースしました。公式リポジトリは現在、統合された生成・編集ワークフローとして Infographic V3 を推奨しています。
オープンソースのU1ファミリーは、基礎となる統一モデルの方向性に関する公開エビデンスを提供します。U1 Proは、ハイエンドなプロダクションデリバリーに焦点を当てた、より大規模なプロプライエタリフラッグシップモデルです。
デリバリーグレードのデザインプロセスでは、通常、中間判断が伴います。
デザイナーは以下の判断を下す可能性があります。
最も重要なこと。
2. どのグリッドや構図がフォーマットに合うか。
3. メインの主題がどこに属するか。
4. どの色を支配的にするべきか。
5. タイトルにどれだけのスペースが必要か。
6. どのディテールを簡略化すべきか。
7. 最初のバージョンがバランスが取れているか。
8. どのエリアに局所的な修正が必要か。
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
センセンスタイムは、U1 Proがインターリーブされた視覚-テキスト推論を通じて、同様のシーケンスを内面化すると述べています。
モデルは、画像全体を一度に完成させる必要はありません。内部分析と視覚的行動を交互に行い、現在の状態を繰り返し検査することができます。
公開インタビューで説明されたトレーニングプロセスには、2つの大きな段階があります。
チームはまず、専門的なデザイン判断を構造化された推論の例に整理します。
これらの例は、以下のような順序の原則を教えます。
次にモデルは、以下のような多くの次元にわたってフィードバックを受け取ります。
報酬システムは、長いビジュアルクリエーションタスクの中で、モデルが次にどのアクションを取るべきかを学習するのに役立つことを意図しています。
これが、「一度生成する」ことと「ループを通じて作成する」ことの中心的な違いです。
高解像度生成は直接的な計算問題を引き起こします。
画像がビジュアルトークンとして表現される場合、解像度を上げるとトークンの数が増加します。標準的なTransformerアテンションは、シーケンスが長くなるにつれてコストが高くなります。
トークンの数が2倍になると、基本的なフルアテンション計算は約4倍に増加する可能性があります。
したがって、8K画像は標準的な1Kや2K出力をはるかに超えるコンテキストと計算負荷を生み出す可能性があります。
センセンスタイムのチームへの公開インタビューでは、U1 Proが使用する2つの技術が説明されています。
多くの画像モデルは16×16パッチを使用します。
U1 Proは高解像度生成に32×32パッチを使用すると報告されています。各トークンがより大きな画像領域をカバーするため、同じ解像度での16×16パッチ数と比較して、ビジュアルトークンの数が約4分の1に減少します。
これにより、長く高解像度の出力がより扱いやすくなります。
より大きなパッチは別の問題を引き起こします。各トークンがより多くのピクセルを表現する必要があるため、小さなテキスト、テクスチャ、細かいエッジに対する制御が低下する可能性があります。
センセンスタイムは、適応型階層ノイズ制御でこれを補うと述べています。
より多くのディテールが必要な領域は、より集中した生成の努力を受け取り、モデルが元のトークン数に戻ることなく、タイポグラフィとテクスチャに対する制御を取り戻すのに役立ちます。
同社によると、その結果、視覚トークンシーケンスが制御不能に増加することなく、最大8Kのネイティブ出力と特別なアスペクト比をサポートします。
これらの詳細は、完全なU1
プロフェッショナル向け技術レポート。本プロダクションモデルの完全なアーキテクチャ、パラメータ数、学習データ、推論要件は、現時点ではまだ公開されていない。
画像生成競争は、歴史的にいくつかの段階を経て発展してきた。
初期のシステムは、認識可能なオブジェクトや一貫性のあるシーンを生成することに苦戦していた。
後のシステムでは、照明、質感、アナトミー、マテリアルレンダリング、写真のようなディテールが改善された。
使いやすい画像には、リアリズム以上のものが求められる。
必要とされる要素:
商湯科技は、この移行を、視覚生成から推論生成およびエージェント的創造への移行と表現している。
主張は、単一のモデルがあらゆるデザイン問題を解決したというものではない。評価目標が変化しているということだ。
美しい画像であっても、成果物として不合格となる可能性がある。
元の記事では、U1 Pro と GPT Image 2 のレシピポスター比較が行われている。
記事は、U1 Pro のよりすっきりした構成、より直接的な階層構造、優れた中国語テキストレンダリングを評価する一方、GPT の結果はより混雑しており、小さな装飾テキストに疑似文字が含まれていると説明している。
この比較は注意深く読む必要がある。
単一のプロンプトと選択された出力のペアは、普遍的なモデルの優位性を確立するものではない。画像システムは、シード、設定、プロンプトのバージョン、編集ワークフローによって異なる結果を生成する可能性がある。
有用な比較には、以下のテストが必要:
商湯科技社内のデザイナーによる評価は、1組の選択された出力よりも意味があるとはいえ、まだ自社運営によるものである。
入手可能な証拠によって支持される最も強い結論は、U1 Pro が中国語タイポグラフィ、密度の高い情報デザイン、東洋的なビジュアルディテール、ネイティブの高解像度構成において、非常に競争力が高いように思われるということである。
SenseNova U1 Pro は正式に発表され、商湯科技は公式製品ギャラリーを公開している。
しかし、完全な公開API製品としての一般提供はまだ開始されていない。
商湯科技の公式ソーシャルメディア発表によると:
2026年7月22日現在、公開製品ページはモデルの機能を実証しているものの、完全なAPI価格、スループット制限、またはセルフホスティング手順は提供されていない。
U1 Pro は、オープンソースの SenseNova U1 モデルと混同されるべきではない。
| 製品 | 提供状況 |
|---|---|
| SenseNova U1 ベースモデル | オープンソースのウェイト、コード、論文が利用可能 |
| SenseNova U1 インフォグラフィック V2/V3 | オープンソースの拡張版が利用可能 |
インフォグラフィックモデルが利用可能です。 |
| SenseNova U1 Pro | 招待制プレビューのみ。公式APIと価格は2026年8月を予定。 |
| SenseNova-Vision | オープンソースの統合コンピュータービジョンモデルと研究が公開されています。 |
すぐに試したい開発者は、公開されているSenseNova U1リポジトリとHugging Faceのリリースから始めることができます。
U1 Proに関する以下の重要な詳細は、まだ公開されていません。
現在のエビデンスは、主に企業のデモ、公式プロダクトギャラリー、内部評価結果、公開インタビュー、そしてオープンソースのU1ファミリーにより確立された技術基盤から構成されています。
本番環境での使用を検討しているチームは、APIのドキュメントを待ち、独自の評価を実施すべきです。
パブリックアクセスが可能になった場合、実用的な評価はアート的なプロンプトだけでなく、実際の成果物を用いて行うべきです。
以下を含めます。
既知のテキストを使用し、全ての文字を検証します。
測定項目:
1枚の優秀な画像と9枚の使い物にならない画像を生成するモデルよりも、やや性能が劣っても安定した出力が得られるモデルの方が価値が高い場合があります。
最良のサンプルだけでなく、合格率を追跡します。
他の要素を保持したまま、1つの要素を変更するようモデルに依頼します。
例:
8Kアセットをブラウザの縮小プレビューだけで判断しないでください。
以下を拡大して確認します。
以下を含めます。
最も安い生成が、必ずしも最も安い成果物とは限りません。
U1 Proは現在、ビジュアル制作に焦点を当てていますが、商湯科技はNEO-unifyをより広範な基盤として位置づけています。
同社のロードマップには以下が含まれます。
工業デザイン。
SenseNova-Visionは、従来のコンピュータビジョンタスクを1つのマルチモーダル生成フレームワークで表現するモデルとして、すでにSenseTimeからリリースされています。
このモデルは以下のタスクをカバーしています:
SenseNova-Visionは、タスクごとに個別の予測ヘッドを追加するのではなく、要求された視覚タスクに応じてテキスト、画像、または混合出力を生成します。
これは、SenseTimeのより大きな「Words to Worlds」の方向性を支えています。すなわち、言語と視覚はアダプターで接続された別々のシステムであるべきではなく、理解、生成、そして最終的には行動が可能な単一のモデルの中で発展すべきだという考え方です。
その発表のメッセージは、1つの実用的な主張に集約できます:
AIが生成したビジュアルコンテンツの最終基準は「見た目が良い」であるべきではない。「使える」であるべきだ。
U1 Proは、次の5つの関連するアイデアを通じて、その基準に到達しようと試みています:
このモデルが一貫してその水準に達しているかどうかは、より広範なAPIアクセス、独立したテスト、そして実際の顧客のワークフローを経て、より明確になるでしょう。
それでも、この発表は画像モデルがどのように位置づけられるかにおける重要な変化を示しています。
それらはもはや、単なる画像生成ツールとして提示されているわけではありません。
それらは、ビジュアル制作エージェントとして提示されているのです。
SenseNova U1 Proは、複雑なビジュアル制作タスクのためのSenseTimeのフラッグシップとなるネイティブマルチモーダルモデルです。理解、生成、行動を統合し、より高解像度で、テキストが豊富で、納品に適したビジュアルアセットを生成するように設計されています。
SenseTimeの公式製品ページによると、U1 Proは最大8Kの出力と特殊なアスペクト比をサポートしています。実際の解像度オプション、レイテンシ、ファイル形式、APIの制限については、公開APIドキュメントが利用可能になった時点で確認する必要があります。
U1 Proの重みは公開されていません。初期のSenseNova U1ベースモデルとインフォグラフィックモデルはオープンソースですが、U1 Proは現在、招待制のプレビューで利用可能なプロプライエタリなフラッグシップモデルです。
SenseTimeの公式発表によると、APIと価格は2026年8月を予定しています。7月22日現在、公開製品ページは公開されていますが、完全な公開APIアクセスと価格はまだ公開されていません。
NEO-unifyは、SenseTimeの統合された理解と生成のためのネイティブマルチモーダルアーキテクチャです。従来の視覚エンコーダ、言語モデル、画像VAEの分離を排除し、テキストトークンと画像トークンを単一のTransformerベースのシステム内で処理できるようにします。
これは、モデルが計画、生成、検査、
画像の編集、再描画、合成、仕上げを経て納品を行う。このモデルは、現在の中間結果に基づいて次の視覚的アクションを選択するように設計されている。
SenseTime社によると、U1 Proは内部評価でGPT Image 2と競合し、中国語テキスト、デザイン品質、東洋文化の細部において高い性能を示した。ただし、独立した広範なテストが依然として必要であり、性能はプロンプト、ワークフロー、評価方法によって異なる。
はい。SenseTime社は、SenseNova U1の研究論文、GitHubリポジトリ、Hugging Faceの重み、インフォグラフィック強化モデルを公開している。これらはU1 Proと同一ではないが、基礎となる統合モデルの方向性へのアクセスを提供する。
SenseNova U1 Proは、SenseTimeが画像生成をより要求の厳しいカテゴリー、すなわち本番納品へと移行させる試みである。これは、ネイティブなマルチモーダル統合、インターリーブされた視覚テキスト推論、エージェント型クリエーションループ、高密度な中国語テキストレンダリング、そして最大8Kの出力を兼ね備えている。
WAICのスクロールとローンチの例
異常に複雑なレイアウト、大規模なグループ、中国語タイポグラフィ、科学的なインフォグラフィック、製品広告、東洋的なビジュアルスタイルを示しています。これらは選ばれた企業事例であり、GPT Image 2との比較結果は、完全に独立した公開ベンチマークではなく、商湯科技(SenseTime)の独自評価に基づいています。
U1 Proは現在招待制のプレビュー段階であり、一般公開APIと価格設定は2026年8月を予定しています。開発者は既にオープンソースのSenseNova U1およびインフォグラフィックモデルを試用できますが、これらのリリースはProシステムとは異なります。
中心的な変化は、「AIが美しい画像を生成できるか」という問いから、「AIが完全なビジュアルアセットを確実に提供できるか」という問いへの移行です。
ひとことから始めて、数分で完全なサイトを手に入れましょう。