はじめに
WAIC 2026において、商湯科技(SenseTime)は次世代のマルチモーダルモデル SenseNova U1 Pro を発表しました。これは複雑な視覚的創造タスクのために設計されたフラッグシップモデルです。
発表デモでは、知能が世界を紡ぐ と題された超ワイドな東洋風都市巻物が披露されました。この画像は第9回世界人工知能会議のために作成され、2018年から2026年までのイベントの進化を一つの連続したビジュアルストーリーに凝縮しています。
この巻物は、都市のランドマーク、川、山々、群衆、建築物、ラベル、そして密度の高い歴史的詳細を、極めてワイドなキャンバス上に組み合わせたものです。商湯科技によると、この画像は別途手動のデザインパイプラインで組み立てられたものではなく、U1 Proによってネイティブの高解像度で直接生成されたとのことです。
このモデルのより広範な目標は、単一のデモンストレーションよりも重要です。
SenseNova U1 Proは、デリバリーグレードのネイティブマルチモーダルエージェント基盤モデルとして位置づけられています。プロンプトを受け取った直後に一枚の画像を生成するのではなく、レイアウトを推論し、ドラフトを生成し、中間結果を検査し、局所的な領域を修正し、より長い生成プロセスを通じて最終的な構図を洗練するように設計されています。
言い換えれば、商湯科技はAI画像生成を、「視覚的に印象的なものを作る」から「実際のデザインワークフローで使用できるアセットを生成する」へと移行させようとしているのです。

WAICのために作られた8K東洋巻物
会議の巻物は、標準的なポスターやソーシャルメディア画像というよりも、伝統的な中国の手巻きに近いパノラマ形式を使用しています。
9年間のWAICを一つの連続した風景でつなげています。構成には以下のものが含まれます:
- 山と水系
- 都市のランドマーク
- 会議会場
- 群衆と公共の場面
- 小さなラベルと注釈
- 異なる年にわたる視覚的なトーンの変化
- 全体にわたる一貫した墨と色彩の美学
このタイプの大きな画像を作成することは、いくつかの理由で困難です。
第一に、超ワイドな構図は、端から端まで首尾一貫していなければなりません。モデルは局所的に魅力的な領域を生成できる一方で、シーンの全体的な構造を失う可能性があります。
第二に、画像には多くの小さな物体やラベルが含まれています。標準的なプレビューではほとんど見えないエラーも、大きな壁に画像が表示されると明らかになります。
第三に、構成には連続性が必要です。建物、川、道路、山、テキストが、無関係な断片を貼り合わせたように感じられてはなりません。
商湯科技によると、U1 Proは最大 8K解像度 と特殊なアスペクト比での出力をサポートしています。公式製品ページでは、これを高解像度素材や詳細なビジュアルデリバリーを目的としたプロダクション機能として提示しています。
WAIC巻物のオンラインバージョンは圧縮されているため、元のディスプレイアセットの完全な品質は保持されていません。
異なるシーン、一つの生成モデル
発表記事では、U1 Proがいくつかの
視覚カテゴリーであり、モデルを1つの特徴的なスタイルに限定するものではない。
含まれていた例:
- 歴史的なパノラマ風景
- サスペンス映画のポスター
- アニメパフォーマンスのポスター
- プレミアム製品の広告
- 博物館・展覧会のポスター
- 科学インフォグラフィック
- 茶カテゴリーの情報デザイン
- キャラクター設定シート
- レシピイラスト
この幅広さが重要なのは、商業デザインが単一のタスクではないからだ。
有用なモデルは、その構成、タイポグラフィ、視覚的階層、素材の表現、色彩システム、情報密度を、意図されたフォーマットに適応させる必要がある。
大規模な人物群を含む歴史的パノラマ
一例として、唐代の長安・西市を21:9の構図で再現したものがある。

この画像には、大勢の人混み、複数の商店、馬、楽師、商人、子供、提灯、そして重層的な建築物が含まれている。
大規模な群衆シーンは、画像生成モデルにとって共通の失敗ポイントである。顔の重複、服装の重複、手の描写の崩れ、スケールの不一致、ポーズのコピーなどにより、シーンが合成的に感じられる原因となる。
U1 Proの例では、より広い街路の構図を保ちつつ、各キャラクターを視覚的に個別化しようと試みている。暖かい提灯の光、涼しげな夜のトーン、反射、そして建築物の奥行きが、1つのシーンの中で処理されている。
これは依然として、選定された企業によるデモであり、独立したベンチマークではない。しかし、商湯科技がモデルの核心と考える、密度の高い構図のタイプを示している。
物語性のあるスペースとタイポグラフィを備えたポスター
発表資料には、民国時代の上海を舞台にしたサスペンス映画のポスターも含まれていた。

構図は、雨、硝子の反射、霧、街灯、そして異なる奥行きに配置された複数のキャラクターを用いている。
この例のポイントは、単なるフォトリアリズムではない。モデルは、視覚的要素がどのように物語を支えるかを理解する必要がある:
- どの人物が焦点となる被写体か。
- どの人物を部分的に隠すべきか。
- 反射が実際の空間とどのように関係するか。
- タイトルを配置する場所。
- 環境がどのようにサスペンスを生み出すか。
- 補足的なテキストをどのように二次的なものに留めるか。
別の例である『長安不眠』は、5人の楽師、5つの楽器、個性的な衣装、そして金と赤の舞台構成を用いている。

これらのサンプルは、U1 Proが単なるプロンプトから画像を生成するレンダラーではなく、レイアウトとアートディレクションのシステムとしてより多く使用されていることを示している。
製品広告と素材の表現
商業広告は、モデルに異なる要求を突きつける。
製品のビジュアルは以下を保持しなければならない:
- パッケージ構造
- ブランドの階層
- 読みやすい商品名
- 一貫した素材感
- コントロールされた反射
- 正確なパースペクティブ
- マーケティングコピーのための余白
- 製品に視線を誘導する構図
ソース素材に示された紅茶の広告は、マットなパッケージ、金色の文字、白磁、木、茶葉、湯気を組み合わせている。

広告では素材の不整合が簡単に目立つ。プラスチックのように見える紙箱や、反射が不正確な陶器のカップは、結果全体を使い物にできなくさせる。
商湯科技は、U1 Proが複数の素材タイプを組み合わせつつ、コントロールされたビジュアルスタイルと読みやすい中国語のコピーを維持できると紹介している。
展示ポスターと2Dから3Dへのデザイン
展示ポスター『山河入画(山河が絵画に入る)』は、水墨のフォルムと立体的な山々や雲を組み合わせている。

下部は紙の上に墨が広がるように始まる。同じフォルムが徐々に、リアルな光とボリュームを備えた山々へと移行する。
赤いリボンが風景の中を進み、小さな人物像へと視線を誘導する。
この例は、いくつかのデザイン能力を示している:
- ポスター全体で一つのビジュアルコンセプトを維持すること。
- 平面的表現と立体的表現を組み合わせること。
- 強いスケール感を保持すること。
- イベント情報を構図内に配置すること。
- 中国語のタイトルと補足情報を読みやすく保つこと。
プロダクションアセットにおいては、テキストの正確性はビジュアル品質と同様に重要である。日付や文字が一つ間違っているポスターは、「ほぼ正しい」と評価することはできない。
長文の中国語テキストと科学的論理
テキストの多い画像は、画像生成システムにとって最も難しい領域の一つであり続けている。
モデルは二つの問題を同時に解決しなければならない:
- 要求された文字を正しくレンダリングすること。
- それらの文字を読みやすい情報構造に配置すること。
発表時に示された月相のインフォグラフィックは、タイトル、説明文、ラベル、図、教育的なカードを含んでいる。

また、太陽・地球・月の関係を物理的に意味のある形で表現する必要もある。
見た目に洗練されたインフォグラフィックでも、科学的な関係が間違っていれば失敗となり得る。このため、テキストの豊富な教育用グラフィックは、OCR的な文字レンダリング以上のものを試すことになる。それらは情報の構成と領域推論もテストするのだ。
別の発表例では、六大カテゴリーを提示している。
中国茶を放射状に配置したレイアウト。

この構成は以下の要素を組み合わせています。
- カテゴリ名。
- 茶葉のイメージ。
- 液体の色彩。
- 産地。
- それを補完する風景イラスト。
- 中心となる視覚的アンカー。
- 均等な間隔で配置された反復モジュール。
現在、商湯科技(SenseTime)の公式プロダクトページでは、同様の高密度インフォグラフィックを用いて、U1 Proの「精密なコンテンツ表現能力」を紹介しています。
生成だけでなく、納品のために設計されたモデル
商湯科技はU1 Proを、複雑なマルチモーダル納品タスクのためのシステムと説明しています。
この区別は重要です。
従来の画像生成器は、一般的に以下のプロセスをたどります。
プロンプト → 画像
ユーザーが結果の良し悪しを判断します。良くなければ、プロンプトを変更するか、別の編集ツールを使用します。
U1 Proは、より長い内部生成プロセスを使用するものとして提示されています。
リクエストを理解する
→ レイアウトを計画する
→ 初期構成を生成する
→ 結果を検査する
→ 局所領域を修正する
→ 要素を結合する
→ タイポグラフィと詳細を洗練する
→ 最終アセットを納品する
公式およびローンチ資料では、これをエージェンティック生成ループと呼んでいます。
このモデルは、1回の中断のない生成パスに依存するのではなく、複数の視覚的アクションを使用できます。
- 生成する。
- 編集する。
- 選択した領域を再描画する。
- 複数の要素を合成する。
- 既に生成されたものを検査する。
- 次にどのアクションを実行すべきかを決定する。
この設計は、コーディングシステムの進化に似ています。
コード補完モデルは次の行を予測します。エージェンティックコーディングシステムは、リポジトリを検査し、変更を計画し、ファイルを編集し、テストを実行し、エラーを読み取り、タスクが完了するまで継続できます。
商湯科技の主張は、視覚的創造も同じ方向に進んでいるというものです。
1文字の誤りがアセット全体を使用不能にする
平均的な視覚スコアは、プロダクションでの失敗を隠蔽する可能性があります。
画像に100文字の中国語が含まれ、99文字が正しいとします。平均的な文字精度に基づくベンチマークは高いスコアを割り当てるかもしれません。
しかし、顧客向けのポスターは別物です。
誤った文字が製品名、日付、住所、科学的記述、または法的通知に現れた場合、そのアセットは却下される必要があるかもしれません。
これにより、より厳格な品質定義が導かれます。
プロダクション画像は、ほとんどの要素が正しく見えるかどうかで判断されるのではありません。完全なアセットが納品可能かどうかで判断されるのです。
商湯科技は、200名の美術学校の学生とプロのデザイナーからなる内部評価パネルを組織したと報じられています。
質問は実用的なものでした。
この画像をクライアントに納品しても構わないと思いますか?
情報源の記事によると、評価された出力の少なくとも60%が直接納品可能と判断された場合、モデルは適格とみなされました。商湯科技は、その比較において、U1 ProとGPT Image 2のみがこの基準を満たしたと報告しました。
同社はさらに、U1 Proが以下の点で特に優れたパフォーマンスを示したと報告しています。
- 中国語テキストのレンダリング。
- グラフィックデザインの品質。
- 東洋文化。
詳細情報:
- 高情報密度のレイアウト。
これらの結果は、SenseTime社の内部評価方法に基づくものです。製品エビデンスとして有用ですが、独立して再現可能な公開ベンチマークとして扱うべきではありません。
NEO-unify: ネイティブ統合アーキテクチャ
U1 Proは、SenseTimeの NEO-unify アーキテクチャを基に構築されています。
初期のSenseNova U1モデルは、2026年4月に発表・オープンソース化されました。その研究論文では、マルチモーダルな理解、推論、生成に対するネイティブ統合アプローチについて説明されています。
多くのマルチモーダルシステムは、異なるコンポーネントから構成されています。
- ビジュアルエンコーダーが画像を理解のための表現に変換する。
- 言語モデルがテキストと推論を処理する。
- VAE(変分オートエンコーダー)または類似の画像デコーダーが生成を担当する。
- 追加のアダプターがコンポーネント間を接続する。
このアーキテクチャはうまく機能しますが、異なるモジュール間で内部空間に非互換性が生じる可能性があります。
NEO-unifyは異なるアプローチを採用しています。
SenseTimeによると、コアアーキテクチャから別個のビジュアルエンコーダーとVAEを排除し、テキストと画像情報が1つの表現と1つのTransformerベースの計算パスを共有できるようにしています。

簡略化して説明すると:
- テキストはワード埋め込みとして入力される。
- 画像はパッチ埋め込みとして入力される。
- 両者は同じモデル内で処理される。
- モデルは、1つの自己回帰シーケンス内でテキストトークンまたは画像パッチトークンを復号化できる。
このシステムは、どのモジュールが停止し、どのモジュールが開始すべきかを決定するための、別個の外部スケジューラーを必要としません。
モデルは次に来るものを予測します。テキストを続けることも、画像トークンに切り替えることも、後でテキストに戻ることもあります。
SenseTimeはこれを、マルチモーダル統合からネイティブマルチモーダル統一への移行と表現しています。
オープンソースのSenseNova U1モデルが確立したもの
U1 Pro以前に、SenseTimeは2つの主要なSenseNova U1バリエーションをリリースしました。
| モデル | 基本構造 | 主な役割 |
|---|---|---|
| SenseNova-U1-8B-MoT | Dense 8B理解基盤 | 統合された理解、推論、生成 |
| SenseNova-U1-A3B-MoT | 合計30B、約3BアクティブなMoE基盤 | より大規模なスパース統合モデル |
この研究プロジェクトは以下をカバーしています。
- テキスト理解。
- 視覚言語認識。
- 知識推論。
- エージェント的な意思決定。
- 空間知能。
- 画像生成。
- テキストリッチなインフォグラフィック生成。
- 画像とテキストが混在した生成。
- 初期のVision-Language-Actionおよびワールドモデルタスク。
SenseTimeは後に、インフォグラフィック強化版をリリースしました。公式リポジトリは現在、統合された生成・編集ワークフローとして Infographic V3 を推奨しています。
オープンソースのU1ファミリーは、基礎となる統一モデルの方向性に関する公開エビデンスを提供します。U1 Proは、ハイエンドなプロダクションデリバリーに焦点を当てた、より大規模なプロプライエタリフラッグシップモデルです。
インターリーブされた視覚テキスト推論
デリバリーグレードのデザインプロセスでは、通常、中間判断が伴います。
デザイナーは以下の判断を下す可能性があります。
- どの情報を
最も重要なこと。
2. どのグリッドや構図がフォーマットに合うか。
3. メインの主題がどこに属するか。
4. どの色を支配的にするべきか。
5. タイトルにどれだけのスペースが必要か。
6. どのディテールを簡略化すべきか。
7. 最初のバージョンがバランスが取れているか。
8. どのエリアに局所的な修正が必要か。
センセンスタイムは、U1 Proがインターリーブされた視覚-テキスト推論を通じて、同様のシーケンスを内面化すると述べています。
モデルは、画像全体を一度に完成させる必要はありません。内部分析と視覚的行動を交互に行い、現在の状態を繰り返し検査することができます。
公開インタビューで説明されたトレーニングプロセスには、2つの大きな段階があります。
指示ベースのコールドスタート
数分で紹介サイトを作り、リード獲得を伸ばす
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
チームはまず、専門的なデザイン判断を構造化された推論の例に整理します。
これらの例は、以下のような順序の原則を教えます。
- 装飾を洗練する前にレイアウトを確立する。
- 細かいテクスチャに取り組む前に支配的な色を設定する。
- セカンダリテキストを追加する前にメインの視覚的階層を安定させる。
- 最終レンダリングの前に情報の正確性を確認する。
多次元報酬による強化学習
次にモデルは、以下のような多くの次元にわたってフィードバックを受け取ります。
- 構図。
- テキストの正確性。
- 視覚的な美しさ。
- 一貫性。
- 情報の階層。
- 被写体の正確さ。
- 素材の品質。
- 局所的なディテール。
- 全体的なデリバリー品質。
報酬システムは、長いビジュアルクリエーションタスクの中で、モデルが次にどのアクションを取るべきかを学習するのに役立つことを意図しています。
これが、「一度生成する」ことと「ループを通じて作成する」ことの中心的な違いです。
トークン増加を制御しないネイティブ8K
高解像度生成は直接的な計算問題を引き起こします。
画像がビジュアルトークンとして表現される場合、解像度を上げるとトークンの数が増加します。標準的なTransformerアテンションは、シーケンスが長くなるにつれてコストが高くなります。
トークンの数が2倍になると、基本的なフルアテンション計算は約4倍に増加する可能性があります。
したがって、8K画像は標準的な1Kや2K出力をはるかに超えるコンテキストと計算負荷を生み出す可能性があります。
センセンスタイムのチームへの公開インタビューでは、U1 Proが使用する2つの技術が説明されています。
より大きな32×32画像パッチ
多くの画像モデルは16×16パッチを使用します。
U1 Proは高解像度生成に32×32パッチを使用すると報告されています。各トークンがより大きな画像領域をカバーするため、同じ解像度での16×16パッチ数と比較して、ビジュアルトークンの数が約4分の1に減少します。
これにより、長く高解像度の出力がより扱いやすくなります。
適応型階層ノイズ制御
より大きなパッチは別の問題を引き起こします。各トークンがより多くのピクセルを表現する必要があるため、小さなテキスト、テクスチャ、細かいエッジに対する制御が低下する可能性があります。
センセンスタイムは、適応型階層ノイズ制御でこれを補うと述べています。
より多くのディテールが必要な領域は、より集中した生成の努力を受け取り、モデルが元のトークン数に戻ることなく、タイポグラフィとテクスチャに対する制御を取り戻すのに役立ちます。
同社によると、その結果、視覚トークンシーケンスが制御不能に増加することなく、最大8Kのネイティブ出力と特別なアスペクト比をサポートします。
これらの詳細は、完全なU1
プロフェッショナル向け技術レポート。本プロダクションモデルの完全なアーキテクチャ、パラメータ数、学習データ、推論要件は、現時点ではまだ公開されていない。
生成品質と納品品質
画像生成競争は、歴史的にいくつかの段階を経て発展してきた。
第1段階:画像をリクエストに沿ったものにする
初期のシステムは、認識可能なオブジェクトや一貫性のあるシーンを生成することに苦戦していた。
第2段階:画像をリアルに見せる
後のシステムでは、照明、質感、アナトミー、マテリアルレンダリング、写真のようなディテールが改善された。
第3段階:画像を使いやすくする
使いやすい画像には、リアリズム以上のものが求められる。
必要とされる要素:
- 正しいテキスト
- 正確な情報
- プロフェッショナルなレイアウト
- 一貫性のあるブランディング
- 適切な寸法
- 編集可能な構造、または信頼性の高いローカル修正
- 複数回の試行における安定した結果
- 印刷品質のディテール
- 明確な承認プロセス
商湯科技は、この移行を、視覚生成から推論生成およびエージェント的創造への移行と表現している。
主張は、単一のモデルがあらゆるデザイン問題を解決したというものではない。評価目標が変化しているということだ。
美しい画像であっても、成果物として不合格となる可能性がある。
GPT Image 2 との比較
元の記事では、U1 Pro と GPT Image 2 のレシピポスター比較が行われている。
記事は、U1 Pro のよりすっきりした構成、より直接的な階層構造、優れた中国語テキストレンダリングを評価する一方、GPT の結果はより混雑しており、小さな装飾テキストに疑似文字が含まれていると説明している。
この比較は注意深く読む必要がある。
単一のプロンプトと選択された出力のペアは、普遍的なモデルの優位性を確立するものではない。画像システムは、シード、設定、プロンプトのバージョン、編集ワークフローによって異なる結果を生成する可能性がある。
有用な比較には、以下のテストが必要:
- 複数のプロンプトカテゴリ
- プロンプトごとの複数世代
- テキスト精度
- レイアウトの一貫性
- 編集可能性
- 参照画像への追従性
- コスト
- レイテンシ
- 解像度
- 失敗率
- 人間の選好
- 最終アセットが納品可能かどうか
商湯科技社内のデザイナーによる評価は、1組の選択された出力よりも意味があるとはいえ、まだ自社運営によるものである。
入手可能な証拠によって支持される最も強い結論は、U1 Pro が中国語タイポグラフィ、密度の高い情報デザイン、東洋的なビジュアルディテール、ネイティブの高解像度構成において、非常に競争力が高いように思われるということである。
提供状況とリリースステータス
SenseNova U1 Pro は正式に発表され、商湯科技は公式製品ギャラリーを公開している。
しかし、完全な公開API製品としての一般提供はまだ開始されていない。
商湯科技の公式ソーシャルメディア発表によると:
- 招待制のプレビューが利用可能である。
- 公式APIのローンチと価格設定は、2026年8月を予定している。
2026年7月22日現在、公開製品ページはモデルの機能を実証しているものの、完全なAPI価格、スループット制限、またはセルフホスティング手順は提供されていない。
U1 Pro は、オープンソースの SenseNova U1 モデルと混同されるべきではない。
| 製品 | 提供状況 |
|---|---|
| SenseNova U1 ベースモデル | オープンソースのウェイト、コード、論文が利用可能 |
| SenseNova U1 インフォグラフィック V2/V3 | オープンソースの拡張版が利用可能 |
インフォグラフィックモデルが利用可能です。 |
| SenseNova U1 Pro | 招待制プレビューのみ。公式APIと価格は2026年8月を予定。 |
| SenseNova-Vision | オープンソースの統合コンピュータービジョンモデルと研究が公開されています。 |
すぐに試したい開発者は、公開されているSenseNova U1リポジトリとHugging Faceのリリースから始めることができます。
まだ公開されていない情報
U1 Proに関する以下の重要な詳細は、まだ公開されていません。
- パラメータ数
- アクティブパラメータ数
- 完全なトレーニングデータの説明
- ハードウェア要件
- 8Kでの生成レイテンシ
- APIレート制限
- API価格
- 対応する編集インターフェース
- 商用データ保持ポリシー
- セーフティフィルターの動作
- モデルの重みがリリースされるかどうか
- 幅広いプロンプトセットにおける独立したベンチマーク結果
現在のエビデンスは、主に企業のデモ、公式プロダクトギャラリー、内部評価結果、公開インタビュー、そしてオープンソースのU1ファミリーにより確立された技術基盤から構成されています。
本番環境での使用を検討しているチームは、APIのドキュメントを待ち、独自の評価を実施すべきです。
実際のデザインワークでU1 Proを評価する方法
パブリックアクセスが可能になった場合、実用的な評価はアート的なプロンプトだけでなく、実際の成果物を用いて行うべきです。
- 代表的なプロンプトセットを構築する
以下を含めます。
- 製品広告
- イベントポスター
- 教育用インフォグラフィック
- キャラクターシート
- ソーシャルメディアカバー
- 雑誌レイアウト
- 科学図表
- ブランド要素が多いアセット
- 超ワイド画像
- 長文の中国語コピー
- テキストの正確性をテストする
既知のテキストを使用し、全ての文字を検証します。
測定項目:
- タイトルの正確性
- 本文の正確性
- 数字
- 日付
- 住所
- 製品名
- 句読点
- 繰り返しラベル
- 複数の結果を生成する
1枚の優秀な画像と9枚の使い物にならない画像を生成するモデルよりも、やや性能が劣っても安定した出力が得られるモデルの方が価値が高い場合があります。
最良のサンプルだけでなく、合格率を追跡します。
- 局所的な修正をテストする
他の要素を保持したまま、1つの要素を変更するようモデルに依頼します。
例:
- 1つの日付を修正する
- 製品の色を変更する
- タイトルを移動する
- 1人のキャラクターを削除する
- 背景を変更する
- 会場を更新する
- レイアウトを維持したままコピーを翻訳する
- 最終出力サイズで検査する
8Kアセットをブラウザの縮小プレビューだけで判断しないでください。
以下を拡大して確認します。
- 小さなテキスト
- 手と顔
- エッジの品質
- 製品ロゴ
- 繰り返しパターン
- 細かいテクスチャ
- 図表ラベル
- 遠近関係
- ワークフロー全体のコストを比較する
以下を含めます。
- 生成時間
- APIコスト
- 試行回数
- 人の修正時間
- 外部編集
- アップスケーリング
- タイポグラフィ修正
- 承認とエクスポート
最も安い生成が、必ずしも最も安い成果物とは限りません。
1枚の画像から統合ビジュアルシステムへ
U1 Proは現在、ビジュアル制作に焦点を当てていますが、商湯科技はNEO-unifyをより広範な基盤として位置づけています。
同社のロードマップには以下が含まれます。
- 一般的な視覚認識
- 空間インテリジェンス
- ビジョン・ランゲージ・アクションシステム
- 具現化インテリジェンス
- ワールドモデル
- 都市計画
- 建築および
工業デザイン。
SenseNova-Visionは、従来のコンピュータビジョンタスクを1つのマルチモーダル生成フレームワークで表現するモデルとして、すでにSenseTimeからリリースされています。
このモデルは以下のタスクをカバーしています:
- 物体検出
- OCR
- キーポイント推定
- セグメンテーション
- 深度推定
- サーフェスノーマル
- ポイントマップ
- カメラポーズ推定
- マルチビュー視覚幾何学
SenseNova-Visionは、タスクごとに個別の予測ヘッドを追加するのではなく、要求された視覚タスクに応じてテキスト、画像、または混合出力を生成します。
これは、SenseTimeのより大きな「Words to Worlds」の方向性を支えています。すなわち、言語と視覚はアダプターで接続された別々のシステムであるべきではなく、理解、生成、そして最終的には行動が可能な単一のモデルの中で発展すべきだという考え方です。
U1 Proが証明しようとしていること
その発表のメッセージは、1つの実用的な主張に集約できます:
AIが生成したビジュアルコンテンツの最終基準は「見た目が良い」であるべきではない。「使える」であるべきだ。
U1 Proは、次の5つの関連するアイデアを通じて、その基準に到達しようと試みています:
- テキストと画像のためのネイティブな統合アーキテクチャ
- インターリーブされた推論と視覚的なアクション
- 長期的なエージェント生成ループ
- 最大8Kの高解像度出力
- 孤立した美しさではなく、完全な納品可能性に基づく評価
このモデルが一貫してその水準に達しているかどうかは、より広範なAPIアクセス、独立したテスト、そして実際の顧客のワークフローを経て、より明確になるでしょう。
それでも、この発表は画像モデルがどのように位置づけられるかにおける重要な変化を示しています。
それらはもはや、単なる画像生成ツールとして提示されているわけではありません。
それらは、ビジュアル制作エージェントとして提示されているのです。
よくある質問
SenseNova U1 Proとは何ですか?
SenseNova U1 Proは、複雑なビジュアル制作タスクのためのSenseTimeのフラッグシップとなるネイティブマルチモーダルモデルです。理解、生成、行動を統合し、より高解像度で、テキストが豊富で、納品に適したビジュアルアセットを生成するように設計されています。
SenseNova U1 Proはネイティブ8K画像を生成できますか?
SenseTimeの公式製品ページによると、U1 Proは最大8Kの出力と特殊なアスペクト比をサポートしています。実際の解像度オプション、レイテンシ、ファイル形式、APIの制限については、公開APIドキュメントが利用可能になった時点で確認する必要があります。
SenseNova U1 Proはオープンソースですか?
U1 Proの重みは公開されていません。初期のSenseNova U1ベースモデルとインフォグラフィックモデルはオープンソースですが、U1 Proは現在、招待制のプレビューで利用可能なプロプライエタリなフラッグシップモデルです。
SenseNova U1 ProのAPIはいつ利用可能になりますか?
SenseTimeの公式発表によると、APIと価格は2026年8月を予定しています。7月22日現在、公開製品ページは公開されていますが、完全な公開APIアクセスと価格はまだ公開されていません。
NEO-unifyとは何ですか?
NEO-unifyは、SenseTimeの統合された理解と生成のためのネイティブマルチモーダルアーキテクチャです。従来の視覚エンコーダ、言語モデル、画像VAEの分離を排除し、テキストトークンと画像トークンを単一のTransformerベースのシステム内で処理できるようにします。
エージェント生成ループとは何ですか?
これは、モデルが計画、生成、検査、
画像の編集、再描画、合成、仕上げを経て納品を行う。このモデルは、現在の中間結果に基づいて次の視覚的アクションを選択するように設計されている。
U1 ProはGPT Image 2より優れているのか?
SenseTime社によると、U1 Proは内部評価でGPT Image 2と競合し、中国語テキスト、デザイン品質、東洋文化の細部において高い性能を示した。ただし、独立した広範なテストが依然として必要であり、性能はプロンプト、ワークフロー、評価方法によって異なる。
開発者は今すぐSenseNova U1の技術を試せるのか?
はい。SenseTime社は、SenseNova U1の研究論文、GitHubリポジトリ、Hugging Faceの重み、インフォグラフィック強化モデルを公開している。これらはU1 Proと同一ではないが、基礎となる統合モデルの方向性へのアクセスを提供する。
関連ツール
- SenseNova U1 Pro: SenseTimeの主力クリエーションモデルの公式プロダクトギャラリーと機能概要。
- SenseNova U1 GitHubリポジトリ: 公式オープンソースコード、ドキュメント、モデル情報、インフォグラフィックのリリース。
- Hugging Face上のSenseNova: 公式モデルの重み、モデルカード、研究リソース。
- SenseNova U1 インフォグラフィック V3: インフォグラフィック生成・編集向けの推奨オープンソースU1リリース。
- SenseNova-Vision: SenseTimeのオープンソース統合コンピュータビジョンモデルとコーパス。
- SenseNovaプラットフォーム: SenseTimeの公式モデルコンソールおよび開発者プラットフォーム。
関連リンク
- SenseNova U1 Pro 公式製品ページ: 8K出力、複雑な情報、プロフェッショナルデザイン、複数のビジュアルシナリオをカバーする公式サンプル。
- SenseTime WAIC 2026 プレビュー: U1 ProとそのWAICローンチを予告するSenseTimeの公式発表。
- SenseNova U1 公式オープンソース発表: オープンソースの統合理解・生成モデルファミリーの公式紹介。
- SenseNova U1 研究論文: NEO-unifyアーキテクチャとオリジナルのU1モデルを説明する技術論文。
- NEO-unify 技術ブログ: ネイティブ統合アーキテクチャに関するSenseTimeの技術概要。
- SenseNova U1 GitHubリポジトリ: 公式コード、モデルリンク、アーキテクチャ詳細、インフォグラフィックドキュメント。
- SenseNova-Vision 研究論文: 統合マルチモーダル生成による従来のコンピュータビジョンタスクの表現に関する研究。
まとめ
SenseNova U1 Proは、SenseTimeが画像生成をより要求の厳しいカテゴリー、すなわち本番納品へと移行させる試みである。これは、ネイティブなマルチモーダル統合、インターリーブされた視覚テキスト推論、エージェント型クリエーションループ、高密度な中国語テキストレンダリング、そして最大8Kの出力を兼ね備えている。
WAICのスクロールとローンチの例
異常に複雑なレイアウト、大規模なグループ、中国語タイポグラフィ、科学的なインフォグラフィック、製品広告、東洋的なビジュアルスタイルを示しています。これらは選ばれた企業事例であり、GPT Image 2との比較結果は、完全に独立した公開ベンチマークではなく、商湯科技(SenseTime)の独自評価に基づいています。
U1 Proは現在招待制のプレビュー段階であり、一般公開APIと価格設定は2026年8月を予定しています。開発者は既にオープンソースのSenseNova U1およびインフォグラフィックモデルを試用できますが、これらのリリースはProシステムとは異なります。
中心的な変化は、「AIが美しい画像を生成できるか」という問いから、「AIが完全なビジュアルアセットを確実に提供できるか」という問いへの移行です。



