소개
WAIC 2026에서 SenseTime은 복잡한 시각적 창작 작업을 위한 차세대 플래그십 멀티모달 모델인 SenseNova U1 Pro를 공개했습니다.
공개 시연은 지혜로 만나는 세계라는 제목의 초광각 동양식 도시 두루마리를 중심으로 진행되었습니다. 이 이미지는 제9회 세계 인공지능 컨퍼런스를 위해 제작되었으며, 2018년부터 2026년까지의 행사 발전 과정을 하나의 연속적인 시각적 내러티브로 압축했습니다.
이 두루마리는 비정상적으로 넓은 캔버스에 도시 랜드마크, 강, 산, 군중, 건축물, 라벨 및 조밀한 역사적 세부 사항을 결합했습니다. SenseTime은 이 이미지가 별도의 수동 디자인 파이프라인을 통해 조합된 것이 아니라 U1 Pro에 의해 네이티브 고해상도로 직접 생성되었다고 밝혔습니다.
이 모델의 더 광범위한 목표는 단일 시연보다 더 중요합니다.
SenseNova U1 Pro는 전달 등급 네이티브 멀티모달 에이전트 기반 모델로 포지셔닝됩니다. 프롬프트를 수신한 후 즉시 하나의 이미지를 생성하는 대신, 레이아웃을 추론하고, 초안을 생성하며, 중간 결과를 검사하고, 로컬 영역을 수정하고, 더 긴 생성 과정을 통해 최종 구성을 개선하도록 설계되었습니다.
다시 말해, SenseTime은 AI 이미지 생성을 '시각적으로 인상적인 것을 만드는 것'에서 '실제 디자인 워크플로에서 사용할 수 있는 자산을 생산하는 것'으로 이동시키려고 노력하고 있습니다.

WAIC를 위해 제작된 8K 동양 두루마리
컨퍼런스 두루마리는 표준 포스터나 소셜 미디어 이미지보다는 전통적인 중국 손두루마리에 더 가까운 파노라마 형식을 사용합니다.
하나의 연속적인 풍경을 통해 9년간의 WAIC를 연결합니다. 구성에는 다음이 포함됩니다:
- 산과 수계
- 도시 랜드마크
- 컨퍼런스 장소
- 군중과 공공 장면
- 작은 라벨과 주석
- 다양한 연도에 걸친 시각적 톤의 변화
- 전체 너비에 걸친 일관된 수묵과 컬러 미학
이 유형의 대형 이미지를 만드는 것은 여러 이유로 어렵습니다.
첫째, 초광각 구성은 한쪽 끝에서 다른 쪽 끝까지 일관성을 유지해야 합니다. 모델은 장면의 글로벌 구조를 잃으면서 매력적인 로컬 영역을 생성할 수 있습니다.
둘째, 이미지에는 많은 작은 객체와 라벨이 포함되어 있습니다. 표준 미리보기에서는 거의 보이지 않는 오류가 이미지가 대형 벽에 표시될 때 명확해집니다.
셋째, 구성에는 연속성이 필요합니다. 건물, 강, 도로, 산 및 텍스트가 함께 붙여진 관련 없는 조각처럼 느껴져서는 안 됩니다.
SenseTime은 U1 Pro가 최대 8K 해상도와 비정상적인 종횡비의 출력을 지원한다고 말합니다. 공식 제품 페이지는 이를 고해상도 자료와 세부적인 시각적 전달을 위한 프로덕션 기능으로 제시합니다.
WAIC 두루마리의 온라인 버전은 압축되어 있어 원본 디스플레이 자산의 전체 품질을 보존하지 못합니다.
다른 장면, 하나의 창작 모델
출시 기사는 여러 분야에 걸쳐 U1 Pro를 제시했습니다.
시각적 범주를 중심으로 모델을 하나의 시그니처 스타일로 제한하지 않습니다.
포함된 예시:
- 역사적인 파노라마 장면
- 서스펜스 영화 포스터
- 애니메이션 공연 포스터
- 프리미엄 제품 광고
- 박물관 및 전시 포스터
- 과학 인포그래픽
- 차(茶) 카테고리 정보 디자인
- 캐릭터 설정 시트
- 레시피 일러스트레이션
이러한 다양성이 중요한 이유는 상업 디자인이 단일 작업이 아니기 때문입니다.
유용한 모델은 구성, 타이포그래피, 시각적 위계, 재질 표현, 색상 체계, 정보 밀도를 의도된 형식에 맞게 조정할 수 있어야 합니다.
대규모 인물 군상이 있는 역사적 파노라마
한 예시는 당나라 시대 장안의 서시장을 21:9 구성으로 재현했습니다.

이미지에는 많은 군중, 여러 상점, 말, 악사, 상인, 아이들, 등불, 그리고 층층이 쌓인 건축물이 포함되어 있습니다.
대규모 군중 장면은 이미지 모델의 일반적인 실패 지점입니다. 반복되는 얼굴, 중복된 의상, 기형적인 손, 일관되지 않은 크기, 복사된 포즈는 장면을 인위적으로 보이게 만듭니다.
U1 Pro 예시는 더 큰 거리 구성을 유지하면서 각 캐릭터를 시각적으로 구별되게 표현하려고 시도합니다. 따뜻한 등불 빛, 차가운 밤 톤, 반사, 건축적 깊이가 하나의 장면 안에서 처리됩니다.
이는 여전히 선별된 회사 데모일 뿐 독립적인 벤치마크는 아닙니다. 그러나 SenseTime이 모델의 핵심으로 간주하는 조밀한 구성의 유형을 보여줍니다.
내러티브 공간과 타이포그래피가 있는 포스터
출시 자료에는 또한 민국 시대 상하이를 배경으로 한 서스펜스 영화 포스터가 포함되었습니다.

구성은 비, 유리 반사, 안개, 가로등, 그리고 다양한 깊이에 있는 여러 인물을 사용합니다.
이 예시의 요점은 단순한 사실적 재현이 아닙니다. 모델은 시각적 요소가 어떻게 내러티브를 지원하는지 이해해야 합니다:
- 어떤 인물이 초점 대상인지
- 어떤 인물들이 부분적으로 숨겨져 있어야 하는지
- 반사가 실제 공간과 어떻게 관계하는지
- 제목이 어디에 속하는지
- 환경이 어떻게 서스펜스를 조성하는지
- 보조 텍스트가 어떻게 부차적으로 유지되어야 하는지
또 다른 예시인 《장안불면(長安不眠)》은 다섯 명의 악사, 다섯 가지 악기, 독특한 의상, 그리고 금색과 빨간색 무대 구성을 사용합니다.

이 샘플들은 U1 Pro가 단순한 프롬프트-이미지 렌더러보다는 레이아웃 및 아트 디렉션 시스템에 더 가깝게 사용되고 있음을 보여줍니다.
제품 광고와 재질 표현
상업 광고는 모델에게 다른 요구 사항을 제시합니다.
제품의 시각적 표현은 다음을 반드시 유지해야 합니다:
- 포장 구조
- 브랜드 위계
- 읽을 수 있는 제품명
- 일관된 소재
- 통제된 반사
- 정확한 원근감
- 마케팅 카피를 위한 공간
- 제품에 시선을 집중시키는 구성
원본 자료에 나온 차 광고는 무광택 포장, 금색 글씨, 백자, 목재, 찻잎, 그리고 증기를 결합하고 있습니다.

소재의 불일치는 광고에서 쉽게 눈에 띕니다. 플라스틱처럼 보이는 종이 상자나 반사가 부정확한 세라믹 컵은 전체 결과물을 사용할 수 없게 만들 수 있습니다.
SenseTime은 U1 Pro가 통제된 시각적 스타일과 읽기 쉬운 중국어 카피를 유지하면서 여러 소재 유형을 결합할 수 있다고 소개합니다.
전시 포스터 및 2D-3D 디자인
전시 포스터 산천입화(山川入畫) 는 수묵화 형태와 입체적인 산과 구름을 결합하고 있습니다.

아래 부분은 종이 위에 번지는 먹으로 시작됩니다. 같은 형태가 점차 현실적인 빛과 볼륨감을 가진 산으로 전환됩니다.
붉은 리본이 풍경 속을 가로지르며 시선을 작은 인물 쪽으로 이끕니다.
이 예시는 여러 디자인 역량을 보여줍니다:
- 포스터 전체에 걸쳐 하나의 시각적 콘셉트 유지
- 평면 렌더링과 입체 렌더링의 결합
- 강한 스케일 관계 유지
- 구성 내에 이벤트 정보 배치
- 중국어 제목과 부가 정보의 가독성 유지
프로덕션 자산의 경우 텍스트 정확도는 시각적 품질만큼 중요합니다. 날짜나 글자가 하나라도 잘못된 포스터는 단순히 "대부분 정확함"으로 평가될 수 없습니다.
긴 중국어 텍스트와 과학적 논리
텍스트가 풍부한 이미지는 여전히 이미지 생성 시스템에게 가장 어려운 영역 중 하나입니다.
모델은 두 가지 문제를 동시에 해결해야 합니다:
- 요청된 문자를 올바르게 렌더링
- 해당 문자를 읽기 쉬운 정보 구조로 배치
출시 시 공개된 월령 인포그래픽은 제목, 설명 단락, 레이블, 다이어그램 및 교육용 카드를 포함하고 있습니다.

또한 태양-지구-달 관계를 물리적으로 의미 있는 방식으로 표현해야 합니다.
과학적 관계가 틀리다면 시각적으로 세련된 인포그래픽도 실패할 수 있습니다. 이러한 이유로 텍스트가 풍부한 교육용 그래픽은 OCR과 유사한 문자 렌더링 이상의 것을 테스트합니다. 정보 구성과 도메인 추론도 함께 테스트합니다.
또 다른 출시 예시는 여섯 가지 주요 범주를 제시합니다.
방사형 레이아웃으로 배치된 중국 차에 관한 이미지입니다.

구성 요소는 다음과 같습니다:
- 카테고리 이름.
- 찻잎 이미지.
- 액체 색상.
- 원산지.
- 보조 풍경 일러스트레이션.
- 중앙 시각적 앵커.
- 일정한 간격으로 반복되는 모듈.
SenseTime의 공식 제품 페이지는 현재 유사한 고밀도 인포그래픽을 사용하여 U1 Pro의 '정밀한 콘텐츠 표현' 기능을 보여줍니다.
단순 생성이 아닌 전달을 위해 설계된 모델
SenseTime은 U1 Pro를 복잡한 멀티모달 전달 작업을 위한 시스템이라고 설명합니다.
이 구분은 중요합니다.
전통적인 이미지 생성기는 일반적으로 다음 과정을 따릅니다:
프롬프트 → 이미지
사용자가 결과물이 적합한지 판단합니다. 적합하지 않으면 프롬프트를 변경하거나 다른 편집 도구를 적용합니다.
U1 Pro는 더 긴 내부 생성 과정을 사용하는 것으로 제시됩니다:
요청 이해
→ 레이아웃 계획
→ 초기 구성 생성
→ 결과 검사
→ 지역별 수정
→ 요소 결합
→ 타이포그래피 및 세부 사항 정제
→ 최종 자산 전달
공식 및 출시 자료에서는 이를 **에이전틱 생성 루프(Agentic Generation Loop)**라고 부릅니다.
이 모델은 중단 없는 단일 생성 패스에 의존하지 않고 여러 시각적 작업을 사용할 수 있습니다:
- 생성.
- 편집.
- 선택 영역 다시 그리기.
- 여러 요소 합성.
- 이미 생성된 내용 검사.
- 다음에 수행할 작업 결정.
이 설계는 코딩 시스템의 진화와 유사합니다.
코드 완성 모델은 다음 줄을 예측합니다. 에이전틱 코딩 시스템은 저장소를 검사하고, 변경을 계획하고, 파일을 편집하고, 테스트를 실행하고, 오류를 읽고, 작업이 완료될 때까지 계속할 수 있습니다.
SenseTime의 주장은 시각적 창작도 같은 방향으로 나아가고 있다는 것입니다.
한 글자 오류로 전체 자산이 사용 불가능해질 수 있다
평균적인 시각적 점수는 제작 실패를 감출 수 있습니다.
이미지에 100개의 한자가 포함되어 있고 99개가 정확하다고 가정해 봅시다. 평균 문자 정확도 기반 벤치마크는 높은 점수를 부여할 수 있습니다.
하지만 고객용 포스터는 다릅니다.
잘못된 문자가 제품명, 날짜, 주소, 과학적 진술 또는 법적 고지에 나타나면 해당 자산은 거부될 수 있습니다.
이는 품질에 대한 더 엄격한 정의로 이어집니다:
제작 이미지는 대부분의 요소가 올바르게 보이는지 여부로 판단되지 않습니다. 전체 자산이 전달될 수 있는지 여부로 판단됩니다.
SenseTime은 200명의 미술대 학생과 전문 디자이너로 구성된 내부 평가 패널을 구성했다고 합니다.
질문은 실용적이었습니다:
이 이미지를 고객에게 전달할 의향이 있습니까?
해당 기사에 따르면, 평가된 출력물의 최소 60%가 직접 전달 가능하다고 판단될 때 모델이 자격을 갖춘 것으로 간주되었습니다. SenseTime은 U1 Pro와 GPT Image 2만이 비교 대상 중 이 기준을 충족하는 유일한 시스템이라고 보고했습니다.
또한 SenseTime은 U1 Pro가 다음 분야에서 특히 우수한 성과를 보였다고 보고했습니다:
- 중국어 텍스트 렌더링.
- 그래픽 디자인 품질.
- 동양 문화.
상세 내용:
- 고밀도 정보 레이아웃
이 결과는 SenseTime의 내부 평가 방법론을 기반으로 합니다. 제품 증빙 자료로서 유용하지만, 독립적으로 재현된 공개 벤치마크로 간주해서는 안 됩니다.
NEO-unify: 네이티브 통합 아키텍처
U1 Pro는 SenseTime의 NEO-unify 아키텍처를 기반으로 구축되었습니다.
이전 SenseNova U1 모델은 2026년 4월에 출시 및 오픈소스로 공개되었으며, 해당 연구 논문에서는 멀티모달 이해, 추론 및 생성을 위한 네이티브 통합 접근 방식을 설명합니다.
많은 멀티모달 시스템은 서로 다른 구성 요소로 조립됩니다:
- 시각 인코더는 이미지를 이해를 위한 표현으로 변환합니다.
- 언어 모델은 텍스트와 추론을 처리합니다.
- VAE 또는 유사한 이미지 디코더는 생성을 담당합니다.
- 추가 어댑터가 구성 요소를 연결합니다.
이 아키텍처는 잘 작동할 수 있지만, 서로 다른 모듈이 호환되지 않는 내부 공간을 학습할 가능성이 있습니다.
NEO-unify는 다른 접근 방식을 취합니다.
SenseTime은 핵심 아키텍처에서 별도의 시각 인코더와 VAE를 제거하여 텍스트와 이미지 정보가 하나의 표현과 하나의 Transformer 기반 계산 경로를 공유할 수 있도록 한다고 밝혔습니다.

간단히 설명하면:
- 텍스트는 단어 임베딩으로 입력됩니다.
- 이미지는 패치 임베딩으로 입력됩니다.
- 둘 다 동일한 모델 내에서 처리됩니다.
- 모델은 하나의 자기회귀 시퀀스 내에서 텍스트 토큰이나 이미지 패치 토큰을 디코딩할 수 있습니다.
시스템은 한 모듈이 중단되고 다른 모듈이 시작되어야 한다고 결정하는 별도의 외부 스케줄러가 필요하지 않습니다.
모델은 다음에 올 것을 예측합니다. 텍스트를 계속하거나 이미지 토큰으로 전환한 후 다시 텍스트로 돌아올 수 있습니다.
SenseTime은 이를 멀티모달 통합에서 네이티브 멀티모달 통일로의 전환으로 설명합니다.
오픈소스 SenseNova U1 모델이 확립한 것
U1 Pro 이전에 SenseTime은 두 가지 주요 SenseNova U1 변형을 출시했습니다:
| 모델 | 기본 구조 | 주요 역할 |
|---|---|---|
| SenseNova-U1-8B-MoT | Dense 8B 이해 기반 | 통합 이해, 추론 및 생성 |
| SenseNova-U1-A3B-MoT | 총 30B, 약 3B 활성 MoE 기반 | 더 큰 희소 통합 모델 |
연구 프로젝트는 다음을 다룹니다:
- 텍스트 이해
- 시각-언어 인식
- 지식 추론
- 에이전트 기반 의사 결정
- 공간 지능
- 이미지 생성
- 텍스트 풍부 인포그래픽 생성
- 혼합 이미지 및 텍스트 생성
- 초기 Vision-Language-Action 및 월드 모델 작업
SenseTime은 이후 인포그래픽 강화 버전을 출시했습니다. 공식 저장소는 현재 통합 생성 및 편집 워크플로를 위해 Infographic V3를 권장합니다.
오픈소스 U1 제품군은 기본 통합 모델 방향에 대한 공개 증거를 제공합니다. U1 Pro는 고급 프로덕션 전달에 초점을 맞춘 더 큰 독점 플래그십 모델입니다.
혼합 시각-텍스트 추론
프로덕션급 디자인 프로세스는 일반적으로 중간 판단을 포함합니다.
디자이너는 다음과 같이 결정할 수 있습니다:
- 어떤 정보가
가장 중요한 것은 무엇인지.
2. 어떤 그리드나 구도가 형식에 맞는지.
3. 주요 주제가 어디에 위치해야 하는지.
4. 어떤 색상이 주를 이루어야 하는지.
5. 제목에 필요한 공간이 얼마인지.
6. 어떤 세부 요소를 단순화해야 하는지.
7. 첫 번째 버전이 균형 잡혀 있는지.
8. 어떤 영역에 국소적인 수정이 필요한지.
SenseTime은 U1 Pro가 인터리브드 시각-텍스트 추론을 통해 유사한 시퀀스를 내재화한다고 밝혔다.
이 모델은 한 번에 전체 이미지를 완성할 필요가 없다. 내부 분석과 시각적 행동을 번갈아 수행하며 현재 상태를 반복적으로 검사할 수 있다.
공개 인터뷰에서 설명된 학습 과정은 두 가지 큰 단계로 구성된다.
명령 기반 콜드 스타트
팀은 먼저 전문적인 디자인 판단을 구조화된 추론 예제로 정리한다.
이 예제들은 다음과 같은 순서 원칙을 가르친다:
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
- 장식을 다듬기 전에 레이아웃을 확립할 것.
- 작은 질감을 작업하기 전에 주요 색상을 설정할 것.
- 보조 텍스트를 추가하기 전에 주요 시각적 계층 구조를 안정화할 것.
- 최종 렌더링 전에 정보의 정확성을 확인할 것.
다차원 보상을 통한 강화 학습
그런 다음 모델은 다양한 차원에서 피드백을 받는다:
- 구도(Composition).
- 텍스트 정확성.
- 시각적 심미성.
- 일관성.
- 정보 계층 구조.
- 주제 정확성.
- 재질 품질.
- 국소적 세부 사항.
- 전반적인 전달 가능성.
보상 시스템은 긴 시각적 창작 작업 중에 모델이 다음에 어떤 행동을 취해야 하는지 학습하도록 돕기 위한 것이다.
이것이 '한 번에 생성'과 '루프를 통한 창작'의 핵심 차이점이다.
통제되지 않은 토큰 증가 없이 기본 8K 지원
고해상도 생성은 직접적인 계산 문제를 야기한다.
이미지가 시각적 토큰으로 표현될 때, 해상도를 높이면 토큰 수가 증가한다. 표준 트랜스포머 어텐션은 시퀀스가 길어질수록 더 많은 비용이 든다.
토큰 수가 두 배로 증가하면 기본 전체 어텐션 계산은 약 4배 증가할 수 있다.
따라서 8K 이미지는 표준 1K 또는 2K 출력보다 훨씬 더 큰 컨텍스트와 계산 부담을 초래할 수 있다.
SenseTime 팀과의 공개 인터뷰에서는 U1 Pro가 사용하는 두 가지 기술을 설명한다.
더 큰 32×32 이미지 패치
많은 이미지 모델은 16×16 패치를 사용한다.
U1 Pro는 고해상도 생성을 위해 32×32 패치를 사용한다고 알려져 있다. 각 토큰은 더 넓은 이미지 영역을 커버하므로, 동일 해상도에서 16×16 패치 수에 비해 시각적 토큰 수를 약 4분의 1로 줄인다.
이를 통해 길고 고해상도의 출력을 더 쉽게 관리할 수 있게 된다.
적응형 계층적 노이즈 제어
더 큰 패치는 또 다른 문제를 야기한다: 각 토큰이 더 많은 픽셀을 표현해야 하므로 작은 텍스트, 질감, 미세한 가장자리에 대한 제어력이 줄어들 수 있다.
SenseTime은 적응형 계층적 노이즈 제어로 이를 보완한다고 밝힌다.
더 많은 디테일이 필요한 영역은 더 집중적인 생성 노력을 받아, 모델이 원래 토큰 수로 돌아가지 않고도 타이포그래피와 질감에 대한 제어력을 회복할 수 있도록 돕는다.
회사에 따르면, 그 결과 시각적 토큰 시퀀스가 통제 불가능하게 증가하지 않으면서 최대 8K 및 특별 종횡비의 기본 출력을 지원하게 된다.
이러한 세부 사항은 공식 출시 기사와 공개 인터뷰에서 비롯된 것으로, 완전한 U1 논문이나 기술 보고서를 기반으로 한 것은 아니다.
전문 기술 보고서. 프로덕션 모델의 전체 아키텍처, 파라미터 수, 학습 데이터 및 추론 요구 사항은 아직 공개적으로 공개되지 않았습니다.
생성 품질 대 납품 품질
이미지 생성 경쟁은 역사적으로 여러 단계에 걸쳐 진행되어 왔습니다.
1단계: 이미지가 요청을 반영하도록 만들기
초기 시스템은 인식 가능한 객체와 일관된 장면을 만드는 데 어려움을 겪었습니다.
2단계: 이미지를 사실적으로 보이게 만들기
후기 시스템은 조명, 질감, 형태, 재질 렌더링 및 사진적 디테일을 개선했습니다.
3단계: 이미지를 사용 가능하게 만들기
사용 가능한 이미지에는 사실성 이상의 것이 필요합니다.
다음이 필요할 수 있습니다:
- 올바른 텍스트.
- 정확한 정보.
- 전문적인 레이아웃.
- 일관된 브랜딩.
- 적절한 크기.
- 편집 가능한 구조 또는 신뢰할 수 있는 로컬 수정.
- 여러 시도에서 안정적인 결과.
- 인쇄 품질 디테일.
- 명확한 승인 프로세스.
SenseTime은 이러한 전환을 시각적 생성에서 추론 생성 및 에이전트 생성으로의 이동이라고 부릅니다.
주장은 하나의 모델이 모든 디자인 문제를 해결했다는 것이 아닙니다. 평가 대상이 변화하고 있다는 것입니다.
아름다운 이미지도 여전히 실패한 납품물일 수 있습니다.
GPT Image 2와의 비교
원본 기사에는 U1 Pro와 GPT Image 2 간의 레시피 포스터 비교가 포함되어 있습니다.
기사는 U1 Pro의 더 깔끔한 구성, 더 직접적인 계층 구조 및 더 강력한 중국어 텍스트 렌더링을 선호했으며, GPT 결과는 더 복잡하고 작은 장식 텍스트에 의사 문자를 포함한다고 설명했습니다.
이 비교는 주의 깊게 읽어야 합니다.
단일 프롬프트와 선택된 출력 쌍은 보편적인 모델 리더십을 확립하지 않습니다. 이미지 시스템은 시드, 설정, 프롬프트 버전 및 편집 워크플로에 따라 다른 결과를 생성할 수 있습니다.
유용한 비교는 다음을 테스트해야 합니다:
- 여러 프롬프트 카테고리.
- 프롬프트당 여러 생성.
- 텍스트 정확도.
- 레이아웃 일관성.
- 편집 가능성.
- 참조 이미지 추종.
- 비용.
- 지연 시간.
- 해상도.
- 실패율.
- 인간 선호도.
- 최종 자산을 납품할 수 있는지 여부.
SenseTime의 내부 디자이너 평가는 선택된 한 쌍보다 더 의미 있지만, 여전히 회사가 주관한 것입니다.
사용 가능한 증거로 뒷받침되는 가장 강력한 결론은 U1 Pro가 중국어 타이포그래피, 밀집 정보 디자인, 동양적 시각 디테일 및 기본 고해상도 구성에서 매우 경쟁력이 있어 보인다는 것입니다.
사용 가능성 및 출시 상태
SenseNova U1 Pro가 공식적으로 공개되었으며, SenseTime은 공식 제품 갤러리를 게시했습니다.
그러나 완전한 공개 API 제품으로서 일반적으로 사용 가능한 상태는 아닙니다.
SenseTime의 공식 소셜 미디어 발표에 따르면:
- 초대 전용 미리보기가 제공됩니다.
- 공식 API 출시 및 가격 책정은 2026년 8월로 계획되어 있습니다.
2026년 7월 22일 현재, 공개 제품 페이지는 모델의 기능을 보여주지만 완전한 API 가격, 처리량 제한 또는 자체 호스팅 지침을 제공하지 않습니다.
U1 Pro는 오픈소스 SenseNova U1 모델과 혼동해서는 안 됩니다.
| 제품 | 사용 가능성 |
|---|---|
| SenseNova U1 기본 모델 | 오픈소스 가중치, 코드 및 논문 사용 가능 |
| SenseNova U1 Infographic V2/V3 | 오픈소스 강화 |
인포그래픽 모델 사용 가능 |
| SenseNova U1 Pro | 초대 전용 프리뷰; 공식 API 및 가격은 2026년 8월 예정 |
| SenseNova-Vision | 오픈소스 통합 컴퓨터 비전 모델 및 연구 자료 제공 |
즉시 실험을 원하는 개발자는 공개된 SenseNova U1 리포지토리와 Hugging Face 릴리스를 통해 시작할 수 있습니다.
아직 공개되지 않은 사항
U1 Pro에 관한 몇 가지 중요한 세부 정보는 아직 공개되지 않았습니다.
- 파라미터 수
- 활성 파라미터 수
- 전체 학습 데이터 설명
- 하드웨어 요구 사항
- 8K에서의 생성 지연 시간
- API 속도 제한
- API 가격
- 지원되는 편집 인터페이스
- 상업용 데이터 보존 정책
- 안전 필터 동작
- 모델 가중치 공개 여부
- 다양한 프롬프트 세트에 대한 독립적인 벤치마크 결과
현재 증거는 주로 회사 시연, 공식 제품 갤러리, 내부 평가 결과, 공개 인터뷰 및 오픈소스 U1 제품군이 구축한 기술 기반으로 구성됩니다.
프로덕션 사용을 고려하는 팀은 API 문서를 기다린 후 자체 평가를 수행해야 합니다.
실제 디자인 작업을 위한 U1 Pro 평가 방법
공개 접근이 가능해지면 실용적인 평가는 예술적 프롬프트만이 아닌 실제 결과물을 사용해야 합니다.
- 대표적인 프롬프트 세트 구축
다음을 포함하세요.
- 제품 광고
- 이벤트 포스터
- 교육용 인포그래픽
- 캐릭터 시트
- 소셜 미디어 커버
- 매거진 레이아웃
- 과학 다이어그램
- 브랜드 중심 에셋
- 초광각 이미지
- 긴 중국어 텍스트
- 정확한 텍스트 요구 사항 테스트
알려진 텍스트를 사용하고 모든 문자를 확인하세요.
측정 항목:
- 제목 정확도
- 본문 텍스트 정확도
- 숫자
- 날짜
- 주소
- 제품명
- 문장 부호
- 반복 레이블
- 여러 결과 생성
하나의 뛰어난 이미지와 아홉 개의 사용 불가능한 이미지를 생성하는 모델은 일관된 출력을 가진 약간 약한 모델보다 가치가 낮을 수 있습니다.
최고 샘플뿐만 아니라 통과율을 추적하세요.
- 로컬 수정 테스트
모델에 다른 모든 요소를 유지하면서 한 가지 요소를 변경하도록 요청하세요.
예시:
- 날짜 하나 수정
- 제품 색상 변경
- 제목 이동
- 캐릭터 하나 제거
- 배경 변경
- 장소 업데이트
- 텍스트 번역 시 레이아웃 유지
- 최종 출력 크기에서 검사
축소된 브라우저 미리보기만으로 8K 에셋을 판단하지 마세요.
다음을 확대하세요.
- 작은 텍스트
- 손과 얼굴
- 가장자리 품질
- 제품 로고
- 반복 패턴
- 미세 질감
- 다이어그램 레이블
- 원근 관계
- 전체 작업 흐름 비용 비교
다음을 포함하세요.
- 생성 시간
- API 비용
- 시도 횟수
- 인간 교정 시간
- 외부 편집
- 업스케일링
- 타이포그래피 수리
- 승인 및 내보내기
가장 저렴한 생성이 반드시 가장 저렴한 결과물은 아닙니다.
하나의 이미지에서 통합된 시각적 시스템으로
U1 Pro는 현재 시각적 창작에 초점을 맞추고 있지만, SenseTime은 NEO-unify를 더 넓은 기반으로 제시합니다.
회사의 로드맵에는 다음이 포함됩니다.
- 일반 시각적 인식
- 공간 지능
- 비전-언어-행동 시스템
- 구현 지능
- 세계 모델
- 도시 계획
- 건축 및
산업 디자인.
SenseTime은 이미 SenseNova-Vision을 출시했습니다. 이는 하나의 멀티모달 생성 프레임워크를 통해 기존의 컴퓨터 비전 작업을 구현합니다.
이 모델은 다음과 같은 작업을 포함합니다:
- 객체 탐지.
- OCR.
- 키포인트 추정.
- 분할.
- 깊이 예측.
- 표면 법선.
- 포인트 맵.
- 카메라 자세 추정.
- 다중 뷰 시각적 기하학.
SenseNova-Vision은 각 작업마다 별도의 예측 헤드를 추가하는 대신, 요청된 시각적 작업에 따라 텍스트, 이미지 또는 혼합 출력을 생성합니다.
이는 SenseTime의 더 큰 "Words to Worlds" 방향성을 지원합니다: 언어와 시각은 어댑터를 통해 연결된 별도의 시스템으로 남아서는 안 됩니다. 이해, 생성, 그리고 궁극적으로 행동할 수 있는 하나의 모델 내에서 발전해야 합니다.
U1 Pro가 증명하려는 것
출시 메시지는 하나의 실용적인 주장으로 요약될 수 있습니다:
"보기 좋다"는 AI 생성 시각적 콘텐츠의 최종 기준이 되어서는 안 됩니다. "사용할 수 있다"가 기준이 되어야 합니다.
U1 Pro는 다섯 가지 연결된 아이디어를 통해 이 기준에 도달하려고 합니다:
- 텍스트와 이미지를 위한 네이티브 통합 아키텍처.
- 인터리브된 추론 및 시각적 행동.
- 긴 에이전트 생성 루프.
- 최대 8K의 고해상도 출력.
- 고립된 미적 평가가 아닌 완전한 전달 가능성에 기반한 평가.
모델이 일관되게 이 기준에 도달하는지 여부는 더 넓은 API 접근, 독립적인 테스트, 실제 고객 워크플로우 이후에 더 명확해질 것입니다.
그럼에도 불구하고 이 출시는 이미지 모델이 어떻게 포지셔닝되는지에 중요한 변화를 의미합니다.
이제 더 이상 이미지 생성기로만 제시되지 않습니다.
시각적 제작 에이전트로 제시되고 있습니다.
자주 묻는 질문
SenseNova U1 Pro란 무엇인가요?
SenseNova U1 Pro는 복잡한 시각적 생성 작업을 위한 SenseTime의 플래그십 네이티브 멀티모달 모델입니다. 이해, 생성, 행동을 통합하며 더 높은 해상도, 텍스트가 풍부하고 전달 준비가 된 시각적 자산을 생산하도록 설계되었습니다.
SenseNova U1 Pro가 네이티브 8K 이미지를 생성할 수 있나요?
SenseTime의 공식 제품 페이지에 따르면 U1 Pro는 최대 8K 출력과 특수 화면 비율을 지원합니다. 실제 해상도 옵션, 지연 시간, 파일 형식 및 API 제한 사항은 공개 API 문서가 제공될 때 확인해야 합니다.
SenseNova U1 Pro는 오픈소스인가요?
공개된 U1 Pro 가중치는 없습니다. 이전 SenseNova U1 베이스 및 인포그래픽 모델은 오픈소스이지만, U1 Pro는 현재 초대 전용 미리보기를 통해 제공되는 독점 플래그십 모델입니다.
SenseNova U1 Pro API는 언제 사용할 수 있나요?
SenseTime의 공식 발표에 따르면 API와 가격은 2026년 8월로 계획되어 있습니다. 7월 22일 기준으로 공개 제품 페이지는 운영 중이지만, 완전한 공개 API 접근과 가격은 아직 발표되지 않았습니다.
NEO-unify란 무엇인가요?
NEO-unify는 통합 이해 및 생성을 위한 SenseTime의 네이티브 멀티모달 아키텍처입니다. 시각적 인코더, 언어 모델, 이미지 VAE 간의 기존 분리를 제거하여 텍스트와 이미지 토큰이 하나의 Transformer 기반 시스템 내에서 처리될 수 있도록 합니다.
에이전틱 생성 루프(Agentic Generation Loop)란 무엇인가요?
모델이 계획, 생성, 검사, 수정 및 최적화를 수행하는 다단계 생성 프로세스로, 여러 반복을 통해 시각적 작업을 수행합니다.
출력 전에 이미지를 편집, 리터칭, 합성 및 정제합니다. 이 모델은 현재 중간 결과를 바탕으로 다음 시각적 동작을 선택하도록 설계되었습니다.
U1 Pro가 GPT Image 2보다 더 나은가요?
SenseTime은 내부 평가에서 U1 Pro가 GPT Image 2와 경쟁력을 보였으며, 중국어 텍스트, 디자인 품질, 동양 문화 디테일에서 강력한 성능을 보였다고 보고합니다. 독립적인 광범위한 테스트는 여전히 필요하며, 성능은 프롬프트, 워크플로 및 평가 방법에 따라 달라집니다.
개발자들은 지금 SenseNova U1 기술을 시험해 볼 수 있나요?
네. SenseTime은 SenseNova U1 연구 논문, GitHub 저장소, Hugging Face 가중치 및 인포그래픽 향상 모델을 공개했습니다. 이들은 U1 Pro와 동일하지 않지만, 기본 통합 모델 방향에 대한 접근을 제공합니다.
관련 도구
- SenseNova U1 Pro: SenseTime의 플래그십 제작 모델 공식 제품 갤러리 및 기능 개요
- SenseNova U1 GitHub 저장소: 공식 오픈소스 코드, 문서, 모델 정보 및 인포그래픽 배포
- Hugging Face의 SenseNova: 공식 모델 가중치, 모델 카드 및 연구 리소스
- SenseNova U1 인포그래픽 V3: 인포그래픽 생성 및 편집을 위한 권장 오픈소스 U1 릴리스
- SenseNova-Vision: SenseTime의 오픈소스 통합 컴퓨터 비전 모델 및 말뭉치
- SenseNova 플랫폼: SenseTime 공식 모델 콘솔 및 개발자 플랫폼
관련 링크
- SenseNova U1 Pro 공식 제품 페이지: 8K 출력, 복잡한 정보, 전문 디자인 및 다양한 시각적 시나리오를 다루는 공식 예시
- SenseTime WAIC 2026 프리뷰: U1 Pro 및 WAIC 출시를 알리는 SenseTime 공식 발표
- SenseNova U1 공식 오픈소스 발표: 오픈소스 통합 이해-생성 모델 제품군에 대한 공식 소개
- SenseNova U1 연구 논문: NEO-unify 아키텍처와 원본 U1 모델을 설명하는 기술 논문
- NEO-unify 기술 블로그: 네이티브 통합 아키텍처에 대한 SenseTime의 기술 개요
- SenseNova U1 GitHub 저장소: 공식 코드, 모델 링크, 아키텍처 세부정보 및 인포그래픽 문서
- SenseNova-Vision 연구 논문: 통합 멀티모달 생성을 통한 전통적인 컴퓨터 비전 작업 표현에 관한 연구
요약
SenseNova U1 Pro는 SenseTime이 이미지 생성을 더 까다로운 범주인 프로덕션 전달로 발전시키려는 시도입니다. 네이티브 멀티모달 통합, 인터리브 시각-텍스트 추론, 에이전트 생성 루프, 정밀한 중국어 텍스트 렌더링 및 최대 8K 출력을 결합합니다.
WAIC 스크롤 및 출시 예시
비정상적으로 복잡한 레이아웃, 대규모 그룹, 중국어 타이포그래피, 과학 인포그래픽, 제품 광고 및 동양적 시각 스타일을 보여줍니다. 이는 선별된 기업 사례이며, GPT Image 2와의 비교 결과는 상하이 센스타임(商湯科技, SenseTime) 자체 평가에 기반한 것이며, 완전히 독립적인 공개 벤치마크는 아닙니다.
U1 Pro는 현재 초청 기반 프리뷰로 제공되며, 공개 API 접근 및 가격 책정은 2026년 8월로 예정되어 있습니다. 개발자들은 이미 오픈소스 SenseNova U1 및 인포그래픽 모델을 탐색할 수 있지만, 이러한 릴리스는 Pro 시스템과 동일하지 않습니다.
핵심적인 변화는 AI가 아름다운 이미지를 생성할 수 있는지 여부에서, 완전한 시각적 자산을 안정적으로 제공할 수 있는지 여부로 옮겨가고 있습니다.



