Einleitung
Auf der WAIC 2026 stellte SenseTime SenseNova U1 Pro vor, sein nächstes Flaggschiff-Multimodalmodell für komplexe visuelle Gestaltungsaufgaben.
Die Präsentation konzentrierte sich auf eine extrem breite, östlich geprägte Stadtrrolle mit dem Titel The World Meets Through Intelligence. Das Bild wurde für die neunte Weltkonferenz für Künstliche Intelligenz erstellt und verdichtet die Entwicklung der Veranstaltung von 2018 bis 2026 in einer durchgehenden visuellen Erzählung.
Die Rolle vereint Stadtwahrzeichen, Flüsse, Berge, Menschenmengen, Architektur, Beschriftungen und dichte historische Details auf einer ungewöhnlich breiten Leinwand. SenseTime gab an, dass das Bild direkt von U1 Pro in nativer hoher Auflösung erzeugt wurde und nicht durch eine separate manuelle Design-Pipeline zusammengesetzt wurde.
Das übergeordnete Ziel des Modells ist wichtiger als die einzelne Demonstration.
SenseNova U1 Pro wird als lieferfertiges natives multimodales Agenten-Basismodell positioniert. Statt sofort nach Eingabe einer Aufforderung ein Bild zu erzeugen, ist es darauf ausgelegt, über das Layout nachzudenken, Entwürfe zu erstellen, Zwischenergebnisse zu prüfen, lokale Bereiche zu überarbeiten und die endgültige Komposition durch einen längeren Generierungsprozess zu verfeinern.
Mit anderen Worten: SenseTime versucht, die KI-Bildgenerierung von „etwas visuell Beeindruckendes schaffen" hin zu „ein Asset produzieren, das in einem echten Design-Workflow verwendet werden kann" zu bewegen.

Eine 8K-Ost-Rolle für die WAIC
Die Konferenzrolle verwendet ein Panoramaformat, das eher einer traditionellen chinesischen Handrolle als einem Standardplakat oder Social-Media-Bild ähnelt.
Sie verbindet neun Jahre WAIC in einer durchgehenden Landschaft. Die Komposition umfasst:
- Berge und Gewässer.
- Städtische Wahrzeichen.
- Konferenzorte.
- Menschenmengen und öffentliche Szenen.
- Kleine Beschriftungen und Anmerkungen.
- Veränderungen im visuellen Ton über verschiedene Jahre hinweg.
- Eine durchgängige Tinten- und Farbästhetik über die gesamte Breite.
Die Erstellung eines solchen großen Bildes ist aus mehreren Gründen schwierig.
Erstens muss eine extrem breite Komposition von einer Seite zur anderen kohärent bleiben. Ein Modell kann attraktive lokale Regionen erzeugen, dabei jedoch die globale Struktur der Szene verlieren.
Zweitens enthält das Bild viele kleine Objekte und Beschriftungen. Fehler, die in einer Standardvorschau kaum sichtbar sind, werden offensichtlich, wenn das Bild auf einer großen Wand angezeigt wird.
Drittens benötigt die Komposition Kontinuität. Gebäude, Flüsse, Straßen, Berge und Texte dürfen sich nicht wie zusammengeklebte, zusammenhanglose Fragmente anfühlen.
SenseTime gibt an, dass U1 Pro eine Ausgabe von bis zu 8K-Auflösung und ungewöhnliche Seitenverhältnisse unterstützt. Die offizielle Produktseite präsentiert dies als Produktionsfunktion, die für hochauflösende Materialien und detaillierte visuelle Lieferung gedacht ist.
Die Online-Version der WAIC-Rolle ist komprimiert, sodass sie nicht die volle Qualität des ursprünglichen Ausstellungs-Assets bewahrt.
Verschiedene Szenen, ein Erstellungsmodell
Der Einführungsartikel präsentierte U1 Pro in mehreren
visuelle Kategorien, anstatt das Modell auf einen einzigen charakteristischen Stil zu beschränken.
Die Beispiele umfassten:
- Historische Panoramadarstellungen.
- Plakate für Spannungsfilme.
- Plakate für Anime-Aufführungen.
- Werbung für Premiumprodukte.
- Museums- und Ausstellungsplakate.
- Wissenschaftliche Infografiken.
- Informationsdesign für Tee-Kategorien.
- Charakterbogen.
- Rezeptillustrationen.
Diese Bandbreite ist wichtig, da kommerzielles Design keine einzelne Aufgabe ist.
Ein nützliches Modell muss seine Komposition, Typografie, visuelle Hierarchie, Materialdarstellung, Farbsystem und Informationsdichte an das jeweilige Format anpassen können.
Historische Panoramen mit großen Personengruppen
Ein Beispiel stellte den Westlichen Markt von Chang'an während der Tang-Dynastie in einem 21:9-Format dar.

Das Bild enthält eine große Menschenmenge, mehrere Geschäfte, Pferde, Musiker, Händler, Kinder, Laternen und eine vielschichtige Architektur.
Große Gruppenszenen sind ein häufiger Schwachpunkt von Bildmodellen. Wiederholte Gesichter, duplizierte Kleidung, missgebildete Hände, inkonsistente Maßstäbe und kopierte Posen können die Szene künstlich wirken lassen.
Das U1 Pro-Beispiel versucht, jede Figur visuell unterscheidbar zu halten, während die größere Straßenkomposition erhalten bleibt. Warmes Laternenlicht, kühle Nachttöne, Spiegelungen und architektonische Tiefe werden innerhalb einer Szene verarbeitet.
Dies ist immer noch eine ausgewählte Unternehmensdemonstration und kein unabhängiger Benchmark. Sie zeigt jedoch die Art dichter Komposition, die SenseTime als zentral für das Modell erachtet.
Plakate mit narrativem Raum und Typografie
Das Launch-Material umfasste auch ein Plakat für einen Spannungsfilm aus dem Shanghai der Republik-Ära.

Die Komposition nutzt Regen, Glasspiegelungen, Nebel, Straßenbeleuchtung und mehrere Figuren in unterschiedlichen Tiefen.
Der Punkt des Beispiels ist nicht nur Fotorealismus. Das Modell muss verstehen, wie visuelle Elemente eine Erzählung unterstützen:
- Welche Figur das zentrale Motiv ist.
- Welche Figuren teilweise verborgen bleiben sollten.
- Wie Spiegelungen zum realen Raum in Beziehung stehen.
- Wo der Titel hingehört.
- Wie die Umgebung Spannung erzeugt.
- Wie unterstützender Text nebensächlich bleiben sollte.
Ein weiteres Beispiel, Chang'an Never Sleeps, verwendet fünf Musiker, fünf Instrumente, unterschiedliche Kostüme und eine gold-rote Bühnenkomposition.

Diese Beispiele zeigen, dass U1 Pro eher wie ein Layout- und Art-Direction-System verwendet wird, als ein einfacher Prompt-zu-Bild-Renderer.
Produktwerbung und Materialdarstellung
Kommerzielle Werbung stellt andere Anforderungen an ein Modell.
Ein Produktvisual muss Folgendes bewahren:
- Die Verpackungsstruktur.
- Die Markenhierarchie.
- Lesbare Produktnamen.
- Konsistente Materialien.
- Kontrollierte Spiegelungen.
- Eine korrekte Perspektive.
- Platz für Werbetexte.
- Eine Komposition, die die Aufmerksamkeit auf das Produkt lenkt.
Die in der Quelle gezeigte Tee-Werbung kombiniert matte Verpackungen, goldene Schrift, weißes Porzellan, Holz, Teeblätter und Dampf.

Materialinkonsistenzen fallen in der Werbung schnell auf. Ein Papierkarton, der wie Plastik aussieht, oder eine Porzellantasse mit falschen Spiegelungen können das gesamte Ergebnis unbrauchbar machen.
SenseTime präsentiert den U1 Pro als fähig, mehrere Materialarten zu kombinieren, während ein kontrollierter visueller Stil und lesbarer chinesischer Text erhalten bleiben.
Ausstellungsplakate und 2D-zu-3D-Design
Das Ausstellungsplakat Berge und Flüsse treten in das Bild ein kombiniert Tuschemalerei-Formen mit dreidimensionalen Bergen und Wolken.

Der untere Teil beginnt als Tusche, die sich über das Papier ausbreitet. Dieselben Formen gehen allmählich in Berge mit realistischen Licht- und Volumeneffekten über.
Ein rotes Band bewegt sich durch die Landschaft und lenkt den Blick auf eine kleine menschliche Figur.
Das Beispiel zeigt mehrere Designfähigkeiten:
- Beibehaltung eines visuellen Konzepts auf dem gesamten Plakat.
- Kombination von flacher und volumetrischer Darstellung.
- Wahrung einer starken Größenbeziehung.
- Platzierung von Veranstaltungsinformationen innerhalb der Komposition.
- Lesbarkeit des chinesischen Titels und der unterstützenden Details.
Für ein Produktions-Asset ist die Genauigkeit des Textes ebenso wichtig wie die visuelle Qualität. Ein Plakat mit einem falschen Datum oder Schriftzeichen kann nicht einfach als „größtenteils korrekt“ eingestuft werden.
Langer chinesischer Text und wissenschaftliche Logik
Textreiche Bilder bleiben einer der schwierigsten Bereiche für Bildgenerierungssysteme.
Das Modell muss zwei Probleme gleichzeitig lösen:
- Die angeforderten Zeichen korrekt darstellen.
- Diese Zeichen in eine lesbare Informationsstruktur einordnen.
Die bei der Einführung gezeigte Mondphasen-Grafik enthält einen Titel, erklärende Absätze, Beschriftungen, Diagramme und Bildungskarten.

Sie muss auch die Sonne-Erde-Mond-Beziehung auf physikalisch sinnvolle Weise darstellen.
Eine visuell ansprechende Infografik kann dennoch scheitern, wenn die wissenschaftliche Beziehung falsch ist. Aus diesem Grund testen textreiche Bildungsgrafiken mehr als nur OCR-ähnliche Zeichenwiedergabe. Sie testen auch Informationsorganisation und fachspezifisches Denken.
Ein weiteres Beispiel von der Einführung zeigt die sechs Hauptkategorien
im radialen Layout von chinesischem Tee.

Die Komposition vereint:
- Kategorienamen.
- Teeblatt-Motive.
- Flüssigkeitsfarben.
- Herkunftsorte.
- Unterstützende Landschaftsillustrationen.
- Einen zentralen visuellen Anker.
- Wiederholte Module mit gleichmäßigen Abständen.
Die offizielle Produktseite von SenseTime verwendet nun ähnliche hochdichte Infografiken, um die Fähigkeit des U1 Pro zur „präzisen Inhaltsdarstellung“ zu demonstrieren.
Ein Modell für die Auslieferung, nicht nur für die Generierung
SenseTime beschreibt den U1 Pro als ein System für komplexe multimodale Auslieferungsaufgaben.
Diese Unterscheidung ist wichtig.
Ein traditioneller Bildgenerator folgt in der Regel diesem Prozess:
Eingabeaufforderung → Bild
Der Nutzer entscheidet, ob das Ergebnis taugt. Ist dies nicht der Fall, ändert der Nutzer die Eingabeaufforderung oder verwendet ein anderes Bearbeitungswerkzeug.
Der U1 Pro wird so dargestellt, dass er einen längeren internen Erstellungsprozess verwendet:
Anfrage verstehen
→ Layout planen
→ Erste Komposition generieren
→ Ergebnis prüfen
→ Lokale Bereiche überarbeiten
→ Elemente kombinieren
→ Typografie und Details verfeinern
→ Endgültiges Asset ausliefern
In den offiziellen und Launch-Materialien wird dies als Agentic Generation Loop bezeichnet.
Das Modell kann verschiedene visuelle Aktionen nutzen, anstatt sich auf einen einzigen ununterbrochenen Generierungsdurchlauf zu verlassen:
- Generieren.
- Bearbeiten.
- Einen ausgewählten Bereich neu malen.
- Mehrere Elemente zusammensetzen.
- Bereits Erstelltes prüfen.
- Entscheiden, welche Aktion als Nächstes erfolgen soll.
Dieses Design ähnelt der Entwicklung von Codiersystemen.
Ein Code-Vervollständigungsmodell sagt die nächsten Zeilen voraus. Ein agentisches Codiersystem kann ein Repository prüfen, eine Änderung planen, Dateien bearbeiten, Tests ausführen, Fehler lesen und fortfahren, bis die Aufgabe erledigt ist.
SenseTimes Argument ist, dass sich die visuelle Erstellung in dieselbe Richtung bewegt.
Ein einziges falsches Zeichen kann das gesamte Asset unbrauchbar machen
Durchschnittliche visuelle Bewertungen können Produktionsfehler verbergen.
Angenommen, ein Bild enthält 100 chinesische Zeichen und 99 sind korrekt. Ein Benchmark, der auf der durchschnittlichen Zeichengenauigkeit basiert, könnte eine hohe Punktzahl vergeben.
Ein kundenorientiertes Plakat ist anders.
Wenn das falsche Zeichen in einem Produktnamen, Datum, einer Adresse, wissenschaftlichen Aussage oder einem rechtlichen Hinweis erscheint, muss das Asset möglicherweise abgelehnt werden.
Dies führt zu einer strengeren Definition von Qualität:
Ein Produktionsbild wird nicht danach beurteilt, ob die meisten Elemente richtig aussehen. Es wird danach beurteilt, ob das vollständige Asset ausgeliefert werden kann.
Berichten zufolge hat SenseTime ein internes Bewertungspanel aus 200 Kunststudenten und professionellen Designern zusammengestellt.
Die Frage war praktischer Natur:
Wären Sie bereit, dieses Bild an einen Kunden auszuliefern?
Der Quellartikel besagt, dass ein Modell als qualifiziert galt, wenn mindestens 60 % der bewerteten Ausgaben als direkt lieferbar beurteilt wurden. SenseTime gab an, dass der U1 Pro und GPT Image 2 in seinem Vergleich die einzigen Systeme waren, die diesen Schwellenwert erreichten.
Das Unternehmen gab weiter an, dass der U1 Pro besonders gut abschnitt bei:
- Darstellung chinesischer Schriftzeichen.
- Grafikdesign-Qualität.
- Östlicher Kultur.
Details.
- Layouts mit hoher Informationsdichte.
Diese Ergebnisse stammen aus der internen Evaluierungsmethodik von SenseTime. Sie sind als Produktnachweise nützlich, sollten jedoch nicht als unabhängig reproduzierter öffentlicher Benchmark behandelt werden.
NEO-unify: Eine native, einheitliche Architektur
Das U1 Pro basiert auf der NEO-unify-Architektur von SenseTime.
Die früheren SenseNova-U1-Modelle wurden im April 2026 vorgestellt und als Open Source veröffentlicht. Ihr Forschungspapier beschreibt einen nativen, einheitlichen Ansatz für multimodales Verständnis, logisches Denken und Generierung.
Viele multimodale Systeme setzen sich aus verschiedenen Komponenten zusammen:
- Ein visueller Encoder wandelt Bilder in Darstellungen für das Verständnis um.
- Ein Sprachmodell verarbeitet Text und logisches Denken.
- Ein variierender Autoencoder oder ein ähnlicher Bilddecoder übernimmt die Generierung.
- Zusätzliche Adapter verbinden die Komponenten.
Diese Architektur kann gut funktionieren, aber die verschiedenen Module können inkompatible interne Räume erlernen.
NEO-unify verfolgt einen anderen Ansatz.
SenseTime gibt an, dass der separate visuelle Encoder und VAE aus der Kernarchitektur entfernt wurden, sodass Text- und Bildinformationen eine gemeinsame Darstellung und einen gemeinsamen, auf Transformatoren basierenden Berechnungspfad nutzen.

Vereinfacht dargestellt:
- Text wird als Worteinbettungen eingegeben.
- Bilder werden als Patch-Einbettungen eingegeben.
- Beide werden im selben Modell verarbeitet.
- Das Modell kann Text-Token oder Bild-Patch-Token innerhalb einer autoregressiven Sequenz decodieren.
Das System benötigt keinen separaten externen Scheduler, der entscheidet, wann ein Modul anhalten und ein anderes beginnen soll.
Das Modell sagt voraus, was als Nächstes kommt. Es kann mit Text fortfahren, zu Bild-Token wechseln und später zum Text zurückkehren.
SenseTime beschreibt dies als den Übergang von multimodaler Integration zu nativer multimodaler Vereinheitlichung.
Was die Open-Source-SenseNova-U1-Modelle etabliert haben
Vor dem U1 Pro veröffentlichte SenseTime zwei Hauptvarianten des SenseNova U1:
| Modell | Basisstruktur | Hauptaufgabe |
|---|---|---|
| SenseNova-U1-8B-MoT | Dichte 8B-Verständnisgrundlage | Einheitliches Verständnis, logisches Denken und Generierung |
| SenseNova-U1-A3B-MoT | 30B gesamt, ca. 3B aktives MoE-Fundament | Größeres, spärliches, einheitliches Modell |
Das Forschungsprojekt umfasst:
- Textverständnis.
- Visuell-sprachliche Wahrnehmung.
- Wissenslogik.
- Agentenbasierte Entscheidungsfindung.
- Räumliche Intelligenz.
- Bildgenerierung.
- Textreiche Infografikgenerierung.
- Verschachtelte Bild-und-Text-Generierung.
- Frühe Vision-Language-Action- und Weltmodell-Aufgaben.
SenseTime veröffentlichte später infografik-optimierte Versionen. Das offizielle Repository empfiehlt derzeit Infographic V3 für einen integrierten Generierungs- und Bearbeitungs-Workflow.
Die Open-Source-U1-Familie bietet öffentliche Belege für die zugrunde liegende, einheitliche Modellrichtung. Das U1 Pro ist das größere, proprietäre Flaggschiff, das auf die anspruchsvollere Produktionsauslieferung abzielt.
Verschachteltes visuell-textuelles Denken
Ein lieferfähiger Designprozess beinhaltet in der Regel Zwischenentscheidungen.
Ein Designer kann Folgendes entscheiden:
- Welche Informationen
ist am wichtigsten.
2. Welches Raster oder welche Komposition zum Format passt.
3. Wo das Hauptmotiv hingehört.
4. Welche Farben dominieren sollten.
5. Wie viel Platz die Überschrift benötigt.
6. Welche Details vereinfacht werden sollten.
7. Ob die erste Version ausgewogen wirkt.
8. Welcher Bereich eine lokale Korrektur erfordert.
SenseTime sagt, dass der U1 Pro eine ähnliche Sequenz durch verschränktes visuell-textuelles Denken verinnerlicht.
Das Modell muss das gesamte Bild nicht in einem Durchgang fertigstellen. Es kann zwischen interner Analyse und visuellen Aktionen abwechseln und dabei wiederholt den aktuellen Zustand überprüfen.
Der in öffentlichen Interviews beschriebene Trainingsprozess umfasst zwei große Phasen.
Anweisungsbasierter Kaltstart
Erstelle in Minuten eine Showcase-Website und gewinne Leads
Beschreibe deine Idee einmal, und We0 AI erstellt eine Showcase-Website, Seiten und ein CMS und hilft nach dem Launch bei Kunden und Traffic.
Eine komplette Projektgeneration zur kostenlosen Registrierung
Am besten geeignet, um einen vollständigen Generierungsablauf auszuprobieren und schnell einen ersten Projektentwurf zu sehen.
Das Team organisiert zunächst professionelle Designurteile in strukturierte Denkbeispiele.
Diese Beispiele lehren Ordnungsprinzipien wie:
- Das Layout festlegen, bevor die Verfeinerung der Dekoration erfolgt.
- Die dominanten Farben festlegen, bevor an kleinen Texturen gearbeitet wird.
- Die hauptsächliche visuelle Hierarchie stabilisieren, bevor sekundärer Text hinzugefügt wird.
- Die Informationsgenauigkeit vor der endgültigen Darstellung prüfen.
Bestärkendes Lernen mit multidimensionalen Belohnungen
Das Modell erhält dann Rückmeldungen über viele Dimensionen hinweg, darunter:
- Komposition.
- Textrichtigkeit.
- Visuelle Ästhetik.
- Konsistenz.
- Informationshierarchie.
- Genauigkeit des Motivs.
- Materialqualität.
- Lokales Detail.
- Gesamte Lieferbarkeit.
Das Belohnungssystem soll dem Modell helfen zu lernen, welche Aktion als Nächstes während einer langen visuellen Erstellungsaufgabe ausgeführt werden sollte.
Dies ist der zentrale Unterschied zwischen "einmal generieren" und "in einer Schleife erstellen".
Natürliches 8K ohne unkontrolliertes Token-Wachstum
Die Erzeugung hoher Auflösungen stellt ein direktes Rechenproblem dar.
Wenn ein Bild als visuelle Token dargestellt wird, erhöht eine höhere Auflösung die Anzahl der Token. Die Standard-Transformer-Aufmerksamkeit wird mit zunehmender Sequenzlänge aufwändiger.
Wenn sich die Anzahl der Token verdoppelt, kann sich der Rechenaufwand für die volle Aufmerksamkeit grob vervierfachen.
Ein 8K-Bild kann daher einen Kontext und eine Rechenlast erzeugen, die weit über eine Standard-1K- oder 2K-Ausgabe hinausgehen.
Öffentliche Interviews mit dem Team von SenseTime beschreiben zwei Techniken, die vom U1 Pro verwendet werden.
Größere 32×32-Bildausschnitte
Viele Bildmodelle verwenden 16×16-Ausschnitte.
Der U1 Pro verwendet Berichten zufolge 32×32-Ausschnitte für die Erzeugung hoher Auflösungen. Jeder Token deckt eine größere Bildregion ab und reduziert die Anzahl der visuellen Token auf etwa ein Viertel der Anzahl bei 16×16-Ausschnitten bei gleicher Auflösung.
Dies macht lange und hochauflösende Ausgaben handhabbarer.
Adaptive hierarchische Rauschsteuerung
Größere Ausschnitte erzeugen ein weiteres Problem: Jeder Token muss mehr Pixel repräsentieren, was die Kontrolle über kleine Texte, Texturen und feine Kanten verringern kann.
SenseTime sagt, dass es dies mit adaptiver hierarchischer Rauschsteuerung kompensiert.
Bereiche, die mehr Details benötigen, erhalten einen fokussierteren Generierungsaufwand, was dem Modell hilft, die Kontrolle über Typografie und Textur zurückzugewinnen, ohne zur ursprünglichen Token-Anzahl zurückzukehren.
Das Ergebnis, so das Unternehmen, ist die Unterstützung für native Ausgaben bis zu 8K und spezielle Seitenverhältnisse, ohne dass die visuelle Token-Sequenz unkontrolliert wachsen kann.
Diese Details stammen aus dem Launch-Artikel und öffentlichen Interviews und nicht aus einem vollständigen U1
Professioneller technischer Bericht. Die vollständige Architektur des Produktionsmodells, die Parameteranzahl, die Trainingsdaten und die Inferenzanforderungen wurden noch nicht öffentlich bekannt gegeben.
Erzeugungsqualität versus Lieferqualität
Der Wettbewerb bei der Bilderzeugung hat sich historisch auf mehrere Phasen konzentriert.
Phase 1: Das Bild soll der Anfrage ähneln
Frühe Systeme hatten Schwierigkeiten, erkennbare Objekte und kohärente Szenen zu erzeugen.
Phase 2: Das Bild soll realistisch aussehen
Spätere Systeme verbesserten Beleuchtung, Textur, Anatomie, Materialdarstellung und fotografische Details.
Phase 3: Das Bild soll nutzbar sein
Ein nutzbares Bild erfordert mehr als nur Realismus.
Es kann Folgendes benötigen:
- Korrekten Text.
- Genaue Informationen.
- Professionelles Layout.
- Konsistentes Branding.
- Angemessene Abmessungen.
- Editierbare Struktur oder zuverlässige lokale Überarbeitung.
- Stabile Ergebnisse bei mehreren Versuchen.
- Druckqualitäts-Details.
- Einen klaren Genehmigungsprozess.
SenseTime bezeichnet diesen Übergang als einen Wandel von der visuellen Erzeugung hin zur Schlussfolgerungs-Erzeugung und agentischen Kreation.
Die Behauptung ist nicht, dass ein Modell jedes Designproblem gelöst hat. Es geht darum, dass sich das Bewertungsziel ändert.
Ein schönes Bild kann dennoch ein fehlgeschlagenes Lieferobjekt sein.
Vergleich mit GPT Image 2
Der Quellartikel enthält einen Vergleich von Rezeptpostern zwischen U1 Pro und GPT Image 2.
Der Artikel bevorzugte die sauberere Komposition, die direktere Hierarchie und die stärkere chinesische Textwiedergabe von U1 Pro, während er das GPT-Ergebnis als überladener und mit Pseudo-Zeichen in kleinen dekorativen Texten beschrieb.
Dieser Vergleich sollte sorgfältig gelesen werden.
Ein einzelner Prompt und ein ausgewähltes Paar von Ausgaben begründen keine universelle Modellführerschaft. Bildsysteme können über verschiedene Seeds, Einstellungen, Prompt-Versionen und Bearbeitungsabläufe hinweg unterschiedliche Ergebnisse liefern.
Ein sinnvoller Vergleich sollte Folgendes testen:
- Mehrere Prompt-Kategorien.
- Mehrere Erzeugungen pro Prompt.
- Textgenauigkeit.
- Layout-Konsistenz.
- Editierbarkeit.
- Befolgung von Referenzbildern.
- Kosten.
- Latenz.
- Auflösung.
- Fehlerrate.
- Menschliche Präferenz.
- Ob das endgültige Asset geliefert werden kann.
SenseTimes interne Designerbewertung ist aussagekräftiger als ein ausgewähltes Paar, wird aber dennoch unternehmenseigen durchgeführt.
Die stärkste durch die verfügbaren Belege gestützte Schlussfolgerung ist, dass U1 Pro in der chinesischen Typografie, der dichten Informationsgestaltung, den östlichen visuellen Details und der nativen hochauflösenden Komposition hoch wettbewerbsfähig zu sein scheint.
Verfügbarkeit und Freigabestatus
SenseNova U1 Pro wurde offiziell vorgestellt, und SenseTime hat eine offizielle Produktgalerie veröffentlicht.
Es ist jedoch noch nicht allgemein als vollständiges öffentliches API-Produkt verfügbar.
SenseTimes offizielle Social-Media-Ankündigung besagt:
- Eine nur auf Einladung zugängliche Vorschau ist verfügbar.
- Der offizielle API-Start und die Preisgestaltung sind für August 2026 geplant.
Zum
22. Juli 2026 demonstriert die öffentliche Produktseite die Fähigkeiten des Modells, bietet jedoch keine vollständigen API-Preise, Durchsatzbeschränkungen oder Anweisungen für das Selbst-Hosten an.
U1 Pro sollte nicht mit den Open-Source-Modellen SenseNova U1 verwechselt werden.
| Produkt | Verfügbarkeit |
|---|---|
| SenseNova U1 Basismodelle | Open-Source-Gewichte, Code und Paper sind verfügbar |
| SenseNova U1 Infographic V2/V3 | Open-Source, verbessert |
Infografik-Modelle sind verfügbar |
| SenseNova U1 Pro | Nur auf Einladung verfügbar; offizielle API und Preisgestaltung für August 2026 geplant |
| SenseNova-Vision | Open-Source, einheitliches Computervisionsmodell und Forschung verfügbar |
Entwickler, die sofort experimentieren möchten, können mit dem öffentlichen SenseNova U1-Repository und den Hugging Face-Veröffentlichungen beginnen.
Was noch nicht bekannt gegeben wurde
Mehrere wichtige Details zu U1 Pro bleiben der Öffentlichkeit vorenthalten:
- Parameteranzahl.
- Anzahl aktiver Parameter.
- Vollständige Beschreibung der Trainingsdaten.
- Hardwareanforderungen.
- Generierungslatenz bei 8K.
- API-Ratenbegrenzungen.
- API-Preise.
- Unterstützte Bearbeitungsschnittstellen.
- Richtlinie zur kommerziellen Datenspeicherung.
- Verhalten des Sicherheitsfilters.
- Ob Modellgewichte veröffentlicht werden.
- Unabhängige Benchmark-Ergebnisse über eine breite Palette von Eingabeaufforderungen.
Die derzeitigen Belege bestehen hauptsächlich aus Unternehmensdemonstrationen, der offiziellen Produktgalerie, internen Bewertungsergebnissen, öffentlichen Interviews und der technischen Grundlage, die durch die Open-Source-U1-Familie geschaffen wurde.
Teams, die einen Produktionseinsatz in Betracht ziehen, sollten auf die API-Dokumentation warten und eigene Bewertungen durchführen.
So bewerten Sie U1 Pro für die reale Designarbeit
Wenn der öffentliche Zugang verfügbar wird, sollte eine praktische Bewertung echte Arbeitsergebnisse verwenden, nicht nur künstlerische Eingabeaufforderungen.
- Erstellen Sie einen repräsentativen Satz von Eingabeaufforderungen
Enthalten Sie:
- Produktwerbung.
- Eventplakate.
- Pädagogische Infografiken.
- Charakterbögen.
- Social-Media-Cover.
- Magazinlayouts.
- Wissenschaftliche Diagramme.
- Markenlastige Assets.
- Ultrabreite Bilder.
- Lange chinesische Texte.
- Testen Sie genaue Textanforderungen
Verwenden Sie bekannten Text und überprüfen Sie jedes Zeichen.
Messen Sie:
- Genauigkeit von Titeln.
- Genauigkeit von Fließtext.
- Zahlen.
- Daten.
- Adressen.
- Produktnamen.
- Zeichensetzung.
- Wiederholte Beschriftungen.
- Generieren Sie mehrere Ergebnisse
Ein Modell, das ein hervorragendes Bild und neun unbrauchbare liefert, kann weniger wert sein als ein etwas schwächeres Modell mit konsistenten Ergebnissen.
Verfolgen Sie die Erfolgsquote, nicht nur das beste Beispiel.
- Testen Sie lokale Überarbeitungen
Bitten Sie das Modell, ein Element zu ändern, während alles andere erhalten bleibt.
Beispiele:
- Korrigieren Sie ein Datum.
- Ersetzen Sie die Produktfarbe.
- Verschieben Sie den Titel.
- Entfernen Sie ein Zeichen.
- Ändern Sie den Hintergrund.
- Aktualisieren Sie den Veranstaltungsort.
- Behalten Sie das Layout bei, während Sie den Text übersetzen.
- Überprüfen Sie in der endgültigen Ausgabegröße
Beurteilen Sie ein 8K-Asset nicht nur aus einer verkleinerten Browser-Vorschau.
Zoomen Sie hinein auf:
- Kleinen Text.
- Hände und Gesichter.
- Kantenqualität.
- Produktlogos.
- Wiederholte Muster.
- Feine Texturen.
- Diagrammbeschriftungen.
- Perspektivische Beziehungen.
- Vergleichen Sie die Gesamtkosten des Workflows
Beinhalten Sie:
- Generierungszeit.
- API-Kosten.
- Anzahl der Versuche.
- Zeit für menschliche Korrekturen.
- Externe Bearbeitung.
- Hochskalierung.
- Typografie-Reparatur.
- Freigabe und Export.
Die günstigste Generierung ist nicht unbedingt das günstigste Arbeitsergebnis.
Von einem Bild zu einem einheitlichen visuellen System
U1 Pro konzentriert sich derzeit auf die visuelle Erstellung, aber SenseTime präsentiert NEO-unify als breitere Grundlage.
Die Roadmap des Unternehmens umfasst:
- Allgemeine visuelle Wahrnehmung.
- Räumliche Intelligenz.
- Vision-Sprache-Aktionssysteme.
- Verkörperte Intelligenz.
- Weltmodelle.
- Stadtplanung.
- Architektur und
Industriedesign.
SenseTime hat bereits SenseNova-Vision veröffentlicht, das klassische Computer-Vision-Aufgaben über ein multimodales Generierungsframework abbildet.
Das Modell deckt Aufgaben ab wie:
- Objekterkennung.
- OCR.
- Schätzung von Schlüsselpunkten.
- Segmentierung.
- Tiefenvorhersage.
- Oberflächennormalen.
- Punktkarten.
- Kameraposenschätzung.
- Multi-View-Visual-Geometrie.
Anstatt für jede Aufgabe einen separaten Vorhersagekopf hinzuzufügen, generiert SenseNova-Vision Text, Bilder oder gemischte Ausgaben, je nach angeforderter visueller Aufgabe.
Dies unterstützt SenseTimes größere „Words to Worlds“-Richtung: Sprache und Vision sollten nicht separate Systeme bleiben, die über Adapter verbunden sind. Sie sollten sich innerhalb eines einzigen Modells entwickeln, das verstehen, generieren und schließlich handeln kann.
Was U1 Pro beweisen will
Die Botschaft zum Start lässt sich auf eine praktische Aussage reduzieren:
„Sieht gut aus“ sollte nicht der endgültige Standard für KI-generierte visuelle Inhalte sein. „Kann verwendet werden“ sollte der Standard sein.
U1 Pro versucht, diesen Standard durch fünf zusammenhängende Ideen zu erreichen:
- Eine native einheitliche Architektur für Text und Bilder.
- Verschränkte Reasoning- und visuelle Aktionen.
- Eine lange agentische Generierungsschleife.
- Hochauflösende Ausgabe bis zu 8K.
- Bewertung basierend auf vollständiger Lieferbarkeit statt isolierter Schönheit.
Ob das Modell diese Messlatte dauerhaft erreicht, wird nach breiterem API-Zugang, unabhängigen Tests und echten Kunden-Workflows deutlicher werden.
Der Start markiert dennoch einen wichtigen Wandel in der Positionierung von Bildmodellen.
Sie werden nicht länger nur als Bildgeneratoren präsentiert.
Sie werden als visuelle Produktionsagenten präsentiert.
Häufig gestellte Fragen
Was ist SenseNova U1 Pro?
SenseNova U1 Pro ist SenseTimes natives multimodales Flaggschiffmodell für komplexe visuelle Erstellungsaufgaben. Es vereint Verständnis, Generierung und Aktion und ist darauf ausgelegt, höher aufgelöste, textreiche und lieferbereitere visuelle Assets zu produzieren.
Kann SenseNova U1 Pro native 8K-Bilder generieren?
SenseTimes offizielle Produktseite gibt an, dass U1 Pro Ausgabe bis zu 8K und spezielle Seitenverhältnisse unterstützt. Tatsächliche Auflösungsoptionen, Latenz, Dateiformate und API-Einschränkungen sollten bestätigt werden, sobald die öffentliche API-Dokumentation verfügbar ist.
Ist SenseNova U1 Pro Open Source?
Es wurden keine öffentlichen U1 Pro-Gewichte veröffentlicht. Die früheren Basis- und Infografikmodelle von SenseNova U1 sind Open Source, während U1 Pro derzeit ein proprietäres Flaggschiff ist, das nur über eine Einladungs-Vorschau verfügbar ist.
Wann wird die SenseNova U1 Pro API verfügbar sein?
SenseTimes offizielle Ankündigung besagt, dass die API und Preisgestaltung für August 2026 geplant sind. Stand
22. Juli ist die öffentliche Produktseite online, aber der vollständige öffentliche API-Zugang und die Preisgestaltung wurden noch nicht veröffentlicht.
Was ist NEO-unify?
NEO-unify ist SenseTimes native multimodale Architektur für einheitliches Verständnis und Generierung. Es beseitigt die herkömmliche Trennung zwischen visuellem Encoder, Sprachmodell und Bild-VAE, sodass Text- und Bild-Token innerhalb eines einzigen Transformer-basierten Systems verarbeitet werden können.
Was ist eine Agentic Generation Loop?
Es handelt sich um einen mehrstufigen Erstellungsprozess, bei dem das Modell plant, generiert, prüft,
Bearbeitet, überarbeitet, komponiert und verfeinert ein Bild vor der Auslieferung. Das Modell ist darauf ausgelegt, die nächste visuelle Aktion auf Basis des aktuellen Zwischenergebnisses auszuwählen.
Ist U1 Pro besser als GPT Image 2?
SenseTime berichtet, dass U1 Pro in einer internen Evaluierung mit GPT Image 2 konkurrieren konnte und bei chinesischem Text, Designqualität und östlichen kulturellen Details stark abschnitt. Unabhängige breit angelegte Tests sind noch erforderlich, und die Leistung variiert je nach Prompt, Arbeitsablauf und Bewertungsmethode.
Können Entwickler die SenseNova U1-Technologie jetzt ausprobieren?
Ja. SenseTime hat das Forschungs-Papier zu SenseNova U1, das GitHub-Repository, die Hugging Face-Gewichte und die infografikgestützten Modelle veröffentlicht. Diese sind nicht identisch mit U1 Pro, bieten aber Zugang zur zugrunde liegenden Unified-Model-Richtung.
Verwandte Tools
- SenseNova U1 Pro: Die offizielle Produktgalerie und der Fähigkeitsüberblick für SenseTimes Flaggschiff-Erstellungsmodell.
- SenseNova U1 GitHub-Repository: Offizieller Open-Source-Code, Dokumentation, Modellinformationen und Infografik-Veröffentlichungen.
- SenseNova auf Hugging Face: Offizielle Modellgewichte, Modellkarten und Forschungsressourcen.
- SenseNova U1 Infographic V3: Die empfohlene Open-Source-U1-Veröffentlichung zur Infografik-Generierung und -Bearbeitung.
- SenseNova-Vision: SenseTimes Open-Source-Unified-Computer-Vision-Modell und Corpus.
- SenseNova-Plattform: SenseTimes offizielle Modellkonsole und Entwicklerplattform.
Verwandte Links
- SenseNova U1 Pro Offizielle Produktseite: Offizielle Beispiele, die 8K-Ausgabe, komplexe Informationen, professionelles Design und mehrere visuelle Szenarien abdecken.
- SenseTime WAIC 2026 Vorschau: SenseTimes offizielle Ankündigung mit Vorschau auf U1 Pro und seinen WAIC-Start.
- SenseNova U1 Offizielle Open-Source-Ankündigung: Offizielle Einführung in die Open-Source-Familie vereinheitlichter Verstehens- und Generierungsmodelle.
- SenseNova U1 Forschungsarbeit: Technisches Papier, das die NEO-unify-Architektur und die ursprünglichen U1-Modelle beschreibt.
- NEO-unify Technischer Blog: SenseTimes technischer Überblick über die native einheitliche Architektur.
- SenseNova U1 GitHub-Repository: Offizieller Code, Modelllinks, Architekturdetails und Infografik-Dokumentation.
- SenseNova-Vision Forschungsarbeit: Forschung zur Darstellung traditioneller Computer-Vision-Aufgaben durch einheitliche multimodale Generierung.
Zusammenfassung
SenseNova U1 Pro ist SenseTimes Versuch, die Bildgenerierung in eine anspruchsvollere Kategorie zu überführen: die produktionsreife Auslieferung. Es vereint native multimodale Vereinheitlichung, verschränkte visuell-textuelle Argumentation, eine agentische Erstellungsschleife, dichte chinesische Textdarstellung und Ausgabe bis zu 8K.
Die WAIC-Scroll- und Startbeispiele
demonstrieren ungewöhnlich komplexe Layouts, große Gruppen, chinesische Typografie, wissenschaftliche Infografiken, Produktwerbung und östliche visuelle Stile. Dies sind ausgewählte Unternehmensbeispiele, und der angegebene Vergleich mit GPT Image 2 stammt aus SensesTimes eigener Bewertung und nicht aus einem vollständig unabhängigen öffentlichen Benchmark.
U1 Pro befindet sich derzeit in der Einladung-only-Vorschau, mit öffentlichem API-Zugang und Preisgestaltung, die für August 2026 geplant ist. Entwickler können bereits die Open-Source-Modelle SenseNova U1 und Infografiken erkunden, aber diese Veröffentlichungen sind nicht identisch mit dem Pro-System.
Die wesentliche Verschiebung besteht darin, nicht mehr zu fragen, ob eine KI ein schönes Bild erzeugen kann, sondern ob sie zuverlässig ein vollständiges visuelles Asset liefern kann.



