For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/fr/articles/vidu-q4-preview-review-4k-ai-video-16s-cl-b7ef8d69.md.
La vidéo IA est généralement assez coûteuse pour que chaque prise ratée ait un impact.

La vidéo IA est généralement assez coûteuse pour que chaque prise ratée ait un impact.
L’auteur original a testé Vidu Q4 Preview, le dernier modèle phare de génération vidéo de ShengShu Technology, et a constaté une structure de coûts très différente.
En utilisant la promotion temporaire du produit web de Vidu, une vidéo d’environ une minute mettant en scène une « grand-mère maléfique » dans un univers de type GTA 6 a coûté environ :
5,4 ¥ au total
≈ 0,09 ¥ par seconde générée
C’est ce prix d’entrée qui rend l’expérience intéressante.
Mais il faut lui apporter une précision importante :
0,09 ¥/s correspond au tarif promotionnel du SaaS, et non au tarif API standard de Vidu.
La plateforme API officielle de Vidu affiche actuellement pour Q4 Preview un tarif en crédits plus élevé, qui dépend de la résolution.
Le modèle ne se limite toutefois pas à proposer une génération peu coûteuse.
Vidu Q4 Preview prend en charge :

L’article source s’intéresse moins aux scores de benchmark qu’à des éléments que les créateurs peuvent observer immédiatement : le jeu des acteurs, le langage de caméra, les effets visuels, la cohérence et l’influence du faible coût des nouvelles tentatives sur le processus créatif.
Le flux de test est simple.
Sur la page Reference-to-Video de Vidu :
L’article original incluait une capture d’écran de cette interface de configuration, mais l’image source n’a pas pu être récupérée de manière fiable lors de la préparation. Elle n’est donc pas reproduite ici.
La documentation officielle de Vidu confirme les paramètres sous-jacents de la conversion de références en vidéo :
| Paramètre | Valeur prise en charge |
|---|---|
| Modèle | viduq4-preview |
| Images de référence | 1 à 15 |
| Audio de référence | 0 à 3 |
| Durée | 3 à 16 secondes |
| Format d’image | 1:1, 9:16, 16:9, 3:4, 4:3 |
| Résolution | 540p, 720p, 1080p, 2K, 4K |
| Sortie audio-vidéo | Prise en charge |
Chaque clip audio de référence peut durer de 3 à 12 secondes et est actuellement documenté comme une entrée MP3.
Le premier test pratique portait sur le jeu des acteurs.
Au lieu du personnage de « grand-mère maléfique » utilisé dans l’exemple d’introduction, l’auteur a choisi un homme et une femme étrangers qui parlent anglais.
L’intérêt du résultat ne résidait pas dans des pleurs théâtraux ou des mouvements exagérés.
Il s’agissait plutôt d’un test plus discret du langage cinématographique :
L’auteur a constaté qu’une génération en un seul plan pouvait maintenir une structure stable de champ-contrechamp.
C’est important, car les scènes de conversation révèlent rapidement les faiblesses de la vidéo IA.
De grands mouvements du visage peuvent parfois dissimuler de petites incohérences.
Une pause silencieuse, non.
Le personnage doit continuer à ressembler à la même personne, conserver le même état émotionnel et rester cohérent dans l’espace pendant que la caméra change de position.
Le deuxième exemple passait du dialogue au combat.
Un utilisateur de Vidu nommé « Spark 279 » a créé une séquence de combat d’environ dix secondes, dans un style de bande dessinée.
La source met en avant :
L’action correspond à un mode d’échec différent de celui du dialogue.
Dans une scène de combat rapide, le modèle doit suivre :
l’identité du personnage
+
la position du corps
+
la position de la caméra
+
la direction du mouvement
+
la géométrie de l’environnement
+
le timing des effets
Lorsque l’un de ces éléments dérive, le clip paraît immédiatement artificiel.
L’impression de l’auteur source est que Q4 Preview maintient ces relations avec une efficacité inhabituelle pour ce niveau de prix.
Il s’agit d’un test qualitatif et non d’un benchmark standardisé, mais il reflète la manière dont les créateurs évaluent réellement la vidéo générative.
Le test suivant se déroulait dans un vaste environnement de science-fiction.
La scène plaçait un astronaute sur une plateforme d’observation, face à une immense structure suspendue au-dessus d’une mer de nuages.
Le détail le plus important n’était pas la structure elle-même.
C’était l’éclairage.
Lorsque la machine s’illuminait, la lumière orange chaude apparaissait également sur :
Lorsque la structure s’assombrissait, la scène revenait à une tonalité plus froide.
La source établit ici une distinction utile.
Un effet visuel paraît plus convaincant lorsqu’il n’est pas simplement « peint » sur une partie de l’image.
Il doit modifier l’environnement alentour.
Par exemple :
explosion
→ les surfaces voisines deviennent plus lumineuses
→ la fumée suit le mouvement
→ les particules réagissent à la scène
→ le mouvement du personnage reste synchronisé
Q4 Preview est explicitement présenté comme un modèle offrant des effets cinématographiques plus puissants, une meilleure interaction avec la scène et une dynamique de caméra renforcée.
L’auteur a également essayé de créer une publicité pour du café.
Ce type de clip est moins spectaculaire qu’une séquence d’action, mais il est plus représentatif des usages commerciaux de la vidéo IA.
Une vidéo produit a besoin de :
La source décrit simplement le résultat comme fluide et exploitable.
Ce type de charge de travail pourrait constituer l’un des arguments commerciaux les plus solides en faveur d’un modèle comme Q4 Preview.
Les créateurs peuvent générer plusieurs versions de :
sans considérer chaque nouvelle tentative comme une décision budgétaire majeure.
C’est la précision factuelle la plus importante de l’article original.
L’article indique :
~0,09 ¥ par seconde
et rapporte que six clips totalisant environ 110 secondes ont coûté moins de 10 ¥.
Ce calcul est cohérent avec le prix d’entrée SaaS proposé pendant une promotion temporaire :
110 × 0,09 ¥ ≈ 9,90 ¥
Mais la tarification API standard de Vidu est différente.
La plateforme API officielle chinoise de Vidu indique actuellement :
1 crédit = 0,03125 ¥
Q4 Preview consomme :
| Résolution | Crédits / seconde | Environ RMB / seconde |
|---|---|---|
| 540p | 9 | 0,28125 ¥ |
| 720p | 19 | 0,59375 ¥ |
| 1080p | 24 | 0,75 ¥ |
| 2K | 38 | 1,1875 ¥ |
| 4K | 78 | 2,4375 ¥ |
Une génération API de dix secondes coûte donc environ :
| Résolution | Coût pour 10 secondes |
|---|---|
| 540p | 2,81 ¥ |
| 720p | 5,94 ¥ |
| 1080p | 7,50 ¥ |
| 2K | 11,88 ¥ |
| 4K | 24,38 ¥ |
L’affirmation de l’article original selon laquelle la vidéo API en 720p coûte « environ 0,6 ¥/s » et celle en 1080p « environ 0,75 ¥/s » sont donc exactes.
Parce que cet exemple utilisait la promotion du produit web plutôt que la facturation API standard.
Vidu a lancé Q4 Preview avec une tarification SaaS promotionnelle qui pouvait ramener certains modes de génération à quelques jiao ou, dans le cas du tarif le plus bas annoncé, à 0,09 ¥ par seconde.
La règle importante est la suivante :
Vérifiez toujours si le prix cité pour Vidu correspond à un usage SaaS promotionnel, à des crédits API, à une résolution, à des réductions liées au forfait ou à une offre de lancement temporaire.
Ces chiffres ne sont pas interchangeables.
Après les tests pratiques, la source s’intéresse au modèle lui-même.
Vidu présente Q4 comme un modèle phare de nouvelle génération axé sur la qualité expressive de la vidéo.
La version Preview met l’accent sur trois domaines :
Ces domaines correspondent étroitement aux modes d’échec observés dans la vidéo générée par IA.
De nombreux personnages générés paraissent déjà photoréalistes.
Le problème plus difficile est qu’ils ne donnent pas toujours l’impression de jouer réellement un rôle.
Un échec courant ressemble à ceci :
visage neutre
→ sourire soudain
→ tristesse soudaine
avec très peu de transition émotionnelle entre les états.
La source estime que Q4 Preview est sensiblement meilleur dans les petites variations de :
C’est pourquoi l’auteur consacre autant de temps aux scènes de dialogue plutôt qu’aux seules explosions et séquences d’action.
Le jeu subtil est souvent un test plus difficile.
La voix fait également partie de la performance.
Reference-to-Video prend en charge jusqu’à :
3 clips audio de référence
La page produit officielle de Vidu indique que ces références vocales peuvent contribuer à préserver la voix d’un personnage dans différentes scènes générées.
L’audio n’est pas simplement une bande-son indépendante.
L’objectif est de maintenir la cohérence entre :
et la performance visuelle.
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
Cela est important lorsqu’un personnage apparaît dans plusieurs scènes avec des émotions différentes.
Le modèle peut conserver la même identité vocale tout en modifiant la manière de la faire entendre.
Le deuxième axe concerne la cinématographie.
La source met en avant des mouvements tels que :
La page officielle de Q4 insiste également sur la narration en plusieurs plans et sur la fluidité des mouvements de caméra.
L’un des progrès utiles concerne la cohérence du sujet pendant ces mouvements.
Le problème le plus difficile n’est pas de faire bouger la caméra.
Il consiste à préserver :
l’identité du sujet
+
les relations spatiales
+
la géométrie de la scène
pendant le déplacement de la caméra.
Q4 Preview peut également passer d’un cadrage large à un cadrage plus serré au sein d’une même génération.
La durée maximale d’un clip unique est de :
16 secondes
ce qui laisse au modèle suffisamment de temps pour créer une courte action ou une scène en plusieurs plans.
Le troisième axe concerne les effets visuels.
La source formule une remarque pertinente : décrire une explosion est facile.
Faire réagir correctement tout ce qui entoure l’explosion est plus difficile.
Un résultat convaincant nécessite :
Le test de science-fiction est présenté comme un exemple de comportement plus intégré des effets.
Là encore, il s’agit d’un test subjectif réalisé par un créateur et non d’un benchmark formel.
Mais c’est un critère d’évaluation pratique pour la vidéo générative destinée à la production.
Vidu Q4 Preview prend en charge la génération directe en :
540p
720p
1080p
2K
4K
Cela est documenté à la fois sur la page produit de Vidu et dans l’API.
Cette capacité s’applique aux interfaces image-vidéo et référence-vidéo de Q4 Preview.
C’est important, car la mention « prise en charge de la 4K » peut désigner des choses différentes selon les produits de vidéo IA.
Ici, la 4K apparaît comme une résolution de sortie sélectionnable nativement dans l’API officielle de génération, et non uniquement comme un processus d’upscaling tiers distinct.
Le compromis est le prix.
Aux tarifs API standards, la 4K consomme :
78 crédits / seconde
≈ 2,4375 ¥ / seconde
Un créateur ne doit donc pas supposer que le tarif promotionnel de 0,09 ¥/s s’applique à la génération API en 4K.
Le dernier axe technique concerne la capacité de référence.
Q4 Preview prend en charge :
1 à 15 images de référence
en mode Reference-to-Video.
Cela laisse aux créateurs la possibilité de séparer les différents éléments visuels.
Par exemple :
référence 1 :
personnage principal
référence 2 :
second personnage
référence 3 :
tenue
référence 4 :
accessoire
référence 5 :
lieu
référence 6 :
style visuel
Le prompt peut ensuite décrire la manière dont ces références interagissent.
C’est utile pour une histoire dans laquelle le même personnage se déplace entre :
sans changer d’apparence à chaque nouvelle scène.
La capacité de référence ne garantit pas une cohérence parfaite, mais elle fournit au modèle davantage d’informations explicites sur lesquelles s’appuyer.
La dernière grande partie de la source porte en réalité sur l’itération.
La génération vidéo IA possède déjà un concept comparable au fait de « tirer des cartes » dans un jeu.
Vous générez plusieurs versions en espérant que l’une d’elles soit la bonne.
Ce n’est pas nécessairement un signe d’échec.
La variation fait partie du travail créatif génératif.
Le problème est le coût.
Lorsque chaque tentative est coûteuse, les créateurs cessent d’explorer.
Une boucle de nouvelles tentatives peu coûteuse change le processus :
générer
→ examiner
→ modifier le prompt
→ recommencer
→ comparer
→ conserver la meilleure prise
Au lieu d’essayer de perfectionner le prompt avant de cliquer sur Générer, le créateur peut tester plusieurs interprétations.
C’est là que réside la véritable importance du tarif promotionnel de 0,09 ¥/s.
Même si le prix à long terme ou le tarif API est plus élevé, un coût de génération inférieur réduit la pénalité liée à l’expérimentation.
La source résume l’expérience ainsi :
« Avec le même budget, on obtient cinq fois plus de séquences. »
Il ne s’agit pas d’une comparaison de prix universelle avec chaque modèle concurrent.
C’est la description que fait l’auteur de la manière dont le coût promotionnel de Q4 Preview a modifié son propre budget de test.
Si chaque plan est généré deux ou trois fois, un faible prix par prise peut faire une grande différence.
Pour les créateurs, la mesure utile n’est pas seulement :
coût par seconde générée
mais plutôt :
coût par seconde exploitable
Si un modèle est peu coûteux mais nécessite dix nouvelles tentatives, le coût de production effectif peut rester élevé.
Si la cohérence et le jeu des acteurs progressent suffisamment pour réduire le nombre de prises ratées, l’économie s’améliore deux fois :
prix de génération inférieur
+
moins de prises créatives inutilisables
La source mentionne à la fois le produit SaaS de Vidu et sa plateforme MaaS/API. Ils répondent à des flux de travail différents.
Convient surtout aux créateurs qui souhaitent :
Convient surtout aux équipes qui doivent :
Pour les usages API, l’identifiant officiel du modèle est :
viduq4-preview
Point de terminaison image-vidéo :
POST /ent/v2/img2video
Point de terminaison référence-vidéo :
POST /ent/v2/reference2video
Ces noms de points de terminaison sont fournis à titre de référence ; l’article original ne contenait pas d’exemple de code API.
| Fonctionnalité | Prise en charge officielle de Q4 Preview |
|---|---|
| Identifiant du modèle | viduq4-preview |
| Image-vidéo | Oui |
| Référence-vidéo | Oui |
| Texte-vidéo | Non dans la cartographie actuelle du modèle Q4 Preview |
| Mode image de début/fin | Non dans la cartographie actuelle du modèle Q4 Preview |
| Résolution | 540p à 4K |
| Fréquence d’images | 24 i/s |
| Durée | 3 à 16 secondes |
| Images de référence | Jusqu’à 15 |
| Audio de référence | Jusqu’à 3 |
| Génération audio-vidéo | Oui |
| Changement automatique de caméra | Oui |
| Durée de l’audio de référence | 3 à 12 secondes chacun |
| Format de l’audio de référence | MP3 |
| Formats d’image | 1:1, 9:16, 16:9, 3:4, 4:3 |
Ce tableau reflète la documentation actuelle de Vidu et fournit davantage de précision qu’une présentation qui considérerait chaque fonctionnalité Vidu comme disponible dans tous les modes de génération de Q4 Preview.
Vidu Q4 Preview est le nouveau modèle phare de génération vidéo IA de ShengShu Technology. Il est conçu pour le jeu expressif des personnages, les mouvements de caméra cinématographiques et les effets visuels. Il prend en charge la génération image-vidéo et référence-vidéo avec synchronisation audio.
Oui. La page produit officielle de Vidu et sa documentation API indiquent des sorties en 540p, 720p, 1080p, 2K et 4K pour Q4 Preview.
L’API officielle prend en charge des clips de 3 à 16 secondes. La page produit de Vidu annonce également une durée maximale de 16 secondes pour la narration en plusieurs plans.
Reference-to-Video accepte entre 1 et 15 images. Elles peuvent servir à définir des personnages, des costumes, des accessoires, des lieux ou des styles.
Reference-to-Video prend en charge jusqu’à trois fichiers audio de référence. Vidu les décrit comme des références vocales destinées à maintenir la cohérence de la voix du personnage, de l’interprétation émotionnelle et de la synchronisation labiale.
Ce chiffre correspond à une promotion de lancement SaaS limitée dans le temps et doit être considéré comme un prix promotionnel de départ. La tarification API standard est plus élevée et dépend de la résolution. Par exemple, la tarification API officielle chinoise est d’environ 0,59375 ¥/s en 720p et de 0,75 ¥/s en 1080p.
L’API chinoise de Vidu indique une consommation de 78 crédits par seconde générée pour Q4 Preview en 4K. Au tarif standard affiché de 0,03125 ¥ par crédit, cela représente environ 2,4375 ¥ par seconde avant toute réduction liée au forfait.
Oui. Vidu documente viduq4-preview pour la génération image-vidéo et référence-vidéo via son API Open Platform.
Vidu Q4 Preview réunit plusieurs caractéristiques que les créateurs doivent généralement arbitrer : une sortie haute résolution, une cohérence multi-référence, des références vocales, un audio synchronisé, des clips en plusieurs plans plus longs et un coût de génération relativement faible.
Les résultats pratiques de la source se concentrent sur les aspects les plus importants d’une vidéo finalisée : le jeu des acteurs, les pauses, les changements de plan, la cohérence de l’action, l’éclairage environnemental et le niveau de finition d’un contenu commercial. Ces observations sont qualitatives, mais les capacités sous-jacentes — sortie 4K, durée de 16 secondes, 15 images de référence et trois clips audio de référence — sont confirmées par la documentation officielle de Vidu.
La principale leçon concernant les tarifs est que le prix annoncé de 0,09 ¥/s correspond à un tarif SaaS promotionnel de départ et non au prix API standard. Les utilisateurs de l’API doivent calculer le coût à partir des crédits associés à chaque résolution, tandis que les créateurs utilisant le produit web doivent vérifier le forfait promotionnel en vigueur avant d’estimer le budget d’un projet.
Le principal avantage pratique de Q4 Preview est que l’amélioration de la cohérence et le faible coût des nouvelles tentatives rendent l’expérimentation moins pénible : les créateurs peuvent consacrer davantage de temps à choisir la meilleure prise au lieu de protéger chaque crédit de génération.
Partez d’une phrase et obtenez un site complet en quelques minutes.