For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh-TW/articles/vidu-q4-preview-review-4k-ai-video-16s-cl-b7ef8d69.md.
AI 影片生成通常成本高昂,因此每一次失敗生成都會帶來負擔。本文評測 ShengShu Technology 最新旗艦影片生成模型 Vidu Q4 Preview,涵蓋 4K 輸出、最長 16 秒片段、多重參考影像與音訊、角色表演、鏡頭語言、視覺特效,以及 SaaS 促銷價格與 ...

AI 影片生成通常成本高昂,因此每一次失敗生成都會帶來負擔。
原作者測試了 Vidu Q4 Preview,這是 ShengShu Technology 最新的旗艦影片生成模型,並發現其成本結構相當不同。
透過 Vidu 限時網頁產品促銷活動,一支約一分鐘、以 GTA 6 風格場景呈現的「邪惡奶奶」影片,成本約為:
總計約 ¥5.4
≈ 每生成一秒 ¥0.09
正是這個入門價格,讓這項實驗變得有趣。
但必須加上一項重要說明:
¥0.09/秒是促銷 SaaS 價格,不是 Vidu 的標準 API 費率。
Vidu 官方 API 平台目前列出的 Q4 Preview 價格更高,並且會依輸出解析度而異。
模型本身也不只是低成本生成器。
Vidu Q4 Preview 支援:

原始文章較少聚焦於基準測試數據,而是著重於創作者能立即觀察到的表現:演技、鏡頭語言、視覺效果、一致性,以及較低重試成本如何改變創作流程。
測試流程相當直接。
在 Vidu 的 Reference-to-Video 頁面中:
原始文章包含了這個設定介面的截圖,但準備期間無法可靠取得該來源圖片,因此本文不予重現。
Vidu 官方文件確認了參考素材生成影片的底層參數:
| 設定 | 支援值 |
|---|---|
| 模型 | viduq4-preview |
| 參考圖片 | 1–15 張 |
| 參考音訊 | 0–3 段 |
| 片段時長 | 3–16 秒 |
| 畫面比例 | 1:1、9:16、16:9、3:4、4:3 |
| 解析度 | 540p、720p、1080p、2K、4K |
| 音畫輸出 | 支援 |
每段參考音訊可以長達 3–12 秒,目前文件記載的輸入格式為 MP3。
第一項實際測試聚焦於表演。
原作者沒有使用開頭範例中的「邪惡奶奶」角色,而是改用一名外國男性與一名外國女性進行英文對話。
結果中真正有價值的部分,不是戲劇化的哭泣或誇張動作。
而是更安靜的電影語言測試:
原作者發現,單次生成可以維持穩定的正反打結構。
這一點很重要,因為對話場景往往能迅速暴露 AI 影片的弱點。
大幅度的臉部動作有時可以掩蓋細微的不一致。
但一段無聲停頓做不到這一點。
角色仍然需要看起來像同一個人,在鏡頭改變時維持相同的情緒狀態,並保持空間上的連貫性。
第二個範例從對話轉向戰鬥。
一名名為「Spark 279」的 Vidu 使用者製作了一段約十秒的漫畫風格打鬥片段。
來源文章強調了以下幾點:
動作場景與對話場景面臨的是不同的失效模式。
在快速戰鬥場景中,模型必須持續追蹤:
角色身分
+
身體位置
+
鏡頭位置
+
運動方向
+
環境幾何關係
+
特效時機
其中任何一項發生漂移,片段就會立即產生合成感。
原作者的印象是,Q4 Preview 以這個價格帶而言,異常良好地維持了這些關係。
這是一項定性測試,而不是標準化基準測試,但它反映了創作者實際評估生成式影片的方式。
下一項測試轉向大型科幻環境。
場景讓一名太空人站在觀景平台上,面向雲海上方一座巨大的懸浮結構。
最重要的細節不是結構本身。
而是光線。
當機器發光時,暖橙色光線也出現在:
當結構變暗時,場景則回到較冷的色調。
來源文章藉此提出了一項有用的區分。
如果視覺效果不只是被「塗」在畫面某個部分,而是能影響周圍環境,效果就會更具說服力。
例如:
爆炸
→ 鄰近表面變得更亮
→ 煙霧隨動作移動
→ 粒子對場景產生反應
→ 角色動作保持同步
Q4 Preview 明確定位於更強的電影級特效、場景互動與鏡頭動態。
原作者也嘗試製作咖啡廣告。
這類片段不如動作場景那麼壯觀,但更能代表商業 AI 影片的使用方式。
產品影片需要:
來源文章簡單地將結果描述為流暢且可用。
這類工作流程可能是 Q4 Preview 最具商業價值的理由之一。
創作者可以生成多個版本的:
而不必把每次重試都視為重大預算決策。
這是原始文章中最重要的事實澄清。
文章提到:
每秒約 ¥0.09
並指出六段總長約 110 秒的影片,成本低於 ¥10。
這個計算與限時 SaaS 入門價格一致:
110 × ¥0.09 ≈ ¥9.90
但 Vidu 的標準 API 定價不同。
Vidu 官方中國 API 平台目前列出的價格為:
1 點數 = ¥0.03125
Q4 Preview 的消耗量如下:
| 解析度 | 每秒點數 | 約合人民幣/秒 |
|---|---|---|
| 540p | 9 | ¥0.28125 |
| 720p | 19 | ¥0.59375 |
| 1080p | 24 | ¥0.75 |
| 2K | 38 | ¥1.1875 |
| 4K | 78 | ¥2.4375 |
因此,一次十秒的 API 生成成本約為:
| 解析度 | 十秒成本 |
|---|---|
| 540p | ¥2.81 |
| 720p | ¥5.94 |
| 1080p | ¥7.50 |
| 2K | ¥11.88 |
| 4K | ¥24.38 |
原始文章所說的 API 720p「約 ¥0.6/秒」以及 1080p「約 ¥0.75/秒」,因此是準確的。
因為該範例使用的是網頁產品促銷活動,而不是標準 API 計費。
Vidu 推出 Q4 Preview 時提供了促銷 SaaS 價格,部分生成模式的價格可以降至幾角錢;在最低宣傳價格的情況下,甚至可達到每秒 ¥0.09。
重要規則是:
始終確認所引用的 Vidu 價格,是指 SaaS 促銷使用、API 點數、解析度、方案折扣,還是限時上市優惠。
這些數字不能互相替換。
完成實作測試後,來源文章轉而分析模型本身。
Vidu 將 Q4 定位為新一代旗艦模型,重點在於更具表現力的影片能力。
Preview 版本強調三個領域:
這些領域與 AI 生成影片常見的失效模式高度吻合。
許多生成角色已經具備寫實的外觀。
更困難的問題在於,他們不一定看起來真的在表演。
常見的失效形式如下:
中性表情
→ 突然微笑
→ 突然悲傷
不同狀態之間幾乎沒有情緒過渡。
來源文章認為,Q4 Preview 在以下細微變化上明顯更好:
這就是為什麼原作者花費大量篇幅測試對話場景,而不只是爆炸與動作場景。
細微的表演通常是更困難的測試。
聲音也是表演的一部分。
Reference-to-Video 支援最多:
3 段參考音訊
Vidu 官方產品頁面表示,這些聲音參考可以協助在生成場景之間維持角色的聲音。
音訊不只是無關的背景配樂。
目標是讓以下要素保持一致:
當角色以不同情緒出現在多個場景中時,這一點相當重要。
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
模型可以在改變表達方式的同時,使用相同的聲音身分。
第二個重點是電影攝影。
來源文章強調了以下鏡頭運動:
Q4 官方頁面也強調多鏡頭敘事與流暢的鏡頭運動。
其中一項有用的改進,是主體在鏡頭運動過程中的一致性。
更困難的問題不是讓鏡頭移動。
而是在鏡頭運動時維持:
主體身分
+
空間關係
+
場景幾何
Q4 Preview 也可以在單次生成中切換較寬與較窄的視角。
其單一片段最長時長為:
16 秒
這讓模型有足夠時間呈現一個短動作節拍或多鏡頭場景。
第三個重點是視覺效果。
來源文章提出了一個很好的觀察:描述爆炸很容易,讓爆炸周圍的一切都正確產生反應則更難。
出色的結果需要:
科幻測試被用作這種整合式特效行為的範例。
再次說明,這是創作者的主觀測試,而不是正式基準測試。
但它是評估生產型生成式影片時的一項實用標準。
Vidu Q4 Preview 支援直接生成:
540p
720p
1080p
2K
4K
Vidu 產品頁面與 API 文件都記載了這項能力。
這項支援適用於 Q4 Preview 的圖片生成影片與參考素材生成影片介面。
這一點很重要,因為 AI 影片產品所謂的「支援 4K」可能代表不同含義。
在此處,4K 是官方生成 API 中原生可選的輸出解析度,而不只是額外的第三方升頻流程。
代價是價格。
按照標準 API 費率,4K 消耗:
78 點數/秒
≈ ¥2.4375/秒
因此,創作者不應假設每秒 ¥0.09 的促銷標題價格適用於 4K API 生成。
最後一個技術重點是參考素材容量。
Q4 Preview 在 Reference-to-Video 模式中支援:
1–15 張參考圖片
這讓創作者可以將素材分開指定。
例如:
參考 1:
主要角色
參考 2:
第二名角色
參考 3:
服裝
參考 4:
道具
參考 5:
地點
參考 6:
視覺風格
接著,提示詞可以描述這些參考素材如何互動。
這對於需要讓同一角色在不同地點之間移動的故事很有用,例如:
同時又不會每次都改變外觀。
參考素材容量不代表一定能達到完美一致性,但它能提供更多明確資訊供模型使用。
來源文章最後一個主要段落其實是在討論反覆迭代。
AI 影片生成已經有點類似遊戲中的「抽卡」:
你生成多個版本,並希望其中一個符合要求。
這不一定代表失敗。
變化本來就是生成式創作的一部分。
問題在於成本。
當每次嘗試都很昂貴時,創作者就會停止探索。
低成本重試循環會改變流程:
生成
→ 檢視
→ 修改提示詞
→ 重試
→ 比較
→ 保留最佳版本
創作者不必在按下生成之前,試圖把提示詞調整到完美,而是可以測試多種解讀方式。
這才是每秒 ¥0.09 促銷價格真正重要的地方。
即使長期價格或 API 價格更高,較低的生成成本仍能降低實驗的代價。
來源文章將這項體驗總結為:
「相同的錢可以購買五倍的影片素材。」
這並不是與所有競爭模型進行的普遍價格比較。
這是原作者對促銷 Q4 Preview 如何改變自身測試預算的描述。
如果每個鏡頭都要生成兩到三次,較低的單次生成價格就可能帶來巨大差異。
對創作者而言,有用的指標不只是:
每生成一秒的成本
而是:
每一秒可用影片的成本
如果模型便宜,但需要重試十次,有效製作成本仍可能很高。
如果一致性與表演能力足以降低重試次數,經濟效益就會同時改善兩次:
較低的生成價格
+
較少失敗的創意版本
來源文章同時提到了 Vidu 的 SaaS 產品與 MaaS/API 平台。
兩者服務於不同的工作流程。
較適合希望:
的創作者。
較適合需要:
的團隊。
對 API 使用而言,官方模型 ID 為:
viduq4-preview
圖片生成影片端點:
POST /ent/v2/img2video
參考素材生成影片端點:
POST /ent/v2/reference2video
這些端點名稱僅供參考;原始文章本身沒有包含 API 程式碼範例。
| 功能 | 官方 Q4 Preview 支援情況 |
|---|---|
| 模型 ID | viduq4-preview |
| 圖片生成影片 | 是 |
| 參考素材生成影片 | 是 |
| 文字生成影片 | 目前 Q4 Preview 模型對照表中不支援 |
| 起始/結束影格模式 | 目前 Q4 Preview 模型對照表中不支援 |
| 解析度 | 540p–4K |
| 幀率 | 24 fps |
| 時長 | 3–16 秒 |
| 參考圖片 | 最多 15 張 |
| 參考音訊 | 最多 3 段 |
| 音畫生成 | 是 |
| 自動切換鏡頭 | 是 |
| 參考音訊時長 | 每段 3–12 秒 |
| 參考音訊格式 | MP3 |
| 畫面比例 | 1:1、9:16、16:9、3:4、4:3 |
這張表反映目前 Vidu 文件中的資訊,比將所有 Vidu 產品功能都視為適用於每一種 Q4 Preview 生成模式更加精確。
Vidu Q4 Preview 是 ShengShu Technology 推出的新一代旗艦 AI 影片生成模型,專注於具表現力的角色表演、電影級鏡頭運動與視覺效果。它支援帶有同步音訊的圖片生成影片與參考素材生成影片。
支援。Vidu 官方產品頁面與 API 文件列出 Q4 Preview 可輸出 540p、720p、1080p、2K 與 4K。
官方 API 支援 3–16 秒片段。Vidu 產品頁面也宣傳支援最長 16 秒的多鏡頭敘事。
Reference-to-Video 可接受 1 至 15 張圖片。這些圖片可以用來建立角色、服裝、道具、地點或風格。
Reference-to-Video 支援最多三個參考音訊檔案。Vidu 將其描述為聲音參考,用於維持角色聲音、情緒表達與唇形同步音訊的一致性。
這個數字指的是限時 SaaS 上市促銷活動,應視為促銷起始價格。標準 API 價格更高,並且取決於解析度;例如,中國官方 API 價格在 720p 約為 ¥0.59375/秒,在 1080p 約為 ¥0.75/秒。
Vidu 中國 API 將 4K Q4 Preview 列為每生成一秒消耗 78 點數。按照標準列出的每點 ¥0.03125 計算,在任何方案特定折扣前,約為每秒 ¥2.4375。
可以。Vidu 文件說明,viduq4-preview 可透過 Open Platform API 用於圖片生成影片與參考素材生成影片。
Vidu Q4 Preview 結合了創作者通常必須取捨的多項能力:更高解析度輸出、多重參考素材一致性、聲音參考、同步音訊、更長的多鏡頭片段,以及相對較低的生成成本。
來源文章的實測結果聚焦於完成影片最重要的幾個方面——表演、停頓、鏡頭切換、動作一致性、環境光線與商業風格的精緻度。這些觀察屬於定性結果,但 4K 輸出、16 秒時長、15 張圖片參考與三段參考音訊等底層能力,已由 Vidu 官方文件確認。
定價方面最大的重點是,每秒 ¥0.09 的標題價格是促銷 SaaS 起始費率,而不是標準 API 價格。API 使用者應根據不同解析度的點數消耗計算成本;使用網頁產品的創作者則應在預估專案成本前,先確認目前的促銷方案。
Q4 Preview 最具實際價值的優勢,是更好的一致性與更低的重試成本讓實驗不再那麼痛苦——創作者可以花更多時間挑選最佳版本,而不是小心翼翼地保護每一次生成點數。
從一句話開始,幾分鐘內拿到完整網站。