
HappyHorse 1.1 深度評測:阿里影業級 AI 影片模型,音訊原生時代的來臨
前言 如果你最近混 AI 影片圈,一定聽過「HappyHorse」這個名字。阿里雲在 2026 年初推出的 HappyHorse 1.0 以「神祕黑馬」之姿橫空出世,短短幾個月內就衝上全球 AI 影片模型排行榜第二名——而且它的競爭對手正在一個接一個倒下:OpenAI 的 Sora 因為每天 100 萬美元的營運成本宣布停產,字節跳動的 Seedance 2.0 也因版權爭議無限期擱置。 而在這個節骨眼上,阿里雲丟出了 HappyHorse 1.1。這次升級不再只是炫技 demo,而是直指商業生產場景:多角色一致性、原生音訊同步、電影級鏡頭語言。這篇文章我會把 HappyHorse 1.1 的核心能力、技術架構、與市場定位一次講清楚,幫你判斷它值不值得進到你的工作流。 技術架構:150 億參數的統一 Transformer HappyHorse 1.1 的底層架構是基於一個 150 億參數的統一自注意力 Transformer。它最特別的地方在於——文字、影像、影片、音訊 token 全部塞進同一個 token sequence 裡處理。 這意味著什麼?傳統影片生成管线通常需要:先跑一個影片生成模型,再用另一個 TTS 模型產語音,最後用唇形同步工具把嘴型對上。HappyHorse 1.1 因為所有模態共享同一個架構,可以在單一步驟內同時生成影片和音訊,並且做到「零漂移唇形同步」(zero-drift lip sync)。 簡單來說:以前你要用三套工具才能完成的流程,HappyHorse 1.1 一個模型就搞定了。 1.1 版本五大核心升級 阿里雲在發布說明中強調了五個生產級別的改進,我們逐個拆解: 1. 動態表現力:動作不再僵硬 1.0 版本最大的槽點是角色動作僵硬、表情呆板。1.1 版透過改進幀對齊算法,大幅提升了動作流暢度。實測結果是:同樣的提示詞,1.1 生成的角色眨眼、手部動作、服裝擺動都自然了至少一個等級。 2. 多圖參考:最多九張輸入圖 這是 1.1 最讓電商和品牌團隊興奮的功能。你可以上傳最多 9 張參考圖片——同一個角色的不同角度、產品的多個視角、場景的不同光線條件——模型會精確保留這些輸入細節,不會出現角色臉部融合或產品特徵丟失的問題。 3. 多角色可靠性 以往多角色影片生成最大的痛點是:角色 A 和角色 B 在鏡頭切換時會互相「串臉」。1.1 版透過改進的角色隔離機制,讓每個角色在不同場景切換時保持固定的外貌特徵。阿里雲的說法是:「提供角色與場景作為獨立輸入,角色在場景切換時保持不變。」 ...