
今天無處不在的 AI 短片,越來越酷炫的生成效果,會不會給你帶來一種錯覺:這年頭生成影片太輕鬆了,一句話就行?
在 APPSO,我們嘗試了很多不同的影片生成模型,發現答案並沒那麼簡單:那些可以被當做樣例展示的「AI 大片」,大多數都是拿 AI 生成一大堆素材,再到影片編輯軟體里通過人工後期修剪、配樂、精細調整的結果。
AI 是做到了可以生成越來越像電影的畫面,但電影之外,還有一個更大的市場。
每天都有大量廣告、電商、遊戲、產品發布、UI 展示、品牌包裝影片正在製作,它們不一定追求奧斯卡級鏡頭,卻更在意另外幾件事:讀懂創意需求,對影片進行精準編輯,把原本分散在生成、剪輯、字幕、動效和聲音等多個環節的步驟,匯合成一套完整的可交付結果。
今天 MiniMax 發布了新一代開源影片模型 MiniMax H3,有著「Seedance
級別」、「全模態精準控制」,以及「AI 原生後期」能力。
我們想看看,它到底能不能把影片生成里那些額外的工作,也一併給解決?

經過初步測試我們發現,簡單的人物/背景/物體替換、基於參考影片學習風格並複製、根據文字需求直接生成一支產品概念片等,都是它的強項。尤其是針對特效剪輯包裝類影片,廣告、電商、UI 設計等場景,基本上都有不錯的表現。
除了模型的能力,MiniMax H3 還有一個更現實的特點——通過技術積累,給企業客戶和創作者帶來更低的使用成本。
再加上解決了生成「不可控」、「離成片遠」的問題,我們發現MiniMax H3 不僅作為影片生成模型本身更能打了,也對非影片專業的用戶更友好了。


給自己 Vibe Coding 的插件做一個宣傳片
和 Seedance 一樣,H3 也是一款「開放通用多模態影片模型」,它支持文字、圖片、影片和音頻混合輸入,一次最多使用 9 張圖片、3 段影片和 3 段音頻,混合文件上限為 12 個。
我們直接把前段時間 Vibe Coding 做的一個瀏覽器標籤頁總結擴展的截圖發給它,一共 7 張圖片,再加上 Google 發布的 Material 3 設計介紹影片。提示詞只有一句話,就是要求它根據這些圖片內容,製作一個工具介紹影片。

H3 的速度很快,我們選擇了兩個影片,也不用等很久。最後出來的結果相當意外,根本不需要我們去寫任何的轉場以及動效,模型自己就知道最合適的呈現方式。
該圖片疑似使用了AI生成技術,請謹慎甄別
兩個影片有不同的效果,但要表達的內容以及產品的主視覺都做到了保持一致。
影片中的主要文字也都能準確渲染,但當遇到較小和密集的文本,H3 還是會偶發亂碼的問題。這也讓我們發現:大多數情況下,上傳圖片的畫質會決定模型生成的準確性。如果使用的截圖,在這些小字部分都足夠清晰,影片模型在處理時,能降低很多錯誤率。
該圖片疑似使用了AI生成技術,請謹慎甄別
此外,這兩個影片都是一次性生成,完全沒有抽卡。
能做類似的宣傳片,也能覆蓋更多場景下的包裝成本。從廣告、遊戲、電商等行業,我們都用 H3 做了一些簡單的測試,基本上都能滿足最初的交付期待。
先是一個簡單的 ID 片頭,我們臨時編了一個名叫 NULO 的 AI 設計工具,它沒有真實產品,也沒有現成的 Logo 和 UI。
不同於上一個案例的「無責任」極簡提示詞,這次我們專門測試了用更詳細的提示詞進行精細控制,用文字寫清畫面順序:三個寫著 IMAGE、VIDEO 和 AUDIO 的卡片依次出現,組合成 NULO 字標;字標隨後展開為產品界面,增加 EXPORT;最後,所有組件重新收攏成 Logo,出現「MAKE IT MOVE.」。
該圖片疑似使用了AI生成技術,請謹慎甄別
▲ 生成一支 10 秒、16:9 橫版的虛構 AI 設計工具品牌片,品牌只叫「NULO」。這是 motion branding / UI product film,不是人物劇情片。
0–2 秒:石墨黑背景,IMAGE、VIDEO、AUDIO 三張素材卡片從畫面邊緣沿節拍進入,吸附並組合成 NULO 字標。
2–5 秒:字標通過形狀變形展開為極簡產品界面。界面只允許出現四個英文標籤:IMAGE、VIDEO、AUDIO、EXPORT。卡片通過遮罩和彈性伸縮進入時間線,當前選中框變為熒光橙。
5–8 秒:界面只切換一次,變成最終海報預覽;一條熒光橙色軌跡穿過各節點,每經過一個節點就同步一個清晰的點擊或滑動音效。
8–10 秒:全部 UI 組件收攏回 NULO Logo,結尾標語「MAKE IT MOVE.」停留 1 秒。
要求:所有文字清晰、拼寫完全正確、各只出現一次;不要新增單詞、按鈕、Logo 或人物;品牌色僅用石墨黑、暖灰、熒光橙;轉場只用形狀變形、遮罩、卡片伸縮與顏色擴散,不用淡入淡出;配原創極簡電子音樂,動畫節點必須與鼓點和音效同步。
這次,H3 還給生成的影片配上了動感的音樂,影片中四個英文單詞都拼對了,石墨黑、暖灰和熒光橙也從頭保持到尾。此外,模型還自動加了一塊帶節點連線的抽象界面,讓卡片、字標、軌跡和片尾看起來屬於同一套設計——整體上,H3 實現了全方位的一致性,令人滿意。
以上都說的是非專業使用習慣。如果換成專業人士的工作習慣,不用提示詞,也不讓模型發揮想像,直接給它一套完整的分鏡圖,效果又會怎樣呢?
我們先用 GPT Image 2 生成了一張機車的圖片,然後根據這張機車圖,生成一張機車的 TVC 15s 分鏡。

分鏡版其實比較模糊,而且圖片是橫著展開的,不符合一般的分鏡設計,但MiniMax H3 還是讀取到了應該要呈現的資訊,對畫面進行了重新布局。
同時,該顯示的文本資訊,在做到了字體的完整還原之外,H3 還會進一步理解文字與畫面的關係,將文字作為視覺設計元素融入場景,而不僅是簡單疊加、生硬地照搬。
就像這裡,把機車的名稱和 Logo 等文字,沒有簡單地照搬分鏡放在左邊,而是放在了機車下方,更符合影片的觀看體驗。
該圖片疑似使用了AI生成技術,請謹慎甄別
同樣的方式,我們也讓 H3 給 iPhone Fold 做了一個 10s 的廣告影片。
該圖片疑似使用了AI生成技術,請謹慎甄別
這些 AI 生成的作品,基本上都能算得上一個完整的 Demo,可以用在社媒、廣告或遊戲裡——
這也是我們在測試後認為 H3 最大的優勢:它不但兼容專業影片工作者的工作流,更讓非影片專業,但要經常跟影片打交道的那些用戶,能夠以極低的門檻,製作出優秀的 demo 和提案素材,並且在後續的工作中顯著降低非專業用戶與專業用戶協作時的溝通障礙。
如果說過去用 AI 生成影片,是在給剪輯師「增加找素材的工作量」;那麼 H3 給人的感覺,很像是內置了一個懂設計的「AI 後期組」。
我們繼續用它來生成一段虛構的時尚品牌片,這次指定了模特、背景甚至還有音樂。

如果去掉影片右下角的水印,很難發現這個影片是由 AI 製作的。MiniMax H3 把我們指定的人物、包袋、汽車和荒漠公路都做到了完美結合,最後還用了一個快速的平移,準確展示所有文本。
該圖片疑似使用了AI生成技術,請謹慎甄別
隨著模型多模態理解、指令遵循等多項能力的提升,H3 可以更好的理解影片內容、用戶意圖,自動完成特效包裝和視覺設計的增強。這些特性的存在,讓 H3 在我們的測試中所生成的結果,往往更接近一條成片,而非簡單的片段或素材。
除了融合產品 UI 和動態包裝,H3 還能生成具備視覺融合度的遊戲 HUD 界面。我們用 GPT-Image-2 生成了一張遊戲角色的立繪圖片,然後要求 H3 根據這張圖片生成一支 12 秒、16:9 橫版的角色與 UI 包裝影片。
該圖片疑似使用了AI生成技術,請謹慎甄別
還有更簡單的產品介紹影片,上傳一張產品主圖,H3 就能給我們生成一段商業廣告片,快速展示產品的能力。結合語音模型,H3 還讓聲音、畫面與角色動作更好地對齊。就像這瓶精華液的廣告,H3 自動加上水滴的營銷,以及對應的定格音效。
該圖片疑似使用了AI生成技術,請謹慎甄別
有新的需求,也可以直接編輯
會做第一版,和會改第二版,是兩種難度。
廣告團隊可能並不缺少創意,利用 H3 的 AI 原生後期和複雜文本支持,大多數時候就能把創意變成一個成品。但如果客戶或者我們自己的腦海里突然提出了一個微調需求,像是「把女主角 A 換成 B」、「把背景從室內換到室外」,模型要能讓我們在 PS 里一樣進行精準微操,才是真正的難處。
在 Artificial Analysis 的全球影片編輯榜上,MiniMax H3 一發布就超過了之前的 Gemini Omni 等影片編輯模型,拿下榜單第一。

我們找到了之前 Gemini Omni 發布時使用的小提琴案例,小提琴家在音樂廳表演的影片,可以直接讓 H3 修改成在草原和海邊。身體的光影,人物的表情,鏡頭的視角,H3 都做到了完美復刻,只執行了對背景的精準修改。

更有意思的是,我們讓它把手中的小提琴換成了二胡,甚至消失不見,然後讓這位小提琴手彈空氣提琴。

在完全保留原影片人物動作骨架和鏡頭運鏡的前提下,單個物體替換的能力,H3 可以將影片中的物體無縫替換為指定參考圖中的對象。
在複雜的雙人或多主體畫面中,H3 還展現出了空間理解能力。我們可以指定「左邊的人根據參考圖換一套衣服」,同時「右邊的人根據參考圖變成一條狗」。
例如我們將前面生成的沙漠公路包包廣告,把汽車替換成別的顏色,把女主角替換成一個年輕的女孩。
該圖片疑似使用了AI生成技術,請謹慎甄別
在傳統工作流里,這需要繁瑣的摳像遮罩與物體綁定,而 H3 能夠在同一個畫面里分別處理不同對象的指令。
精準編輯的能力還體現在當我們輸入提示詞「將攝像機角度調整為從小提琴手的肩膀上方拍攝。」時,H3 依舊能保持人物的耳環、衣服、背景環境一致,僅做到對鏡頭角度的修改。
該圖片疑似使用了AI生成技術,請謹慎甄別
全模態精準控制很好地彌補了大多數影片生成「無法定點修改」的空白。當甲方提個需求說這個 Demo 替換成 XX,現在交給 H3 就可以編輯好。
另一條影片賽道
討論 AI 影片時,我們總是在乎哪個影片模型畫質最好,哪個模型電影感最強。
但真正開始做影片之後,會發現還有一件更重要的事。七張產品截圖能不能被整理成一支介紹片;一段文字能不能變成包含 Logo、UI、轉場和配樂的品牌片;第一版出來以後,背景、道具和鏡頭角度還能不能繼續修改。
相比單個鏡頭有多漂亮,這些問題更直接決定了一條影片能否被拿去討論和使用。
MiniMax H3 給我們的感覺,就是解決這些問題的一款模型。

它未必能完全生成那些沒有 AI 味的影片,但它幾乎把過去散落在影片生成、後期包裝、字幕、動效和局部修改里的工作,全部重新放回了同一個模型里。經過測試後,我們對 H3 形成的觀感是:它不一定每次都能給你驚喜,但它每次交付都讓你放心。
對於廣告、電商、遊戲或者產品團隊來說,這意味著第一次可以先用一套很低的成本,把創意快速做出來;確認方向以後,再決定要不要繼續投入更高規格的製作。
更重要的是,當 AI 影片開始真正進入商業生產,模型之間競爭的重點也開始發生變化。
該圖片疑似使用了AI生成技術,請謹慎甄別
過去一段時間,AI 影片模型不斷刷新畫質、運鏡和電影感的上限,MiniMax H3 展現出的另一種方向則是繼續把創意生成、精準編輯、包裝和修改做得更完整,讓模型更接近真正能夠交付內容的生產工具。
或許,這就是 AI 影片發展的另一條賽道:比起一味追逐更便宜、更誇張的生成效果,持續把模型能力打磨得更完整,精進技術,並且將其開源,從而讓更多團隊真正把 AI 影片用進日常工作流。
長期穩定生成 AI 影片的內容團隊,他們更關心整個生產流程是否足夠穩定、技術是否能持續疊代,以及模型能力可以無縫容易自己的工作流。
當一款具備完整商業能力的「Seedance 級別」影片模型開源出來,它帶來的價值,是讓這些團隊第一次有機會圍繞模型搭建屬於自己的影片生產能力,而非依賴高價 Token 採購,被綁定在持續的高成本、高槓桿飛輪上狂奔。
這些影片內容團隊,現在也可以按照自己的節奏來搭建算力,實現工作流和業務邏輯的試錯與調整,最終走上更可持續、更自主可控的道路。
這才是模型開源這件事,最好的結果。
*文章內影片可前往 APPSO 微信公眾號查看,點擊鏈接 https://mp.weixin.qq.com/s/1X0i3EfI4iweeAMMJ8O6JA
*






