
上周,《後西遊記》在湖南衛視黃金檔時段上映。
這部劇最大的特點,是全程採用 AIGC
參與製作,並可根據觀眾反饋調整未播內容。首播後,《後西遊記》拿下同時段省級衛視收視第一,製作成本約為真人劇的十分之一,芒果 TV 官方播放量已達 1.1 億次。

關注度之外,AI 影片正在進入新的階段。過去,AI 更多承擔單個鏡頭、單張圖片的生成工作,而如今,行業開始探索讓 AI 參與完整內容生產流程。
APPSO 之前也報道過,2026 世界人工智慧大會(WAIC
)期間,智象未來
(HiDream.ai
)正式發布全球首個無限時長內容創作智能體 vivago R1
。
現在,vivago R1 已經正式全球上線,國內版本名為「夠搭
」(以下統稱 vivago R1)。它試圖解決的是另一個問題:當 AI 已經能夠生成畫面之後,普通人距離製作一部完整作品,還有多遠?

▲ vivago R1 體驗地址:vivago.ai
夠搭體驗地址:goudaai.com
熱知識,vivago R1 是首個可穩定生成 3 至 5 分鐘影片的對話式創作 Agent
。
不同於需要用戶自行搭建工作流的畫布式、節點式工具,vivago R1 採用對話式創作路線,用戶只需自然語言描述創意,就能完成從故事、腳本、分鏡,到角色、鏡頭和成片生成的全流程,大幅降低了創作門檻。
如果說《後西遊記》展示了 AI 如何進入影視工業,vivago R1 展示的則是 AI 如何以 Agent 形式參與影視生產,並將完整的內容生產能力交給普通用戶。APPSO 決定第一時間上手測試。
實測 R1 ,一個人就是一支 AI 劇組
既然《後西遊記》成為近期 AI 影片領域最受關注的話題,我們直接圍繞西遊主題進行創作。
我們為夠搭設計了一部名為《重啟·西遊》的電馭叛客短片。
2099 年,人類記憶被統一意識網路「天庭系統」重寫,最後一段未被改寫的原始數據「悟空」從廢棄數據中心中甦醒,攜帶「真經」穿越電馭叛客新長安城,在被系統獵殺之前上傳真經。
視覺風格是東方電馭叛客——敦煌壁畫遇上銀翼殺手。

把創意輸入夠搭後,Agent 自動匹配 Cinematic Story Director,先生成完整分鏡腳本和關鍵畫面,然後等我確認創作方向之後繼續生成影片。
在這一過程中,R1 夠搭的 Chat 與畫布形成了一套圍繞 Agent 協作設計的創作流程。
Chat 負責承接用戶意圖、調用素材並推動腳本、分鏡和影片生成;畫布則結構化呈現腳本、分鏡、影片及關鍵資產,方便用戶查看進展、比較結果。簡單來說,Chat 用於與 Agent 協作,畫布用於整理和呈現創作成果。

視覺一致性是夠搭給我留下最深印象的部分。APPSO 要求的「冷藍色賽博世界風格」和「暖金調真經力量」的色調對比貫穿全片,沒有跨場景的風格跳變。

悟空的角色形象——賽博僧袍、額頭金色電路紋路、琥珀色瞳孔——在多個鏡頭間保持了辨識度;全息賽博佛像角色也做得相當高級,把那種神聖與賽博元素融合的氣質展現得淋漓盡致。

新長安城全景那種細節密度極高的畫面,通常是 AI 影片最容易崩的類型,城市細節、人物關係以及整體視覺風格需要同時保持穩定,而 R1 完成的效果已經接近一支完整概念短片。

過去,AI 影片最容易展示的是某個驚艷鏡頭。但一個行業共識是:即使拿到了世界上最強的模型,普通人依然做不出想要的東西。因為模型能力與用戶想要的結果之間,存在巨大的 Gap——這個 Gap 填充的是創作者腦中的審美、經驗和判斷,是海量被專業訓練過的創作直覺。
如今,行業開始面對更複雜的問題:如何讓多個鏡頭、一段故事乃至一整支影片保持連貫。vivago R1 的最大亮點,正是 AI 影片從生成片段走向完整作品的交付。

·當品牌廣告,被 AI 裝進一個對話框
完成長影片測試後,我們又嘗試了商業廣告場景。
我們準備了測試素材:一張人物照片、產品包裝和 Logo;讓夠搭用這些素材做一條社媒廣告——「每吃一口,人格切換一次」:沒吃前低電量,第一口職場精英,第二口熱血俠客,第三口鬆弛日常。

夠搭匹配 Story Ad Director 後,先生成廣告分鏡,再根據確認後的方案完成影片製作。整個過程中,人物形象和產品包裝保持了較好的連續性。

對於品牌、電商和內容創作者而言,AI 影片的價值體現在降低製作成本、縮短修改周期,並減少重複製作與人工調整的投入。當影片生成逐漸從一次性的創意嘗試,走向穩定、可交付的生產流程,AI 影片也開始展現更清晰的商業價值。

·AI 開始理解網際網路那些「人類暗號」
更刁鑽的測試是網路熱梗。
我們又輸入了一段充滿諧音梗的任務——「嚕妹嚕妹嚕妹妹,豬 mer 豬 mer 豬 mermer…..,嚕妹聽到後走過來掐一下嚕嚕的臉,哄哄嚕嚕」。
這類內容看似簡單,但實際上需要理解諧音梗、理解「掐臉」的情感含義、還要編排成有節奏的影片。不僅考察它的影片生成能力,還考察它的搜索和理解能力。

R1 先通過 Websearch 查了這個梗的來源,然後生成了包含原創角色和情緒轉折的完整影片。

整個使用過程中,我們都沒有告訴他嚕嚕的形象和聲音,儘管如此,夠搭做出來的還原度和情感表達已經相當不錯,萌化了老夫的少女心。

·未來每個人,都可能擁有自己的數字資產庫
除了直接生成內容,夠搭還有一個更重要的能力:幫助用戶沉澱自己的創作資產。
在夠搭的 SkillHub
中,用戶可以找到大量預設功能,將抽象的 AI 能力轉化成具體創作場景。它的價值在於降低用戶理解 AI 能力的成本,讓更多人知道自己可以用 AI 完成什麼,也讓創作從「想到一個點子」更快進入執行階段。
其中,OOTD Advisor
是一個比較有代表性的功能。

APPSO 準備了一個 AI 生成的人物照作為素材,把它發給夠搭,然後讓它結合上傳的人物形象特點,幫忙搭個四五套衣服。要求是既適合通勤穿,又不顯得普通有班味。

它最終幫我搭配了四種風格的 OOTD, 說實話,每一種風格都頗具特色,真的太方便了!以後想試衣服,直接把我的照片和在網上看好的衣服發給它,豈不是可以直接賽博試衣?

最最最令人興奮的功能,還不止如此。我們精挑細選,好不容易搭配出喜歡的穿搭,做出想要的動漫形象,以及栩栩如生的場景,總不能每次都「抽卡」吧?

夠搭針對這種割裂感的體驗,推出了資產庫積累功能。資產庫和普通收藏的差異在於,普通收藏通常保存的是用戶看到的內容,而資產庫沉澱的是用戶在產品內生成、篩選並認可的內容,並在後續創作中直接調用。

比如我可以把我最喜歡的 OOTD 添加到資產庫,再把嚕嚕的形象,還有之前「賽博西遊」中的「天機塔」場景都加到素材庫,來一場跨次元的對話~

一次創作不再只是一次性輸出,而會逐漸成為下一次創作的素材基礎。
從留聲機到 vivago R1,人類創造力迎來第三次釋放
回看人類歷史,真正改變創作方式的技術,往往都在解決同一個問題:如何讓更多人的想法抵達最終作品。
1877 年,愛迪生發明留聲機,讓聲音第一次被記錄和復現,人類表達開始擺脫時間與空間的限制。進入 20 世紀,單反相機的問世,尤其是微單的普及,讓攝影從少數人的專業技能變成普通人記錄世界、表達自我的方式。

留聲機讓每個人都可以保存自己的聲音,單反相機讓每個人都可以記錄眼前的世界。
而今天,AI 影片正在推動第三次創造力釋放。
過去,一個人腦海中的故事想變成一部完整影片,需要經過一條複雜的專業鏈路。編劇負責構建故事,導演負責設計鏡頭,攝影負責捕捉畫面,剪輯負責組織節奏,後期負責完成最終呈現。
創意和作品之間,始終隔著一層複雜的「翻譯層」。

AI 影片的發展,正在改變這一關係。
早期 AI 影片模型,例如 Sora,讓大眾第一次看到機器生成影片的可能性。一句自然語言描述,就可以生成具有電影感的畫面,讓人類第一次感受到 AI 影片創作的魔力。
但從一個驚艷的鏡頭,到一部完整的影片作品,中間依然存在巨大距離。影片創作真正困難的地方,在於如何讓多個鏡頭保持統一,讓角色在不同場景中保持一致,讓故事擁有連續的敘事邏輯。
這也是 R1 想解決的問題。如開頭所述,當下行業正在形成兩條路線:一種把模型、工具和參數交給用戶,讓創作者自行組合和調試,換取更高自由度;
另一種則像 R1 一樣,是將專業創作者的經驗、審美和判斷邏輯融入 Agent 編排能力。用戶只需簡單對話,背後則由 Agent 理解並執行完整創作流程。
兩種路徑沒有絕對對錯。前者上限更高,適合專業創作者;後者門檻更低、交付更穩定。

這也指向一個更本質的判斷:模型能力不等於產品能力。
在 AI 影片創作里,模型和工具鏈再複雜,若不能將創意穩定組織成完整作品,就只是「能力展示」,而非真正的生產力。
除了面向普通用戶的對話式創作體驗,R1 也開始向開發者和專業內容團隊開放更高階的使用方式。目前,夠搭已經支持 CLI 命令行交互模式,讓用戶可以通過終端直接調用影片生成、素材渲染、任務調度以及參數配置等能力,感興趣的朋友不妨嘗試一下。

而從夠搭出發,我們也可以進一步看到它背後的公司——成立於 2023 年的智象未來(HiDream.ai)。
作為一家專注多模態生成式人工智慧的企業,智象未來自主研發了 HiDream-O1 系列大模型,並將多模態理解與生成能力應用於內容創作。
支撐這一目標的,是智象未來在模型架構上的長期探索。當前許多影片生成模型會先將圖像壓縮至隱空間,再基於壓縮表達進行學習和生成。雖然這種方式能夠降低計算成本,但也可能損失文字、表情和紋理等細節。

HiDream-O1 系列採用原生全模態 UiT(Unified Transformer)架構,減少 VAE 和獨立文本編碼器等環節,將圖像像素、文本 Token、影片體素、音頻、動作及空間關係等原始信號映射至統一 Token 空間,再通過同一套 UiT 完成理解、生成和推理。
在這一技術路線下,智象未來進一步拓展了世界模型的能力邊界。截止到今年 7 月,智象未來原生全模態交互式世界模型 HiDream-O1-World 在 WBench 評測中取得領先表現。

無論是 HiDream-O1-Image,還是 HiDream-O1-World,智象未來作為創新型大模型企業,正逐步形成覆蓋視覺模型、交互式世界模型及具身世界模型的模型家族矩陣,構建統一世界模型基座的技術閉環。
而模型之外,智象未來也在持續推動產品化加速落地。
如果說 HiDream 系列大模型探索的是模型能力的上限,那麼 vivago R1 則致力於把這些能力轉化為人人都能使用的創作體驗。
從留聲機到單反相機,再到 vivago R1,人類創造力的每一次釋放,都伴隨著創作門檻的降低。
一邊是在提升 AI 影片生產的能力邊界,一邊是在擴大參與創作的人群範圍。當這兩股力量同時推進,夠搭真正改變的,將是未來每個人都擁有用 AI 講述自己故事的機會。






