宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

從畫廊里的語音陌生人遊戲,到賭上全部身家的一千張A100

2026年09月25日 首頁 » 熱門科技

在採訪接近尾聲時,Anastasis Germanidis 拋出了一個判斷:像 Interface World Models 這樣的技術,終局是一台完全由神經網路驅動的作業系統。他提到 Andrej Karpathy 很早就寫過類似的想法,但他覺得更值得深究的是當下的一個悖論——今天的語言模型能談論任何話題、能把對話引向任意方向,幾乎無所不能,但人們與它交互的界面卻異常僵化。在他看來,用不了多久,界面本身也會變成可學習的組件:交付一個應用不再只是交付一個語言模型,還要交付渲染、交付像素本身。這句話像是給整場對話定了調——Runway 走到今天,從來不是一家做影片特效工具的公司,而是一家在賭"生成"這件事的邊界到底在哪裡。

Runway 聯合創始人 Anastasis Germanidis 與 Latent Space 的 swyx 和 Vibhu 坐下來,把公司七年的路徑重新捋了一遍:從一個把開源模型包裝給藝術家用的小工具,到簽下一份讓 B 輪公司顯得"有點不理智"的算力合同,再到今天把影片生成當作通往世界模擬的路徑。這條路線不是一開始就設計好的,而是一步步被逼出來的。

1. 他一直活在兩個平行世界裡

Anastasis 說自己長期被分裂在兩個身份之間。一邊是他自己的藝術實踐,做了很長時間的互動藝術;另一邊是在不同公司做機器學習工程師、後端工程師的職業軌跡。他對編程和計算的興趣一直存在,但真正讓他著迷的是仿真——把這種興趣帶回了早期的藝術創作里。

這種雙線並行不是簡單的愛好疊加。一條線是生成模型和當時正在起效的早期機器學習研究,另一條線是仿真本身:通過給人類行為和互動建一個極簡的模型,我們能從中學到什麼。這個問題後來幾乎原樣投射到了 Runway 的產品哲學裡——生成模型不只是用來產出內容,也是理解和模擬世界的一種方式。

2. 一場由馬爾可夫鏈驅動的畫廊社交實驗

2015 年,Anastasis 做過一個項目:在展覽空間裡給人發出語音指令,協調陌生人之間的互動。系統會先給每個人分配一個身份——你是建築師,30歲,喜歡體育——然後把你和另一個人匹配起來,生成一段完全虛構的對話開場。

當時語言模型遠沒有今天這樣成熟,這套系統靠的是模板和馬爾可夫鏈生成的文本拼接而成:一堆職業列表、一堆性格類型列表、一堆年齡列表,程序隨機組合出人設,再驅動整個畫廊里的小型對話模擬。這不是一次嚴肅的技術攻堅,卻精確地預演了後來 Runway 反覆出現的思路——用非常簡單的生成機制,去逼近對人類行為的某種理解。

3. 一個訓練在自動駕駛數據上的模型,被拿去生成一百萬個行人

Anani Valley 和 Anani Road 是 Anastasis 與聯合創始人 Chris 合作的早期項目之一,用的是 NVIDIA 在 2016、2017 年發布的 Pix2PixHD——一個把場景語義圖轉換成照片級輸出的圖像到圖像模型。按今天標準看效果非常粗糙,但它是第一批能生成 1K 解析度圖像的模型之一,訓練數據全部來自自動駕駛場景,語義類別也局限在行人、交通標誌、自行車、紅綠燈這些"路上會遇到的東西"。

真正有意思的是接下來發生的事:人們拿這個模型去生成極其超現實的畫面——一百萬個行人、一百萬個交通標誌、巨人般的人類。這是 Runway 最早得到的一個信號:一個訓練在極其枯燥數據集上的模型,一旦被重新給到藝術家手上、被推向分布之外,反而能產出藝術上有說服力的東西。這在某種程度上就是 Runway 這家公司的方法論摘要——同一個生成模型,換個方向看它,圍繞它搭建有意思的工具,交到藝術家手裡,他們會做出你完全想不到的事情。

4. 從包裝開源模型,到不得不自己建研究團隊

Runway 最初的定位很樸素:把當時所有開源模型——比如 Pix2Pix——用簡單的方式包裝起來,交給藝術家用。這個想法的出發點是,那些模型如果不是機器學習工程師根本用不了,那把它們交給藝術家之後會發生什麼?

但這個定位很快撐不住了。團隊很快意識到,公司內部必須建一個真正的研究組織,這個轉折發生在公司成立後大約第一年。當時的圖像生成模型、尤其是影片生成模型——那時候影片生成的例子屈指可數——都遠沒有成熟到可以產品化、嵌入創作工作流的程度。於是團隊不得不去推動研究前沿本身。

這段研究幾乎是在後台悄悄進行了將近四年,期間 Runway 真正被外界認識的產品是一個叫 Green Screen 的摳像工具,解決的是影片分割這個在特效製作里極其重要但極度手工、沒人願意做的問題——rotoscoping。這個工具後來被用在《媽的多重宇宙》等多部高關注度電影和劇集裡,Runway 在很長一段時間裡本質上是一家後期製作工具公司,直到潛在擴散模型帶來了 Gen-1、Gen-2。

5. 一次"有點不理性"的決定:簽下一千張A100

轉折發生在 2022 年年中。當時 Runway 意識到自己的研究規模相對算力而言太小,而圖像和影片生成很可能會遵循和語言模型一樣的 scaling law。於是他們做了一個大膽的決定:簽約建一個一千張 A100 的集群。在當時,Runway 只是一家 B 輪公司,這幾乎是一個略顯不理智的決定,但團隊真心相信,如果在足夠大的規模上訓練一個影片模型,最終會得到一個足夠好的模型。

2022 年秋天,團隊給自己定下一個目標:找到影片領域的"潛在擴散/Stable Diffusion 時刻"是什麼樣子。當時最好的影片模型叫 CogVideo,解析度只有 256×256,質量並不高。於是 Runway 決定不再依賴別人的研究成果,自己投入建集群、訓練影片模型。

6. 文生影片太難了,所以先做影片生影片

訓練 Gen-1 的過程中,團隊原本想直接做文本生成影片,但很快發現完全從零生成影片的難度太高。一個更容易切入的起點是影片到影片的轉換——當你有更強的條件約束時,重新對一段已有影片進行風格化,本質上比從無到有生成一段影片要容易得多。基於這個判斷,Runway 在 2023 年 1 月先發布了 Gen-1。

Anastasis 回憶起當時看到那些結果的感受:那種震撼幾乎和當年圖像生成或影片生成剛出現時一樣——你會覺得這不可思議,這居然是可以做到的。這句樸素的感慨,恰好呼應了他在採訪開頭提出的那個更大的判斷:從圖像到影片,從影片到界面,Runway 一直在重複同一件事——把生成模型推向它原本沒被設計要去的方向,然後看它能走多遠。

從畫廊里的語音陌生人實驗,到自動駕駛數據集裡長出的超現實圖像,再到押上全部家當的一千張A100,Runway 走的從來不是一條線性的產品路線圖,而是一連串"發現生成模型能做的事,遠比設計它的初衷要多"的時刻。這也是理解 Anastasis 那句"界面終將變成可學習組件"的最好背景——如果一個訓練在枯燥數據上的模型都能被逼出藝術性,那麼一個被封裝在僵化界面里的語言模型,被解放出來也只是時間問題。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新