宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

給你的臉「整個容」,卻讓它在所有照片裡保持同一個人——來自特拉維夫大學與康奈爾大學的人臉身份編輯新技術

2026年07月23日 首頁 » 熱門科技

這項由以色列特拉維夫大學與美國康奈爾大學聯合開展的研究,以預印本形式於2026年7月13日提交至arXiv,編號為arXiv:2607.11885,有興趣深入了解的讀者可以通過該編號在arXiv平台上查詢完整論文。

每個人大概都有過這樣的經歷:用了一款AI換臉或美顏軟體,把自己的照片改得挺滿意,但一旦換個背景、換個角度再生成,那個"你"就完全對不上了——明明要的是那個帶雀斑的、高鼻樑的、濃眉毛的你,生成出來的卻像換了個陌生人。這種感覺就像是你讓裁縫按照你的樣子定做了一件衣服,結果發現每次量尺寸的結果都不一樣,衣服穿上去要麼肥要麼瘦,總是對不準。

這正是當前AI生成人臉時面臨的核心難題:如何對一個人的外貌做出精細調整,同時保證不管在哪張圖裡,他都還是那個人?特拉維夫大學與康奈爾大學的研究團隊提出了一種叫做"潛在身份調整"(Latent-Identity Tuning)的技術框架,專門解決這個問題,讓你能夠像調音台旋鈕一樣,精準調節某人外貌的某一個具體細節,而且調整之後的"身份"會穩定地出現在後續所有生成的圖像里。

一、先搞清楚問題:為什麼精細改臉這麼難

要理解這項研究在做什麼,先得理解現有技術卡在哪裡。

目前主流的AI圖像生成工具,比如大家聽說過的Stable Diffusion、FLUX這類"文生圖"模型,已經能夠根據文字描述生成非常逼真的人臉圖像。更進一步,還有一類叫做"個性化生成"的技術,它能夠讀取你提供的一張或幾張真實照片,提取出你這個人的面部特徵,然後在任意場景下把你畫出來——騎馬的你、宇航員裝扮的你、中世紀騎士造型的你,諸如此類。

但問題來了:這些技術基本上只擅長"複製",而不擅長"修改"。它可以把你的長相忠實地搬到各種場景里,但如果你想改一點點——比如讓自己的鼻子稍微小一些,或者添一圈絡腮鬍,或者讓臉上多幾顆雀斑——它就會開始犯難。要麼改不到位,要麼改完之後這個人就不像你了,要麼同一個修改在不同圖里呈現的效果完全不一致。

更根本的問題在於:現有的圖像編輯技術,改的是"圖",而不是"人"。你改了這張圖,下一張圖還是得從頭算。就像你在一張紙上畫好了一個人的肖像,然後用橡皮擦和鉛筆在這張紙上改了改——但如果有人再印一張新的肖像出來,那些改動就消失了,新的圖還是原來的樣子。

這項研究的核心突破,就是把修改從"圖的層面"提升到了"身份表示層面":直接動那個代表這個人"是誰"的核心編碼,而不是去改某張具體的圖。這樣一來,不管之後生成多少張圖,用的都是那個被修改過的"身份配方",改動自然就全都帶上了。

二、身份是怎麼被編碼進去的:認識Q-Former

要理解研究團隊在哪裡動了手腳,先得了解一個叫做"Q-Former"的東西。

在這類個性化生成系統里,有一個專門負責"讀臉"的模組。你把一張人臉照片輸入進去,這個模組會把照片分析一遍,然後輸出一組數字序列——就像是一套密碼,裡面記錄了這張臉的所有特徵。這組密碼之後會被傳遞給圖像生成模型,告訴它"嘿,你接下來要畫的人長這樣"。

Q-Former(全稱是Querying Transformer,查詢變換器)就是這個"讀臉編碼"模組裡的關鍵組件。它的工作方式有點像一個有著很多專項記者的採訪團:每個記者只負責追問人臉的某一個部位——一個專門盯著眼睛看,一個專門關注嘴唇,一個負責記錄鼻子的細節。Q-Former維護著一組叫做"查詢向量"的學習參數,每個查詢向量通過交叉注意力機制去掃描輸入的人臉圖像,提取它最關心的那部分資訊,最終產生一組固定數量的輸出向量,這就是"身份令牌"(Identity Tokens)。

研究團隊在論文的圖2里展示了一個非常直觀的發現:當你把Q-Former里不同查詢令牌的注意力範圍可視化出來時,會發現它們真的各司其職——一個令牌主要關注眼睛區域,另一個關注鼻子,還有一個盯著嘴唇。不僅如此,同一個令牌在處理不同人的臉時,始終盯著同一個區域。這說明Q-Former並不是隨機地把整張臉壓縮進一個大箱子,而是把不同的面部特徵分門別類地裝進了不同的格子裡。

這個發現非常重要,因為它意味著如果你想改某個人的眉毛,你只需要動負責眉毛的那幾個令牌,而不需要把整張臉重新算一遍。這就是精準編輯的基礎。

三、改哪幾個格子:令牌選擇的兩種方法

好,既然每個令牌對應著不同的面部區域,那怎麼知道"該改哪些令牌"來達成你想要的修改效果?

研究團隊提出了兩種方法,分別針對不同類型的修改目標。

第一種方法用於處理局部、有明確位置的面部修改,比如"改眼睛""改嘴唇""改鼻子"這類需求。方法的思路出人意料地簡單直接:拿一張人臉照片,把你想修改的那個部位從另一張臉上挖出來,粗暴地貼上去(就像小時候拼貼遊戲裡把不同人臉的五官剪下來拼在一起),然後把原圖和拼貼圖分別送進編碼器,看看兩者產生的身份令牌有哪些地方發生了變化。哪個令牌變化最大,說明那個令牌對這個面部區域最敏感,就把它納入"負責該區域的令牌組"里。

重複這個過程五到十次(每次用不同的人臉做拼貼),統計出哪些令牌最頻繁地出現在變化最大的那批里,就形成了一個穩定的令牌子集S,專門負責這個面部區域。這個子集只需要算一次,之後對任何人的臉做同類修改都可以復用。

第二種方法針對的是整體性的、沒有固定位置的全局外貌屬性,比如"雀斑""膚色""臉頰紅暈"。這類屬性在臉上各處都有體現,用粘貼補丁的方法沒法定位。於是研究團隊換了個角度:利用一個有著大量標註資訊的人臉數據集(CelebA數據集,裡面有20多萬張人臉,每張都標註了40個外貌屬性),把每張臉編碼成身份令牌,然後對每一個令牌單獨訓練一個線性分類器,看看僅憑這個令牌能不能可靠地判斷出一個人是否有雀斑、是否有紅暈。如果某個令牌對某個屬性的預測準確率超過70%,就說明這個令牌里編碼了關於這個屬性的資訊,把它納入負責這個屬性的令牌組。

兩種方法的邏輯可以用一個類比來理解:如果你想知道圖書館裡哪個書架放著關於"眼科"的書,第一種方法是先拿一本眼科書走過去,看看哪個書架有反應(上面其他書的分類標籤跟著出現了"醫學"字樣);第二種方法是把圖書館裡所有書依次拿到那個書架前,測試哪個書架能最準確地判斷"這本書是不是關於雀斑護理的"。兩種方法對應不同場景,互相補充。

四、有了令牌組,怎麼進行實際編輯

確定了哪些令牌負責哪些面部區域之後,就可以開始對這些令牌動手了。研究團隊設計了幾種不同的編輯方式,各有適用場景。

最直觀的一種是"身份插值",也就是把兩個人的身份特徵混合在一起。具體做法是把兩個人各自的身份令牌按照一定比例加權平均——比如70%取自A,30%取自B——然後用這個混合後的令牌去生成圖像。如果你把兩個人的全部令牌都混合,就會得到一張介於兩人之間的臉,從A漸漸變成B,過渡非常自然,不會有任何突兀的跳躍。這就像是用顏料調色,紅色和黃色之間可以有無數種橙色的深淺變化,而不是非得在紅色和黃色之間二選一。

更有趣的是"局部身份遷移":只混合負責特定部位的那些令牌,而保持其他令牌不變。比如你覺得B的眼睛好看,就只把負責眼睛的令牌換成B的版本,其餘部分還是A的。這樣得到的結果就是:A的臉型、鼻子、嘴唇,配上B的眼睛。研究團隊在論文裡展示了眉周區域(眉毛+眼瞼)和嘴唇的遷移效果,效果相當自然,其他面部特徵幾乎不受影響。

還有一種方法叫"監督線性方向",是基於數據統計找出一個"讓臉長出鬍鬚"或"讓臉變成光頭"的方向。做法是把大量有鬍鬚的人臉和沒有鬍鬚的人臉分別編碼成令牌向量,然後計算兩組的平均值之差,這個差值就代表了"鬍鬚方向"。之後對任何人的身份令牌沿著這個方向移動一定距離,就相當於給這個人"添加鬍鬚",移動多少距離決定了鬍鬚的濃密程度。

另一種監督方法是訓練一個支持向量機(SVM,一種常見的分類模型)來區分有某個屬性和沒有某個屬性的兩類臉,然後用這個分類器劃定的邊界線的垂直方向作為編輯方向。研究團隊發現這兩種方式各有優勢:對於臉頰紅暈這種細微變化,SVM方向更精準;對於剃光頭或留鬍子這種大幅度改變,平均值差值方向效果更好。原因在於SVM傾向於找到最具區分性的維度,對小變化很敏感,但對大幅度變化有時候會抓到"捷徑"而不夠全面;平均值差值則更整體,對大變化方向的描述更完整。

此外,研究團隊還探索了不依賴任何標註數據的"無監督方向"——直接用主成分分析(PCA,一種發現數據里最主要變化方向的數學工具)來掃描身份令牌空間,看看其中最顯著的變化方向是什麼。對一萬張FFHQ數據集裡的人臉做了PCA之後,他們發現這些方向里有些對應著年齡變化,有些對應著眼睛的睜閉程度,有些對應著嘴唇顏色的深淺。

當PCA作用於所有令牌時,捕捉到的是整體性的全局變化,比如年齡感,但這些方向往往會同時影響多個面部區域,局部控制力較弱。當PCA只作用於某個特定令牌時,控制力很精準,但效果太微弱,因為資訊分散在多個令牌里,單個令牌改變太小。效果最好的是介於兩者之間的方式:用令牌選擇方法確定負責某個區域的令牌子集,只對這個子集做PCA,然後沿著主方向移動。這樣既保持了局部性,又有足夠的編輯力度。比如對眼睛的令牌子集做PCA,就能發現控制眼睛睜開程度的方向,從"眯眼"到"大眼"可以連續調節,而且對其他面部特徵影響極小。

五、還有一種"手工貼補丁"的玩法

除了數學方向上的操作,研究團隊還發現了一種更加直覺性的編輯方式,叫做"補丁編輯"(Patch Editing)。

具體來說,就是在輸入照片上做像素層面的粗糙替換——把一種特定風格的鬍鬚圖像直接貼到人臉上,或者把某副眼鏡貼到鼻樑上,然後把這張"拼貼圖"送進編碼器,用它生成的身份令牌來驅動後續的圖像生成。

令人驚喜的是,編碼器並不會被粗糙的拼貼邊緣所干擾,而是會把這個"意圖"理解得相當準確——生成出來的圖像里,那種類型的鬍鬚或那副眼鏡會以非常自然、融合的方式出現在人臉上,而且能夠穩定出現在不同場景的多張生成圖里。

這種方式特別適合那些用文字很難準確描述的修改需求——你可能說不清楚"我要那種留著下唇小撮胡的梵戴克(Van Dyke)造型",但你可以直接從網上找一張那種胡型的參考圖貼上去。論文裡展示了貼入不同風格眼睛、嘴唇和梵戴克鬍鬚的實驗結果,在"登山場景"和"城市場景"兩種不同的生成提示下,那些特定的外貌細節都保持了一致。

六、跟其他方法比,這套框架的表現如何

研究團隊做了相當系統的比較實驗。他們構建了一套包含20個身份圖像的測試基準,針對五種基礎外貌修改(包括添加/去除鬍鬚、剃光頭、改變性別、添加/去除眼鏡、添加/去除劉海)和七種需要更細膩控制的高級修改(包括雀斑、弓形眉、濃眉、厚唇、小鬍子、蒼白膚色、玫瑰色臉頰),配合13條由大語言模型生成的場景描述提示,每個修改對每個方法都生成13張圖像,總計超過3000張圖用於比較。

評估指標從三個維度衡量:一是"身份一致性",用ArcFace人臉識別算法來測量同一個人在不同生成圖之間的長相相似度,分數越高說明同一身份在不同圖里長得越像;二是"編輯貼合度",用一個視覺問答模型來判斷生成的圖像有沒有準確地完成了指定的修改;三是"提示詞貼合度",同樣用視覺問答模型來判斷生成的圖像是否符合文字場景描述。

被比較的方法包括兩種專門做身份編輯的工具:PreciseControl和Weights2Weights(簡稱W2W),以及當時最先進的圖像編輯模型Flux Kontext(分兩種用法:直接一步生成的Kontext Direct,以及先改圖再用改圖生成場景的Kontext Sequential)。

在身份一致性這個維度上,PreciseControl得分0.25,W2W得分0.31,Flux Kontext Direct得分0.37,Flux Kontext Sequential得分0.51,而這項研究的方法(分別基於Omni-ID和PuLID兩種編碼器)得分為0.47和0.49。在編輯貼合度上,這項研究方法得分與Kontext Direct相當(均約0.79-0.81),同時遠高於PreciseControl和W2W。在提示詞貼合度上,這項研究方法得分0.88-0.91,顯著高於所有基線方法。

在涉及高級精細修改的場景下,W2W和PreciseControl的表現都大幅下滑甚至無法支持(PreciseControl不支持高級修改),而這項研究方法在高級修改上的表現與基礎修改相當,沒有明顯退步。Kontext Sequential在身份一致性上與這項研究接近,但在高級修改的編輯貼合度和提示詞貼合度上都落後。

研究團隊還做了一項用戶研究,邀請參與者在看到原始人臉照片和編輯指令之後,對比每種方法生成的結果,從身份保留、跨圖身份一致性、編輯貼合度、提示詞貼合度和綜合偏好五個維度做出選擇。最終,在與W2W的比較中這項研究方法的整體偏好贏率達到94%;與Kontext Direct相比贏率85%;與Kontext Sequential相比贏率83%。

七、這套方法有沒有局限

研究團隊沒有迴避這套方法的局限性,在論文裡專門討論了一個重要的制約因素:Q-Former的令牌數量。

前面說過,Q-Former會把人臉資訊分裝進一組令牌里。如果令牌數量充足,每個令牌就能專注於一個小的面部區域,形成自然的"分區",局部編輯就可以做得很精準。但如果令牌數量太少,每個令牌就不得不同時兼顧多個面部特徵,這時候你想只改眼睛,但負責"眼睛"的那個令牌里還混著其他特徵的資訊,動了它就會產生連帶的變化。

這個問題在使用監督方向和無監督PCA方向時影響相對較小,因為這些方向是從大量數據里統計出來的,能夠找到即便在"混合"令牌里也比較純淨的變化方向。但如果你想做更直接的令牌替換(比如把A的某個令牌直接換成B的),令牌數量不足就會導致"溢出效應",改了眼睛不小心把鼻子也帶變形了。

研究團隊由此建議,未來設計個性化生成模型時,應該在Q-Former的令牌數量上給足餘量,這樣不僅對模型本身的生成質量有好處,還能為下游的精細編輯任務提供更好的基礎。

---

說到底,這項研究做的事情可以用一句話來概括:把對人臉的修改從"每次從頭來"變成了"一次調好,處處生效"。

這背後的關鍵洞察在於,當前最先進的人臉編碼器其實已經悄悄地學會了把臉的不同部位分開記錄,只是之前沒人去細究這些記錄之間的關係。研究團隊通過兩種令牌選擇方法找到了每個面部區域對應的"檔案格子",再用數學手段在這些格子裡找出有意義的變化方向,就把一個原本"只會複製、不會修改"的系統變成了一個具備精細改寫能力的工具。

對於普通用戶來說,這項研究意味著未來的AI圖像工具可能真的能做到:"幫我把我的照片裡的鼻子改小一點,然後在任何你幫我生成的圖裡,我的鼻子都是這個新的樣子。"不是改完一張扔掉,而是修改之後的"你"成為一個持續生效的新設定。

這同時也引出了研究團隊自己提到的社會影響問題:精細控制面部特徵的能力在創意表達和個人定製方面有廣泛的正面應用,但也可能被用於生成誤導性內容或未經本人同意地改變他人形象。研究團隊鼓勵持續發展檢測算法、推行生成內容水印機制,以及在使用他人肖像時遵守明確的授權流程。

有興趣深入了解這套方法的全部技術細節、實驗數據和可視化結果的讀者,可以在arXiv上通過編號2607.11885找到完整論文。

---

Q&A

Q1:什麼是"身份令牌",它在人臉生成里起什麼作用?

A:身份令牌是Q-Former編碼器讀取一張人臉照片之後輸出的一組數字向量,裡面記錄了這張臉的外貌特徵。圖像生成模型接收這組令牌後,就知道要畫一個什麼樣的人。研究發現,不同的令牌對應著臉的不同區域——某個令牌管眼睛,某個令牌管鼻子,這為精細編輯奠定了基礎。

Q2:潛在身份調整和普通的圖像編輯軟體有什麼區別?

A:普通圖像編輯是改某一張具體的圖,改完這張就完了,下次重新生成還是原來的樣子。潛在身份調整改的是編碼器輸出的"身份表示"本身——改了之後,不管之後生成多少張圖,這個改動都會保留,就像改了模具而不是改了單件產品。

Q3:Flux Kontext這類圖像編輯模型和這項研究的方法主要差距在哪裡?

A:Flux Kontext做的是圖像層面的編輯,每次生成都是獨立的,沒有持續的"身份檔案",所以在多張圖之間保持同一個人的一致性較難。這項研究的方法則通過修改身份令牌來鎖定改動,跨圖一致性明顯更高,尤其在需要細膩控制的高級修改上(如雀斑、特定眉形)差距更為突出。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新