宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

盧森堡大學與薩拉戈薩大學聯手:讓機器人「一眼認出」任意物體並精準對齊3D模型,效果首次超越有監督方法

2026年07月28日 首頁 » 熱門科技

這項由盧森堡大學自動化與機器人研究組(SnT)聯合西班牙薩拉戈薩大學共同開展的研究,以預印本形式發布於2026年7月16日,論文編號為arXiv:2607.15058,研究受盧森堡國家研究基金DEUS項目資助。

**當機器人拿起一件東西之前,它需要先"看懂"這件東西**

不妨設想你是一位倉庫工人,上級給了你一張椅子的示意圖,然後讓你在堆滿貨物的倉庫里找到那把椅子,並把它精確地擺放到貨架上——不僅要搞清楚椅子在哪兒、朝向哪邊,還要搞明白它究竟有多大。這個任務聽起來對人類來說並不困難,但對機器人或電腦視覺系統而言,卻是一項極具挑戰性的難題。

這正是"CAD模型與圖像對齊"這一研究方向所要解決的核心問題。CAD模型可以理解成一種精確的三維數字藍圖,就像建築師畫的施工圖紙。當系統拿到一張普通照片,它需要把這個三維藍圖"貼合"到照片裡的對應物體上,弄清楚物體的旋轉角度、所處位置以及實際尺寸——這三者合在一起,在技術上被稱為"9D姿態估計",其中9個維度分別對應3個方向的旋轉、3個方向的平移以及3個軸向的縮放比例。

這項能力一旦成熟,將直接賦能機器人抓取、增強現實疊加以及場景理解等大量實際應用。然而,現有方法普遍存在兩個痛點:要麼需要大量昂貴的人工標註數據來訓練,泛化能力差;要麼雖然不需要標註、能做到"零樣本"對齊,卻精度不足、速度太慢。

這支研究團隊為此提出了一套名為**SUFLECA**(Scaling Up Feature LEarning for CAD-to-image Alignment,即"面向CAD對齊的特徵學習規模化擴展")的新框架,並在核心評測基準上首次以零樣本方法超越了有監督方法的精度,同時做到速度更快、顯存占用更小。

---

一、從"認臉"到"認形":視覺特徵學習的根本困境

要理解SUFLECA解決了什麼問題,先要弄清楚現有方法為何會失敗。

近年來,電腦視覺領域出現了一批被稱為"視覺基礎模型"的強大工具,它們經過海量圖片訓練,能夠提取圖像中的豐富語義特徵。你可以把這類特徵理解為一種"外貌描述"——比如"這個區域看起來像布料"、"那個角落顏色偏暖"、"這裡的紋理很細密"。利用這種外貌描述,系統可以在CAD渲染圖和真實照片之間尋找相似的區域,從而建立"對應關係"——即哪張圖的哪個點對應另一張圖的哪個點。

然而,"外貌描述"天然有個弱點:同一個物體在不同光線、不同遮擋、不同拍攝角度下,外貌會發生很大變化;而CAD渲染圖作為乾淨的三維模型投影,和真實照片之間存在明顯的風格差距,這就是所謂的"合成到真實域的鴻溝"。更根本的問題在於,外貌特徵無法告訴系統一個表面點在三維空間裡究竟位於哪個位置,而這恰恰是做姿態估計時最需要的資訊。

研究者們此前已經嘗試過一種補救方案,叫做"歸一化物體坐標"(Normalized Object Coordinates,簡稱NOC)監督學習。NOC可以理解成給物體表面的每一個點貼上一個三維坐標標籤——物體最左邊的點標記為紅色,最右邊的點標記為青色,最高的點標記為亮色,最低的標記為暗色,諸如此類。通過教會模型預測這些坐標標籤,模型就能在特徵空間裡建立起對三維幾何的理解。

但問題是,之前採用這種思路的方法(如ZeroCAD)只在合成數據上訓練,且只覆蓋9個物體類別、約30萬張圖片,模型一旦碰到真實場景里有遮擋、有雜亂背景的物體,就會出現明顯的精度下滑。此外,這些方法在建立對應關係時,採用的是簡單的"最近鄰匹配"——即找到特徵最相似的點就配對——這種做法容易產生"一對多"的混亂匹配,幾何上非常不一致,最後不得不依賴耗時的疊代優化來補救。

SUFLECA的兩項核心貢獻,分別針對上述兩個痛點進行了根本性改進。

---

二、用67萬張圖片"磨練眼力":大規模幾何感知特徵學習

SUFLECA的第一項核心貢獻,是將NOC監督特徵學習的規模大幅擴展,從數據量、數據多樣性和真實性三個維度同時發力。

研究團隊匯聚了12個來源各異的數據集,包括室內場景掃描(ScanNet、ScanNet++)、移動端RGB-D採集(ARKitScenes)、網路影片幀(RealEstate10K)、合成渲染場景(3D-Front、Hypersim、ShapeNet),以及更傳統的目標識別數據集(Pascal3D+、Pix3D、ObjectNet3D)等,總計形成約**67.5萬張訓練圖像**,平均每張圖含3.38個被標註的物體實例。這一規模比此前最強的同類方法大了約一倍,物體類別覆蓋範圍也遠超以往。

更重要的是,這個數據集橫跨真實圖像和合成圖像兩個領域。由於CAD對齊任務本身就需要在真實照片和合成渲染之間建立橋樑,研究團隊在每張有CAD標註的真實圖像旁邊,額外生成了一張對應的合成渲染圖:把CAD模型以大致相同的角度渲染出來,配上隨機化的背景和材質,偶爾還會把場景里的某個物體替換成外觀相似但型號不同的版本。這樣一來,模型在訓練時就同時接觸到"真實世界的雜亂感"和"合成圖像的幾何精確性",自然地學會跨域不變的幾何感知特徵。

並非所有數據集都直接提供現成的NOC標註圖,大多數數據集只給出了三維場景中物體的位姿資訊。研究團隊因此設計了一套自動化的NOC推導流程:先把CAD模型按照已知位姿投影到圖像上,大致確定物體位置,再用SAM2(一種強大的圖像分割模型)精確提取物體掩碼,然後利用深度圖或單目深度估計把掩碼內的像素反投影回三維空間,最後按照標準方法計算每個像素的歸一化坐標。為了把質量差的標註過濾掉,團隊還設置了驗證步驟:將計算得到的NOC與CAD渲染的理論NOC進行對比,誤差超過閾值的實例直接丟棄;可用標註像素太少的幀也整體捨棄。對於高幀率攝像機拍攝的影片數據集,還通過等間隔採樣和最小相機位移約束來確保視角多樣性。

在模型結構上,SUFLECA選擇了DUNE-B作為凍結的感知編碼器——這是一種經過大量異質數據預訓練的通用視覺編碼器,具有很強的基礎特徵提取能力。DUNE-B的多尺度輸出特徵通過一個"密集預測Transformer"(Dense Prediction Transformer,簡稱DPT)模組進行融合和上採樣,產生與輸入圖像等解析度的稠密特徵圖,每個像素對應一個384維的特徵向量。在這個特徵圖之上,再接一個輕量級的"NOC分類頭":將三維坐標空間的每個軸向分成64個均勻區間(稱為"bin"),對每個像素預測它落在哪個區間,再以加權平均的方式還原出連續坐標值。訓練損失由兩部分組成:分類交叉熵損失(確保預測的區間是正確的)和L1回歸損失(確保預測的連續坐標值足夠精確)。

關鍵的設計在於:NOC分類頭只在訓練時使用,**推理時直接丟棄**。真正用於後續匹配的,是DPT輸出的那個384維特徵圖,經過L2歸一化後作為每個像素的"幾何感知描述子"。通過NOC監督,這個特徵空間被"塑形"成對三維幾何敏感的形態,而同時保留了DPT特徵本身的判別能力。研究團隊還提供了一個名為SUFLECA-blend的變體,將DPT特徵與DUNE-B主幹網路的最後一層輸出特徵拼接,以在泛化能力和計算量之間取得不同的平衡。

---

三、像拼圖高手一樣找准對應:幾何一致性匹配算法

光有好特徵還不夠,如何利用這些特徵建立準確的對應關係,同樣至關重要。SUFLECA的第二項核心貢獻,是一套完整的幾何一致性對應估計算法。

整體對齊流程可以分為以下幾個環節,像一條精密的流水線依次運行。

首先,系統對輸入的真實圖像提取特徵圖,同時對候選CAD模型預先渲染若干個固定視角的視圖(默認6個),並為每個視圖預計算好特徵圖和三維點坐標。有了這批預渲染視圖,系統面臨的第一個問題是:從6個候選視角里,選哪個視角來做匹配最合適?研究者們發現,經過訓練的視覺編碼器其實能在特徵層面隱式編碼視角資訊。於是,系統用單目深度估計把真實圖像的掩碼區域裡的像素反投影成三維點雲,從中用"最遠點採樣"(Farthest Point Sampling)挑出512個代表性點,然後對每個點去找6個候選視圖里特徵最相似的像素,把所有點的最大相似度取平均,得分最高的視圖就被選為匹配對象。

選好視圖之後,下一步是建立點對點的對應關係。普通的最近鄰匹配會把真實圖像里的每個點都找一個最相似的渲染圖像點來配對,但這很容易讓多個點都配到同一個目標點,造成"多對一"的混亂。SUFLECA採用的是**互相k近鄰匹配**:只有當圖像里的點A在渲染圖里k個最近鄰中找到了點B,同時渲染圖裡的點B在圖像里k個最近鄰中也找到了點A時,這對配對才被保留下來。當多個點同時認領同一個目標時,用貪心策略只保留相似度最高的那一對。這樣得到的候選對應關係(稱為"假設對應集")質量已經比單純最近鄰好很多,但仍然可能包含幾何上不合理的匹配。

真正的精華在最後的**幾何一致性篩選**這一步。研究者們設計了一套聰明的方法來判斷哪些對應關係在三維幾何上是自洽的。核心思路是:如果兩對對應關係(A對應A',B對應B')都是正確的,那麼A和B之間的三維距離,應該與A'和B'之間的三維距離滿足一個由物體各向異性縮放比例決定的關係。換句話說,正確的對應關係應該"集體同意"一個統一的縮放參數,而錯誤的對應關係則會違背這個約束。

為了處理這個問題,研究團隊先通過枚舉所有候選對應對,計算每對的各向同性縮放比例對數值,取直方圖的眾數來得到一個魯棒的初始等比縮放估計;再以此為基礎,用疊代重加權最小二乘法(IRLS)細化出三個軸向可能各不相同的各向異性縮放估計,同時用一個係數α在各向異性估計和等比初始值之間做插值,防止樣本不足時估計退化。有了這個縮放估計,就能對每一對候選對應計算"預測距離"和"觀測距離"的相對偏差,將偏差小於閾值β的對應對在一個一致性矩陣里標記為互相支持。然後計算這個矩陣的主特徵向量,每個候選對應關係在特徵向量里的分量反映了它與多數"靠譜對應"的一致程度,低於閾值的對應關係被剔除,高於閾值的被保留下來傳入後續的RANSAC註冊求解器。

最終的三維配准步驟採用了一種支持各向異性縮放的普氏分析(Procrustes)算法,在空間分區RANSAC框架下魯棒地求解旋轉、平移和縮放參數。與此前方法不同的是,SUFLECA不把CAD檢索的置信度分數作為對齊質量的代理指標,而是直接從配准殘差的資訊矩陣出發,計算對數行列式作為對齊質量得分。這個得分在多視角聚合或多檢測非極大值抑制時用於排序,比語義檢索置信度更能真實反映幾何對齊的質量。

---

四、數字說話:在ScanNet25k上首次超越有監督方法

評測結果是這項研究最具說服力的部分。

核心評測基準ScanNet25k是從室內掃描數據集ScanNet中提煉出來的標準測試集,包含來自Scan2CAD標註的真實物體對齊任務,涵蓋浴缸、床、垃圾桶、書架、柜子、椅子、顯示器、沙發、桌子共9個類別。判定標準相當嚴格:平移誤差須在20厘米以內,旋轉誤差須在20度以內,尺寸誤差須在20%以內,三個條件同時滿足才算正確。

在這個基準上,SUFLECA(基礎版)以**33.4%的類別平均精度**和**42.3%的實例平均精度**排名第一,相比此前最強的零樣本基線ZeroCAD(不含疊代優化版本)分別提升了10.3和12.2個百分點,相比ZeroCAD完整版(含疊代優化)也分別高出10.3和12.2個百分點。更引人注目的是,SUFLECA在9個類別里有7個達到了最高或次高精度,**整體精度首次超越了依賴9D位姿監督訓練的有監督方法MultiObj-SPARC**,儘管後者在ScanNet上進行了充分的有監督訓練。

在另一個分測試集DiffCAD split(包含6個類別,評測時不使用非極大值抑制)上,對零樣本方法而言挑戰更大,因為沒有NMS來抑制錯誤對齊。SUFLECA在這個更嚴苛的設置下同樣表現突出:類別平均精度達到36.1%,實例平均精度44.8%,比ZeroCAD分別高出20.2和23.9個百分點,甚至超過了DiffCAD論文中使用真實位姿選最優結果的"神諭版本"(oracle variant,類別均值35.8%,實例均值41.9%)。

更輕量的SUFLECA-S版本(使用更小的DUNE-S編碼器,特徵維度256)以30.6%/39.5%的精度同樣大幅領先所有零樣本基線,證明即便用更緊湊的模型,這套框架的核心優勢依然成立。SUFLECA-blend版本在常見室內類別上的表現與基礎版相當,但在應對不常見物體時具有更強的泛化能力。

---

五、在陌生物體上的泛化測試:CO3D數據集實驗

為了檢驗SUFLECA對從未見過的物體類別是否依然有效,研究團隊還在CO3D數據集上設計了一套更貼近真實使用場景的評測。

CO3D是一個以物體為中心的三維重建數據集,研究團隊對其進行了適配:通過將COLMAP點雲與單目深度估計對齊來恢復度量尺度,並在物體掩碼內隨機放置矩形遮擋塊來模擬部分遮擋,CAD候選模型則通過SAM3D和OSCAR零樣本檢索獲得。評測分為兩組:**已見類別**(椅子、沙發,這兩類在SUFLECA訓練時出現過)和**未見類別**(烤麵包機、吹風機、微波爐、行李箱,這四類訓練時從未出現)。每類採樣100幀圖像,覆蓋208個不同物體實例。

在已見類別上,SUFLECA三個變體的表現均顯著優於對比方法:3D交並比達到62.6%左右,而DINOv3-L和DUNE-B基線分別只有36.2%和23.4%,Diorama達到39.4%。在更具挑戰性的未見類別上,SUFLECA同樣保持了相當的競爭力:基礎版3D-IoU達到48.9%,SUFLECA-blend通過融合更通用的DUNE-B特徵進一步提升到49.5%,Diorama以39.1%位居第二但在旋轉精度上相對較好,而DINOv3-L和DUNE-B基線則因缺乏幾何感知特徵而表現很弱(8.8%和4.5%)。這組結果表明,SUFLECA學到的幾何感知特徵具有跨類別的遷移能力,即便面對訓練時從未見過的物體,也能在有部分遮擋和檢索不精確的條件下維持較好的三維對齊質量。

---

六、拆解每一塊積木:消融實驗的發現

研究團隊還系統地測試了每個設計選擇對最終性能的貢獻,以確認沒有哪個環節是"多餘的裝飾"。

關於訓練數據:當把ScanNet相關數據(即與評測集來源相同的數據)重新納入訓練時,精度從33.4%/42.3%小幅提升到34.4%/42.8%。這個僅1個百分點的提升說明,即便在嚴格零樣本設置下不使用任何與測試集同源的數據,SUFLECA的性能依然很強,多樣化訓練數據的覆蓋範圍已經提供了足夠的泛化能力。

關於對應估計策略:若只用最簡單的最近鄰匹配,精度降至26.3%/34.2%,比完整版本低了7個百分點以上。加入互相一致性約束(變為互相最近鄰匹配)可以提升到30.7%/39.4%,但仍有差距。進一步改用互相k近鄰匹配則達到32.0%/41.0%,最後加上幾何一致性篩選才達到最終的33.4%/42.3%。每一步改進都帶來了實質提升,證明這套多層次的匹配策略各環節缺一不可。

關於NMS評分機制:如果用ROCA檢索置信度代替SUFLECA自己的對齊質量得分來做NMS排序,精度降至30.4%/39.3%(下降3個百分點);如果用視角選擇相似度得分來排序,則進一步降至29.2%/38.8%。這說明基於配准殘差資訊矩陣的對齊質量評分,是比語義檢索置信度更可靠的篩選依據。

---

七、速度與內存:零樣本方法中的效率冠軍

SUFLECA的優勢不只體現在精度上,在計算效率方面同樣表現突出。

從GPU顯存占用來看,SUFLECA基礎版只需要2178 MB,是所有零樣本對比方法裡最低的(ZeroCAD代理實現需要約5000 MB,FoundationPose需要8544 MB)。特徵維度384遠低於ZeroCAD的2048,正是高效運行的關鍵之一。更輕量的SUFLECA-S版本顯存占用進一步降至1556 MB,特徵維度僅256。

從單實例處理時間來看,SUFLECA基礎版每個物體實例只需0.53秒,SUFLECA-S更快至0.49秒,均比ZeroCAD(含疊代優化,約3.77秒)快了7倍以上,也比沒有疊代優化的ZeroCAD代理版(1.30秒)快了一倍以上。研究團隊還對SUFLECA內部各環節做了細分計時:特徵提取86.6毫秒、視角選擇43.1毫秒、對應估計與篩選68.7毫秒、RANSAC三維配准332.0毫秒。絕大部分時間花在RANSAC上,而RANSAC的疊代次數是可以直接調節的,這意味著使用者可以根據需要靈活地在速度和精度之間取得平衡。

---

八、真實部署時的軟肋:CAD檢索質量的制約

研究團隊也坦誠地分析了整個系統的薄弱環節:CAD檢索的質量對最終對齊精度有相當大的影響。

當使用Scan2CAD數據集提供的理想標註(即給出每個物體的正確CAD模型)時,SUFLECA的類別平均精度達到43.0%、實例平均精度54.2%;當使用有監督訓練的ROCA檢索器時(檢索準確率34.3%),精度降至33.4%/42.3%;而當使用完全零樣本的GroundedSAM+OSCAR檢索時,由於檢索準確率僅有3.8%(大量檢索到的CAD模型與目標不匹配),精度進一步降至22.5%/33.1%。

有意思的是,從理想標註到有監督檢索,檢索準確率下降了約65個百分點,但對齊精度只下降了約9個百分點;而從有監督檢索到零樣本檢索,檢索準確率又下降了約30個百分點,對齊精度只下降了約11個百分點。這種"對齊精度的衰減遠慢於檢索準確率的衰減"的規律表明,SUFLECA對檢索不精確的CAD模型具有一定的魯棒性——即便拿到的CAD模型不是完全匹配的版本,它依然能找到有效的幾何對應關係。不過,如何在真實世界的遮擋和外觀變化下實現高質量的零樣本CAD檢索,依然是一個有待突破的開放問題。

---

說到底,SUFLECA這項工作做的事情可以用一句話概括:它教會了電腦用"幾何眼光"而非"外貌眼光"去匹配物體。通過匯集12個跨領域數據集、用三維坐標標籤塑造特徵空間、再用一套嚴密的幾何一致性篩選機制挑出可靠對應關係,這套系統在不需要任何位姿標註數據的情況下,精度首次超越了需要大量有監督訓練的專用方法,同時做到了更快的速度和更低的顯存消耗。

這對機器人領域來說意味著什麼?它意味著機器人在面對陌生物體時,不再需要預先收集大量該物體的標註圖像來訓練,只要有一個粗略的三維模型,就能做到較為精準的位姿估計和抓取規劃。對增強現實應用而言,這也意味著更低門檻的三維內容疊加能力。

當然,如研究團隊自己指出的,目前這套系統還有兩個明顯局限:其一,整個流水線的上限仍然受CAD檢索質量制約,在真實場景中零樣本檢索到精確匹配模型依然很難;其二,SUFLECA目前主要針對室內常見物體類別,戶外場景和長尾類別的覆蓋有待擴展。這兩個方向,也自然地成為了下一步研究的路標。

對這個話題感興趣的朋友,可以通過論文編號arXiv:2607.15058查閱完整論文,項目代碼也已在GitHub上的snt-arg/SUFLECA倉庫公開。

---

Q&A

Q1:SUFLECA是什麼,和普通的物體姿態估計方法有什麼區別?

A:SUFLECA是一種零樣本的CAD模型與圖像對齊方法,無需任何位姿標註數據就能估計物體的三維旋轉、位移和尺寸。與普通方法相比,它通過在67萬張真實和合成圖像上學習幾何感知特徵,再配合幾何一致性篩選算法,在不做疊代優化的情況下實現了更高精度和更低顯存占用,是目前在ScanNet25k基準上首個超越有監督方法的零樣本框架。

Q2:SUFLECA在實際機器人應用中能用嗎,速度夠快嗎?

A:目前SUFLECA處理每個物體實例只需約0.53秒,顯存占用約2178 MB,在零樣本方法中效率最高,基本滿足機器人實時感知的需求。不過,整個系統還依賴CAD檢索等上游模組,在真實部署中如果CAD檢索不準確,對齊精度會有明顯下降,這是目前實際落地時需要注意的瓶頸。

Q3:SUFLECA對從未見過的物體類別也能用嗎?

A:可以,但效果有所差異。在CO3D數據集的測試中,對於訓練時從未出現的類別(如烤麵包機、吹風機等),SUFLECA-blend變體的3D交並比達到約49.5%,仍然顯著優於純視覺基礎模型的基線方法。主要原因是NOC監督學習到的幾何感知特徵具有跨類別遷移能力,但對更陌生的物體泛化能力會有一定下滑。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新