這項研究由大連理工大學、Alaya Lab和東京大學聯合完成,以預印本形式發布於2026年7月13日,論文編號為arXiv:2607.11523。有興趣深入鑽研的讀者可以通過該編號在arXiv平台查閱完整論文。
你有沒有這樣的經歷:正在廚房忙著做飯,卻突然忘了自己把鹽放在哪裡;或者拿著螺絲刀修東西,卻意識到自己其實需要扳手;又或者一個重要的任務做到一半,被別的事情打斷之後完全忘記。這些日常小困擾,大多數情況下都只能靠自己解決,因為你身邊的助手——不管是手機上的語音助手還是智能喇叭——都在等著你開口發問,而不是主動幫你留意這些細節。
來自大連理工大學、Alaya Lab和東京大學的研究團隊覺得,這種"等你發問才回答"的助手模式實在太被動了。他們想打造一種新型助手,能像一個貼心的生活秘書一樣,通過持續觀察你正在經歷的一切,在合適的時機主動開口提醒、糾錯或建議——而不是等你問了才說。這個系統被命名為Vinci2,是他們早前研究成果Vinci的升級版。整個項目包含兩大核心成果:一個叫EgoServe的評測基準,以及一個叫EgoMemo的智能代理模型。
一、為什麼"等你發問"的助手已經不夠用了
把助手比作一個跟在你身邊的秘書,現有的大多數AI助手只能算是"接待員"——你走過去說"我需要幫助",他才開始工作。研究團隊把這種模式叫做"被動範式",用大白話說就是:你不問,我不答。這種模式的問題在於,很多時候你甚至不知道自己需要幫助,比如你根本沒意識到自己正在用錯誤的方式削洋蔥,或者你已經好幾天每晚熬夜刷手機這個習慣正在影響你的健康。
現有的另一類嘗試稍微進步了一些,叫做"半主動範式"。這類系統會在你一開始就告訴它"我要做紅燒排骨,幫我盯著步驟"之後,自動監控你的操作並在關鍵節點給出提示。但問題是,這種系統的視野非常局限——它只能根據你最初給的任務指令行動,而且只能看到當下這一刻的畫面,完全不理解你這兩天、這幾個月的行為規律,也沒有能力判斷"這個時候打擾你是否合適"。
研究團隊提出的第三種範式,才是他們真正想做的事情:完全主動的助手。這種助手就像一個跟了你多年的老朋友,對你的習慣、偏好、當前狀態都了如指掌。它不需要你給出任何指令,就能自己判斷"現在這個情況,我應不應該說話、說什麼、怎麼說"。這才是Vinci2想要實現的目標。
二、先把"考試題"設計好——EgoServe評測基準的誕生
在你著手打造一個聰明的系統之前,你首先得有辦法衡量它到底有多聰明。研究團隊發現,現有的所有影片理解測試題,要麼是給你一段剪好的影片片段問你"這段影片講了什麼",要麼是讓你在固定任務框架下評價系統的反應,沒有任何一套測試題是專門用來考察"AI在連續觀察你的日常生活時,能不能在正確的時刻主動幫你"這件事的。於是他們自己設計了這套考試——EgoServe。
EgoServe的底層素材來自三個現實場景的第一視角影片數據集。第一個是EgoLife,記錄了真實參與者連續多天的日常生活,從早上起床到晚上睡覺,時長跨越幾天甚至更長,研究團隊從中選取了三位參與者前五天的錄像。第二個是HoloAssist,記錄的是有人指導下的實際操作任務,比如組裝設備、配置電子產品,這些影片標註了每個操作步驟、錯誤點和教練的糾正時機,一共挑選了191段驗證影片。第三個是CaptainCook4D,專門記錄了人們按照食譜烹飪的過程,其中既有正確操作也有刻意設置的錯誤操作,覆蓋24種菜譜,選取了87段有明確錯誤標註的影片。
這三個數據來源合在一起,覆蓋了從幾分鐘到好幾天的不同時間尺度,為EgoServe提供了豐富多樣的現實場景基礎,整個基準總計超過3000條服務實例,影片總時長約128小時。
EgoServe把助手能提供的幫助分成了四個層次,每個層次對應不同的時間跨度,就像是不同"記憶深度"的考題。最淺的一層叫即時服務,助手只需要看清當下發生了什麼就能行動,比如你正在徒手搓刀刃,它立刻提醒你注意安全,或者你在用一把不合適的工具,它建議你換一個更順手的。這類服務考察的是對當前畫面的快速感知能力。
稍深一層叫短期服務,需要助手記住過去幾分鐘內發生的事情。比如它看到你剛才把鹽放進了鍋里,但你現在又拿起鹽罐準備再加,它就該提醒你不要放重了;又比如你剛完成了一道工序,它可以順勢提示你下一步該做什麼;或者你中途犯了個操作錯誤,它幫你糾正回來。
再深一層叫情節服務,需要助手記住幾十分鐘甚至幾個小時前的事情。比如你之前開始了一個任務但還沒做完就去做別的事了,等你空下來,它提醒你那個沒完成的事情;或者你現在的處境讓之前某件事變得重要,它幫你把那件事從記憶里調出來。
最深的一層叫長期服務,需要助手跨越多天甚至多個活動場景進行推斷。比如它發現你連續好幾天每次開會都忘了帶筆記本,於是主動建議你養成一個新習慣;或者它把你今天的情況和三天前發生的某件事聯繫起來,給你一個有背景依據的提醒。
在這四個時間層次之內,EgoServe又把具體的服務細化成了十個子類別,分別是安全提醒、工具建議、錯誤糾正、資源提示、步驟引導、任務提醒、記憶回溯、習慣指導、日常優化和跨日關聯。這十類服務覆蓋了人在日常生活和操作任務中最常見的需求場景,構成了一套相當全面的考卷。
EgoServe評測一個AI助手的好壞,從兩個維度來看。第一個維度是時間精準度:助手提供幫助的時機是否準確?它不能太早(事情還沒發生),也不能太晚(已經無法挽回),必須在一個合理的時間窗口內出現,而且提供的是正確類別的服務。第二個維度是內容質量:助手說的話是否真的有用、是否貼合當時的情境?這部分由大型語言模型擔任評判官,對生成的回應打1到5分。
三、給AI裝上一個"三層記憶系統"——EgoMemo的設計原理
解決了"怎麼考試"的問題之後,研究團隊著手設計能通過這套考試的AI助手,這就是EgoMemo。它最大的特點是完全不需要專門訓練,而是通過精巧的記憶結構和資訊檢索機制來實現主動幫助。
把EgoMemo的工作方式比作一個經驗豐富的私人管家,這位管家隨時跟著你,用三本不同粒度的記事本記錄你的生活,隨時翻閱這些記錄來判斷是否該主動上前說話。
第一本記事本記錄的是最細緻的細節。每隔一小段時間,管家就把這段時間裡發生的一切用文字描述出來,標註好時間,並且保存幾張關鍵的畫面截圖。對EgoMemo來說,這些文字描述是通過一個視覺語言模型自動生成的,針對每一小段影片(比如30秒一段)產生詳細的文字描述,記錄下你的手在做什麼、你看到了什麼、周圍有什麼物品,形成所謂的片段級描述庫。
第二本記事本是中等粒度的。每隔幾分鐘,管家會回顧一下最近這段時間的細節記錄,把它們壓縮成一段連貫的活動描述,比如"這個人過去五分鐘一直在準備食材,已經切好了洋蔥和胡蘿蔔"。這些活動級摘要既保留了足夠多的有用資訊,又大幅減少了需要處理的文字量,讓助手能對最近的行為有個整體把握。
第三本記事本記錄的是最宏觀的視角。每隔更長的時間(比如一個小時),管家會再把活動摘要進一步濃縮,形成對整個時間段的高層次描述,比如"今天上午這個人在廚房待了兩個小時,烹飪、清潔交替進行,期間還接了兩個電話"。這些會話級摘要幫助助手理解用戶在更長時間尺度上的行為模式。
光有這三層文字記錄還不夠,因為有些資訊用文字很難描述清楚,比如某個物品長什麼樣、放在什麼位置。於是EgoMemo還維護了一個視覺畫面檔案,把每段影片的關鍵截圖轉化成機器能理解的數字向量(可以理解為每張圖片的"數字指紋"),存檔備查。當助手需要找"和這張圖片長得差不多的過去場景"時,就能通過比對數字指紋快速定位。
除了這些記憶之外,EgoMemo還同步維護著一張不斷成長的關係網路圖。每次生成新的文字描述時,系統會自動提取出裡面出現的人物、物品、地點,以及它們之間的關係,把這些資訊添加到一張語義關係圖中。比如"刀放在廚房檯面上"、"鹽罐在櫥櫃第二層"、"張三昨天提到過要開會"——這些零散的知識點都被組織成一張相互關聯的知識網路,方便助手在需要時快速找到相關聯的資訊。
四、判斷該不該開口,以及如何找到相關記憶
每當一段新的影片片段到來,EgoMemo的推理部分就開始工作。它先看一眼最新的畫面描述,結合最近的活動摘要,自問一個問題:"當前這個情況,我需不需要主動說點什麼?"如果答案是不需要,就繼續靜默觀察;如果答案是需要,就進入下一個階段——決定去哪裡找支撐這個判斷的背景資訊。
這裡的關鍵挑戰在於,僅憑當下這一刻的觀察,助手往往無法給出高質量的建議。就像一個新來的管家看到你在翻抽屜,不知道你是在找鑰匙還是找膠帶,更不知道你今天之前有沒有用過這個抽屜里的東西。但一個跟了你多年的老管家,會立刻想起你早上出門前把備用鑰匙放進了這個抽屜。這種"歷史背景"就是需要從記憶中檢索的資訊。
EgoMemo通過三條並行的檢索通道來找這些背景資訊。第一條是文字相似度檢索,它把當前的問題轉化成一個搜索關鍵詞,在三層文字記憶里找出最相關的段落——無論是幾分鐘前的細節描述,還是幾個小時前的活動摘要,都在檢索範圍之內。第二條是關係圖檢索,它從問題中提取出關鍵的實體詞(比如"鑰匙"、"抽屜"),在關係圖中找到這些詞節點,再順著圖上的連線擴展到相鄰的相關資訊,這樣即使問題用的詞和原來記錄用的詞不完全一樣,也能找到語義上相關的內容。第三條是圖像相似度檢索,它把文字描述先轉化成視覺特徵描述,再用這個描述去比對視覺檔案里所有截圖的數字指紋,找出畫面上最相似的歷史時刻。
檢索結束後,三條通道的結果被匯聚起來,但這裡還有個難題:關係圖檢索和圖像檢索返回的只是一些片段的索引編號,而不是可以直接閱讀的文字。為了讓推理部分能正常使用這些資訊,EgoMemo增加了一個"描述重建"步驟——把檢索到的圖片和原始文字片段一起餵給視覺語言模型,讓它用流暢的文字重新描述"在這段檢索到的歷史時刻里,發生了什麼"。這個步驟就像是讓管家不僅找到了那頁記錄,還把它翻譯成了一段說得清楚的話,消除了各種代詞混用和視覺細節缺失的問題。
最後,當下畫面的描述、三條通道檢索到的背景資訊、以及重建後的歷史敘述,全部匯聚給推理模組,由它做出最終判斷:要不要開口,以及說什麼。整個流程既可以在主動模式下運行(助手自己判斷是否該說),也可以在被動模式下運行(用戶主動發問,助手去檢索歷史背景來回答)——兩種模式共用同一套架構,不需要做任何修改。
五、系統有多聰明——用數據說話
研究團隊在EgoServe上測試了EgoMemo,同時也拿當下最強的幾個商用大模型做了對比,包括OpenAI的GPT-5-mini和Qwen3-VL-Plus。
對比結果清楚地展示了主動幫助這件事有多難。Qwen3-VL-Plus直接在情節級和長期級服務上接近全軍覆沒——因為它根本沒有歷史記憶可供調用,遇到需要回憶幾小時前甚至幾天前資訊的情況,完全束手無策。GPT-5-mini情況稍好,整體得分4.7,在即時安全提醒和步驟引導這類只需要看當前畫面的任務上表現還算過得去,但在長期服務上同樣幾乎全部交白卷。
EgoMemo的整體F1得分達到了8.0,幾乎是GPT-5-mini的兩倍。最顯著的提升出現在那些需要跨時間記憶的服務類別上:跨日關聯得分從兩個基準的0分提升到了4.9,日常優化得分達到了11.8,而基準模型在這個類別上同樣是0分。在情節級服務上,EgoMemo在記憶回溯和任務提醒兩個子類都取得了非零得分,而至少有一個基準模型在其中一類上得了0分。對於成功匹配到正確時間窗口的預測,內容質量評分平均為2.8分(滿分5分),整體質量處於合理水平。
研究團隊還做了一組拆解實驗,把EgoMemo的各個組件一個一個拿掉,看會發生什麼。把三層時間記憶系統簡化成只有一層細節記錄,整體得分從8.0降到7.0,跨日關聯得分從4.9跌到1.9,日常優化得分從11.8減半到5.7,證明分層記憶對跨時間推理至關重要。把描述重建步驟去掉,整體降到6.6,記憶回溯和跨日關聯都跌到0分,說明原始檢索結果如果不經過重建處理,推理模組根本無法利用。去掉圖像檔案,整體從8.0降到6.9,主要影響跨日關聯和日常優化這兩類需要識別重複出現的視覺場景的任務。去掉關係圖檢索,整體降到6.5,跨日關聯直接歸零,說明關係圖是連接跨時間語義關聯的核心機制。去掉文字相似度檢索,整體降到6.8,跨日關聯降到2.1,這是找到時間上相關內容的主要渠道。三條檢索通道缺一不可,共同構成了互補的證據體系。
六、能力遷移——在其他測試場景同樣表現出色
一套專門為主動助手設計的系統,能不能在其他更通用的影片理解任務上也發揮作用?研究團隊把EgoMemo放到了另外五個已有的測試基準上驗證。
在ESTP-Bench這個考察影片流中主動問答能力的基準上,EgoMemo在需要顯式背景資訊支撐的任務上達到了27.6分,超過了包括EyeWO在內的有監督訓練模型(EyeWO得23.6分),而且EgoMemo完全不需要訓練數據,這一點相當值得注意。
在OVO-Bench這個考察實時影片理解能力的基準上,EgoMemo的實時感知得分達到75.15,超過了GPT-4o(64.46)和LLaVA-OneVision(64.02)。這背後的原因是,EgoMemo通過多層摘要對影片進行了系統性的理解和索引,而不僅僅是逐幀處理畫面。
在離線的第一視角影片問答任務上,EgoMemo在EgoSchema這個需要長時間跨度推理的基準上得到74.8分,比此前最好的EgoThinker高出7.2分;在QAEgo4D這個情節記憶查詢任務上也達到68.0,同樣領先。在EgoTaskQA這個更依賴短片段內精細動作理解的任務上,EgoMemo得60.9,與EgoThinker的64.4接近,差距來自這個任務的特性——它更需要直接感知當下畫面,而不是調用歷史記憶。
從檢索效率角度看,研究團隊也做了橫向比較。VideoAgent每處理一分鐘影片需要67.25秒;Video-RAG需要20.81秒;EgoMemo只需要13.11秒,比VideoAgent快5.1倍,比Video-RAG快1.6倍。EgoMemo在構建記憶的階段確實需要較長時間(平均每分鐘影片77.33秒),但由於記憶構建和推理檢索是異步進行的,這部分時間不會加到每次查詢的延遲上。
七、數據是怎麼製作出來的——標註流程的設計
製作EgoServe的標註數據本身也是一項不小的工程,因為標註主動幫助比標註普通影片內容難得多。你不僅要知道影片裡發生了什麼,還要判斷哪個時刻應該觸發哪類服務,以及助手該說什麼。
研究團隊採用了半自動化的流程。對於HoloAssist,他們把影片中已有的人工標註(包括步驟邊界、錯誤標記、教練糾正)按時間順序整理成結構化文檔,然後用特定的提示詞引導Gemini大模型把這些結構化標註轉化為主動服務實例——比如教練的糾正動作自然對應錯誤糾正服務,步驟轉換點對應步驟引導服務。
對於EgoLife,研究團隊把每小時的人工標註整理後送入Gemini,針對即時、短期和情節級服務,讓模型直接從當前時間段內生成候選服務實例。但對於需要跨越多天的長期服務,他們設計了一個滾動積累的策略:先讓模型從第一天的記錄中提取潛在的長期事件線索,把這些線索攜帶到下一天的處理過程中,再結合新的觀察生成候選觸發點——這樣就模擬了助手跨天積累記憶、識別行為規律的過程。
對於CaptainCook4D,研究團隊直接利用現有的食譜步驟標註和錯誤標籤,生成工具建議、步驟引導和錯誤糾正三類服務實例。
所有自動生成的候選標註,最後都經過了人工核查。兩名標註員共同觀看對應影片片段,討論並決定是否接受該候選條目。他們會拒掉三類問題標註:沒有實際幫助價值的(比如把用戶已經在螢幕上看到的資訊再說一遍)、觸發時間窗口與實際影片內容不對應的,以及僅憑對話音頻而非視覺觀察生成的。
最終,從4038個初始候選條目中,有3437條通過了人工核查,整體通過率85.1%。不同服務類別的通過率有所差異:安全提醒最高(實際上因為重新分類還從195條增加到了241條),跨日關聯滿額保留,而資源提示類最低(69.8%),反映了從視覺畫面中判斷"剛才用了什麼資源"這件事本身的困難。
說到底,Vinci2這項研究做的事情,可以用一句話來概括:它試圖把AI助手從"你來問我才回答"的被動接線員,升級為"我全程陪著你、在合適的時候主動開口"的貼心夥伴。為了做到這件事,研究團隊首先制定了一套全面的考卷(EgoServe),明確定義了什麼叫"在正確的時機提供正確的幫助",並且把幫助分成了從即時到跨日的四個時間層次;然後設計了一套記憶和檢索架構(EgoMemo),讓AI能像真正有記憶的助手一樣,把當下觀察和歷史積累結合起來做判斷。
這項研究目前仍存在一些明顯的局限性。EgoMemo在把影片轉化為文字描述時,會不可避免地丟失一些難以言說的視覺細節;它依賴名稱匹配來識別同一個實體,當兩個物品外觀相似但名稱不同時容易出錯;自動標註流程也可能對某些更容易生成的服務類別有偏向。研究團隊也坦承,整體得分仍處於中等水平,說明主動助手這個問題遠比看起來複雜——同時找對時機、判對類別、生成有用的回應,三件事加在一起的難度相當高。
對於普通用戶來說,這項研究意味著未來的智能設備有可能變得更加"懂你"——不是你說什麼它理解什麼,而是它看著你的日常,在你最需要的時候主動說一句恰到好處的話。這一天什麼時候會真正到來,或許值得持續關注。
Q&A
Q1:EgoMemo需要提前訓練才能使用嗎?
A:EgoMemo完全不需要專門訓練,它是一個"開箱即用"的系統,通過實時構建記憶結構和檢索歷史資訊來工作。這意味著它可以直接應用於新的場景,不依賴特定任務的訓練數據,這也是它能在多個不同類型的測試基準上都取得不錯表現的重要原因。
Q2:EgoServe和已有的影片理解測試有什麼本質區別?
A:EgoServe最核心的區別在於它考察的是"主動干預"而非"被動回答"。現有測試大多是給你一段影片然後問你問題,而EgoServe要求AI自己判斷什麼時候該說話、說什麼類型的話,並且評估時機是否準確。這是一個從"問答能力"到"情境判斷能力"的根本性轉變。
Q3:EgoMemo的三條檢索通道分別解決什麼問題?
A:三條通道各有分工。文字相似度檢索負責找語義相近的歷史描述,適合處理能用語言清晰表達的資訊;關係圖檢索負責找語義上相關聯但用詞不同的資訊,比如"刀"和"切割工具"之間的關聯;圖像檔案檢索負責找視覺上相似的歷史畫面,彌補文字描述無法捕捉的視覺細節。三者互補,缺任何一個都會影響特定類別任務的表現。






