宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

哈工深團隊打造的「懂你」AI助手:讓手機幫你跨應用辦事,還能越用越聰明

2026年07月24日 首頁 » 熱門科技

這項由哈爾濱工業大學(深圳)與深圳灣區研究院聯合開展的研究,以預印本形式發布於2026年7月,論文編號為arXiv:2607.12625,感興趣的讀者可通過該編號查閱完整原文。

手機里裝了幾十個App,但每次要辦一件稍微複雜點的事,還是得自己一個一個打開、一步一步操作,AI助手明明掛著嘴邊,真正能幫上忙的時候卻少得可憐。哈工深的研究團隊就是奔著這個現實痛點去的。他們造出了一個叫做KnowAct-GUIClaw的系統,核心思路可以用一句話概括:**一個真正懂你的AI助手,應該像一個經驗豐富的老秘書——不僅知道你要什麼,還記得上次怎麼做、哪裡踩過坑,下次直接走捷徑。**

這篇研究誕生的背景,是當前AI智能體領域一個尚未解決的尷尬:市面上已有OpenClaw這類優秀的AI智能體框架,能幫人自動分解任務、調用工具、完成複雜目標。但這些框架有兩個硬傷——第一,它們不擅長操作手機和電腦螢幕上的圖形界面,遇到需要"點開App、找到按鈕、填寫內容"這類操作就力不從心;第二,它們沒有學習記憶機制,每次執行任務都像第一次,完全不會從過去的經歷中積累經驗。KnowAct-GUIClaw就是為了同時解決這兩個問題而生的。

---

一、老秘書的工作哲學:懂得深,才能做得好

所謂"老秘書",從不是接到一個任務就埋頭幹活的人。在動手之前,他會先翻翻手頭的記錄——上次幫你訂機票走的哪個App、某個平台的設置在哪個角落、你的偏好是什麼。這正是KnowAct-GUIClaw系統的核心設計哲學,研究團隊將其概括為"Know Deeply, Act Perfectly"(深度理解,精準執行)。

這套系統的整體架構由兩個角色分工協作。一個是"主控智能體",相當於那位老秘書本人,負責理解用戶意圖、分解任務、調配資源、監督全局;另一個是"GUI執行器",相當於一雙擅長操作螢幕的手,專門負責在具體的App界面上完成一系列點擊、滑動、輸入等操作。這兩個角色之間有明確的邊界:主控智能體管"做什麼",GUI執行器管"怎麼在螢幕上做"。

兩者之間的分工為什麼重要?因為AI操作圖形界面,本質上是一個"盲人摸象"式的困境。每次截圖只能看到螢幕當前顯示的內容,看不到後台狀態,也不知道用戶是否已經登錄、權限是否已經授予、某個按鈕點下去會觸發什麼。研究團隊用一個專業詞彙描述這種困境:部分可觀測的馬爾可夫決策過程(POMDP)——簡單說就是,智能體在不完整的資訊下需要連續做決策,還得能從錯誤中恢復。把這個複雜的"螢幕操作問題"單獨交給一個專門的執行器處理,主控智能體就能集中精力在更高層的任務規劃上,整體效率和準確性都大幅提升。

---

二、從任務到行動的四步流水線:知、路、行、思

KnowAct-GUIClaw的整個執行過程分為四個環節,研究團隊稱之為Know-Route-Act-Reflect(知-路-行-思),這四步首尾相連、循環疊代,構成一個不斷進化的閉環。

第一步"知",是動手之前的準備功課。系統會主動去翻閱自己積累的歷史記錄和知識庫,把與這次任務相關的資訊都調出來備用——比如這類任務通常用哪個App、上次有沒有遇到過類似情況、有沒有現成的操作捷徑可以復用。這些記憶不會強制覆蓋當前指令,而是作為參考建議提供給後續環節。當用戶的指令比較模糊時,系統還會結合歷史中記錄的用戶偏好,自動補全合理的默認假設,並向用戶明確說明,等待確認或修改。

第二步"路",是任務分解和路徑規劃。面對一個可能橫跨多個App的複雜任務,系統會把它切分成若干個子任務,每個子任務對應一個具體的App,並明確規定這個子任務需要哪些輸入資訊、完成後要輸出哪些資訊。這些中間資訊不是靠模型"腦補"傳遞,而是寫進一塊公共的"黑板"上,下遊子任務直接從黑板上取數據。如果某塊數據取不到,任務就直接中止,而不是讓系統胡亂猜一個繼續跑——這種"缺數據就停"的設計,有效防止了AI憑空捏造資訊導致連鎖錯誤的問題。

第三步"行",是具體的螢幕操作執行階段。GUI執行器在這一步登場,它擁有一套完整的操作工具箱:點擊、滑動、輸入文字、返回主界面、等待加載……除了這些基礎動作,它還能調用系統預先驗證過的"快捷方式",比如Android深度鏈接(直接跳轉到某個App的特定頁面)和系統意圖(通過系統級命令觸發特定功能)。這些快捷方式能繞過大量繁瑣的導航步驟,但只有在系統確認目標頁面確實存在且參數正確之後才會使用,避免了因盲目走捷徑而跑偏的風險。

第四步"思",是任務結束後的復盤和沉澱。系統會把這次任務的執行軌跡梳理成簡潔的經驗筆記,成功的路徑提煉成可復用的技能模板,失敗的經歷提煉成警示教訓。下次遇到類似任務,這些沉澱的經驗就會在"知"這一步被調取出來,讓整個執行過程走得更快更穩。

---

三、記憶系統:AI版的"工作日誌"

KnowAct-GUIClaw的記憶系統分為兩種形態,各司其職,相輔相成。

第一種是"經驗記憶",儲存的是文字形式的經驗教訓。每次任務跑完,系統會把執行過程濃縮成一段簡潔的描述,分成成功筆記和失敗筆記兩類分別寫入。成功筆記記錄"這類任務這樣走效率最高、這個App的目標功能在這個入口";失敗筆記記錄"這條路走不通、這個界面設置不在手機App里而在網頁管理後台"。這些記憶不會被無限堆積,系統會過濾掉重複的內容,每種任務最多保留幾條最有價值的經驗,保持知識庫的精煉和有效。

論文裡有一個非常生動的案例:用Mastodon這個社交平台創建邀請鏈接。沒有記憶系統的情況下,AI老老實實打開Mastodon的手機App,在設置里翻來翻去,最終走到死路——因為帶高級選項的邀請鏈接功能根本不在手機App里,只在網頁管理後台。有了記憶系統之後,系統在"知"這一步就調出了一條經驗筆記:"Mastodon邀請鏈接需要通過網頁管理後台操作,手機App不支持。"於是直接打開瀏覽器,登錄管理後台,找到邀請設置,任務順利完成。從走錯路到精準導航,差別就在於那一條幾行字的經驗記錄。

第二種是"技能庫",儲存的是可以直接復用的操作程序。技能庫里的每一項技能都是一段標準化的操作流程,比如"在拼多多搜索商品:打開App → 點擊搜索欄 → 輸入關鍵詞 → 點擊搜索按鈕"。這段流程里,固定不變的內容(按鈕位置、界面元素)直接寫死,會隨任務變化的內容(搜索關鍵詞)用占位符表示,執行時動態填入。

技能不是一成不變的。當系統在執行中發現某個技能失效了(比如App更新後界面布局變了),它不會直接丟掉這個技能另起爐灶,而是觸發"技能進化"機制:記錄失敗的步驟、截圖證據和錯誤原因,然後針對這個技能做定向修復——也許是更新按鈕坐標,也許是加一個處理彈窗的可選步驟,也許是收窄技能的適用範圍。修復優先於重建,保證了技能庫的穩定積累。

---

四、跨App資訊傳遞:黑板機制杜絕"資訊丟失"

處理橫跨多個App的複雜任務,最容易出的問題不是某個單步操作失誤,而是"資訊在傳遞過程中丟失或變形"。

設想這樣一個場景:用戶讓AI助手"去我的郵件里找今晚派對的時間,然後提前一小時給我設一個鬧鐘"。這其實是兩個子任務——先從郵件App讀取時間,再去時鐘App設定鬧鐘。如果這兩步之間沒有可靠的資訊交接機制,AI很可能讀完郵件就忘了時間,或者把"7:00 PM"誤記成"7:00 AM"。

KnowAct-GUIClaw的"黑板"機制專門解決這個問題。每個子任務開始前,系統會在黑板上聲明"我需要哪些數據""我會產出哪些數據",執行完成後嚴格按照聲明把結果寫回黑板,下一個子任務只從黑板上讀取前面子任務明確寫入的數據,不做任何自由發揮的推斷。論文展示的派對-鬧鐘案例中,郵件子任務把"派對時間=晚上7點"寫進黑板,主控智能體在黑板上做了減法(7點減去1小時等於6點),然後把"設置時間=晚上6點"傳給時鐘子任務,鬧鐘準確設定。整個過程透明、可追溯,數據不會在模糊的自然語言摘要中悄悄跑偏。

還有一個更複雜的案例:用戶讓AI助手"檢查郵件找到我參加的會議酒店地址,發簡訊告訴Tom,再用地圖查一下從MIT步行過去要多久"。郵件子任務找到了"Harvard Square Hotel"這個名字,但沒有完整地址。主控智能體發現這個資訊不夠用,直接調用網路搜索工具補全了地址,然後把完整地址"Harvard Square Hotel, 110 Mount Auburn St, Cambridge, MA 02138"分別傳給簡訊子任務和地圖子任務。地圖最終報告步行需要13分鐘。當GUI操作獲取的資訊不足時,主控智能體可以主動用非GUI的工具(比如搜索)補全,而不是讓整個任務卡死,這種靈活的救場能力是系統設計的一大亮點。

---

五、混合操作模式:能走捷徑就不繞彎路

操作手機螢幕,不是什麼功能都需要從桌面一步一步點進去。Android系統本身提供了"深度鏈接"和"意圖"兩種機制,允許直接跳轉到某個App內的特定頁面,甚至直接觸發某個功能。KnowAct-GUIClaw把這些系統級捷徑集成進了操作工具箱。

論文裡的跨App比價案例把這個優勢展示得非常直觀:用戶讓AI比較同款SSD在京東和淘寶的價格。京東那邊,系統觸發了一個預先驗證過的搜索意圖,直接跳轉到了包含該商品搜索結果的頁面;淘寶那邊,系統沒有可用的已驗證捷徑,於是老老實實走了5步普通GUI操作——打開App、關掉促銷彈窗、點擊搜索框、輸入商品名、點擊搜索。京東1步,淘寶5步,差距清晰可見。兩邊的價格都通過黑板機制匯總到主控智能體手裡,主控智能體綜合比較後給出購買建議。

捷徑的使用有嚴格的前置驗證——系統不會看到一個深度鏈接就直接用,而是先在設備上實際測試這個鏈接能不能打開正確的頁面、參數有沒有被正確傳遞,通過驗證的才會被收錄進捷徑庫,未通過的只作為候選記錄保留。這種"先驗證後使用"的原則,避免了因為捷徑無效而導致任務出錯的風險。

---

六、在真實測試中的表現:開源模型打敗閉源巨頭

研究團隊在兩個主要的基準測試上評估了KnowAct-GUIClaw的性能。

第一個是MobileWorld基準測試,包含117個長流程手機任務,覆蓋20個真實App,難度較高。這是研究團隊的主戰場,也是本文最核心的實驗數據來源。在這個測試中,單獨使用Qwen3.5-35B這個參數量較小的開源模型作為GUI執行器,成功率只有24.8%——約莫四分之一任務能完成。把它接入KnowAct-GUIClaw框架、加上主控智能體和經驗記憶之後,成功率跳升到34.5%;再開啟技能庫,成功率進一步升至37.9%。

更令人關注的是一組跨模型遷移實驗:用Kimi-K2.6這個較強的模型跑過任務之後,把它積累下來的經驗記憶和技能庫"移植"給Qwen3.5-35B來用,後者的成功率一路升至41.0%,比它單獨跑的24.8%整整高出16.2個百分點。這說明系統積累的知識財富具有真正的可遷移性——不是和某個特定模型綁定的私有財產,而是任何接入系統的模型都能受益的共享資產。

當使用Kimi-K2.6同時擔任主控智能體和GUI執行器時,系統達到了64.1%的成功率,超過了榜單上所有其他參與者,包括Seed-2.0-Pro(63.2%)和GPT-5.5(62.4%)這兩個強力閉源商業模型。這是一個完全由開源模型驅動的系統,在長流程手機任務上的表現超越了當時最先進的閉源AI,意義相當顯著。

從效率角度看,技能庫的價值不只體現在成功率上,還體現在操作步數的減少上。在那些實際用上了技能的任務中,使用技能庫讓每個任務平均減少了3.3個GUI操作步驟,總體界面截圖和操作的計算量也減少了約6%——也就是說,任務做對了,花的力氣還更少了。

第二個測試是AndroidDaily基準,包含235個任務,需要真實操作iOS設備(測試了跨平台能力),部分任務還要求不只是完成操作、還要給出具體答案。在194個可用任務上,KnowAct-GUIClaw的成功率達到78.61%,大幅領先於專門為GUI任務設計的對比系統(UI-TARS-1.5的56.64%)。系統在需要跨App分析和給出明確答案的複雜任務上優勢尤為突出,正是因為黑板資訊傳遞和經驗記憶兩個機制在這類任務上發揮了最關鍵的作用。

---

七、跨平台驗證:安卓之外,HarmonyOS和Windows同樣能用

研究團隊沒有把系統限定在安卓平台上做測試,還在HarmonyOS(華為鴻蒙)和Windows上進行了驗證。

鴻蒙測試選取了63個任務,包括跨App的日曆管理、地圖規劃、社交軟體操作等,最終完成了48個,成功率76.2%。Windows測試設計了30個桌面任務,覆蓋瀏覽器操作、文件管理、Office文檔、終端命令、系統控制等場景,完成了21個,成功率70.0%。

兩個平台都暴露出了各自獨特的難題,研究團隊對此做了坦誠的分析。鴻蒙上的失敗案例之一是設置一個8:25的鬧鐘——問題出在分鐘的選擇界面上,採用了一種慣性滾輪式選擇器,AI反覆在附近區域滑動,就是無法精準停在25這個位置,最終步驟耗盡任務失敗。另一個失敗案例是在淘寶下單後移交控制權,AI在訂單確認頁面就停下來了,誤以為那就是支付頁面,其實支付頁面要再點一下"立即付款"才會出現——這是對App界面流程語義的誤判。Windows上的失敗案例則揭示了另一層困難:讓AI從內置表情面板里找到"大笑"表情並發送,AI能找到表情面板,但選錯了表情——因為面板里的表情圖標沒有文字標籤,只有圖形,AI需要把"大笑"這個語言描述映射到一個視覺符號,這種"語言-圖形"的對應是當前AI模型的一個普遍短板。

這些失敗案例並非被輕描淡寫地帶過,而是被研究團隊當作開放性挑戰列出,為後續研究指明了方向:精細的幾何控制、短暫出現的界面元素(如通知彈窗)的實時響應、以及自然語言到視覺符號的語義對應,都還有大量工作可以深入。

---

說到底,KnowAct-GUIClaw乾的這件事,是在嘗試讓AI助手真正"用過就不白用"。現有的很多AI系統,每次執行任務都像新手上路,路上踩過的坑下次還會再踩;而KnowAct-GUIClaw設計了一套系統性的記憶和學習機制,讓每一次成功和失敗都能轉化為下一次任務的財富。

這項研究對普通用戶意味著什麼?從理論上說,如果這類系統真的落地到日常使用的手機助手裡,用戶委託AI完成跨App複雜任務的可靠性會大幅提升,不再需要自己一個一個App地切換操作。經過一段時間的使用積累,助手會越來越熟悉你的手機環境和操作習慣,常用的路徑會越走越快,踩過的坑不會重複踩。

當然,研究團隊自己也坦承,當前的系統在精細手勢控制、實時彈窗響應、複雜圖形界面語義理解上還存在明顯局限,距離能穩定服務所有用戶的實用級產品還有一段路要走。未來他們計劃把知識檢索、外部工具調用和GUI操作三件事合併到一個統一的決策周期里,而不是現在這種分階段的流水線結構,從而進一步減少主控智能體和執行器之間的來回通信開銷。

讀到這裡,你可能會好奇:如果AI助手真的能記住我的操作習慣,那隱私怎麼辦?記憶存在哪裡、誰能看到、怎麼刪除?這些工程落地層面的問題,是這類系統真正走進千家萬戶之前必須回答的現實挑戰,也是學界和產業界共同需要持續關注的議題。對這項研究感興趣的讀者,可以通過arXiv:2607.12625查閱完整論文和實驗日誌,實驗日誌還公開在GitHub上,地址在論文中有明確標註。

---

Q&A

Q1:KnowAct-GUIClaw的記憶系統和普通AI聊天記錄有什麼不同?

A:普通AI聊天記錄只是保存對話文本,下次對話不一定會參考。KnowAct-GUIClaw的記憶系統是主動提煉的經驗庫,分為"經驗記憶"(文字版操作教訓)和"技能庫"(可直接復用的操作流程)兩類,會在每次新任務開始前主動檢索相關內容來指導執行,而且這些知識可以跨不同AI模型共享使用,不綁定某個特定模型。

Q2:KnowAct-GUIClaw能操作iPhone上的App嗎?

A:可以部分支持。論文中的AndroidDaily基準測試就是在iOS設備上進行的,系統成功率達到78.61%。不過系統目前的技能庫和快捷方式機制主要針對Android平台設計(如深度鏈接和系統意圖),iOS上只能依賴基礎的螢幕操作動作,深度集成程度相對有限。

Q3:開源模型用KnowAct-GUIClaw框架後為什麼能超過閉源大模型?

A:閉源大模型(如GPT-5.5、Seed-2.0-Pro)在MobileWorld測試中直接操作螢幕,靠模型本身的能力硬扛複雜任務。KnowAct-GUIClaw給開源模型加上了經驗記憶和技能庫,相當於讓模型站在了此前積累的所有經驗肩膀上——知道哪個App哪個功能在哪裡、哪條路走不通、有哪些捷徑可用。這種"知識加持"彌補了模型規模上的差距,讓較小的開源模型在長流程任務中表現反超了更大的閉源模型。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新