我們介紹了一項通過全國規模研究,探索AI用於鑑別診斷與症狀檢查的開創性研究成果。
大部分臨床診斷可以僅通過語言訪談得出。這類診斷性訪談通常由臨床醫生通過線上或線下的醫患互動來完成。儘管這類交互是症狀評估的黃金標準,但由於經濟、地理及系統性障礙,其可及性往往受到限制。當前的語言模型在經過精心整理的醫學案例評估中,已展現出較強的鑑別診斷能力,這也凸顯了其輔助診斷的潛力。然而,現有評估大多依賴經過高度整理、資訊詳盡甚至人工合成的病例描述,可能無法反映真實世界中患者的實際表現。這些評估並未捕捉到普通患者描述症狀時的真實狀態,例如醫學素養參差不齊、資訊不完整,以及自然對話中出現的各種複雜情況。這是一個關鍵缺口,導致語言模型在真實場景中的表現存在較大不確定性。
為填補這一缺口,我們開展了一項現場對比研究,測試了一組實驗性對話AI智能體原型,旨在探索對話式AI如何完成端到端的症狀訪談與鑑別診斷評估,以供研究基準測試使用。在我們最新發表的論文《SymptomAI:面向日常症狀評估的對話式AI智能體》中,我們報告了一項全國規模隨機研究(n=13,917)的成果。在該研究中,獲得知情同意的參與者與五種基於Gemini Flash 2.0的SymptomAI智能體之一進行交互。研究過程中生成的所有診斷、標籤和疾病關聯僅用於研究分析,不構成經臨床確認的診斷或官方醫療評估。在與AI智能體交互兩周後,我們邀請參與者反饋其就醫所獲得的診斷結果。基於這些數據,我們開展了臨床專家標註研究,將SymptomAI的診斷表現與真實臨床醫生的醫療評估進行了對比。
在評估SymptomAI鑑別診斷準確性之後,我們進一步將其診斷結果與參與者在與AI對話前一段時間內的Fitbit可穿戴設備生物信號進行比對。結果顯示,SymptomAI判斷為感染性疾病病因的對話,與可能指示免疫反應的生理趨勢相吻合,為SymptomAI的診斷性能提供了進一步佐證。
研究設計與參與者互動方式
本研究部署了一套對話AI智能體,用於端到端的患者訪談與鑑別診斷評估。參與者可與智能體就其症狀展開對話,獲得候選鑑別診斷列表,並進入後續診斷環節。
共有13,917名知情同意的研究參與者,每人向五種隨機分配的SymptomAI智能體之一描述自身症狀,各智能體在症狀訪談方式上具有不同程度的靈活性。在對話過程中,參與者描述症狀,SymptomAI則提出追問,最終形成鑑別診斷結果(即一份包含多個可能診斷的列表)及後續建議。參與者隨後可選擇就醫,並被要求在兩周後通過問卷分享就診結果。為評估SymptomAI的表現,我們還開展了臨床專家標註研究:由三名通過委員會認證的臨床醫生審閱對話記錄,並提供各自的評估意見(即鑑別診斷)。隨後,每位醫生以盲審方式對SymptomAI和其他醫生提供的鑑別診斷進行排名。
研究結果顯示,在超過50%的案例中,臨床醫生對SymptomAI生成的鑑別診斷的評價優於其他臨床醫生的診斷,表明SymptomAI的診斷質量與臨床醫生相當甚至更優。
SymptomAI生成的鑑別診斷被臨床評估者評為最佳診斷的概率更高。
在Top-5準確率(即參與者就診醫生給出的真實診斷是否出現在鑑別診斷列表的前五項中)方面,臨床醫生判定SymptomAI生成的鑑別診斷準確的頻率同樣高於其他臨床醫生的診斷。
SymptomAI生成的鑑別診斷更有可能涵蓋就診醫生給出的真實診斷結果。
不同訪談策略的效果比較
本研究還評估了不同病史採集訪談方式的效果。參與者被隨機分配至五個研究組,每組採用不同的提示策略:兩組(Dynamic Live和Dynamic Final)具有完全的自由追問權限,兩組(Fixed Canonical和Fixed Canonical的靈活版本)採用醫學院標準病史採集問題,最後一組為無提示的基礎大語言模型,代表當前用戶與大語言模型聊天機器人交互的默認狀態。結果表明,所有主動提問策略(即SymptomAI主動向參與者提問的情形)的表現均顯著優於基礎組,驗證了主動資訊收集對提升鑑別診斷準確性的重要價值。
此外,研究發現SymptomAI在臨床醫生對自身診斷信心最低的案例中,超越臨床基準的幅度最為顯著。
生物信號分析的潛力
鑑於SymptomAI相對於臨床基準的準確性,我們還可以探索其大規模應用潛力。目前,臨床標註的高昂成本限制了真實世界中人群規模數據集的分析。SymptomAI等準確的症狀檢查系統,有望實現臨床質量診斷的自動化參考標註,從而為生理數據的大規模分析提供支撐——這在目前尚屬不可能完成的任務。
其中一個典型應用場景是將可穿戴設備的生物信號與不同類別的疾病進行關聯分析。急性呼吸道感染在可穿戴生物信號中表現出最為顯著的變化。為在人群規模上研究這一現象,我們收集了參與者在與SymptomAI交互前最多30天內的每日生物特徵數據。結果顯示,在用戶報告症狀的前幾天,生物信號出現了明顯偏移,提示症狀發作的時間節點。值得注意的是,組間差異是通過對SymptomAI首選候選診斷進行分類、並將呼吸道感染診斷歸為一組來實現的,該組排除了過敏性鼻炎或慢性阻塞性肺病等非感染性呼吸系統疾病。可穿戴生物信號偏移峰值與參與者報告症狀日期的吻合,為其所報告症狀提供了可觀測的生理學證據。
基於AI的症狀評估為新型研究打開了大門。通過SymptomAI分析大量症狀報告,並與實時Fitbit數據相結合,我們可以探索多種疾病的數字生物信號表型。分析揭示了生理指標的明顯變化,包括心血管功能、呼吸、皮膚溫度和睡眠質量,這些變化發生在用戶與SymptomAI對話前的數天內,且與症狀對話的時間高度吻合,這為驗證患者自報症狀或提供被動數據、輔助鑑別診斷提供了可能的路徑。此外,實時可及性也凸顯了AI症狀檢查的一項核心優勢:與可能因排班延誤而推遲的傳統門診不同,參與者可在症狀出現時即時參與SymptomAI研究,這有助於提高患者自報發病時間的準確性——這對人群規模的健康分析至關重要。
局限性與未來展望
SymptomAI是一項探索性研究,代表了AI症狀評估領域的重要研究進展,展示了其為尋求症狀解讀的公眾提供幫助的潛力。儘管人群規模的部署評估揭示了遠程患者訪談的症狀評估準確性,但與臨床醫生評估進行比較時仍存在一定局限。
首先,鑑別診斷本身具有模糊性,已報告的診斷也可能隨時間推移發生變化和演進。症狀評估是對某一時刻症狀表現的快照,由於研究規模較大,我們無法對症狀報告的頻率和時間進行控制。部分參與者可能在更具代表性的體徵尚未出現前便已報告症狀,而另一些患有慢性病的參與者則可能在已有多年經驗的情況下,在症狀明顯時才進行報告。未來研究可聚焦於疾病發展特定階段的具體疾病,如代謝綜合徵早期或呼吸道感染初期症狀。研究過程中生成的所有診斷、標籤和疾病關聯均為AI生成,僅供研究分析使用,不構成經臨床確認的診斷或官方醫療評估。
其次,在本次評估中,臨床醫生審閱的是靜態對話記錄,無權自行追問。若由臨床醫生主導症狀訪談,他們可能會直覺性地獲取不同的資訊。此外,儘管近期研究表明對話式AI系統能夠以媲美臨床醫生的細緻程度和準確性採集臨床數據,但此類系統可能會錯過肢體語言、視覺評估、病歷記錄等替代信號,以及在基層醫療中醫患之間已有的信任關係。
總結
本文介紹了SymptomAI——一種用於真實世界患者訪談與症狀評估的實驗性對話AI智能體。我們通過在人群樣本上的鑑別診斷準確性,展示了SymptomAI的端到端真實世界表現,並闡明了SymptomAI的診斷如何支持可穿戴生物信號等人群規模信號的分析,從而識別生理信號與所報告疾病之間的關聯。
本研究由Joe Breda、Jake Sunshine與Daniel McDuff共同主導完成。感謝來自Google Research和Google DeepMind的共同作者與合作者對本研究的貢獻。
Q&A
Q1:SymptomAI是什麼?它能診斷疾病嗎?
A:SymptomAI是谷歌研究團隊開發的一種實驗性對話AI智能體,用於通過自然對話進行症狀訪談和鑑別診斷評估。它能根據用戶描述的症狀提出追問,並給出可能的診斷列表。但需要注意,SymptomAI生成的所有診斷結果僅供研究分析使用,不構成經臨床確認的正式醫療診斷,不能替代醫生的專業判斷。
Q2:SymptomAI的診斷準確率如何,與真實醫生相比怎麼樣?
A:研究結果顯示,在超過50%的案例中,臨床醫生對SymptomAI生成的鑑別診斷評價優於其他臨床醫生的診斷。在Top-5準確率方面,SymptomAI生成的診斷列表包含患者就診醫生所給出真實診斷的比例也高於臨床醫生。尤其是在臨床醫生對自身診斷信心較低的案例中,SymptomAI超越臨床基準的幅度最為顯著。
Q3:SymptomAI是基於哪個大語言模型開發的,研究規模有多大?
A:SymptomAI基於谷歌的Gemini Flash 2.0大語言模型開發,共設計了五種不同提示策略的智能體變體。研究共招募了13,917名知情同意的參與者參與全國規模的隨機對照研究,是目前同類研究中規模最大的一次,研究還結合了參與者的Fitbit可穿戴設備數據進行生理信號分析。






