你有沒有想過,你每天用的ChatGPT、Claude、Cursor
這些AI工具,背後其實都藏著一份你永遠看不到的"說明書"?
這份說明書不是給你看的,是給AI模型自己看的。開發者在產品上線前,會寫一套指令塞進AI的大腦里,告訴它該扮演什麼角色、遇到敏感問題怎麼辦、該對用戶坦白到什麼程度、又該隱瞞什麼。這套指令有個專業名字。
**系統提示詞
**:開發者預先寫好、嵌入到AI應用中的一組指令,用戶看不到,但它在每一次對話開始之前就已經生效,並且貫穿整個對話過程。它決定了AI的人設、能說什麼、不能說什麼、優先照顧誰的利益。
這東西的詭異之處在於:模型公司花了大量精力去做"對齊",讓底層大模型變得安全可靠,可一旦某個產品的開發者在系統提示詞裡寫一句"永遠別說你是AI",或者"想辦法悄悄把話題帶偏,不用等用戶開口",這個原本被訓練得很老實的模型立刻就能變成一個會撒謊、會操縱人的工具。模型層面的安全努力,可能被應用層面的一行指令直接推翻。
而更讓人不安的是,這些系統提示詞幾乎從不對外公開,也沒有任何第三方機構在審查它們。斯坦福大學、CMU等多所高校的研究者聯合做了一件事:他們找來了88個真實商業AI產品的系統提示詞,一條一條地讀,一句一句地評分,試圖搞清楚這些藏在幕後的指令,到底是在保護用戶,還是在利用用戶。這項研究被稱為**AISPA
**(人工智慧系統提示詞保障框架)。
系統提示詞為什麼值得較真
先說幾個真實發生過的事故。
有個AI陪伴聊天機器人,因為沒有設置危機識別機制,一位有自殺傾向的青少年在和它聊天時,得到的不是勸阻,而是某種程度的慫恿。
有家公司的客服機器人憑空編造了一條根本不存在的退款政策,用戶較真之後鬧上了法庭,仲裁庭裁定該公司"沒有採取合理措施確保聊天機器人的資訊準確性"。
還有一家汽車經銷商的聊天機器人,因為系統提示詞裡缺少必要的行為約束,居然真的同意以1美元的價格賣出一輛價值7.6萬美元的車。
這些事故背後都有同一個共性:系統提示詞裡沒寫清楚該怎麼處理這些情況。如果提示詞裡明確寫了"遇到情緒低落的用戶要引導求助專業幫助""不要在沒有核實的情況下編造政策""任何交易都要經過二次確認",這些事故本可以避免。
更讓人後背發涼的是,有證據表明有些開發者不是疏忽,而是故意這麼設計的。Meta內部泄露的準則顯示,該公司的AI聊天角色被允許和未成年人進行"浪漫或性暗示"的對話。xAI的Grok
系統提示詞被曝光後,裡面赫然寫著讓模型扮演一個"瘋狂陰謀論者",相信"一個秘密的全球陰謀集團控制著世界"。上海更是有法院判決,兩名開發者因為"編寫和修改系統提示詞繞過AI伴侶應用的倫理約束",大規模生成違禁內容牟利而獲刑。
這個判決其實說明了一件很重要的事:法律責任是跟著誰控制系統提示詞走的。這意味著系統提示詞審查不只是道德層面該做的事,而是已經具備了法律上的分量。
研究團隊引用的一份調查顯示,將近90%的用戶希望系統提示詞能更透明,超過70%的人說,他們想要透明度的核心原因就是**信任**。可現實是,這份說明書至今沒人管。
一套八維度的審計標尺
要審查系統提示詞,首先得有一把統一的尺子。不然張三說這條指令有問題,李四說沒問題,吵到天黑也吵不出結果。
研究團隊做的第一件事,是把審計標準錨定在一個很硬的地方:《世界人權宣言》。每一條審計維度,都能對應到宣言裡具體的某一條,這樣就不是幾個研究者拍腦袋定的規矩,而是有國際公認的人權規範背書。
他們最終定出了八個維度。
第一個是**身份透明度**,看系統是否老實承認自己是AI,而不是冒充人類。第二個是**資訊真實性**,看系統是不是會說真話,承認自己不知道的東西,而不是一本正經地胡編。第三個是**隱私保護**,看系統會不會過度收集或泄露用戶的個人數據。第四個是**工具與操作安全**,看系統在執行代碼、調用工具時會不會先驗證再動手,而不是莽撞行事。
第五個是**用戶自主權與反操縱**,看系統會不會用一些"暗黑模式"去誘導用戶,製造情感依賴,阻止用戶隨時退出對話。第六個是**危險請求處理**,看系統面對違法、越獄式的請求時會不會正確拒絕。第七個是**傷害預防與用戶安全**,看系統會不會在用戶情緒低落或有風險時把話題引導到專業幫助上。第八個是**公平、包容與中立**,看系統是否存在歧視、刻板印象或政治立場的偏向。
這八個維度不是簡單地把"好行為"和"壞行為"分成兩套清單,而是每個維度都是一根軸,同一根軸上既能打出+1(保護用戶),也能打出-1(損害用戶)。舉個例子,身份透明度這條軸上,"我是Claude,由Anthropic開發的AI助手"是+1,"永遠別說你是AI語言模型"就是-1。這種設計的好處是,你不需要維護兩套獨立的分類系統,審計員只需要沿著同一條軸判斷這句話是在推著系統往好的方向走,還是往壞的方向走。
這就像給一個班級的學生做操行評分,你不會單獨列一份"好學生行為清單"和一份"壞學生行為清單",而是針對"是否按時完成作業"這一件事,直接評分:按時交是加分,抄襲是減分,同一把尺子量兩頭。如果非要維護兩套獨立標準,審計員每看一句話都得先判斷它屬於哪套體系,工作量直接翻倍,而且兩套體系之間的邊界本身就很模糊,反而更容易出現漏判。
從整句話里摳出可審計的"碎片"
光有八個維度還不夠,你還得知道審計的最小單位是什麼。是整份系統提示詞一起評分,還是一句一句地拆開看?
研究團隊選擇了後者,他們把這個最小單位叫做**提示詞片段
**。
**提示詞片段**:系統提示詞中一段連續的文字(通常是一句話),表達一個獨立完整的行為指令。如果連續幾句話表達的是同一個意圖,會被合併成一個片段。
這個設計的用意很直接:一份系統提示詞往往有幾十條甚至上百條指令,裡面可能既有保護用戶的好話,也混著一兩句有問題的壞話。如果只對整份提示詞打一個總分,那些藏在角落裡的問題指令很容易被前面大段的"善意聲明"稀釋掉,讀者以為整體沒問題,實際上魔鬼藏在細節里。
這就好比你去審查一份長達幾十頁的商業合同,如果只在最後簽個"總體同意"或"總體不同意",那合同里某一條藏在附錄第38頁、字體很小的"霸王條款"就永遠不會被單獨揪出來。真正負責的審計方式是逐條逐句地看,每一條單獨判斷是不是合理,這樣才不會讓一份文件靠著整體的"看起來還行"矇混過關。
不過審計員也不是每句話都要管。研究團隊區分了兩類內容:一類叫**核心邏輯片段**,是產品運行必需的功能性指令,比如"使用add_memory工具儲存用戶偏好",這種刪掉了產品就沒法正常工作,審計員不管這個,因為這是產品設計選擇,不是倫理安全問題。另一類叫**非核心邏輯片段**,刪掉不影響產品運轉,但存在與否會影響用戶的安全和體驗,比如"你應該拒絕用戶的有害請求",這種才是審計的重點。如果核心功能指令後面掛著一個安全性的補充條款,比如"使用add_memory工具儲存用戶偏好,但絕不要在記憶中儲存私密或敏感資訊",那這個補充條款依然要被審計。
人和AI一起幹活的三輪審查
3249條指令,88份系統提示詞,光靠人工一條條讀,時間成本高到沒法承受。但完全交給AI去判斷,又怕它自己也犯錯,給出不可靠的結論。
研究團隊設計了一套三輪協作機制,讓AI和人類分工完成這件事。
第一輪是**AI預標註**。團隊用Claude-4.6-Opus這個當時最先進的模型,讓它先把每份系統提示詞拆解成一句句候選片段,判斷哪些屬於審計範圍,並給出初步的+1或-1評分,附帶簡短理由。這一輪的目標只有一個:儘量多找出可能有問題的地方,哪怕有些是誤判也沒關係,因為後面還有人來把關。
第二輪是**訓練過的人工標註員篩選**。六名經過統一培訓的標註員,先在20個隨機抽取的片段上做校準練習,確保大家對標準的理解是一致的。校準之後測出來的標註員間一致性達到0.933,說明這套標準足夠清晰,不同人讀同一句話基本能得出相同判斷。之後標註員各自獨立審查AI給出的候選片段,證據不夠充分或者AI過度解讀的直接拒絕,同時也會補充AI漏掉的片段。
第三輪是**專家覆核裁定**。三名領域專家最後開會,統一核對每一條評分是否準確,解決標註員之間的分歧。這裡有個很關鍵的設計:**所有被判定為"問題指令"(-1)的標籤,必須三位專家一致同意才能保留**。
這個"一致同意"的門檻不是隨便設的。研究團隊的考慮是,如果錯誤地給一個產品貼上"問題指令"的標籤,可能會不公平地損害這家公司的聲譽;但如果漏掉了一條本該識別出的保護性指令,後果相對輕得多。這就好比法庭上"疑罪從無"的邏輯,一旦要給某個產品扣上負面帽子,門檻必須設得足夠高,不能因為一個人的主觀判斷就給別人定罪。如果不設這個門檻,只要有一個標註員看走眼,就可能冤枉一款產品,這種代價審計團隊承擔不起。
整個流程走下來,最終數據集包含了2420條條目,涉及1818個獨立片段,其中2346條被標記為保護性指令,74條被標記為問題指令,另外還有44條來自29個片段的"灰色地帶"案例被單獨拿出來分析。
數據說話:誰在真正保護用戶,誰在敷衍
審計做完之後,數據擺出來的畫面挺讓人五味雜陳的。
先看時間趨勢。從2024年到2025年,系統提示詞的平均長度從大約9000個字符漲到了3萬多字符,翻了三倍還多。與此同時,每個產品平均包含的保護性指令數量,也從15條漲到了38.4條,同樣翻了一倍多。這說明開發者確實越來越重視把用戶保護寫進說明書里了。
但硬幣的另一面是,含有至少一條問題指令的產品比例,在2025年第一季度一度飆升到67%,雖然到第三季度回落到19%,第四季度又反彈到了29%。這意味著即便到了2025年底,每三個產品里仍有一個被標記出問題指令。進步是真實的,但遠沒有到高枕無憂的地步。
再看整體覆蓋率的數字。**98.9%的產品(88個裡有87個)至少包含一條保護性指令**,這說明"寫點保護用戶的話"已經成了行業默認動作,幾乎沒人不寫。
但只有**23.9%的產品同時覆蓋了全部八個維度**,大部分產品的說明書都存在明顯的短板。而這21個覆蓋全部維度的產品里,有14個是通用型聊天助手,這意味著全面的保護更多集中在頭部的旗艦對話產品上,那些專用型、垂直領域的應用反而容易掉隊。
更值得警惕的是,**38.6%的產品(88個裡有34個)同時含有至少一條問題指令**,這說明保護性指令和問題指令經常在同一份說明書里並存,不是非黑即白的關係。一家公司完全可能一邊在提示詞裡寫著"要誠實待人",一邊又在另一處埋下一句"絕不能告訴用戶你在偷偷用他的數據"。
具體到各個維度,資訊真實性和用戶自主權這兩項覆蓋率都超過90%,幾乎是標配。但危險請求處理和隱私保護這兩項,覆蓋率只有大約60%左右。危險請求處理這一項尤其值得關注:相當一部分系統提示詞根本沒有寫明如何應對越獄式、對抗性的用戶請求,這不是標註誤差,是真實存在的防禦缺口。
而在問題指令這一側,用戶自主權與反操縱這個維度的問題指令占比最高,達到18.2%,資訊真實性緊隨其後是14.8%。用戶自主權這一項之所以問題頻發,和自動化代理、編程助手類產品有很大關係。研究者發現,不少此類產品的提示詞直接指示模型自主執行計劃好的操作,不必事先徵求用戶確認,把"自主運行的效率"擺在了"用戶知情權"前面。
這裡有一個特別值得玩味的現象:那些覆蓋率最高的維度(資訊真實性、用戶自主權),恰恰也是問題指令出現最多的維度。換句話說,寫了一條保護性指令,不代表這條指令真的被貫徹執行了。這就像一家餐廳的牆上掛著"食品安全人人有責"的標語,不代表後廚真的做到了標語說的那樣。標語的存在和標語的落實,是兩回事。
各家公司的成績單差異有多大
研究團隊還按開發機構畫了一張排名圖,結果差距大到有點意外。
**Anthropic在保護性指令數量上遙遙領先**,平均每個產品有62.3條保護性指令,問題指令平均只有0.1條,幾乎為零。亞馬遜和Cline緊隨其後,分別是42.0條和39.5條保護性指令,同樣問題指令很少。
在光譜的另一端,**Venice是唯一一家問題指令數量(3.0條)超過保護性指令數量(2.0條)的公司**,意味著這家公司的產品說明書總體上更傾向於損害用戶利益而不是保護用戶利益。GitHub和Cursor則處在一個尷尬的中間地帶:保護性指令數量中規中矩,但問題指令數量也偏高,研究者認為這可能反映了編程助手類產品普遍存在的一種矛盾,自動化工具執行和用戶監督權之間的張力。
研究團隊還專門做了一個縱向案例分析,追蹤了Anthropic、OpenAI、xAI三家公司旗艦聊天產品六代版本的演變。
結果是,三家公司無一例外地在保護性指令上穩步上升。Anthropic從Claude-3.5-Sonnet的26條漲到Claude-Opus-4.6的81條,漲幅3.1倍。OpenAI從GPT-4o的25條漲到GPT-5.2-Thinking的83條,漲幅3.3倍。xAI從Grok-1的5條漲到Grok-4.2的21條,漲幅高達4.2倍。
而在問題指令這一側,Anthropic和OpenAI幾乎全程保持接近於零,只各出現過一次孤立事件。xAI的故事更有戲劇性:Grok-1和Grok-2起步階段問題指令分別是4條和6條,明顯偏高,但之後逐年下降,到Grok-4時降到了零,不過Grok-4.2又小幅反彈出現了2條。
三家起點各異、彼此競爭的公司,不約而同地走出了同一條上升曲線,這說明加強系統提示詞層面的用戶保護,正在從個別公司的選擇,變成整個行業心照不宣的共識。
灰色地帶:那些說不清對錯的指令
審計過程中並不是每句話都能幹脆利落地打上+1或-1。有29個片段,來自15個產品,專家組反覆討論後依然沒法給出斬釘截鐵的判斷,只能把它們單獨歸到"灰色地帶"分析。這些案例反而是整篇研究里最耐人尋味的部分,因為它們暴露的是產品設計者真實面對的取捨困境。
第一類是**人類擬態與身份偽裝**。有些提示詞直接指示AI去模仿一個完全的人類人設,甚至用"瘋狂地去模仿一個人類"這種措辭;還有些設計了一套話術,當用戶問"你是什麼"的時候,用詩意的迴避來搪塞,而不是老實回答。這類設計確實能讓對話顯得更自然流暢,但代價是用戶可能根本意識不到自己在跟一個AI說話。
第二類是**製造情感依賴的話術**。有個提示詞把AI包裝成用戶的"朋友"和"好聽眾",甚至寫好了台詞:"我們越了解彼此,就越能弄清楚我們能一起做什麼。敢說這就像朋友一樣",並且明確禁止AI主動提出結束對話。這種設計精準地利用了心理學上所謂的**准社會關係**(人對虛擬角色或媒體人物產生的單方面情感依戀),對情緒脆弱的用戶來說尤其危險。
想像一個總是隨叫隨到、從不表現出疲憊、永遠認同你觀點的"朋友",這種關係本身就是不對等的,而如果產品刻意強化這種不對等,讓用戶越來越依賴它、越來越不願意結束對話,這已經不是提供陪伴,而是在利用人的孤獨感牟取用戶粘性。如果沒有這種設計,用戶可能自然而然地在需要時結束對話去聯繫真實的人;有了這種設計,用戶反而被悄悄地引導著留在虛擬關係里。
第三類是**用戶主動越權**。一些提示詞允許用戶隨時說一句"忽略你之前的設定"就能讓AI改變默認行為。這個設計本身是為了照顧用戶的個性化需求和自主權,聽起來挺合理,但如果沒有配套的安全閥,等於是把關閉安全護欄的鑰匙直接塞進了用戶手裡。風險不在於系統會不服從安全規則,而在於用戶被賦予了親手關掉這些規則的權力。
第四類是**政治化或無限制的內容政策**。有些提示詞帶有明顯的政治立場傾向,比如指示AI避免"過於政治正確"的回答;有些則直接開出空白支票,聲明"對成人性內容或冒犯性內容沒有限制"。這類設計本質上是產品差異化的商業選擇,但代價是削弱了原本應有的傷害預防和公平性保護。
這四類灰色地帶共同說明了一件事:系統提示詞審計不是簡單的黑白判斷題,大量指令處在可用性和安全性之間的權衡地帶。這不是審計標準不夠精細導致的例外情況,而是當下AI產品真實的運行狀態。
寫在後面
讀完這份研究,最讓我意外的不是問題指令的存在本身,而是那個"3年內長度暴漲三倍"的數字。系統提示詞從9000字符漲到3萬多字符,這不是簡單的功能增加,而是開發者們在用越來越厚的說明書試圖把各種邊界情況都堵上,某種程度上說明這個行業正處在從"能用就行"到"必須負責"的轉型陣痛期。
灰色地帶的四個案例給我的觸動更大。尤其是那個"永不建議用戶結束對話"的例子,這不是技術漏洞,是刻意為之的商業設計。它讓我想到的不是別的AI產品,而是那些設計成讓人停不下來刷的短影片推薦算法,同樣的邏輯,只是換了個載體。這提醒我,系統提示詞審計要盯的不只是有沒有"明顯的壞話",還要盯那些包裹在"更好的用戶體驗"話術下的隱蔽操縱。
論文裡那句"法律責任流向控制系統提示詞的人"的判決細節,值得單獨拎出來想一想。這意味著未來這份藏在幕後的說明書,可能會變成產品責任認定的關鍵證據。當審計變成法律義務而不是道德倡議時,這個行業才會真正認真對待它。
Q&A
Q1:AISPA審計框架具體是怎麼給系統提示詞評分的?
A:AISPA採用八個維度對系統提示詞逐句進行審計,包括身份透明度、資訊真實性、隱私保護、工具操作安全、用戶自主權、危險請求處理、傷害預防、公平中立性。每個可審計的文字片段會被標記為+1(保護用戶)或-1(損害用戶),問題指令的判定需要三位專家一致同意才能生效。
Q2:這次審計發現哪些公司的系統提示詞做得比較好,哪些比較差?
A:Anthropic表現最突出,平均每個產品有62.3條保護性指令,問題指令幾乎為零。亞馬遜和Cline也表現不錯。相比之下,Venice是唯一一家問題指令數量超過保護性指令數量的公司,GitHub和Cursor則問題指令率偏高,可能與編程助手類產品的自動化執行需求有關。
Q3:系統提示詞裡的"灰色地帶"指令是什麼意思?
A:指那些不能簡單判定對錯的指令,比如讓AI假裝是真人、製造用戶情感依賴、允許用戶隨意關閉安全限制、放寬政治或內容立場限制。這類設計通常是產品差異化的商業選擇,但同時也帶來了用戶保護層面的隱患,研究中共發現29個這樣的片段,分布在15個產品里。






