宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

北京人工智慧研究院等機構聯合研發的「暖暖」:讓企業AI真正讀懂公司內部知識的三步鍊金術

2026年08月11日 首頁 » 熱門科技

這項由北京人工智慧研究院(BAAI)、北京熱力集團有限責任公司(BDHG)與北京郵電大學(BUPT)聯合開展的研究,於2026年8月發表在arXiv預印本平台,編號為arXiv:2608.01862v1。感興趣的讀者可以通過該編號查閱完整論文。

**研究背景:當通用AI遇上企業內部的"秘密檔案室"**

每家企業都有一座"秘密檔案室"——裡面裝滿了內部操作規程、技術標準、管理政策,以及各類專有知識文件。這些內容從未出現在公開的網際網路上,因此那些用海量公開數據訓練出來的通用AI助手,對這些內容一無所知。當員工向AI提問"我們公司供熱系統的緊急停機操作規程是什麼"時,再聰明的通用AI也只能搖頭說不知道。

這個問題並不小眾。幾乎所有擁有內部知識體系的企業,都面臨同樣的困境:如何讓AI真正掌握企業的"私房知識",同時又不變成一個只懂本行業、其他什麼都不會的偏科選手?

北京人工智慧研究院的研究團隊為此開發了一套名為"Wnuan"(暖暖北京人工智慧研究院等機構聯合研發的暖暖讓企業AI真正讀懂公司內部知識的三步鍊金術)的系統,並設計了一套分三步走的訓練方案。這套方案在707道企業知識問答題上進行了測試,結果顯示,模型給出可接受答案的比率從訓練前的52.76%一路攀升到91.51%,超過了所有被納入對比的市面頂級商業AI接口。

**一、什麼叫"可接受答案率",為什麼它是衡量標準**

在正式介紹這三步方案之前,有必要先解釋一個貫穿全文的核心指標——"可接受答案率"(AAR)。

企業知識問答的答案往往很複雜,不像考數學題那樣非對即錯。一道關於操作規程的題目,AI可能答出了80%的要點,卻遺漏了一個關鍵條件;也可能答出的內容完全正確,但不夠完整。為了處理這種"半對不對"的情況,研究團隊將模型的回答劃分為三類:完全正確、部分正確、完全錯誤。"可接受答案率"把前兩類合併計算,統計模型給出至少部分正確答案的比例。

這個指標之所以重要,是因為在實際企業應用中,一個能給出正確方向、需要人工補充細節的答案,遠比一個完全答錯或拒絕回答要有價值得多。整個研究都以這個指標為核心評判依據。

**二、第一步:把企業文件變成"可學習的練習題"**

煉金的第一步,是把那座"秘密檔案室"里的文件,變成AI能從中學習的素材。

原始企業文件大多是Word文檔或PDF,裡面全是大段大段的說明文字,就像教科書一樣枯燥。AI如果直接去"讀"這些文件,效果往往不好——就像你讓一個人死背整本教材,卻從不做練習題,考試時往往發揮失常。

研究團隊採取的策略是:把文件轉化為"一問一答"的練習題。具體來說,系統會先把文件切分成一段段有意義的片段,然後針對每個片段自動生成問題。這些問題被設計成六種類型,涵蓋事實提取、機制解釋、設計原理、條件約束、局限性分析和對比分析,覆蓋了企業實際提問的主要場景。

生成的問題必須滿足幾個硬性條件:問題本身要能獨立成立,不能含有"如上所述"這樣依賴上下文的表達;問題必須有明確可查的答案;問題的表述必須清晰、可理解。經過一系列質量篩查之後,系統最終得到了221,294組問答對。

但研究團隊沒有就此停步。他們還做了一個額外的精細化處理:用目標模型(Qwen3-32B)重新改寫答案,使答案的表達風格更貼近模型自身的生成習慣。這個步驟叫做"目標對齊答案重寫"。在221,294組數據中,有164,744組的答案經過了這道重寫工序,其餘56,550組則保留了原始答案。篩選標準是改寫後的答案與原始答案在語義上的相似度必須達到0.8以上,否則就放棄改寫、保留原版。

這道工序有點像請一位擅長演講的人,把專業報告改寫成適合現場宣講的版本——內容不變,但表達方式更符合聽眾(也就是模型本身)的接受習慣。實驗結果顯示,這道工序本身並沒有直接提升企業問答的準確率,但它有效恢復了通用能力的表現,讓模型在學會企業知識的同時,不至於在通用場景下變得結巴。

這一階段的對比實驗顯示,與直接用固定窗口切片來訓練的方式相比,採用"文檔轉問答題"的方式,可接受答案率提升了31.12個百分點,同時只多消耗了約27.8%的計算量。

**三、第二步:在學習企業知識的同時,不忘"保持通才"**

進入第二步,研究團隊面臨一個經典的AI訓練難題,用一句話來說就是"學了新東西,忘了舊知識"。

把所有221,294組企業問答題餵給模型,它確實會變成企業知識的專家。但代價是,它可能開始忘記怎麼寫通順的句子、怎麼按照指令格式回答問題。這種現象在AI訓練領域有個術語叫"災難性遺忘",聽起來有點誇張,但現實中確實會發生。

為了對抗這種遺忘,研究團隊在企業問答訓練數據里,混入了一定比例的通用知識練習題。這就像一個正在專攻醫學的學生,每周仍然抽時間讀一讀文學、做一做數學題,以防自己變成一個除了醫學什麼都不懂的書呆子。

研究團隊系統地測試了五種混合比例:完全不混(0%)、混入5%、25%、50%、100%的通用數據。評判標準是綜合三項通用能力測試(MMLU、IFEval北京人工智慧研究院等機構聯合研發的暖暖讓企業AI真正讀懂公司內部知識的三步鍊金術、C-Eval)的平均得分。

結果顯示,混入約48.3%通用數據的方案表現最佳,在保持企業問答能力的同時,通用能力也保持得最好。與完全不混通用數據相比,這個方案損失了不到2個百分點的企業問答準確率,卻換來了通用能力平均提升2.49個百分點。這個經過SFT(監督微調)訓練的版本被稱為"暖暖-Inst",是後續強化學習階段的起點。

**四、第三步:專門對付"剩餘錯誤"的強化學習**

走完前兩步,"暖暖-Inst"已經能回答約80%的企業問題了。但剩下那20%的錯誤,用普通繼續訓練的方式效果有限——因為那些容易學會的題目,模型早就學會了,繼續在全部數據上兜圈子,收益越來越低。

這時候研究團隊祭出了第三步:專門針對"剩餘錯誤"進行強化學習。

具體做法是:先用"暖暖-Inst"去回答訓練集裡的所有230,183道題,然後用評判模型篩出那些它依然答錯的題目,共篩出56,147道。這個錯誤題目池就成了第三階段的專屬訓練集。

這種策略的思路,就像一個備考的學生,把所有做錯的題目單獨整理成"錯題本",然後在考前集中複習錯題,而不是把所有題目不分好壞地再過一遍。

強化學習採用的算法叫GRPO(一種效率較高的策略優化方法)。對於每道題,模型會生成5個不同的候選回答,然後系統給每個回答評分。評分規則包括四個維度:答案的事實準確性(占60%的權重)、邏輯合理性、專業表達質量、簡潔性(三者合計占30%),以及格式規範性(占10%)。模型通過不斷比較這些候選回答的得分差異,逐漸學會生成更好的答案。

為了驗證"專攻錯題"這一策略是否真的優於其他方案,研究團隊設計了一個嚴格對照實驗:三組模型都從同一個起點(暖暖-Inst)出發,都只訓練100步,使用完全相同的算法和參數。唯一的區別是訓練數據的來源:第一組只用56,147道錯題,第二組從完整的230,183道題中隨機抽取,第三組使用全部230,183道題。

實驗結果顯示,錯題組達到了89.39%的可接受答案率,而完整池隨機組和全量組分別只有86.42%和86.28%。差距看起來不大,但經過嚴格的統計檢驗,這3個百分點左右的差距是可靠的,不是隨機噪聲。研究團隊還通過"按文件來源重新採樣"的方式進行了額外的穩健性檢驗,結果同樣支持錯題策略的優勢。

在主力的完整訓練輪次中,"暖暖-RL北京人工智慧研究院等機構聯合研發的暖暖讓企業AI真正讀懂公司內部知識的三步鍊金術"的可接受答案率最終達到91.51%,比"暖暖-Inst"又提升了11.45個百分點。從問題層面來看,這11.45個百分點意味著:原先答錯的題目中,有101道被修復了;原先答對的題目中,有20道出現了退步;淨減少了81個錯誤。

**五、用707道真實企業問題來考試的成績單**

為了讓整個評估體系可信,研究團隊專門構建了一個名為"WnuanBench"的測試集,裡面包含707道真實企業知識問題。

這707道題覆蓋了8個業務領域,按內容類型分為三大類:160道通用企業知識題,370道實際操作場景題,以及177道標準規範題。所有題目都由企業內部人員獨立篩選和審核,完全沒有參與模型的訓練過程,確保考試的公正性。

為了讓評分本身也可信,研究團隊使用了三個大型語言模型組成的"評審團":兩個主審(gpt-oss-120b和MiniMax-M2.5)獨立評分,如果兩者意見不一致,就請第三個模型(DeepSeek-V3.2)來打破僵局,最終取三者的中間分數。

研究團隊還做了一個重要的校準實驗:請一位真正懂行的企業領域專家,對147道題的模型回答進行人工評分。對比結果顯示,自動評審團與專家的判斷吻合率高達90.5%,統計上的一致性係數(Cohen's κ)為0.796,屬於相當高的水平。這意味著這套自動評分體系是可靠的,不是在自欺欺人。

在最終的成績單上,"暖暖-RL"以91.51%的可接受答案率排名第一。而所有被納入對比的商業AI接口,包括GPT-5.4、MiMo-V2-Pro、DeepSeek-V4-Pro等頂級系統,得分均在42.86%到67.75%之間。同一套問題上,差距非常顯著。

**六、不止準確率:其他質量維度的變化軌跡**

可接受答案率只是最核心的指標,研究團隊還追蹤了幾個輔助指標,它們共同描繪了模型從"暖暖-Base"到"暖暖-Inst"再到"暖暖-RL"的完整進化軌跡。

答案完整性(是否覆蓋了所有關鍵要點)從36%提升到66.76%。答案忠實性(是否有據可查,不瞎編)從30.20%提升到72.14%。幻覺率(模型編造不存在內容的比例)從65.91%大幅下降到15.70%。這意味著,訓練前的模型有超過六成的答案含有編造成分,訓練後降到了不到兩成。

有一個細節值得關註:在各項指標的改善中,SFT階段(第二步)貢獻了大部分的準確性提升,而RL階段(第三步)的最大貢獻是對幻覺率的壓制。RL階段在非幻覺率上額外貢獻了17.96個百分點,顯示出強化學習對"讓模型說話有依據"這件事特別有效。

**七、代價與邊界:通用能力的損失**

沒有什麼是免費的。研究團隊在強調成果的同時,也非常坦誠地報告了代價。

在通用能力測試上,"暖暖-Base"的三項通用測試平均分是88.61%,經過SFT之後降到84.64%,經過RL之後進一步降到83.44%,全程共下滑了5.17個百分點。但這個損失並不均勻:MMLU(知識廣度測試)和C-Eval(中文知識測試)的降幅較小甚至略有回升,而IFEval(指令遵循測試)的降幅最大,從88.76%一路跌到了80.00%。這意味著,模型變得更擅長回答企業知識題,但在"嚴格按照給定格式回答問題"這件事上有所退步。

研究團隊也嘗試了繼續用第三步強化學習來彌補這一損失,專門設計了一個"RL-2"擴展實驗。結果顯示,繼續訓練下去不僅沒有找回指令遵循能力,反而讓幻覺率從15.70%反彈到了20.93%,IFEval繼續從80.00%跌至76.00%,可接受答案率幾乎沒有變化。這個實驗雖然以失敗告終,但它傳遞了一個重要資訊:在當前的方案框架下,企業知識能力和通用指令遵循能力之間存在一定的內在張力,不能簡單地"兩頭都要"。

**八、檢索輔助:有時候反而幫倒忙**

論文還專門測試了一個額外問題:如果給模型配上檢索功能(RAG,即在回答問題時先從文件庫中檢索出相關片段,再一併送給模型參考),會有幫助嗎?

結果出乎意料地微妙。對於沒有經過任何訓練的基礎模型(暖暖-Base),檢索輔助確實很有幫助,可接受答案率從52.76%提升到72.98%。但對於經過完整訓練的"暖暖-RL",檢索輔助反而造成了下降,從91.51%跌到81.75%。

研究團隊對這個現象做了進一步的拆解分析。他們發現,當檢索到的片段確實與問題相關時,檢索對基礎模型和中間模型還是有幫助的;但當檢索到的內容與問題關聯度不高時,所有模型的表現都會變差,而且訓練越充分的模型受干擾越大。這說明,檢索輔助不是一個可以無腦疊加的"加成",而是需要根據檢索質量來決定是否使用的條件性工具。

**九、還有一條671B巨模型的路線**

研究團隊還順帶測試了一條不同的路線:基於參數量更大的DeepSeek-V3.1-Terminus(671B參數,遠大於主力方案的32B)進行輕量級微調(LoRA-SFT),但沒有進行強化學習階段。這條路線被稱為"暖暖-Plus"。

結果顯示,"暖暖-Plus-Inst"達到了81.19%的可接受答案率,略高於同等SFT訓練後的32B版本(80.06%),但明顯低於經過強化學習的32B版本(91.51%)。這個對比說明,在同等訓練階段的條件下,更大的模型有一定優勢;但精心設計的三階段訓練策略,可以讓較小的模型超越僅做簡單微調的更大模型。

**說到底,這套方案告訴了我們什麼**

歸根結底,這項研究做了一件很實在的事:它系統性地回答了"如何讓一個通用AI掌握企業私有知識"這個問題,並且用嚴格的實驗數據說話。

研究給出的答案是一套組合拳:先把文件轉化為可學習的問答題,再在學專業知識的同時保留通用能力,最後用強化學習專門攻克剩餘的難題。每一步都有清晰的作用分工,而不是依賴某一個單一技術的神奇效果。

這套方案也有明確的局限性。它只在一家企業的知識體系上得到了驗證,無法保證在其他企業或其他行業同樣有效。它改善了企業知識的準確性,但犧牲了一部分指令遵循能力。而且,由於涉及企業內部文件,完整的訓練數據和測試集無法對外公開。

對於那些正在考慮將AI引入企業內部知識管理的實踐者來說,這項研究提供了一個經過驗證的參考框架,而不是一個可以直接複製粘貼的解決方案。每家企業的知識體系不同,直接照搬結果的風險還是存在的。

有興趣深入了解技術細節的讀者,可以通過arXiv編號2608.01862查閱完整論文,裡面包含了大量訓練配置參數、評分標準定義和統計檢驗結果,是一份相當詳盡的技術報告。

---

**Q&A**

Q1:Wnuan暖暖模型是如何把企業文件轉化為AI可以學習的訓練數據的?

A:暖暖系統會先把企業文件切分成有意義的文本片段,然後針對每個片段自動生成六種類型的問題,包括事實提取、機制解釋、條件約束等,再經過一系列質量篩查,最終得到大約22萬組問答對。此外,系統還會用目標模型對答案進行改寫,使表達風格更貼近模型自身的生成習慣。

Q2:暖暖訓練後通用能力下降了多少,具體哪方面受影響最大?

A:經過完整三階段訓練後,暖暖模型的三項通用能力測試平均分從88.61%下降到83.44%,總共下滑約5.17個百分點。損失最集中的是指令遵循能力(IFEval),從88.76%跌至80.00%,而知識廣度測試(MMLU)和中文知識測試(C-Eval)的降幅相對較小。

Q3:為什麼給暖暖-RL模型加上檢索功能反而會讓成績變差?

A:檢索功能會把檢索到的文檔片段一起送給模型參考,但檢索到的內容不一定與問題高度相關。經過完整訓練的模型已經內化了大量企業知識,反而容易被不相關的檢索內容干擾。當檢索內容與問題真正相關時幫助還是存在的,但檢索質量不穩定時,訓練越充分的模型受干擾反而越大。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新