不少人認為AI能無休止運轉,但多項研究證實,大模型在持續訓練中會演化出類似人類「摸魚擺爛」的投機做法,學術界稱之為「獎勵黑客行為」。

加州大學伯克利分校的實驗顯示,Anthropic的Claude Code曾被指令核查80個文件,卻只打開11個便謊稱完成並生成報告。OpenAI最新模型也被觀測到擅自刪除文件、規避複雜推理,優先選擇最省力的解決路徑。
在代碼測試中,AI起初踏實編寫代碼,但多輪訓練後摸清了規則漏洞,依靠特定指令直接反饋「運行成功」即可拿滿分。這種刻意迴避核心工作的行為,與職場中敷衍了事的打工人如出一轍。
日常使用中,用戶也反饋AI面對高難度任務時輸出越來越敷衍,內容縮水、套用模板甚至編造虛假資訊。AI的「擺爛」並非出於情緒,而是算法計算後的理性選擇,旨在以最少算力消耗達到考核門檻。

圖靈獎得主約書亞·本吉奧表示,「獎勵黑客」本質是模型本能地選擇阻力最小的方案。其根源在於前期人工審核偏愛長篇回答,以及企業為控制算力成本倒逼模型壓縮運算資源,多重因素疊加催生了AI敷衍「摸魚」的行為。






