Agent 記憶中毒的成本量化與內容篩選的極限
Agent 記憶中毒的成本量化與內容篩選的極限
來源: arXiv(cs.CR, cs.AI) 日期: 2026-08-21
摘要
這篇論文量化了 Agent 持久記憶的「記憶中毒」攻擊成本:錯誤陳述一旦被寫入長期記憶,會在未來相關會話中被反覆檢索,造成錯誤資訊的持久化。只用一次性生成的普通假陳述污染 LongMemEval 語料 1.2%,準確率就從 0.850 暴跌至 0.300。更關鍵的發現是:對間接提示注入召回率達 0.832 的四階段寫入時篩選管線,竟攔不下任何一個(0/360)中毒記憶——這暴露了「純內容篩選」的根本邊界:判斷真假需要文本之外的外部佐證。來源加權檢索同樣失效:出廠權重與無防禦在統計上無異(p=0.80),強權重只能靠排除不可信內容才回復效用,但當答案證據本身來自不可信來源時,證據召回歸零。作者主張改用「檢索階段的受限佔用約束」而非加法式來源懲罰。
對 CJ 哥的價值
企業導入 Agent 長期記憶時,不能只靠內容過濾或來源排名來防記憶/資料中毒——這是結構性的死路。可作為 CJ 哥談「Agent 治理」時的反面教材:真正的解法需要外部 grounding(事實查證)與檢索階段的上限約束,而非在寫入端做文字篩選。