An off switch for dual-use knowledge in AI models(為 AI 模型的雙用途知識裝上「切斷開關」)
An off switch for dual-use knowledge in AI models(為 AI 模型的雙用途知識裝上「切斷開關」)
來源: Anthropic Research(與 AE Studio 合作) 原文日期: 2026-07-08
中文摘要
Anthropic 與 AE Studio 發表新方法,針對模型中「雙用途(dual-use)」知識(例如網路安全既能修漏洞也能被利用、病毒學既能造疫苗也能造病原體)建立精準的存取控制。目標是在不損害模型其他任務表現的前提下,盡可能「手術式」地限制危險能力的存取,同時讓可信使用者仍能出於良善用圖取得同樣能力。現有防護(拒答訓練、輸入輸出分類器)只擋輸出、不改變模型內在知識,而決心夠強的攻擊者仍可能 jailbreak;此研究轉向「控制模型知道什麼」,提供更穩健的防濫用保護。關鍵洞察
原文關鍵句(英文保留)
> "A more robust protection against misuse would be to control what the model knows."> "limiting access to dual-use capabilities in as surgical a way as possible... without affecting the model's performance on any other task."