SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent
作者: Mingxuan Zheng, Yujin Zhou, Chuxue Cao, Boqin Yin, Yuyao Zhang, Jiapeng Sun, Shuaishuai Gong, Sirui Han, Yike Guo
發表: 07 Aug 2026 | 引用: N/A(新論文,Semantic Scholar 尚未索引)
摘要
LLM Agent 透過累積「技能」(可重用、以文字形式存在並載入脈絡的知識工件)來適應重複性任務。現有技能精煉方法缺少顯式診斷機制,且把刪除當作一般編輯操作。SkillProx 提出受近端梯度下降啟發的前向—後向框架:前向階段以閉環診斷驅動編輯、回滾退化;後向階段把技能分解為可稽核的知識單元,用 leave-one-out 效用審計估計貢獻,再以驗證門檻決定鞏固、降級或移除。實驗顯示 SkillProx 平均比最強的梯度式基線高出 3.0 個百分點。
企業應用啟示
對 CJ 哥的顧問價值中高——「技能=可累積、可稽核的知識資產」這個視角,能幫助客戶把 Agent 部署從一次性專案升級為組織知識資產管理(類似 SOP 數位化),是 Agent 時代知識管理的新論述素材。
關鍵技術 / 觀點
技能是輕量、可重用的文字工件,載入脈絡即生效,不需更新權重
閉環診斷演化:任務執行 → 失敗診斷 → 文字空間更新 → 回滾退化 → 再診斷
後向階段以 leave-one-out 效用審計,把技能拆成可稽核知識單元並分級處置
目標函數:任務損失 × 技能複雜度——追求「夠用且簡單」的技能庫,避免膨脹