Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications
作者: Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang
發表: 2026-06-16
摘要
本文提出一個兩階段統一框架,解決企業級多 Agent 系統的客製化與部署挑戰。第一階段「Agentic Model Customization」結合持續預訓練、監督式微調與偏好優化,將緊湊模型適配至專業領域;第二階段「Inference Optimization」整合推測解碼(Speculative Decoding)與 FP8 量化,以最小品質損失實現成本效益的推論服務。在企業工作負載上,此框架達到 4.48 倍吞吐量加速,同時維持效能並提升長尾場景的穩健性。
企業應用啟示
對 CJ 哥輔導企業 AI 落地的實務意義:不需要超大模型,透過三階段客製化(持續預訓練+微調+偏好優化)搭配推論優化(推測解碼+FP8),就能以 1/4 成本達到企業級效能。
關鍵技術 / 觀點
兩階段框架:模型客製化 → 推論優化,分離部署流程
三階段客製化:持續預訓練 + 監督式微調 + 偏好優化(CPO)
推論加速:推測解碼 + FP8 量化 + 目標校準 = 4.48x 吞吐量提升
長尾穩健性:優化後模型在邊緣案例上反而更穩健
緊湊模型策略:不需最大模型,適配後的緊湊模型即可滿足企業需求