title: "Inference Economics of Enterprise Coding Agents: Cloud vs. On-Premise LLMs"
tags: [arxiv, 論文, 企業 AI, LLM, 推理成本, 部署策略]
source: https://arxiv.org/abs/2607.13080
date: 2026-07-20
domain: 技術深讀
type: research
status: active
updated: 2026-08-30
---# Inference Economics of Enterprise Coding Agents: Cloud vs. On-Premise LLMs
作者: Sheng-Wei Peng, Yi-Hsun Lin, Yi-Pei Lee
發表: 2026-07-13
摘要
自主程式碼代理讓工程組織面臨兩難選擇:API-based 的 Frontier 模型(強推理能力、高 token 成本)vs. 本機部署的量化開源權重模型(低邊際成本擴展、資料主權、但推理能力較弱)。本研究透過在正式產品 monorepo 上進行兩個連續 28 天的非隨機縱向案例研究,比較 API-based Claude Opus 4.7/4.8 與本機量化模型的實際成本效益。結果提供了企業在 Cloud vs. On-Premise 之間的推理經濟學決策框架。
企業應用啟示
對於正在評估 AI 代理部署策略的企業客戶,這篇論文直接量化了 Cloud API 與 On-Premise 方案的實際成本差異與效益取捨,特別是在資料主權、延遲、Token 成本、模型能力四維度的權衡,是企業 AI 基礎設施投資決策的實證參考。
關鍵技術 / 觀點
實證設計: 兩個連續 28 天週期的橫向對比,使用真實產品程式碼庫
成本維度: API Token 成本 vs. 本機推理基礎設施成本的完整經濟模型
品質取捨: 量化 Frontier vs. 量化開源模型在程式碼生成正確性、可維護性上的差異
資料主權: On-Premise 方案在資料主權和合規性上的優勢量化解讀
顧問啟示: 提供了 CIO/CTO 在選擇 AI 代理基礎設施時的具體評估框架