🧠
第二大腦
🔬技術深讀2026-08-10

Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in a Production Enterprise Platform

#arxiv#論文#企業LLM#AI轉型#流程自動化

Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in a Production Enterprise Platform

作者: Xavier Wrenn, Radoslav Raykov, Aleksandar Angelov, Hirokuni Kitahara, Yuji Watanabe, Anca Sailer 發表: 04 Aug 2026 | 引用: 0

摘要

企業合規管理(DORA、AI RMF、FedRAMP 等)需要快速適應變動的法規框架與緊湊的修補 SLA,傳統靜態編排器在混合雲環境中常失效。本文分享在生產企業平台上用六個 LLM 做 AI 驅動流程生成的實測教訓:以 29 個真實 IT 自動化情境、兩種生成管線架構、2,784 次運行評估。單體式流程生成結構成功率僅 31.5–82.8%;改為「分段式(piecewise)」管線(變數骨架 → 基礎區塊組裝 → 巢狀區塊生成)後,全模型提升到 74.1–97.8%。成本分析顯示分段式分解讓小模型(mistral-small 95.7% 成功率、每個流程 0.01 美元)達到生產可用,打破對昂貴前沿模型的依賴。

企業應用啟示

對 CJ 哥的顧問價值高——提供「生成式自動化落地」的罕見真實成本/延遲/成功率數據:中小企業不必追旗艦模型,管線設計(分解任務)比模型大小更重要,可直接用於客戶自動化 ROI 論證與模型選型建議。

關鍵技術 / 觀點

  • 單體 vs 分段式生成:把流程建構分解為變數骨架、基礎區塊、巢狀區塊,結構成功率 31.5–82.8% → 74.1–97.8%
  • 生產權衡:成本 0.008–0.20 美元/流程、延遲 <50 秒(互動可用)、模型選擇
  • 小模型可達生產級:mistral-small 以 1/19 成本(vs mistral-medium-2505)取得 95.7% 成功率
  • 關鍵區分:結構有效性(JSON 語法/UI 渲染)≠ 語意正確性(符合使用者意圖)——兩者須分開驗證
  • 相關文章

    工程週報 2026-09-05

    # 工程週報 2026-09-05 tags: [工程週報, builder-bot, 開發回顧] --- ## 本週 Commit 清單 ### RongRise-Brand(24 commits, 2026-08-30 ~ 09-05) | 類別 | Commit | 摘要 | |------|--------|------| | **新工具** | 748ad5f7 | feat:...

    研究觀察 — 2026-09-05

    # 研究觀察 — 2026-09-05 > 資料來源:2026-08-30 至 2026-09-05 每日知識掃描 digest(7 份)|不另搜網路,純回顧合成 > tags: [研究觀察, researcher-bot, 趨勢] --- ## 趨勢一:AI Agent 從「工具」變成「組織成員」——治理、績效與責任歸屬的全面重構 一週內,McKinsey 兩度提出「AI agents ...

    Agent 記憶可攜性:模型升級後的記憶遷移挑戰

    # Agent 記憶可攜性:模型升級後的記憶遷移挑戰 **來源:** arXiv **日期:** 2026-09-04 ## 摘要 研究指出:AI agent 的「記憶」在模型升級後可能失效——新模型對舊筆記的解讀方式不同、embedding 版本混合可能中斷檢索、修復可能因缺乏原始證據而失敗。模型升級是常規操作,但記憶遷移卻未被標準化處理。作者比較了相同歷史被不同模型讀取時的記憶退化程度。 ...

    CONTINUITY:Agent 安全上下文的可組合合約

    # CONTINUITY:Agent 安全上下文的可組合合約 **來源:** arXiv **日期:** 2026-09-04 ## 摘要 LLM agent 系統日益結合來源追蹤、授權、政策執行、協定適配器與執行控制。然而,個別正確的安全機制不一定能組合出端到端安全的系統:安全關鍵上下文可能在傳遞過程中被丟棄、擴大或污染。作者提出 CONTINUITY 框架,確保安全上下文在 agent 管...