AI Agent 部署 Playbook

场景定义

为企业部署 AI Agent,用于客服、内部知识问答、销售助手、流程自动化或运营辅助。

关键前提假设

  • 客户已有明确业务流程或知识来源。
  • 至少有一个可度量目标,例如响应时间、人工处理量、转化率或满意度。
  • 客户能提供测试数据和使用者反馈。
  • 生产上线前必须经过权限、合规和安全审查。
  • Agent 要影响一个真实业务决策或动作,而不只是提供聊天回答。

标准流程

  1. 决策澄清:确认 Agent 要影响哪个业务决策或动作。
  2. 数据盘点:梳理知识库、业务系统、日志、FAQ、客服记录。
  3. Ontology 建模:定义业务对象、关系、动作和权限边界。
  4. 原型构建:先做最小闭环,不追求全功能。
  5. 测试评估:建立黄金问题集、动作验证集和失败样本库。
  6. 生产部署:接入权限、审计、监控、回滚和人工兜底。
  7. 内部冠军训练:让客户能维护知识、评估回答、处理异常。

Palantir 案例启发

参考 01-palantir-case-study:Palantir AIP 的核心不是把 LLM 做成 ChatBI,而是通过 Ontology 和工具调用,把模型输出转成安全可审计的业务操作。

FDE 在 Agent 项目中要先问:

  • 这个 Agent 要改变哪个业务决策?
  • 它需要理解哪些业务对象和关系?
  • 它能调用哪些工具或系统动作?
  • 哪些动作必须由人审批?
  • 失败时如何回滚或人工兜底?

Agent 行动门禁

不能进入生产化,如果:

  • 只定义了问答范围,没有定义业务动作。
  • 没有明确工具调用权限。
  • 没有操作审计记录。
  • 没有人工兜底。
  • 没有验证 Agent 输出对业务决策的影响。

交付物清单

  • Agent 原型与生产配置。
  • 知识源清单。
  • 黄金问题集。
  • 评估指标。
  • 运维 runbook。
  • 内部冠军培训记录。

常见风险与避坑

风险处理方式
客户想一次覆盖全部场景先选高频低风险场景
知识源混乱先做数据盘点和版本管理
幻觉无法解释建立可追溯引用和人工兜底
权限边界模糊上线前完成角色、数据、审计设计
Agent 只会聊天不会行动回到业务决策,定义对象、动作和工具调用
工具调用过于激进增加人工审批、沙箱和回滚

SRMClaw 现场经验

参考 2026-08-industrial-equipment-srm-digital-employees

  • 财务、评分和风控数字由确定性引擎计算,LLM 只解释与编排。
  • 多个 Agent 可以复用统一服务,但身份、租户、角色、工具和仪表盘必须分别绑定。
  • 外部 Provider 只提供事实;风险等级由可审计规则生成,Provider 失败时转人工复核。
  • 付费调用、业务阻断和系统回写都应成为显式门禁,未批准时默认关闭。
  • 生产部署成功不等于客户采用;上线后要同时看目标租户登录、业务 API、消息和真实业务动作,并剔除 UAT 流量。

评估指标

  • 有效解决率。
  • 人工转接率。
  • 平均响应时间。
  • 用户满意度。
  • 高风险回答拦截率。
  • 工具调用成功率。
  • 人工审批通过率。
  • 业务动作完成率。

相关链接