AI Agent 部署 Playbook
场景定义
为企业部署 AI Agent,用于客服、内部知识问答、销售助手、流程自动化或运营辅助。
关键前提假设
- 客户已有明确业务流程或知识来源。
- 至少有一个可度量目标,例如响应时间、人工处理量、转化率或满意度。
- 客户能提供测试数据和使用者反馈。
- 生产上线前必须经过权限、合规和安全审查。
- Agent 要影响一个真实业务决策或动作,而不只是提供聊天回答。
标准流程
- 决策澄清:确认 Agent 要影响哪个业务决策或动作。
- 数据盘点:梳理知识库、业务系统、日志、FAQ、客服记录。
- Ontology 建模:定义业务对象、关系、动作和权限边界。
- 原型构建:先做最小闭环,不追求全功能。
- 测试评估:建立黄金问题集、动作验证集和失败样本库。
- 生产部署:接入权限、审计、监控、回滚和人工兜底。
- 内部冠军训练:让客户能维护知识、评估回答、处理异常。
Palantir 案例启发
参考 01-palantir-case-study:Palantir AIP 的核心不是把 LLM 做成 ChatBI,而是通过 Ontology 和工具调用,把模型输出转成安全可审计的业务操作。
FDE 在 Agent 项目中要先问:
- 这个 Agent 要改变哪个业务决策?
- 它需要理解哪些业务对象和关系?
- 它能调用哪些工具或系统动作?
- 哪些动作必须由人审批?
- 失败时如何回滚或人工兜底?
Agent 行动门禁
不能进入生产化,如果:
- 只定义了问答范围,没有定义业务动作。
- 没有明确工具调用权限。
- 没有操作审计记录。
- 没有人工兜底。
- 没有验证 Agent 输出对业务决策的影响。
交付物清单
- Agent 原型与生产配置。
- 知识源清单。
- 黄金问题集。
- 评估指标。
- 运维 runbook。
- 内部冠军培训记录。
常见风险与避坑
| 风险 | 处理方式 |
|---|---|
| 客户想一次覆盖全部场景 | 先选高频低风险场景 |
| 知识源混乱 | 先做数据盘点和版本管理 |
| 幻觉无法解释 | 建立可追溯引用和人工兜底 |
| 权限边界模糊 | 上线前完成角色、数据、审计设计 |
| Agent 只会聊天不会行动 | 回到业务决策,定义对象、动作和工具调用 |
| 工具调用过于激进 | 增加人工审批、沙箱和回滚 |
SRMClaw 现场经验
参考 2026-08-industrial-equipment-srm-digital-employees:
- 财务、评分和风控数字由确定性引擎计算,LLM 只解释与编排。
- 多个 Agent 可以复用统一服务,但身份、租户、角色、工具和仪表盘必须分别绑定。
- 外部 Provider 只提供事实;风险等级由可审计规则生成,Provider 失败时转人工复核。
- 付费调用、业务阻断和系统回写都应成为显式门禁,未批准时默认关闭。
- 生产部署成功不等于客户采用;上线后要同时看目标租户登录、业务 API、消息和真实业务动作,并剔除 UAT 流量。
评估指标
- 有效解决率。
- 人工转接率。
- 平均响应时间。
- 用户满意度。
- 高风险回答拦截率。
- 工具调用成功率。
- 人工审批通过率。
- 业务动作完成率。