核心判断
生成更快不能单独证明试点成功;要同时观察正确性、人工成本、业务结果和风险。
适合对象
已选定试点任务、需要制定验收口径的企业负责人
下一步行动
记录旧流程基线、样本范围、五类指标和停止条件。
先说结论
AI 试点验收要回答三件事:原来做这项工作花了什么成本,新流程实际改善了什么,以及改善是否引入了新的错误或负担。先记录旧流程,再让新旧流程按同一任务和口径比较,结论才有意义。
先定任务和观察范围
假设运营团队每周整理一次客户反馈简报,过去由员工查看工单、表格和会议纪要后写成一页摘要。这是假设情境,不是客户案例。试点目标可以写成:“在不漏掉重要问题的前提下,减少资料整理时间,让负责人仍能核对摘要。”
在开始前确定:处理哪类反馈、样本取自哪段时间、谁使用结果、谁负责核对、哪些信息不能进入工具、试点持续几轮。范围如果不断变化,前后对比会失去解释力。

五类指标分别看
| 指标 | 记录方式 | 常见误判 |
|---|---|---|
| 处理时间 | 从接收资料到可供审核的草稿,按同一口径记时 | 只算 AI 生成时间,漏掉资料准备和人工修改 |
| 正确与漏项 | 事先列出必须包含的事实和重要问题,人工逐项检查 | 把语言通顺当作事实准确 |
| 返工与复核 | 记录修改次数、复核时间、退回原因 | 把人工复核视为“系统没用”,或完全不计复核成本 |
| 业务结果 | 看下游是否真正使用、是否缩短后续处理或改善客户响应 | 用打开工具的次数代替业务收益 |
| 风险与可恢复 | 记录错误后果、停止条件和恢复办法 | 因平均表现不错就忽略少数高代价错误 |
其中哪些指标最重要,要由具体任务决定。例如对外发送报价草稿时,事实准确和人工核价的权重,通常高于生成速度。NIST 的框架强调明确业务目标、使用范围、人工监督与持续测量;表中五类指标是本文提供的实务整理,并非 NIST 发布的固定清单。来源:NIST AI RMF Core
用同一批任务比较,并记录例外
可以挑选一组有代表性的历史任务,先记录旧流程,再让试点流程处理同类任务。记录样本数量、资料条件、操作者经验以及中途改变的规则。若试点样本太少,只能说明这次观察的结果,不宜外推到全年或所有岗位。
结论不要只写“效率提升”。更有用的写法是:“在这批任务中,草稿准备时间减少;人工核对时间增加;两次重要信息遗漏均在发布前被发现。”这是一种记录格式示例,不是知客云试点结果。
试点结束时做三选一
继续:目标结果改善,错误后果可控,人员愿意使用,资料有人维护。调整:方向有用,但资料、提示、流程或人工分工需要修改。暂停:问题本身不清楚,资料无法合法稳定取得,或错误成本超过收益。
若决定扩展到其他团队,重新确认任务是否相同、知识是否共享、责任人是否到位;一个岗位的通过结果不能自动代表另一岗位。OECD 对中小企业 AI 应用的研究也讨论了技能和知识不足等采用障碍,提醒企业把持续使用能力纳入扩展判断;研究样本不代表本站目标客户的实际比例。来源:OECD 报告
如果还没确定试点任务,先看《企业 AI 应用怎么开始?从一项业务任务到限定试点》;如果卡在资料准备,看《企业做 AI,先建知识库还是先梳理业务流程?》。


