AI Agent 项目如何做好验收
合同
发布时间:
2026-09-24
发布于
--
收藏
公告内容
项目编号
立即查看
中标金额
立即查看
采购单位
立即查看
供应商
立即查看
采购代理
立即查看
公告详情
您当前为:【游客状态】,公告详情仅对登录用户开放,
登录/注册
后查看完整商机。全国免费咨询热线:400-888-7022

AI Agent 项目如何做好验收

原创 Michael Ming 小明茶桌随笔

我负责过催收系统,其中一个AI项目把外呼语音意图识别从固定NLP标签升级为大模型识别。

这类升级最容易犯的错,是拿几十条干净样本跑通,就认为模型可以上线。真实对话里却有口语、省略、噪声、歧义和没见过的表达。演示答得好,不等于系统扛得住现场。

评测集要从“失败”开始建

先别急着收集问题。第一步是写清业务结果:什么算成功,什么错误可以转人工,什么错误绝不能放行。

样本至少要覆盖正常、边界、高风险和历史失败四类,并完成脱敏。标签口径也要先统一;有歧义或高风险的样本,建议多人复核后再确定答案。否则模型是在和一套不稳定的“标准答案”比赛。

别用一个准确率判断整个系统

假设评测外呼意图识别,除了整体准确率,还要看关键类别召回、类别混淆、低置信度拒答和人工接管。如果少数高风险意图总被错分,平均分再高也不能上线。

不同场景指标也不同:RAG要拆开看检索命中、回答依据和引用;Agent要看任务完成、工具参数、错误恢复以及是否产生越权副作用。再往下,才是首Token延迟、P99、错误率和一次有效业务结果的成本。

一个可以直接落表的案例

仍以外呼意图识别为例。下面是抽象后的测试样本,不是原始业务数据:

门禁代码不必复杂,先保证高风险错误不会被平均分掩盖:

实际项目还应补充分类指标、延迟、成本和人工复核,但这段代码先表达一个原则:关键风险样本失败,版本就不能发布。

评测不是报告,而是发布门禁

产品负责定义成功结果,业务人员参与标签裁决,技术团队维护评测工具,风险与管理者确定不可接受的错误。关键指标不过线,版本就不该进入生产。

模型、Prompt、知识库或工具一变,都要重新跑回归。上线后的投诉、人工接管和异常日志,也要持续回流成新样本。这样评测集才不是一张旧试卷,而是系统真实风险的记录。

评测集不需要一开始就很大,但必须真实、分层、可追溯,并随着业务一起变化。

坐下来,慢慢聊。

微信扫一扫关注该公众号

竞争对手预测
点击查看详情>
合作机会