收藏
原创 Michael Ming 小明茶桌随笔
我负责过催收系统,其中一个AI项目把外呼语音意图识别从固定NLP标签升级为大模型识别。
这类升级最容易犯的错,是拿几十条干净样本跑通,就认为模型可以上线。真实对话里却有口语、省略、噪声、歧义和没见过的表达。演示答得好,不等于系统扛得住现场。
评测集要从“失败”开始建
先别急着收集问题。第一步是写清业务结果:什么算成功,什么错误可以转人工,什么错误绝不能放行。
样本至少要覆盖正常、边界、高风险和历史失败四类,并完成脱敏。标签口径也要先统一;有歧义或高风险的样本,建议多人复核后再确定答案。否则模型是在和一套不稳定的“标准答案”比赛。
别用一个准确率判断整个系统
假设评测外呼意图识别,除了整体准确率,还要看关键类别召回、类别混淆、低置信度拒答和人工接管。如果少数高风险意图总被错分,平均分再高也不能上线。
不同场景指标也不同:RAG要拆开看检索命中、回答依据和引用;Agent要看任务完成、工具参数、错误恢复以及是否产生越权副作用。再往下,才是首Token延迟、P99、错误率和一次有效业务结果的成本。
一个可以直接落表的案例
仍以外呼意图识别为例。下面是抽象后的测试样本,不是原始业务数据:
门禁代码不必复杂,先保证高风险错误不会被平均分掩盖:
实际项目还应补充分类指标、延迟、成本和人工复核,但这段代码先表达一个原则:关键风险样本失败,版本就不能发布。
评测不是报告,而是发布门禁
产品负责定义成功结果,业务人员参与标签裁决,技术团队维护评测工具,风险与管理者确定不可接受的错误。关键指标不过线,版本就不该进入生产。
模型、Prompt、知识库或工具一变,都要重新跑回归。上线后的投诉、人工接管和异常日志,也要持续回流成新样本。这样评测集才不是一张旧试卷,而是系统真实风险的记录。
评测集不需要一开始就很大,但必须真实、分层、可追溯,并随着业务一起变化。
坐下来,慢慢聊。
微信扫一扫关注该公众号