直接回答。 AI给出的置信度,只有在同一任务、同一评分方法和可复核样本上检验过,才可能辅助分流。把“模型说有九成把握”直接解释成“九成答案正确”,会把语言表达误当成可靠的业务测量。
核心要点
- 先确认置信度来自哪里:分类器分数、规则评分还是模型自述。
- 校准检查预测分数与实际正确比例之间的关系,不替代错误后果评估。
- 分群比较任务、输入质量和业务风险,不用总平均覆盖关键缺口。
- 分流阈值由人审能力、错误代价和运营目标共同决定。
- 模型、数据和流程变化后,原有校准结果需要重新核验。
从一个可判定的任务开始
假设团队用AI把客户工单分到几个服务队列。此时“正确”可以由已核定的路由政策和独立复核者判断。若业务标签本身相互重叠,先解决标签定义,不能把员工之间的分歧全部算成模型不准确。
另一个任务是生成开放式方案。方案可能没有单一正确答案,不能套用工单分类的正确率定义。团队要先把可判断的维度拆出来,例如是否使用指定产品事实、是否满足约束、是否包含禁止承诺。没有清楚的评价对象,置信度校准只是在给模糊意见配数字。
模型自述“我很确定”可以作为输出的一部分,但不应被当成已经验证的概率。外部评分器也需要测试;它可能继承同样的事实错误。采购时要问分数生成方法、训练或调整条件、版本和已知限制,而不是只问后台有没有置信度字段。
制作校准核验表
把固定评估样本按照分数区间分组,每组记录样本量和经独立复核确认的正确比例。区间划分、正确标准和排除规则应在测试前写明。数量太少的区间应标记证据不足,不要画出精细曲线后制造精确感。
| 字段 | 需要记录的内容 |
|---|---|
| 分数定义 | 数字来自哪个组件,表示什么 |
| 任务定义 | 哪种输出被判定为正确 |
| 样本来源 | 时间、群体、输入质量和排除项 |
| 分组结果 | 每组数量、正确数量及未裁定数量 |
| 业务后果 | 错误会导致转错队列还是不可逆操作 |
未裁定样本不能为了报表好看而悄悄删除。可以单列并说明影响。如果困难样本都进入未裁定类别,剩下的“高准确率”只描述容易判断的部分。测试记录还应保留复核冲突如何解决,以便下一次使用相同标准。
校准之后才讨论阈值
即使分数与正确比例关系较稳定,阈值也不能只由模型团队设定。业务需要知道错误自动处理的代价、人审能承接多少任务、低分结果是否可以继续补问,以及哪些严重错误必须单独阻断。
例如把工单送到错误队列可能可以恢复,但直接拒绝客户权益可能有更大后果。两种动作即使使用同一个分数,也可能需要不同处置。数值较高并不能越过原本必须人工批准的动作权限。
可以先在影子模式观察:记录如果按候选阈值分流会产生多少自动完成、人工复核和严重错误,但不真正改变客户结果。这个阶段让团队理解阈值的运营影响,而不是拿客户业务去验证一个尚未解释的数字。
别让总体结果掩盖分群问题
检查不同语言、文档清晰度、任务类型和客户群体的结果。一个大样本常规群体可以把总体平均拉高,同时掩盖小群体中分数过度自信的问题。分群需要合法且必要的数据用途,不应为了报表新增无关敏感属性。
分群表里同时写样本数,避免把少量观察当成稳定差异。如果某类输入在生产中很常见、测试中却很少,优先补样本。不要仅仅因为一个群体分数低,就排除它以提升系统的汇总指标。
业务风险也应该分层。关键错误可有独立的复核要求,普通措辞偏差则可进入改进队列。把二者混成一个平均“质量分”,会使阈值看上去简洁,却让实际后果失去可见性。
什么时候原来的校准会失效
如果供应商只提供一个无法解释的总分,可以先把分数保留下来做观察,不让它控制自动执行。要求供应商提供字段定义、版本变更通知和测试条件;拿不到这些材料时,在采购记录中明确“分数含义未验证”,而不是由项目组替供应商补写一个概率解释。
更换模型、改变提示词、加入检索资料或改标签政策,都可能改变分数与结果的关系。即使模型没换,季节性工单、产品升级和客户结构变化也可能让原有样本不再代表生产。发布记录应标明哪套校准对应哪套系统配置。
上线后用获准且最小化的样本定期复核,检查高分错误和人工复核结果。不要只收集投诉,因为没被用户发现的错误不会自动进入投诉库;也不要把所有历史对话永久存下,数据保留应由授权目的和政策决定。
理门的企业AI方法帮助团队先定义任务与后果,再讨论数值门槛;资源中心可与业务负责人一起用于准备评测。如果希望梳理现有置信度字段,通过沟通入口提供任务定义和匿名示例即可。
常见问题
置信度达到某个数字是否可以免审?
不能仅凭一个数字决定。还要有适用任务的验证、明确错误后果以及获准的动作边界。必要审批不能被分数替代。
分数不准是否意味着模型没价值?
不一定。模型可能适合草稿生成或人审辅助,但其分数不适合自动分流。应把输出用途和分数用途分开评估。
小样本可以做校准吗?
可以探索问题,但应诚实标明证据不足。不要把探索结果包装为生产概率承诺,也不要给稀疏区间制造精细百分比。
参考来源
- NIST AI RMF Core:MEASURE 2.1涉及测试集和方法记录,MEASURE 2.5涉及可靠性与泛化限制。本文表格是实践建议,不是NIST规定的统一评分法。
- NIST AI RMF Playbook:说明风险管理建议应按实际情境选用。该自愿框架不为任何模型置信度背书。
预约沟通