理门 LIMEN AI预约沟通
← 返回博客与资源
洞察 / 企业AI运营与治理6 分钟阅读

AI置信度不能当准确率:校准怎么做

AI给出的置信度,只有在同一任务、同一评分方法和可复核样本上检验过,才可能辅助分流。把“模型说有九成把握”直接解释成“九成答案正确”,会把语言表达误当成可靠的业务测量。

AI置信度不能当准确率:校准怎么做的深蓝色等距企业流程示意插画;非真实现场照片

直接回答。 AI给出的置信度,只有在同一任务、同一评分方法和可复核样本上检验过,才可能辅助分流。把“模型说有九成把握”直接解释成“九成答案正确”,会把语言表达误当成可靠的业务测量。

核心要点

  • 先确认置信度来自哪里:分类器分数、规则评分还是模型自述。
  • 校准检查预测分数与实际正确比例之间的关系,不替代错误后果评估。
  • 分群比较任务、输入质量和业务风险,不用总平均覆盖关键缺口。
  • 分流阈值由人审能力、错误代价和运营目标共同决定。
  • 模型、数据和流程变化后,原有校准结果需要重新核验。

从一个可判定的任务开始

假设团队用AI把客户工单分到几个服务队列。此时“正确”可以由已核定的路由政策和独立复核者判断。若业务标签本身相互重叠,先解决标签定义,不能把员工之间的分歧全部算成模型不准确。

另一个任务是生成开放式方案。方案可能没有单一正确答案,不能套用工单分类的正确率定义。团队要先把可判断的维度拆出来,例如是否使用指定产品事实、是否满足约束、是否包含禁止承诺。没有清楚的评价对象,置信度校准只是在给模糊意见配数字。

模型自述“我很确定”可以作为输出的一部分,但不应被当成已经验证的概率。外部评分器也需要测试;它可能继承同样的事实错误。采购时要问分数生成方法、训练或调整条件、版本和已知限制,而不是只问后台有没有置信度字段。

制作校准核验表

把固定评估样本按照分数区间分组,每组记录样本量和经独立复核确认的正确比例。区间划分、正确标准和排除规则应在测试前写明。数量太少的区间应标记证据不足,不要画出精细曲线后制造精确感。

字段需要记录的内容
分数定义数字来自哪个组件,表示什么
任务定义哪种输出被判定为正确
样本来源时间、群体、输入质量和排除项
分组结果每组数量、正确数量及未裁定数量
业务后果错误会导致转错队列还是不可逆操作

未裁定样本不能为了报表好看而悄悄删除。可以单列并说明影响。如果困难样本都进入未裁定类别,剩下的“高准确率”只描述容易判断的部分。测试记录还应保留复核冲突如何解决,以便下一次使用相同标准。

校准之后才讨论阈值

即使分数与正确比例关系较稳定,阈值也不能只由模型团队设定。业务需要知道错误自动处理的代价、人审能承接多少任务、低分结果是否可以继续补问,以及哪些严重错误必须单独阻断。

例如把工单送到错误队列可能可以恢复,但直接拒绝客户权益可能有更大后果。两种动作即使使用同一个分数,也可能需要不同处置。数值较高并不能越过原本必须人工批准的动作权限。

可以先在影子模式观察:记录如果按候选阈值分流会产生多少自动完成、人工复核和严重错误,但不真正改变客户结果。这个阶段让团队理解阈值的运营影响,而不是拿客户业务去验证一个尚未解释的数字。

别让总体结果掩盖分群问题

检查不同语言、文档清晰度、任务类型和客户群体的结果。一个大样本常规群体可以把总体平均拉高,同时掩盖小群体中分数过度自信的问题。分群需要合法且必要的数据用途,不应为了报表新增无关敏感属性。

分群表里同时写样本数,避免把少量观察当成稳定差异。如果某类输入在生产中很常见、测试中却很少,优先补样本。不要仅仅因为一个群体分数低,就排除它以提升系统的汇总指标。

业务风险也应该分层。关键错误可有独立的复核要求,普通措辞偏差则可进入改进队列。把二者混成一个平均“质量分”,会使阈值看上去简洁,却让实际后果失去可见性。

什么时候原来的校准会失效

如果供应商只提供一个无法解释的总分,可以先把分数保留下来做观察,不让它控制自动执行。要求供应商提供字段定义、版本变更通知和测试条件;拿不到这些材料时,在采购记录中明确“分数含义未验证”,而不是由项目组替供应商补写一个概率解释。

更换模型、改变提示词、加入检索资料或改标签政策,都可能改变分数与结果的关系。即使模型没换,季节性工单、产品升级和客户结构变化也可能让原有样本不再代表生产。发布记录应标明哪套校准对应哪套系统配置。

上线后用获准且最小化的样本定期复核,检查高分错误和人工复核结果。不要只收集投诉,因为没被用户发现的错误不会自动进入投诉库;也不要把所有历史对话永久存下,数据保留应由授权目的和政策决定。

理门的企业AI方法帮助团队先定义任务与后果,再讨论数值门槛;资源中心可与业务负责人一起用于准备评测。如果希望梳理现有置信度字段,通过沟通入口提供任务定义和匿名示例即可。

常见问题

置信度达到某个数字是否可以免审?

不能仅凭一个数字决定。还要有适用任务的验证、明确错误后果以及获准的动作边界。必要审批不能被分数替代。

分数不准是否意味着模型没价值?

不一定。模型可能适合草稿生成或人审辅助,但其分数不适合自动分流。应把输出用途和分数用途分开评估。

小样本可以做校准吗?

可以探索问题,但应诚实标明证据不足。不要把探索结果包装为生产概率承诺,也不要给稀疏区间制造精细百分比。

参考来源

  • NIST AI RMF Core:MEASURE 2.1涉及测试集和方法记录,MEASURE 2.5涉及可靠性与泛化限制。本文表格是实践建议,不是NIST规定的统一评分法。
  • NIST AI RMF Playbook:说明风险管理建议应按实际情境选用。该自愿框架不为任何模型置信度背书。

如果这也是你正在面对的问题

从一条真实业务流程开始。

预约沟通