苏州炬擎数原科技
Novi Enterprise ↗ 中文 / EN联系我们
← 返回行业资讯
行业资讯 2026-09-29 · 次阅读

合同审查类 AI 的准确率该怎么评估

小
小编
TorchDigit
合同审查类 AI 的准确率该怎么评估

合同审查类应用的准确率,不能用一个数字概括。审查包含多个不同性质的任务:找出风险条款、比对标准模板、提取关键要素、判断条款是否缺失。每类任务的评估方式不同,把它们平均成一个总体准确率,反而会掩盖真实问题。

先拆分任务类型,再分别评估

风险条款识别。衡量的是能否找出需要关注的条款。这里要同时看漏报与误报:漏掉一条高风险的条款,代价可能远大于多提醒几条。因此评估时应区分不同风险等级的召回率,高风险条款的召回率是核心指标。

模板比对。衡量的是能否准确指出差异。这类任务有明确参照,评估相对客观,主要看差异识别的完整性与准确性。

要素提取。衡量的是提取字段是否正确。需要注意评估时是否把格式差异算作错误,比如日期写法不同但含义一致的情况。

条款缺失判断。衡量的是能否发现缺少必要条款。这类任务依赖对完整合同结构的理解,评估需要覆盖多种合同类型。

四类任务分别评估后,再看综合表现,才能定位问题出在哪一环。

fig-1.png

评估要用真实合同,且区分难度

用公开数据集评估意义有限,因为合同类型、条款表述习惯、业务背景差异很大。评估集应来自实际业务中处理的合同,并覆盖主要类型。

难度分层是必要的。常规的、结构清晰的合同与复杂、非标准的合同,AI 的表现差别很大。如果评估集以常规合同为主,得出的准确率会明显高于实际使用中的体验。

建议评估集中包含一定比例的困难样本:表述不规范的、结构特殊的、历史上有过争议的,这样才能反映真实可用性。

关注错误类型而不只是错误率

错误率相近的两个系统,实际使用价值可能差别很大。原因在于错误的性质不同。

引用错误:指出了问题但依据的条款不准确。这类错误会损害使用者对系统的信任,需要单独统计。

优先级错误:把低风险问题标为高风险,或反之。这直接影响审查效率,高优先级错误过多会让使用者忽略全部提示。

遗漏错误:未能发现问题。这是最需要关注的类型,尤其在高风险条款上。

评估报告中应分开呈现这几类,而不是只给一个总体准确率。

fig-2.png

上一篇 风控与合规审核类 AI 应用为什么更适合本地部署
下一篇 长文档处理为什么成了法律场景的硬需求

相关阅读