AI法律科技与智能化实务横幅
法律AI智能化正在进入实务场景 合同审查、合规分析、案件事实梳理与律所工作流
首页 / AI行业观察

法律 AI 评测的真正难题:分数背后是谁定义了好答案

法律 AI 评测的真正难题:分数背后是谁定义了好答案

法律 AI 的榜单正在迅速变长,模型、助手和 Agent 都有了自己的分数。然而,对准备采购工具的律所和企业法务来说,“第一名”常常不是最重要的信息。直接影响部署的,是评测用了什么材料、模拟了哪类工作、谁规定了合格答案,以及失败会以什么方式出现。

斯坦福大学以人为本人工智能研究院近日把这种困境称为法律 AI 的“可读性”问题:市场知道系统能力在提升,却仍难以看清它在具体法律任务中的表现和错误概率。研究者提醒,基准测试并非纯技术过程,数据、指标和资源配置背后都有机构选择。开发商、律所、学术机构与公共部门掌握的数据不同,激励也不同,因此同一工具可能在不同测试里呈现出完全不同的面貌。

漂亮总分可能遮住关键失误

法律工作很难被压缩成一个平均值。合同起草文字流畅,不等于完整执行了修改指令;法律检索找到了相似案件,也不等于核验了效力和适用范围;Agent 完成第一份备忘录,更不等于它能在新证据出现后修正原判断。

公开评测正在尝试拆开这些维度。Legal AI Benchmarking 将可靠性与可用性分开:前者看答案是否准确、完整并诚实处理不确定性,后者才看表达、篇幅和结构。Realm 的法律推理评测则把任务拆成争点识别、规则选择、事实适用和结论,结果显示模型往往较会发现争点,却更容易在规则与事实的衔接处失分。这些细分指标比“文书写得像不像律师”更接近实际风险。

选型前先审一遍评测本身

法务团队不必自建庞大实验室,但可以要求供应商交代评测边界。至少应追问:

  • 测试任务来自真实业务、合成样本,还是公开考试题;
  • 材料是否包含扫描件、附件、相互矛盾的条款和缺失事实;
  • 评分由执业人员、模型裁判还是两者共同完成,分歧如何复核;
  • 结果是否按任务类型和错误严重度展示,而非只给综合排名。

还要检查测试环境是否接近预定用法。一个在单轮问答中表现出色的模型,接入知识库、权限系统和多步审批后,未必仍能保持相同水平。反过来,底层模型分数一般,也可能因检索范围清晰、模板稳定和人工复核点合理而成为更可靠的业务工具。

把公开榜单变成内部证据

更实用的做法,是从公开基准中提取可能的失误模式,再用少量脱敏材料做内部验证。合同团队可设置“应保持原文不动”“指令与附件冲突”“关键条款缺失”等用例;诉讼团队可测试引用核验、证据缺口和新事实加入后的改写;企业法务还应记录处理时间、复核成本与高风险错误,而不只是答案是否可读。

评测最终服务于责任分配,而不是替工具颁奖。能够说明何时可交给 AI、何时必须由律师接管,并留下版本、来源和复核记录的测试,才能切实降低采用成本。公开榜单可以帮助缩小候选范围,但让系统进入业务的那一步,仍应由组织自己的任务、风险容忍度和审查标准决定。

资料线索

轩辕法律服务网 Law2CN.com 广告