7月6日更新的法律模型榜单,将法律知识、合同分析和判例推理等指标纳入比较。Legal Benchmarks发布的月度榜单则显示,同一模型在信息抽取、合同起草和长文本回答等任务上的表现可能存在明显差异。对律所和企业法务而言,评测重点正从模型总排名转向具体任务的稳定性、使用成本和人工复核效率。
LegalBench类数据集进一步将法律任务拆分为争点识别、规则记忆、规则适用和文本解释等能力。此类细分结果有助于使用方判断模型适合哪些工作环节,但仍不能直接等同于实际业务中的交付质量。
总分难以反映实务表现
法律工作通常由多个环节组成。合同审查不仅要识别异常条款,还要结合业务立场提出修改意见;诉讼检索既要找到依据,也要解释依据与案件事实之间的关系;企业合规问答则更重视答复口径、资料时效和更新机制。
模型在事实抽取任务中取得较高分数,并不代表其能够稳定完成合同红线审查,也不能据此判断其适合直接向业务部门提供法律相关答复。榜单所使用的数据、评分方式和任务范围,均可能影响最终排名。
Legal Benchmarks还提到,部分高分模型生成的回答明显更长。更多文本未必能够降低律师工作量,反而可能增加核阅和修改成本。因此,采购方除关注正确率外,还需考察答案长度、引用透明度、可编辑性以及律师完成二次复核所需的时间。
自有材料成为测试重点
对于准备引入合同审查工具的法务部门,更具参考价值的做法是使用常见合同模板、第三方合同和内部谈判红线建立小型测试集。材料经过脱敏后,可以用于检验系统能否识别责任上限缺失、自动续约等条款风险,能否按照公司立场提供替代文本,以及是否会在依据不足时生成未经证实的判断。
测试过程可以分别记录检索、抽取、分析、起草和复核等环节的表现,避免仅凭一次完整问答评价系统。除成功样本外,失败样本同样需要保留,以观察模型容易在哪类条款、事实关系或法律概念上出现偏差。
- 记录单项任务的处理时间、调用成本和输出长度;
- 统计律师修改比例及完成复核所需时间;
- 检查答案是否提供可核验的来源和依据;
- 测试系统能否标示不确定内容并保留审计记录。
人机协作纳入评估
Business Insider今年6月报道的AI原生律所案例显示,相关工具主要承担初稿制作、材料整理和重复性工作,律师仍负责专业判断、客户沟通和案件策略。由此看,法律AI的评估对象不宜局限于模型单次生成的答案,还应包括律师复核后的交付质量和整个工作流程的效率变化。
AI for Law Workshop在ICML 2026议程中也将法律推理质量、事实一致性和跨法域验证列为关注方向。随着法律AI进入更多业务场景,通用榜单可以用于初步筛选,但不足以替代基于本机构材料和流程的验证。
榜单成绩换一套合同库未必复现
法律AI测试结果受到样本范围、法域、资料时效和评分标准影响。供应商演示或公开榜单中的成绩,未必能够在特定机构的合同体系、知识库和权限设置下复现。涉及法律结论的输出还需核对法规、判例和内部制度来源,不能因语言表述完整而降低复核要求。
律所和企业法务在试点阶段可使用真实但脱敏的材料反复测试,并明确哪些任务可以由系统辅助、哪些结论必须由律师确认。此类评测本身不构成法律意见,其作用在于帮助采购和试点团队判断工具的适用范围,以及进入正式工作流所需的审核和责任机制。