这篇文章解决什么问题
Realm法律推理评测显示,模型能识别争点,却常在法律规则与案件事实的衔接处失分。斯坦福大学研究人员据此提示:法律AI榜单的任务、样本和评分方法并不相同。律所和企业法务选型时,应追问测试方法,并用内部材料核验错误成本和复核安排。
相关工具:企查查企业信息 MCP 企业背景调查 Skill 启信慧眼 MCP
模型识别争点很在行,但一到法律规则与案件事实的衔接就容易失分。Realm法律推理评测公布的这一结果,印证了斯坦福大学以人为本人工智能研究院近日提出的问题:法律AI评测越来越多,市场仍难看清系统在具体任务中的表现和出错概率。准备采购的律所和企业法务,不能只看综合排名;评测材料、任务设置、评分主体和错误类型,才关系部署风险。
斯坦福研究院把这一现象称为法律AI的“可读性”问题。基准测试不只是技术测量,样本选择、指标设计和资源投入都带有机构判断。开发商、律所、学术机构与公共部门使用的数据和场景不同,目标也不同;同一工具在不同榜单上出现较大差异,并不意外。
高分未必避得开高风险错误
法律业务包括检索、审阅、起草、推理和持续修正等环节,单一平均分难以覆盖各类风险。合同文本表述流畅,不代表系统完整执行了修改指令;检索结果与案情相似,不能证明模型核验过裁判效力和适用范围;智能体能写出首份备忘录,也不等于新增证据出现后能及时调整原有判断。
部分公开评测已开始细分指标。Legal AI Benchmarking分别评价可靠性与可用性:前者考察答案的准确性、完整性和不确定性处理,后者关注表达、篇幅和结构。Realm则把任务拆成争点识别、规则选择、事实适用和结论形成。结果显示,模型的短板集中在规则与事实的连接处。
分项结果有助于定位失误,但还要看样本来源和评分方法。测试若主要采用公开考试题或结构清晰的文本,未必适用于带扫描件、多个附件、矛盾条款和事实缺口的实际案件。由模型自动评分、执业人员评分,还是两者共同评分,也可能改变结论。
选型时先问清测试怎么做
律所和企业法务选型时,可要求供应商披露测试任务的来源、材料形态、评分人员及复核程序,并按任务类型和错误严重程度提供结果。只公布综合分数或排名,无法判断系统会不会遗漏关键条款、引用失效案例,或在证据不足时给出过度确定的结论。
测试环境与实际部署不同,成绩也会变化。单轮问答得分高的模型,接入内部知识库、权限系统和多步审批流程后,可能因检索错误、上下文缺失或工具调用失败而掉链子。反过来,底层模型榜单成绩平平的产品,也可能凭借清晰的检索范围、稳定模板和人工复核节点,在特定业务中表现稳定。
内部验证要把错误成本算进去
公开基准可用于缩小候选范围,正式部署前仍要用少量脱敏业务材料做验证:合同团队可设“原文不得修改”、指令与附件冲突、关键条款缺失等场景;诉讼团队可测案例引用核验、证据缺口识别以及新增事实后的文书修订。企业法务还需记录处理时间、人工复核成本和高风险错误,不能只看答案通不通顺。
测试结果还应与使用权限和责任安排挂钩。引用来源不明、事实冲突或可能造成重大法律后果的任务,应明确人工接管条件,并保留模型版本、资料来源、操作过程和复核记录。公开榜单反映的是特定条件下的能力,机构自己的业务测试和风险判断,谁也替不了。
资料来源
- Stanford HAI:Legal AI’s Legibility Problem
- Legal AI Benchmarking:公开评测方法与榜单
- Realm:Legal reasoning benchmark
- Harvey:Legal Agent Benchmark
引用与继续阅读
法律AI评测高分,落地前还要看什么|AIILAW.cn|2026-07-23|https://aiilaw.cn/legal-ai-benchmark-legibility-20260723/