7月13日,法律服务机构Percipient推出Certera.AI测试版。该平台允许法律专业人士将同一提示提交给不同模型,在模型名称被隐藏的情况下比较回答质量。Percipient还计划推出由律师投票形成的排行榜,为法律人工智能产品评估提供参考。
随着法律AI产品密集更新,律所和企业法务部门的选型难度有所上升。同一工具在合同条款抽取、文本改写和复杂法律分析等任务中的表现可能存在明显差异;厂商演示所使用的数据、模板和工作流程,也未必与采购方的实际环境一致。Certera.AI尝试通过同题盲测,将评估重点放在具体输出上。
匿名比较减少品牌干扰
按照Percipient公布的介绍,评审者在不知道模型名称的情况下查看答案,可以围绕风险识别、依据引用、修改建议和表达质量作出判断。对于均能完成基本任务、但输出质量差异不易量化的产品,这种测试方式有助于降低品牌知名度和既有印象对评分的影响。
盲测结果仍有明显边界。一次回答表现较好,无法证明产品能够长期稳定交付。公开法律AI基准通常受任务数量、语言和法域范围限制,部分测试仅考察单轮回答,尚未覆盖持续对话、外部工具调用及复杂工作流。不同提示写法、模型版本和参数配置,也可能造成结果波动。
因此,盲测排名只能作为采购证据之一。涉及客户资料、案件文件和企业内部数据时,采购方仍需核查数据存储与使用方式、访问权限、日志留存、模型更新机制以及供应商的安全与合规安排。
业务样本比公共榜单更接近实际
对律所和企业法务部门而言,自建小规模测试集通常更能反映产品适配程度。测试任务可从近期高频业务中抽取,并在去除客户名称、交易信息等可识别数据后使用。十至二十个任务即可覆盖信息抽取、条款改写、风险排序和需要说明理由的复杂分析。
测试前应明确标准,并由熟悉相关业务的律师匿名评分。可考察的项目包括:
- 准确性:是否遗漏决定性事实、例外条款或适用法域,引用依据是否准确;
- 可用性:输出需要多少人工修改,能否纳入现有合同、备忘录或审查报告;
- 可追溯性:能否定位原文、展示引用来源并保留操作记录;
- 稳定性:相同任务重复运行后,关键判断和引用是否出现明显变化;
- 总成本:除订阅和接入费用外,复核、返工、培训及系统维护成本也应计入。
测试还需记录题目版本、评分理由、模型与配置、测试日期及复核人员。模型升级、数据源调整或供应商更换后,采购方可依据同一套材料重新验证,避免将某次测试成绩长期作为产品能力证明。
通用榜单对不上你们的合同类型
Legal Benchmarks、Harvey等机构和厂商近期发布的评测方法,均增加了真实法律任务和律师评价的比重。相关结果说明,通用模型排名与具体法律工作能力之间并不存在简单对应关系。采购团队仍需结合自身合同类型、适用法域、交付格式和质量门槛作出判断。
如果产品能够调用外部数据库、自动生成文件或触发后续流程,测试方案还应覆盖授权范围、人工复核节点和失败后的回退措施。对可能影响客户权益、诉讼策略或交易决策的输出,应保留律师审核,不宜仅凭排行榜或厂商提供的准确率数字决定是否采用。
盲测为法律AI选型增加了一种较为直观的比较方法,但其价值取决于测试任务是否贴近业务、评分标准是否一致,以及安全和责任审查是否同步进行。对厂商公布的排名和性能数据,采购方仍应结合测试范围与方法限制审慎理解。