首页 / 工具与工作流

Percipient上线盲测平台,想靠律师投票排座次

配图:Percipient上线盲测平台,想靠律师投票排座次

7月13日,法律服务机构Percipient推出Certera.AI测试版,让法律人把同一提示丢给不同模型、在隐藏模型名的前提下比答案,并计划做律师投票排行榜。文章说明盲测能挡掉多少品牌干扰,以及选型为什么还得靠自家测试集和数据安全审查。

这篇文章解决什么问题

7月13日,法律服务机构Percipient推出Certera.AI测试版,让法律人把同一提示丢给不同模型、在隐藏模型名的前提下比答案,并计划做律师投票排行榜。文章说明盲测能挡掉多少品牌干扰,以及选型为什么还得靠自家测试集和数据安全审查。

7月13日,法律服务机构Percipient放出Certera.AI测试版。法律专业人士可以把同一个提示丢给不同模型,在模型名字被隐去的情况下比回答质量。Percipient还打算做一个律师投票的排行榜,供评估法律AI产品时参考。

法律AI产品更新得密集,律所和企业法务挑工具反而更难了。同一个工具,在合同条款抽取、文本改写和复杂法律分析这些任务上,表现可能差得很远;厂商演示用的数据、模板和流程,也未必和采购方的实际环境对得上。Certera.AI想用同题盲测,把评估的重点拉回到具体输出上。

隐去名字,少些品牌干扰

按Percipient的介绍,评审者看不到模型名字,只看答案,可以从风险识别、依据引用、修改建议和表达质量这几处下手判断。有些产品都能把基本任务做完,输出质量的差距又不容易量化,这种测法能压低品牌知名度和先入印象对打分的影响。

盲测结果也有明显的边界。一次回答好看,证明不了产品能长期稳定交付。公开的法律AI基准,通常受任务数量、语言和法域范围的限制,有的只考单轮回答,没覆盖持续对话、外部工具调用和复杂工作流。提示怎么写、模型是哪个版本、参数怎么配,都可能让结果上下飘。

所以,盲测排名只能算采购证据里的一条。碰到客户资料、案件文件和企业内部数据,采购方还得查数据怎么存、怎么用,访问权限、日志留存、模型更新机制,以及供应商的安全与合规安排。

自家样本,比公共榜单更贴业务

对律所和企业法务来说,自己搭一个小测试集,通常更能看出产品合不合用。题目从近期高频业务里抽,去掉客户名称、交易信息等可识别数据再用。十到二十个任务,就够覆盖信息抽取、条款改写、风险排序,以及需要讲清理由的复杂分析。

测试前先把标准定清楚,再请熟悉相关业务的律师匿名打分。要看的东西有这么几项:

  • 准确性:有没有漏掉决定性事实、例外条款或适用法域,引用的依据准不准;
  • 可用性:输出还要人工改多少,能不能直接进现有的合同、备忘录或审查报告;
  • 可追溯性:能不能定位原文、摆出引用来源,并留下操作记录;
  • 稳定性:同一个任务反复跑,关键判断和引用会不会明显变;
  • 总成本:除了订阅和接入费用,复核、返工、培训和系统维护的成本也要算进去。

测试还得留档:题目版本、评分理由、用的模型和配置、测试日期、复核人。等模型升级、数据源调整或换了供应商,采购方可以拿同一套材料重新验一遍,别把某一次的成绩长期当成产品能力的证明。

通用榜单,未必对上你的合同类型

Legal Benchmarks、Harvey等机构和厂商最近发布的评测方法,都加重了真实法律任务和律师评价的分量。这些结果说明,通用模型的排名和具体法律工作能力之间,没有简单的对应关系。采购团队还是得看自己的合同类型、适用法域、交付格式和质量门槛来判断。

要是产品能调外部数据库、自动生成文件或者触发后续流程,测试方案还得覆盖授权范围、人工复核节点,以及失败之后怎么回退。对那些可能影响客户权益、诉讼策略或交易决策的输出,要留住律师审核这一关,别只看排行榜或厂商给的准确率数字就决定用不用。

盲测给法律AI选型多了一种比较直观的比法,但它值多少钱,取决于测试任务贴不贴业务、评分标准是不是前后一致,还有安全和责任审查有没有同步跟上。厂商公布的排名和性能数据,采购方仍要结合测试范围和方法上的限制,审慎地看。

相关报道

引用与继续阅读

Percipient上线盲测平台,想靠律师投票排座次|AIILAW.cn|2026-07-15|https://aiilaw.cn/legal-ai-blind-testing-procurement-20260715/

按任务选择法律 AI 工具 · 订阅后续文章 RSS

从读到用

带走这份四步核对清单

  • 先界定任务与数据边界
  • 检查来源是否可定位
  • 设置人工复核与升级条件
  • 保留权限、版本和日志