7月17日,法律科技公司Harvey发布Legal Agent Bench的并购尽调扩展,将法律智能体置于接近真实交易的数据室环境中。测试材料包括数千份合同、公司文件、诉讼材料和知识产权记录,系统需要从分散的信息中识别风险,并形成供交易团队使用的尽调意见。
与围绕单一法律问题设置的传统基准相比,此次扩展把文件覆盖、跨文档分析和工作结果追溯纳入评估。Harvey称,示例环境包含3500多份文件、约4500万词元,并预设数十项需要识别和处理的问题。上述规模及测试设计来自厂商披露,仍需结合公开方法、样本设置和第三方复测判断其代表性。
测试对象转向完整尽调流程
传统法律人工智能基准通常给出明确问题和范围有限的材料,主要考察法律知识、文本理解与推理能力。并购尽调面对的则是范围更大、关联关系更复杂的文件集合,遗漏关键材料可能直接影响风险判断。
例如,控制权变更条款可能出现在关键客户合同及其附件中;软件许可风险可能需要结合技术说明、内部备忘录、知识产权文件和后续修订材料进行判断。系统即使准确找到某一条款,如果未能识别相关定义、附件或更新版本,仍可能形成不完整的结论。
这类任务也对通用智能体常用的检索策略提出挑战。依靠关键词缩小范围、选择性阅读,可以提高回答速度,却难以证明重要文件已经得到审查。交易团队除关注系统发现了哪些问题,还需要了解文件扫描范围、解析失败情况、风险点的原文出处,以及材料相互矛盾时采用了何种处理方式。
文件结构影响检索质量
围绕智能体法律应用的近期讨论,已将数据准备和文档结构列为影响结果的重要因素。合同中的定义、附件、修订文件和交叉引用如果在解析或切分阶段失去关联,模型引用的段落即使真实存在,也可能缺少作出法律判断所需的完整语境。
法律检索还涉及文件效力、适用法域和生效时间。文本相似度较高的材料未必具有更高权威性,旧版本文件也可能因内容更完整或关键词更集中而被优先检出。数据室中的文件命名、版本记录和权限设置不规范,还可能使部分材料未进入检索范围。
斯坦福大学等机构此前对商用法律检索工具开展的实证研究显示,检索增强生成技术可以降低幻觉发生率,但不能消除错误。进入大规模尽调场景后,风险不仅表现为单个答案失实,还包括跨文件关系丢失、修订版本误用、关键文件漏检及引用链条不完整。
采购评估关注覆盖与追溯
对于律所和企业法务部门,类似任务型基准可为产品采购和内部测试提供更接近实务的评估框架。测试不宜只比较尽调摘要的文字质量,还应核验以下环节:
- 文件覆盖:任务完成后能否导出文件清单、解析状态和未读取原因,并标明无法处理的文件类型。
- 来源追溯:每项风险能否链接至原文,同时呈现相关定义、附件、补充协议和修订关系。
- 判断边界:系统是否区分事实提取、风险分级和律师意见,避免将模型判断表述为确定结论。
- 人工复核:律师的修改、确认和退回能否留痕,高风险或低置信度事项是否进入人工审查流程。
上述指标还涉及责任分配。如果系统未能解析部分文件,或因权限、格式和版本问题遗漏材料,项目团队需要及时收到提示;如果模型对同一事项给出相互冲突的判断,也应保留依据和处理记录。缺少这些信息,使用者难以评估结果的完整性,也难以在交易完成后追溯审查过程。
3500份文件测的是这一套题
真实任务型测试可以观察法律智能体在大规模材料中的工作表现,但不能替代律师审查,也不足以单独证明某一产品适用于所有交易。数据室构成、预设问题、文件格式和评分标准均会影响结果,不同法域、行业及交易结构下的风险分布也存在差异。
对采购方而言,厂商基准更适合作为初步证据,后续仍需使用本机构材料开展受控测试,并核查数据安全、访问权限、日志保存和人工复核机制。产品能否完整说明文件处理范围、判断依据和复核责任,将直接影响其在并购尽调中的可用性。