7月17日,法律科技公司 Harvey 发布 Legal Agent Bench 的并购尽调扩展,把3500余份文件、约4500万词元纳入测试,考察智能体识别跨文件风险、追溯依据和形成尽调意见的能力。文件覆盖、版本管理和人工复核也因此被推到产品评估的重点。
这篇文章解决什么问题
7月17日,法律科技公司 Harvey 发布 Legal Agent Bench 的并购尽调扩展,把3500余份文件、约4500万词元纳入测试,考察智能体识别跨文件风险、追溯依据和形成尽调意见的能力。文件覆盖、版本管理和人工复核也因此被推到产品评估的重点。
3500多份文件,约4500万词元,数十个预设风险点——这是Harvey给法律智能体搭的“数据室”。7月17日,这家法律科技公司发布Legal Agent Bench的并购尽调扩展:系统要在接近真实交易的环境里,从分散的合同、公司文件、诉讼材料和知识产权记录中识别风险,并形成供交易团队使用的尽调意见。上述规模和测试设计来自厂商披露,代表性还要结合公开方法、样本设置和第三方复测来判断。
考题从单点变成全流程
传统法律 AI 基准通常给出明确问题和范围有限的材料,考察的是知识、文本理解与推理。并购尽调面对的是另一回事:文件集合更大、关联更复杂,漏看一份材料就可能让风险判断整个偏掉。
控制权变更条款可能藏在关键客户合同及其附件里;软件许可风险可能要结合技术说明、内部备忘录、知识产权文件和后续修订才判断得了。系统就算准确找到了某一条款,只要没识别出相关定义、附件或更新版本,结论照样不完整。
这类任务还在挑战通用智能体惯用的检索策略——靠关键词缩小范围、选择性阅读确实快,但证明不了重要文件都已被审查过。交易团队除了问“发现了哪些问题”,还想知道:文件扫描范围有多大?哪些解析失败了?每个风险点的原文出处在哪?材料相互矛盾时怎么处理?
文档结构决定检索质量
近期围绕智能体法律应用的讨论,已经把数据准备和文档结构列为影响结果的关键因素。合同里的定义、附件、修订文件和交叉引用如果在解析或切分时失去关联,模型引用的段落就算真实存在,也可能缺少作出法律判断所需的完整语境。
法律检索还要考虑文件效力、适用法域和生效时间。文本相似度高的材料未必更权威;旧版本文件可能因为内容更完整或关键词更密集,反而被优先检出;数据室里的命名、版本记录和权限设置不规范,甚至会让部分材料压根没进检索范围。
斯坦福大学等机构此前对商用法律检索工具的实证研究显示,检索增强生成能降低幻觉发生率,但消不掉错误。放到大规模尽调场景里,风险不再只是单个答案失实,还包括跨文件关系丢失、修订版本误用、关键文件漏检和引用链条不完整。
采购方该核验什么
对律所和企业法务部门来说,任务型基准提供了一个比文字质量更实在的评估框架。测试时至少要核验四个环节:
- 文件覆盖:任务完成后能不能导出文件清单、解析状态和未读取原因,并标明没法处理的文件类型。
- 来源追溯:每项风险能不能链到原文,同时呈现相关定义、附件、补充协议和修订关系。
- 判断边界:系统有没有把事实提取、风险分级和律师意见分开,别把模型判断说成确定结论。
- 人工复核:律师的修改、确认和退回能不能留痕,高风险或低置信度事项有没有进入人工审查流程。
这些指标也牵涉责任分配:系统没解析某些文件,或者因为权限、格式、版本问题漏了材料,项目团队要及时收到提示;模型对同一事项给出互相冲突的判断,也要留好依据和处理记录。缺了这些信息,使用者既评估不了结果的完整性,也很难在交易完成后追溯审查过程。
厂商基准终究只是初步证据——数据室的构成、预设问题、评分标准都会影响成绩,不同法域、行业和交易结构下的风险分布也各不相同。采购方还得用本机构的材料做受控测试,并核查数据安全、访问权限、日志保存和人工复核机制。产品能不能说清文件处理范围、判断依据和复核责任,才是它能不能进并购尽调现场的分水岭。
相关报道
- Harvey:Extending Legal Agent Bench to M&A Due Diligence
- Clixlogix:Why Agentic Legal AI Needs Document Structure Before Better Models
- Stanford等:Assessing the Reliability of Leading AI Legal Research Tools
引用与继续阅读
Harvey 用3500份文件和4500万词元考法律智能体|AIILAW.cn|2026-07-20|https://aiilaw.cn/legal-ai-ma-due-diligence-benchmark-20260720/