这篇文章解决什么问题
法律 AI 采购不能只看演示和功能表。本文用合同审查、法规研究、案例检索、尽调、文档处理和诉讼材料六类任务,说明如何固定样本、记录错误与复核时间,并核对数据处理条件和总成本。
相关工具:合同审查助手 Skill 腾讯电子签 Skill MCP-Doc Word 文档处理
法务部门准备采购 AI 时,常会遇到两份看起来都不错的演示:一份几秒钟生成长报告,另一份能把意见写回 Word。试用后,前者的引用需要重新查找,后者又漏掉附件,采购讨论还是会回到原点:这个工具到底解决什么工作?
选择法律 AI 工具,应把常用任务做成可复查的试用题,比较结果质量、交付形式、人工复核时间和数据处理条件。价格表和功能表可以缩小候选范围,最后仍要回到实际工作样本。
本文提供六类任务的评估方法及可下载工作簿。这是一份选型指南,没有对商业产品做同题运行,也没有产品排名。文中列出厂商入口,供读者核查公开资料,不表示本站已验证其性能或作出采购推荐。
采购说明先写清一个月要做什么
“提升法务效率”不足以定义项目。可以写得更具体:每月检查若干份采购合同,逐条定位并交付修改对照;每周完成法规研究,能够打开原文并记录版本;每次争议项目整理材料,关键事实可以回到具体页码。
数量也不必凭感觉填写。可以从团队最近四周的任务登记中,统计每类工作的文件量、材料长度、处理人和返工原因。没有记录,就先观察一周,不要把供应商测算的节约比例当作自己的基线。
采购目标还要写明使用人。独立律师可能更看重单次成本和上手时间;法务团队会更关心文档格式、权限和多人交接;已有知识库的机构,则要检查能否接入现有资料,以及资料如何更新。这些差异会改变比较维度。
最后写一条验收句子,例如:“使用约定样本,生成包含原文位置的合同意见,并能打开导出的文件完成逐项检查。”没有具体交付物,试用很容易被演示效果带偏。
四类方案要放在同一任务里比
| 方案类别 | 可以重点调查的方向 | 需要核清的条件 |
|---|---|---|
| 通用 AI 助手 | 文字整理、草稿、按给定材料分析 | 文件处理范围、联网与引用、账户条款 |
| 法律垂直产品 | 法律场景流程及专用输出 | 数据覆盖、规则更新、导出能力 |
| 数据库及其 AI 功能 | 法源与案例获取、检索过程 | 授权范围、全文可得性、历史版本 |
| Skills/MCP 等组合 | 重复任务、不同工具连接 | 宿主、组件依赖、权限、维护责任 |
这些类别没有天然的高低之分。只需把给定材料整理成表格的任务,未必需要购买完整数据库;需要核实案例的任务,也不能用写作组件替代资料访问权限。
公开资料可以先从通义法睿官网、法睿开发文档和千千律约产品介绍等原始入口查起。记录页面日期和适用产品,区分网页版、接口服务和企业方案;不能把接口文档中的能力直接算到另一个套餐上。
本站法律 AI 资源库可用于发现候选项;处理重复工作时,也可查看库中的合同 Skills。收录条目、热度和名称相似,都不能替代对实际提供者和安装来源的确认。
六类任务分别这样出题
合同审查。给出正文、技术附件和一页交易背景,预埋日期冲突及验收条件缺失。要求返回原文、问题、建议和待确认事项,并提供可打开的交付文件。命中检查点后,还要看修改是否引入新矛盾。
法规研究。给定法域、事实时间和具体问题,要求提供来源清单及适用条件。用一个必须区分历史文本与现行文本的问题,检查工具是否主动记录时间,是否把新闻解读当作正式条文。原文无法取得时,对限制的说明也应计入评价。
案例检索。提供固定事实与争议点,让工具先列检索条件,再给出候选案例和相似性比较。关注案号、法院、程序阶段、全文来源和不相似因素;案例数量多,不能单独构成优势。
企业尽调。使用合法取得的公开样例,指定企业全称和统一社会信用代码,要求每项字段附来源及查询日期。设置同名主体干扰项,检查工具会不会把别的公司的信息混入结果。演示材料中的负面事项应明确为虚构,不能随意为真实公司编造风险。
PDF 与 Word。准备包含表格、脚注、扫描页和批注的文件,要求提取或修改指定部分。检查数字、表格关系、页码定位和导出文件的可读性。文件能够下载,只说明生成了产物,不代表格式保留完整。
诉讼材料。用模拟聊天、邮件和交付记录,要求生成事件时间线、事实证据表和缺件清单。给出两个相互冲突的日期,观察工具是原样保留争议,还是为了叙述流畅而擅自选定其中一个。
每类任务先准备两个小样本:一个正常任务,一个含有缺失或矛盾的任务。六类共十二个,足以看出部分工作方式差异,但不足以据此宣称某产品具有“行业准确率”。团队只采购合同功能时,也可以只测合同;明确范围,比硬凑全六类更有用。
试用前冻结材料和评分规则
先保存输入材料、标准提示词和检查点表的版本。运行后发现某工具很擅长临时新增任务,可以记作补充测试,不能暗中替换原基准,让结果显得更好。
同一基础任务尽量使用一致输入。产品原生工作流确实需要不同操作时,应记录差异,分为“共同任务结果”和“原生功能体验”两栏。例如,一款产品能直接导出 Word,另一款只能复制文本,这既是交付能力的差别,也会影响人工时间。不能把人工加工后的两个文件做成完全相同,再把差异抹掉。
重点任务建议独立运行三次,保留每次结果和失败记录。这只是观察稳定性的操作建议,不是法定或行业统一测试次数。报告可以记录中位处理时间,也应列出耗时范围。用户点击、文件准备、核验和修改时间要分别记录,避免把“生成用了二十秒”写成“完成工作用了二十秒”。
不支持的任务标注“不支持”,需要额外授权的标注“未满足测试条件”,接口报错则记录实际错误。不要把这些状态都当作零分混算,也不能把未测试项目留空后默认通过。
先记录错误和遗漏,再考虑总分
每个任务可以设置五项维度:事实与规则处理、来源追踪、遗漏及误报、交付可用性、复核成本。团队确实需要总分时,应先确定权重并写明理由。例如,文档处理部门可以提高格式保留权重,研究团队可以提高来源权重;不同权重得出的结果,不能都叫“综合最强”。
比总分更有用的是具体数据。假设模拟合同预设 15 个检查点,一个方案命中 12 个,可以写“本样本检查点覆盖 12/15”。如果它同时提出 8 条没有依据的修改,还要单列错误建议数;不能只公布 80%,让人误以为这是所有合同的准确率。
工具提出一项未预埋、但确实合理的问题时,评审者应说明新增发现及判断依据。人工基准也可能遗漏。保留更正记录,既不要求机器只复述预设答案,也不允许为了迎合结果随意改分。
关键任务可以设置不计分的准入条件:例如,正式研究报告必须能够回溯关键来源,指定交付文件必须正常打开。这类条件要事先约定。摘要再流畅,也补不上特定项目缺少必要来源的问题。
复核成本要算进总账
以下是虚构预算算例,用于说明计算方式,不是产品报价:方案甲每月许可费 800 元,方案乙 1,500 元;每月处理 100 项任务,内部时间成本按每小时 200 元估算。假定甲每项复核 12 分钟,乙 6 分钟,复核成本分别为 4,000 元和 2,000 元。只计算这两项,总额为 4,800 元和 3,500 元。
这个算例不能证明价格高的方案更好。需要核实的是,六分钟和十二分钟是否来自同等质量下的实际记录,以及团队是否认可每小时 200 元的口径。没有时间记录时,应把这些数字列为情景假设,按不同数值做敏感性比较。
还要计入数据库授权、文件转换、培训、组件维护、失败重做和迁移成本。组合方案的模型费可能很低,但某个连接服务可能需要长期维护;企业版单价较高,也可能包含部分团队功能。费用应按满足同一任务要求后的总成本比较。
采购文件可保留“报价日期、币种、税费、人数、额度、超额单价、续费条件”等列。官方未公布价格时,应写明需询价,不能从几年前的评测中补出一个现价。
供应商应回答这些问题
只问“数据安全吗”,很难得到可以验收的答案。换成以下问题,技术和法务才能分别核查。
- 输入文件经过哪些服务,分别由谁提供?
- 哪些内容会被保存,保存目的与期限是什么?能否删除,备份如何处理?
- 是否用于模型训练或改进?适用哪个账号、套餐和开关?
- 团队管理员、普通用户及外部协作者分别能访问什么?
- 数据库来源与访问授权由谁提供?授权到期会影响什么?
- 能导出哪些格式,终止服务后能否取回必要记录?
- 产品或底层模型发生变化,是否通知,是否支持重新验证?
- 发生错误调用、服务中断或材料外传时,双方如何联系和处置?
网页宣传、客服回答、合同承诺和实际配置应分别登记。有些能力只在企业部署选项中提供;不能拿该选项的说明,为默认个人账户作保证。涉及个人信息委托处理等安排,还需结合实际关系核定合同与监督要求。个人信息保护法原文。
试用结束后写成一页决定
采购结论可以包括:拟采用的方案与版本;允许承担的任务;使用材料范围;已测试样本与日期;通过的条件;失败项目和回退方式;预计费用;负责人及下次复评触发条件。
例如可以写:“用于公开法源初步整理及模拟合同练习;真实客户材料另按准入范围处理。当前没有验证扫描件批注保留,因此不用于该项交付。”这比“满足所有法律场景”更容易执行,也方便后续扩大范围。
选型不必一次解决未来两年的全部需求。先把最高频的一项工作用好,积累复核时间和失败记录;后续确需案例数据库或自动导出时,再测试新增功能。账号共享、人员离职、套餐变化和底层模型更新,都可能需要重新审视原决定。
试用会议要看原始材料
要求演示者展示输入文件、完整输出和复核后的交付件,不要只看几张最好看的截图。选择一条关键结论,请他当场回到原文定位;再找一条没有识别的问题,讨论正式工作中应如何补救。
会议记录可以采用四栏:“发现、证据、影响、决定”。例如:“导出表格丢失两条批注;见样本 D02 及输出文件;需要人工补录,影响交接;暂不采用该功能。”这类记录不容易被会后的宣传语替换,也便于供应商提供修复版本后复测。
也应给供应商相同的解释机会。若失败由材料损坏或操作不符合官方要求造成,应说明情况并做可比的补测;补测要保留初次结果和修正条件。不能把一次人为误操作永久算作产品能力,也不能因供应商解释而删除真实失败。
多名同事参与时,先独立审看同一份结果,再讨论分歧。有人重视文字流畅,有人重视可核验来源,分歧可能来自评分含义不同。把“来源可靠”拆成“链接能开、原文能定位、内容支持结论”,更容易形成一致标准。
试用样本还应包含团队不熟悉或工具不擅长的情形。只用供应商已经演示过的范本,不能说明它面对新材料时如何处理未知问题。公开样本可用于开始,正式扩大范围前,再按允许条件加入能够代表实际任务的材料。
不同团队从不同任务起步
个人律师每周只处理几份合同,可以先比较文件操作和复核成本,避免为了一个简单任务维护复杂连接。选择期间重点记录:需要转换几次格式、每次引用是否需要重新查找、客户临时修改时能否继续沿用已有工作。
企业法务处理大量相似业务,可以先由熟悉该类合同的人制作基准,包括常见例外和不应修改的条款。工具是否遵从审查标准、是否记住版本和业务立场,比回答通用问题是否漂亮,更接近实际使用目的。
有信息化团队的律所可以增加权限、接口和日志验证,但仍应以一个完整业务任务验收。接口返回 200,只说明请求层面成功,不能说明字段正确、来源完整或文档能够交给客户。技术检查与业务检查都应有人签注。
三类团队都要保留退出办法。试用不合适时,材料能否取回、模板能否迁移、账号如何关闭、运行记录存放在哪里,都应在采购前问清楚。切换成本通常在积累了大量材料后才显现。
出现哪些变化应重新测试
底层模型更新、数据库来源改变、文件解析器更换、套餐权限调整,以及团队引入新合同类型,都可能使旧结果不再代表当前工作。复测不必每次重做全部十二项,可以按变化影响的任务选择固定样本,并保留原结果对照。
例如,变化只涉及 Word 导出时,先检查批注、表格、编号和版本差异;若同时更换模型,再扩大到条款识别和修改建议。测试范围应由变化决定,不必按日历机械重复。
出现一次严重错误时,也不要只加一句更长的提示词就结束。应检查错误出在读取、检索、生成还是交付,并判断同类任务是否受影响。相关条件得到解释并重新验证后,才适合恢复原使用范围。
团队没有足够条件完成某项验证时,可以暂时限制该功能,继续使用已验证部分。采购决定可以保留未解项,只要没有把它们藏在一个漂亮总分后面。
下载评估表后先做小范围试用
下载法律 AI 六类任务评估包,包含测试任务、运行记录、评分维度、供应商问卷和预算示例。预算数字已标注为虚构假设,产品得分保持空白。
合同任务可直接使用采购合同审查实战的教学包;引证检查参照法律检索核验指南;试用通过后,用律所 AI 使用规范把允许范围交给团队。
本文由 AI 辅助检索与撰写,已进行公开资料核对和文字修订。没有开展商业产品同题实测,未采用厂商提供的性能数字或用户访谈结论。资料核对日期:2026 年 9 月 15 日。
引用与继续阅读
法律 AI 试用:六类任务怎么测|AIILAW.cn|2026-09-15|https://aiilaw.cn/legal-ai-tools-evaluation-guide/