AI法律科技与智能化实务横幅
法律 AI 已经走进具体工作 合同审查、合规分析、案件梳理与律所工作流
首页 / AI工具应用

模型降价之后,法律 AI 更需要按任务风险分层

模型降价之后,法律 AI 更需要按任务风险分层

7月30日,OpenAI下调GPT-5.6 Luna与Terra的API价格,并把不同型号的速度、推理能力和单位任务成本放在同一套产品叙事中。更值得法律行业关注的并不是某个百分比,而是小型模型已经能够使用工具、完成多步骤流程。过去只有少量高价值事项值得调用先进模型,如今合同归类、条款抽取、材料初筛等高频工作也可能进入规模化预算。

这会改变法律AI采购中的一个老问题:团队不必再寻找一款包办所有工作的“最强模型”,而应判断每一道工序需要多少智能、允许多大误差,以及哪一步必须交给律师。

低价不等于可以取消复核

厂商公布的通用评测显示,新模型在单位成本和处理速度上取得进展;Clio与Legora提供的早期反馈也涉及法律检索、交易文件分析、结构化起草和先例审查。但这些数字大多来自各自测试集,不能直接证明模型在某一法域、某类合同或某家机构的模板上同样可靠。

尤其是法律任务,错误成本并不与文本长度成正比。漏掉一处控制权变更条款,可能比写错十段普通摘要更严重;检索到真实判例,也不代表它仍然有效或足以支持所述命题。模型降价之后,省下的预算更适合投入样本建设、人工复核和持续评测,而不是简单扩大无人审核的调用量。

把一个工作流拆成不同风险层

实际部署可以先按输出用途分层,再决定模型,而不是反过来。一个相对稳妥的起点是:

  • 低风险层:文档去重、格式整理、已知字段抽取,可使用低成本模型并抽样检查;
  • 中风险层:合同差异比较、尽调问题清单、检索词扩展,应保留来源定位和逐项复核;
  • 高风险层:法律结论、诉讼文件、最终谈判立场,应调用更强模型,并由有权限的律师作实质审查和签发。

同一事项也可以动态路由。例如先让轻量模型识别文档类型和异常项,只有置信度不足、涉及关键条款或出现来源冲突时,才升级到更强模型。这样节省的是无差别使用高算力的成本,而不是专业判断。

评测指标应落到“合格结果成本”

单看每百万Token价格容易产生错觉。法律团队真正支付的还包括返工时间、律师复核、错误升级、系统集成与数据治理。更有用的指标是:完成一份达到内部验收标准的结果,总共花了多少钱和多少人工时间。

测试时可以固定一组真实但已脱敏的事项,记录准确率、关键问题召回率、引证可核验率、人工修改分钟数和升级比例。若便宜模型生成十份材料,却有三份需要重做,它未必比单价更高但一次通过率稳定的模型划算。评测还应按任务分别统计,避免平均分掩盖某个高风险环节的明显短板。

采购合同也要为模型切换留出空间

价格与能力快速变化后,法务在采购阶段应确认数据用途、日志保存、子处理者、模型版本变更通知和退出机制,并要求供应商说明不同任务实际调用的模型。内部系统则要保留版本、提示词、输入来源、工具调用与复核人的记录,便于出现争议时还原过程。

模型越来越便宜,会让法律AI从少数人的试验走向日常基础设施。真正稳健的做法,是把低成本能力放在边界清楚、能够验证的位置,把高风险判断继续留给负责任的人。本文仅作行业信息交流,不构成针对具体事项的法律意见。

参考线索

轩辕法律服务网 Law2CN.com 广告
从读到用

带走这份四步核对清单

  • 先界定任务与数据边界
  • 检查来源是否可定位
  • 设置人工复核与升级条件
  • 保留权限、版本和日志