7月,月之暗面发布Kimi K3。联合早报援引彭博社报道称,这款模型在多项基准测试中的表现接近OpenAI和Anthropic的头部模型,并在网页开发任务相关的Arena排行榜上取得较高名次。相关表现引起市场对中美前沿模型差距的重新讨论,也为律所、企业法务和法律科技公司的模型采购增加了新的选项。
据月之暗面官方博客介绍,Kimi K3拥有2.8万亿参数、原生视觉能力和100万token上下文窗口,主要面向长周期编程、知识工作及推理任务。上述参数和能力来自厂商披露,仍需结合独立测试及具体业务场景评估。月之暗面同时表示,K3整体性能具有竞争力,但用户体验与最强闭源模型仍有差距;对于要求智能代理在明确范围内行动的应用,开发者需要通过系统提示词或AGENTS.md设置更清晰的行为约束。
法律业务关注任务适配
通用模型排行榜通常衡量编程、推理或问答能力,难以直接反映模型在法律业务中的可靠性。合同审查、诉讼材料整理、尽职调查摘要、法律检索和账单分析使用的数据、输出要求及责任链条并不相同。法律团队除考察模型能力外,还需明确模型可以读取哪些资料、可以完成哪些操作,以及输出由谁复核。
长上下文和代理能力能够帮助模型处理较大的案卷、合同组或内部知识库,但也可能扩大错误操作的影响。模型在缺少授权边界时生成结论、调用工具或继续推进流程,可能涉及客户保密、内部权限和专业责任。系统部署因此需要配套访问控制、操作日志、人工复核及异常处置机制,不能仅依赖提示词约束。
开放模型增加采购选择
联合早报此前将Kimi K3称为全球规模较大的开源模型之一,并援引相关信息称其性能接近美国前沿模型。开放权重路线可能改变法律科技市场的采购结构。律所和企业法务除使用少数闭源服务外,还可根据数据敏感程度、部署成本和业务负载,将部分任务交由本地或专有环境中的模型处理。
部署方式改变并不会自动消除合规风险。采购闭源模型时,审查重点通常包括数据处理规则、保密承诺、审计能力、服务连续性及供应商责任;使用开放模型时,还要核查模型许可证、部署和推理服务主体、微调数据来源、安全更新及输出留痕。本地部署可以减少部分数据外传风险,但系统运维、权限配置和二次训练仍可能形成新的责任环节。
国内模型能力提升后,法律科技产品的竞争也可能进一步转向法律数据和工作流程。仅接入通用模型难以形成稳定优势。法规、案例、合同模板、内部法律意见和审批记录能否被准确整理,检索结果能否回到原始依据,人工复核能否嵌入流程,将直接影响产品在专业场景中的可用性。
训练来源进入合同审查
K3发布期间,围绕“模型蒸馏”的争议也受到关注。联合早报相关报道提到,中国官员对有关炒作作出回应。现有公开信息尚不足以对具体争议作出法律定性,但训练数据来源、模型输出相似性、商业秘密和许可边界已成为前沿模型竞争中的现实议题。
企业采购法律AI工具时,可在合同中要求供应商说明训练及微调数据的合规安排,明确客户数据是否会被用于后续训练,并约定第三方知识产权索赔、争议输出处理和日志导出机制。模型被用于合同生成、案件策略分析、客户文件处理或知识库问答后,这些安排与服务价格、性能指标同样会影响采购风险。
供应商对训练数据的披露通常受到商业秘密限制,采购方未必能够获得完整数据清单。因此,合同审查还需关注供应商能否提供数据治理说明、权利保证、审计材料及赔偿安排,并根据不同任务控制模型的使用范围。
按业务建立测试标准
K3的发布尚不足以支持法律团队立即替换现有模型,也不能证明国内模型已在所有法律场景中取得优势。较为审慎的采购方式,是避免把供应商国别、品牌或单一排行榜作为决定性依据,并为不同任务分别测试。
法律检索应重点检查引文准确性、原文可追溯性和法规时效;合同审查应测试模型对企业模板、交易背景和风险偏好的理解;诉讼材料分析需要核验时间线、证据对应关系及不确定性提示;面向员工或客户的法务入口,还要测试权限控制、转人工机制和日志完整性。测试集应包含实际业务中的边界案例,并保留人工评估记录。
多模型、多供应商和多种部署方式并存后,法律AI采购将更接近一项持续的技术与合规管理工作。模型性能仍是重要指标,但资料来源、权限范围、人工复核和责任承担同样需要在上线前确定,并在模型更新后重新评估。
资料来源
- 联合早报:彭博:月之暗面新模型打破美国领先中国 AI 固有认知
- Kimi / Moonshot AI:Kimi K3 Tech Blog: Open Frontier Intelligence
- 联合早报:月之暗面发布全球最大规模开源模型Kimi K3
- 联合早报:月暗新模型搅动市场 中国官员斥炒作“蒸馏”将适得其反