一封监管问询函列出十七个编号事项,卷宗里却混着邮件截图、扫描件、整改报告和几年前的制度版本。通读文件未必是最耗时的环节,把每份材料放回问询函对应的格子里更费工夫。8月11日,Relativity 发布 aiR for Review 的 Custom Analyses,用自定义提取和分类处理图片、扫描件及半结构化文件。中国团队很难把它当成一份可直接采购的海外产品答案,但可以借用其中的拆题方式。
这类系统能把“相关/不相关”之外的判断写成字段。例如,材料对应问询函第几项,文件属于制度说明、业务执行还是整改记录,是否已在关联事项中提交过。Relativity 的说明中,这些字段由单一目标的提示分别生成;审阅人员仍然保留相关性和特权判断,并对字段结果确认或改写。产品页同时将 Custom Analyses 列为可按事项要求批量提取、分类文档的能力。
问询函编号可以成为文档审阅的主索引
国内企业处理监管检查、行政调查或内部调查材料时,常见的工作表是“文件名、来源人、日期、摘要”。它便于盘点,却未必能回答监管者的问题。问询函的编号、适用期间、业务主体和文件角色,才是后续解释和提交的结构。
假设一项问询涉及某三年期间的营销审批。模型可被限定为从文件中提取问询编号、涉及主体、文件角色和日期范围,每个字段对应一个明确的判断条件。输出用于形成初筛表,不替代事实认定。截图中的聊天记录、扫描版审批单和附件中的旧版本制度,恰好也是最容易被人工表格漏掉、又不适合用关键词粗筛的材料。
一项抽取任务只承担一个判断
海外产品的做法里有一个细节值得保留:一个提示对应一个目标。把“是否相关、对应哪项问询、是否涉密、是否已提交、摘要是什么”压进同一条指令,得到的往往是一段顺口的说明,字段之间却难以复核。拆成独立字段后,抽样核验可以对应到每一个判断条件;复核人改动的是单个字段,无需推翻整段模型意见。
这套方法并不依赖 Relativity。中国团队在自建检索系统、国内模型或已有电子取证平台中,都可以先把问询函整理成编号和要件,再将编号映射、文件角色、时间范围等写成单独的结构化结果。需要留存的材料包括原始文件定位、模型版本、提示内容、输出值和人工改写记录。缺少这些,后一轮补件或质询到来时,很难说明某份文件为何被归到某一项之下。
材料能否出域仍是独立问题
这一流程移植到中国时,硬约束不在提示词。问询材料可能含有个人信息、商业秘密、客户资料或受保密义务约束的第三方文件。海外 SaaS 的功能说明、ISO 或 SOC 认证,不能自动回答这些材料能否被上传、由谁访问、解析结果保存在哪里。采购或上线材料通常需要把数据类别、处理地点、分包处理、保留期限和导出路径单列出来,这些问题与模型分类准确率是两条不同的审查线。
因此,较小的试点可以只使用已经脱敏、已完成权限确认的历史材料,并保留人工既有的编号结果作对照。模型字段与人工结果不一致的样本价值最高:它能暴露问询编号定义是否含混、文件角色是否混用,或图片和扫描件是否需要单独处理。
对法务和调查团队而言,下一次问询函到来时,可以先做的一件事,是把问询编号整理成一张可测试的字段表,再交给模型逐项填充。模型少读几千页,本身不构成可交付的成果;监管追问时,每个编号下都要能拿出可回看的文件依据。