高风险业务里的 AI 怎么落地:设计一个可审计的人工复核闭环
摘要:以合规审查和材料核验为例,讨论 Human-in-the-loop 工作流中的任务拆解、证据状态、人工决策、审计记录和失败边界。
关键词:Human-in-the-loop、AI 合规审查、人工复核、AI 工作流、审计日志、风险控制
在内容推荐或图片生成中,AI 输出不理想往往只意味着体验下降。但在合同、采购、财务、法务和合规场景中,一个遗漏的强制条款可能直接改变业务结果。
这类系统不能把“模型回答”当作流程终点。更合适的定位是让 AI 完成证据整理、差异发现和初步分类,再把必须由人承担的判断明确交回给授权角色。
这就是 Human-in-the-loop 的核心:不是在页面底部放一句“结果仅供参考”,而是把人工复核设计成系统状态机的一部分。

图 1:合规审查先限定项目、参考资料和审查范围,再启动分析。截图取自标脉云的真实业务界面。
先拆分事实提取和业务判断
一个“这个项目是否合规”的问题里,至少混合了两类任务。
事实提取可以由系统辅助完成,例如找出资质要求、签章要求、授权文件、截止时间和废标条款。业务判断则需要结合企业实际材料、授权制度和风险偏好,例如某项资质能否满足、某个偏离是否可以接受。
把两类任务分开后,输出结构可以设计为:
Requirement
- source evidence
- extracted condition
- current material
- machine status
- reviewer decision
- review note
模型可以给出“已找到”“可能缺失”“存在冲突”等机器状态,但最终的“满足”“不满足”“需补充”应由有权限的人员确认。
用响应矩阵代替一段长答案
高风险场景不适合只输出一段自然语言总结。长文本可读,但很难逐项确认,也不利于责任分配。
响应矩阵更适合把要求拆成独立条目,每一项包含来源、当前证据、风险等级、负责人、截止时间和复核状态。这样既方便逐项处理,也能避免某条重要要求被模型写在段落中间后无人跟进。
风险等级也不应完全由模型自由决定。可以先建立明确规则:导致直接失去资格的条款属于高风险;需要补充材料但仍有时间处理的属于中风险;表达或格式问题属于低风险。模型负责匹配规则,人负责确认边界。
人工复核不是一个复选框
如果页面只有“我已阅读”按钮,系统无法证明用户核验了什么。有效的人工复核至少应该记录:
- 复核人及其角色;
- 复核时间;
- 看到的文档版本和 AI 结果版本;
- 对每个关键事项的决定;
- 修改前后的内容;
- 退回、补充或升级处理的原因。
当输入文档发生变化时,相关复核状态需要失效或进入重新确认,而不能继续沿用旧结论。
把失败状态显式化
AI 工作流常见的危险做法,是把超时、解析失败和低置信度都包装成一个不完整的正常答案。更稳健的系统应区分:
- 文档无法解析;
- 没有找到相关证据;
- 找到多处冲突证据;
- 模型置信度不足;
- 用户没有权限读取来源;
- 任务执行超时或服务异常。
这些状态需要进入不同的处理分支。比如解析失败应要求更换文件,证据冲突应要求人工选择版本,权限不足则不应泄露任何片段。
审计日志记录什么
为了事后还原一次判断,日志需要覆盖输入、处理和输出三部分。
输入包括文件版本、项目状态、用户选择的审查范围和权限上下文;处理包括模型与提示模板版本、检索到的证据 ID、规则版本和异常;输出包括初始结果、人工修改、最终决定和导出记录。
日志不等于把所有敏感文本无限期保存。系统仍需要设置数据保留周期、脱敏策略和访问权限,并明确哪些内容只记录哈希与引用,哪些内容必须保存原文快照。
如何做上线前验证
这类功能不适合只用几个“看起来正确”的问题验收。测试集应该覆盖:
- 明确满足的要求;
- 明确缺失的材料;
- 同一要求在多个文件中冲突;
- 扫描件和表格中的关键条款;
- 已过期或被替代的文件;
- 无权访问的敏感资料;
- 模型应当拒绝判断的模糊问题。
除了准确率,还要测试状态流转:任务失败后能否重试,文档更新后旧结论是否失效,审核人退回后负责人是否收到明确动作,以及导出内容是否与最终批准版本一致。
结语
高风险业务采用 AI 的目标,不应该是把人从流程中移除,而是把人的注意力集中到真正需要判断的地方。
当事实、证据、机器状态、人工决定和版本记录被放在同一条链路上,AI 才能从一个会生成答案的组件,变成一个可控、可复核、可审计的工作流节点。
–EOF–
转载须以超链接形式标明文章原始出处和作者信息
