从 4 个监管网站每日自动采集法规,经 AI 提取、打标、汇总,人工审核后上线——替代纯手工录入的机械劳动,保留人的判断。
独立负责内容策略、生产管线设计、质量标准定义的全流程。我不是写代码的那个人,但我决定了「AI 做什么、不做什么」——这是产品经理在这个项目里最核心的价值。
公司金融法规库的生产完全依赖人工:专人每天手动访问 4 个监管网站逐条查看更新,人工录入十余个字段,再由另一组人审核。整条链路有三个核心问题:
核心原则:AI 不替代决策,只替代录入、提取、分类。
凡是判断性的工作(认可/否定、放行/驳回、错误纠正)保留人工;凡是机械性、模式化的工作(采集、提取、打标、名词识别)由 AI 完成。
不是「AI 一把梭」,而是每个阶段明确定义了谁做什么、谁判断什么。
以下是我在产品设计过程中做的判断——不是「AI 应该怎么做」,而是「为什么这么做」。
初筛只需要做一件事:收录 / 不收录 / 存疑三选一判定,输出 20 字以内。非法规内容(年度报告、征求意见稿)应该在最早阶段被识别并挡掉,不需要浪费 token 做深度字段提取。分开后初筛输出 token 减少约 90%,成本显著降低,且职责单一更容易迭代。
两个任务性质完全不同:2A 是严格结构化抽取,输出必须通过 JSON Schema 校验;2B 是语义分类加决策漏斗,提示词长达数千字且随业务频繁调整。分开后各自独立测试、独立优化,互不拖累。2B 不依赖 2A 的输出——它只需要法规全文和名称,这两个在更早的爬虫阶段就已确定。
2A、2B、爬虫三路数据汇成一条 23 字段的完整记录。这个合并是确定的字段映射,不涉及任何语义判断——不该用 AI。用 AI 做无判断的合并是过度设计,引入幻觉风险却没有收益。
第一版自动校验产生了 654 条疑似问题,但大量是假阳性。AI 在批量模式下会系统性地跳过软性检查——它知道规则但不觉得「必须执行」。解决方案:把关键校验做成硬阻断(不过不进入下一阶段),同时补全规则覆盖面和调整阈值,将待人工核查收敛到 30—40 条。
AI 概括会「平滑」掉关键约束。一条法规原文说「除国务院银行业监督管理机构另有规定外,信托公司不得以任何方式…」,AI 概括可能写成「信托公司一般不得…」——那个「除另有规定外」在金融合规场景里就是命。所以我定了纯净度标准:定义部分必须是原文逐字引用,AI 只能做格式清洗和结构提取。
每个字段标注了产出阶段(爬虫 / AI / 汇总),确保「每个字段只在一个节点产出」——没有两个节点修改同一个字段的情况。
| 字段 | 产出阶段 | 类型 |
|---|---|---|
| 法规名称 | AI 2A | 文本 |
| 法规版本 | AI 2A | 格式:YYYY年M月发布/修订 |
| 发文单位(全称) | AI 2A | 简称→全称映射 |
| 发文字号 | AI 2A | 去重提取纯文号 |
| 发文日期(落款) | AI 2A | 以正文落款为准,非网站发布日期 |
| 实施日期 | AI 2A | 正文「自xxx起施行」提取 |
| 效力状态 | AI 2A | 枚举:现行/修订/废止/失效 |
| 法规全文 | AI 2A | 去 HTML 标签保留换行 |
| 标签一~四级 | AI 2B | 金融行业/市场/管理 → 四层联动 |
| 打标置信度+理由 | AI 2B | 高/中/低,低则自动勾人工复核 |
| 法规原始页面链接 | 爬虫采集 | 唯一键,去重主键 |
| 法规原始页面 PDF | 爬虫采集 | Playwright 导出,防链接失效 |
| 监管机构 | 采集模块 | 维度数 |
|---|---|---|
| 证监会 | 政府信息公开 · 主动公开(证监会令 / 公告 / 监管规则适用指引) | 3 |
| 金融监管总局 | 法律法规 + 政策规章规范性文件 | 2 |
| 中国人民银行 | 国家法律 / 行政法规 / 部门规章 / 规范性文件 | 4 |
| 外汇管理局 | 政策法规 | 1 |
每日 08:00 定时采集前一日新发布法规,以「原始页面链接」为唯一键去重。采集频率和去重策略在 PRD 中明确定义,所有爬虫探针脚本(8 个)已完成可行性验证。
| 异常场景 | 处理方式 |
|---|---|
| 详情页 404 / 链接失效 | 记录原始链接、跳过正文提取、标记「待人工补录」 |
| 附件 PDF/Word 解析失败 | 保存原始文件、标记「正文待补」、不影响其他字段入库 |
| AI 调用超时 / 失败 | 单条跳过、记录日志、每日汇总告警 |
| PDF 快照失败(空白 / 半截) | 标记异常但不阻塞主流程——正文文本已单独提取 |
| AI 不可用(整体降级) | 回退到「仅采集 + 人工处理」模式,法规不丢失 |
| 同一法规被多源转载 | 以原始页面链接为唯一键去重,取最早采集源 |
| 类型 | 内容 | 状态 |
|---|---|---|
| PRD | 含背景、范围、数据源、24 字段定义、AI 节点设计、状态机、异常处理、实施计划 | ✅ 完成 |
| 过程流程图 | 6 阶段人机协作流程,标注 AI / 人工 / 终审角色 | ✅ 完成 |
| 数据流向图 | 24 字段从采集到入库的完整流转路径 | ✅ 完成 |
| AI 提示词 × 4 | 初筛判定 / 字段提取 / 标签打标 / 字段汇总规范 | ✅ 完成 |
| 爬虫探针 × 8 | 4 个监管网站可行性验证,含懒加载防漏策略 | ✅ 归档 |
| 验证脚本 × 2 | PDF 导出验证 + 字段汇总降级场景验证 | ✅ 完成 |
| 端到端测试 | 2 条真实样本跑通全部 AI 节点 | ✅ 通过 |