← 返回首页

金融知识库 AI 生产管线

从 4 个监管网站每日自动采集法规,经 AI 提取、打标、汇总,人工审核后上线——替代纯手工录入的机械劳动,保留人的判断。

核心数据

2,100+
条法规已上线
1,400+
条术语 · 44 个行业
+180%
法规模块月活同比增长(零投放)
~1.3
PV/UV 比(命中率高,用户不迷路)

我的角色

独立负责内容策略、生产管线设计、质量标准定义的全流程。我不是写代码的那个人,但我决定了「AI 做什么、不做什么」——这是产品经理在这个项目里最核心的价值。

要解决什么问题

公司金融法规库的生产完全依赖人工:专人每天手动访问 4 个监管网站逐条查看更新,人工录入十余个字段,再由另一组人审核。整条链路有三个核心问题:

效率低
每天处理量受限于人工录入速度,无法覆盖所有新发布法规
易遗漏
人工巡检难免漏看,特别是凌晨和周末发布的
数据滞后
从法规发布到入库上线,往往滞后 2—3 天
核心原则:AI 不替代决策,只替代录入、提取、分类。
凡是判断性的工作(认可/否定、放行/驳回、错误纠正)保留人工;凡是机械性、模式化的工作(采集、提取、打标、名词识别)由 AI 完成。

生产管线:6 阶段人机协作

不是「AI 一把梭」,而是每个阶段明确定义了谁做什么、谁判断什么。

📋 过程流程
阶段一:采集
定时任务
每日 08:00
🕷️
多源爬虫
4 个网站
10 个维度
📄
PDF 快照
Playwright
懒加载防漏
阶段二:AI 初筛 → 人工校验
🤖
AI 初筛
收录/不收录/存疑
👤
人工校验
点击链接溯源
认可 / 否定
不收录
非法规内容
直接挡掉
阶段三:AI 深度处理 → 汇总 → 人工审核
🤖
字段提取 2A
12 个结构化字段
JSON Schema 校验
⚙️
字段汇总
机械合并
23 字段完整记录
👤
人工审核
有误修改
无误放行
🤖
标签打标 2B
四级联动标签
100+ 分类
阶段四:上线
👤
老板终审
放行 / 驳回
法规库上线
RAG 检索底座
阶段五-六:百科词库管线(法规上线后触发)
🤖
AI 名词提取
从法规正文
提取金融术语
👤
百科审核
👤
老板终审
百科词库上线

5 个关键设计决策

以下是我在产品设计过程中做的判断——不是「AI 应该怎么做」,而是「为什么这么做」。

设计决策

① 初筛和字段提取分开,而不是合并成一个「全功能 AI 节点」

初筛只需要做一件事:收录 / 不收录 / 存疑三选一判定,输出 20 字以内。非法规内容(年度报告、征求意见稿)应该在最早阶段被识别并挡掉,不需要浪费 token 做深度字段提取。分开后初筛输出 token 减少约 90%,成本显著降低,且职责单一更容易迭代。

设计决策

② 字段提取(2A)和标签打标(2B)并行而非串行

两个任务性质完全不同:2A 是严格结构化抽取,输出必须通过 JSON Schema 校验;2B 是语义分类加决策漏斗,提示词长达数千字且随业务频繁调整。分开后各自独立测试、独立优化,互不拖累。2B 不依赖 2A 的输出——它只需要法规全文和名称,这两个在更早的爬虫阶段就已确定。

设计决策

③ 字段汇总不用 AI,纯机械合并

2A、2B、爬虫三路数据汇成一条 23 字段的完整记录。这个合并是确定的字段映射,不涉及任何语义判断——不该用 AI。用 AI 做无判断的合并是过度设计,引入幻觉风险却没有收益。

踩过的坑

④ 校验规则从「指南」升级到「硬阻断」

第一版自动校验产生了 654 条疑似问题,但大量是假阳性。AI 在批量模式下会系统性地跳过软性检查——它知道规则但不觉得「必须执行」。解决方案:把关键校验做成硬阻断(不过不进入下一阶段),同时补全规则覆盖面和调整阈值,将待人工核查收敛到 30—40 条。

踩过的坑

⑤ 定义必须逐字引自法规原文,禁止 AI 概括

AI 概括会「平滑」掉关键约束。一条法规原文说「除国务院银行业监督管理机构另有规定外,信托公司不得以任何方式…」,AI 概括可能写成「信托公司一般不得…」——那个「除另有规定外」在金融合规场景里就是命。所以我定了纯净度标准:定义部分必须是原文逐字引用,AI 只能做格式清洗和结构提取。

数据模型:24 个字段 + 状态机

每个字段标注了产出阶段(爬虫 / AI / 汇总),确保「每个字段只在一个节点产出」——没有两个节点修改同一个字段的情况。

字段产出阶段类型
法规名称AI 2A文本
法规版本AI 2A格式:YYYY年M月发布/修订
发文单位(全称)AI 2A简称→全称映射
发文字号AI 2A去重提取纯文号
发文日期(落款)AI 2A以正文落款为准,非网站发布日期
实施日期AI 2A正文「自xxx起施行」提取
效力状态AI 2A枚举:现行/修订/废止/失效
法规全文AI 2A去 HTML 标签保留换行
标签一~四级AI 2B金融行业/市场/管理 → 四层联动
打标置信度+理由AI 2B高/中/低,低则自动勾人工复核
法规原始页面链接爬虫采集唯一键,去重主键
法规原始页面 PDF爬虫采集Playwright 导出,防链接失效

状态机

待初筛人工认可待字段提取 → AI 处理 → 待审核 → 人工放行 → 待终审 → 老板放行 → 已上线
 ↳ 人工否定 → 不收录           ↳ 驳回 → 待审核    ↳ 驳回 → 待审核

数据源:4 个监管机构 · 10 个采集维度

监管机构采集模块维度数
证监会政府信息公开 · 主动公开(证监会令 / 公告 / 监管规则适用指引)3
金融监管总局法律法规 + 政策规章规范性文件2
中国人民银行国家法律 / 行政法规 / 部门规章 / 规范性文件4
外汇管理局政策法规1

每日 08:00 定时采集前一日新发布法规,以「原始页面链接」为唯一键去重。采集频率和去重策略在 PRD 中明确定义,所有爬虫探针脚本(8 个)已完成可行性验证。

异常处理:不阻塞主流程

异常场景处理方式
详情页 404 / 链接失效记录原始链接、跳过正文提取、标记「待人工补录」
附件 PDF/Word 解析失败保存原始文件、标记「正文待补」、不影响其他字段入库
AI 调用超时 / 失败单条跳过、记录日志、每日汇总告警
PDF 快照失败(空白 / 半截)标记异常但不阻塞主流程——正文文本已单独提取
AI 不可用(整体降级)回退到「仅采集 + 人工处理」模式,法规不丢失
同一法规被多源转载以原始页面链接为唯一键去重,取最早采集源

项目交付物

类型内容状态
PRD含背景、范围、数据源、24 字段定义、AI 节点设计、状态机、异常处理、实施计划✅ 完成
过程流程图6 阶段人机协作流程,标注 AI / 人工 / 终审角色✅ 完成
数据流向图24 字段从采集到入库的完整流转路径✅ 完成
AI 提示词 × 4初筛判定 / 字段提取 / 标签打标 / 字段汇总规范✅ 完成
爬虫探针 × 84 个监管网站可行性验证,含懒加载防漏策略✅ 归档
验证脚本 × 2PDF 导出验证 + 字段汇总降级场景验证✅ 完成
端到端测试2 条真实样本跑通全部 AI 节点✅ 通过