MRM 体制变更 (OCC 2026-13)
B1→B15 我们一路从「能跑评测」(B7 eval gate)走到「能对抗、能 HITL、能算 κ」(B14-B15 FIS×Anthropic 模式 + 对抗/HITL 套件)。但一个能跑分的 harness 不等于一个能过监管审查的系统——这正是 B16 的位置:把已建的技术能力套进真实的模型风险治理框架,让它能被「有效挑战」。今天是 B16 第一砖:监管底座从废止的 SR 11-7 换成
阶段: B16 · 治理一页纸 + AI 原型 + 可用性(Day 151-160) 标签: #model-risk-management #occ-2026-13 #effective-challenge #ai-governance
今日导引(由浅入深)
B1→B15 我们一路从「能跑评测」(B7 eval gate)走到「能对抗、能 HITL、能算 κ」(B14-B15 FIS×Anthropic 模式 + 对抗/HITL 套件)。但一个能跑分的 harness 不等于一个能过监管审查的系统——这正是 B16 的位置:把已建的技术能力套进真实的模型风险治理框架,让它能被「有效挑战」。今天是 B16 第一砖:监管底座从废止的 SR 11-7 换成 OCC Bulletin 2026-13,并诚实指出本仓最大的合规杀伤点——evalBaseline.ts 的自评闭环违反「有效挑战」原则。今天的最小可判定产出:docs/AML_GOVERNANCE_MAP.md 含 OCC 2026-13 三控制域骨架 + 已核验日期。
1. 机理精读
模型风险管理 (MRM) 的元老指引正式换代。 美国银行业监管中统治了十余年的 SR 11-7("Guidance on Model Risk Management")已于 2026-04-17 正式废止,监管转向 OCC Bulletin 2026-13 的「原则化、风险匹配」框架。这是一次范式而非细节的变更:
- SR 11-7 时代倾向于一套统一的验证清单——不论模型大小都套同一套检查项。
- OCC 2026-13 不再强制统一清单,而要求机构按模型风险等级自定控制强度——高风险模型上重控,低风险模型上轻控。
- 举证责任转移:由机构自证其控制与风险匹配,监管者据此「有效挑战」。这对一个会写 SAR 草稿的 AML LLM 是利空——它落在高风险一端,要求更强的独立验证。
三栏内核没变,只是更原则化。 不论 SR 11-7 还是 OCC 2026-13,MRM 的三栏支柱仍是:
- 模型清单 (inventory)——你得知道自己有哪些模型在跑、各自版本号、负责人、用途。
- 独立验证 (validation)——必须有独立于开发者的角色去验证模型,覆盖概念合理性、数据、输出、监控。
- 有效挑战 (effective challenge)——这是最锋利的一条:验证者要有能力、独立性、地位去真正质疑模型,而不是橡皮图章。「独立性」是关键词:验证者必须独立于被验证的模型与其作者。
为什么这条对本仓是杀伤点。 本仓的 src/aml/evalBaseline.ts 是一个循环自评结构——同一套规则引擎既出预测、又用同作者写的合成生成器当金标来打分。在 MRM 语义下这一步一步都犯规:
- 角色未分离:被验证者自己当了验证者,violates「有效挑战」要求的独立性。
- 数据未独立:金标来自同作者的合成生成器,预测的盲区与金标的盲区同源,错误会相互抵消而非暴露。
- GenAI 放大:LLM-as-judge 若与被测同源、同 prompt、同温度,会系统性高估自身表现——偏差有方向,不是随机噪声。
所以 OCC 2026-13 对本仓的整改指令很明确:把自评结果从「独立验证证据」里剔除,改用独立的金标 + 独立裁判(Day 154-155 用 cohensKappa.ts 独立 harness 量化裁判与人工金标的一致性来替换)。
「有效挑战」具体长什么样——一个审查人会问的四问。 effective challenge 不是抽象口号,它是一组可被预演的尖锐问题。把自己当 OCC 审查人,对本仓 SAR 生成器至少会问:
- 数据流:SAR 草稿引用的交易从哪来?是否可溯源到真实案件交易集(防 hallucination)?
- 评测:你用什么金标证明它判得准?金标是否独立于被测(不是自己生成自己评)?
- 成本/可监控:单 case 成本与时延有没有持续监控、退化能否被 gate 拦住?
- 为什么这样设计:为什么 SAR 必须人审、为什么 OFAC 是硬停而非软提示?
本仓对这四问的答案分别落在 groundTruthEval.ts / cohensKappa.ts / gate.ts / hitl.ts——能逐条指认证据文件,才算经得起「有效挑战」。
与相邻概念的边界。 MRM 管的是「模型本身的风险与验证」,它与即将到来的 EU AI Act(Day 152,管透明度/披露/高风险分级)、NIST 600-1(Day 153,管 GenAI 专属 12 类风险)是互补而非重叠的三套框:MRM 偏「内部模型治理流程」,AI Act 偏「面向用户/市场的合规义务」,NIST 偏「风险清单与控制映射」。Day 154 的任务正是把三套收敛成一页。
SR 11-7 → OCC 2026-13 关键差异速查。
| 维度 | SR 11-7(已废止 2026-04-17) | OCC 2026-13(现行 2026-04) |
|---|---|---|
| 取向 | 统一验证清单 | 原则化、风险匹配 |
| 控制强度 | 一刀切 | 按模型风险等级自定 |
| GenAI 适配 | 无专门指引 | 与 NIST 600-1 衔接的 GenAI 视角 |
| 三栏内核 | inventory / validation / effective challenge | 不变(更强调独立性) |
| 对本仓 evalBaseline | 已不合规 | 明确判违反「有效挑战」 |
资源出处:OCC Bulletin 2026-13 "Model Risk Management" (2026-04);SR 11-7 rescinded 2026-04-17。
2. 推导 / 手算 / 代码走读
本日是治理映射工作,引用了两个「模型」的代码证据。逐条走读真实符号:
- 「模型」(1) — agent harness 的 fail-closed gate:
src/agent/eval/gate.ts的checkGate(current, baseline, thresholds)。它的核心不变量写在源文件注释里:「A gate must FAIL CLOSED」——若某阈值已配置但当前指标缺失或非有限(NaN/Infinity),直接记 violation,绝不静默放绿。代码里对completionRate/judgeHumanKappa/unknownRate三个指标都先用Number.isFinite守卫,再比基线。这对应 MRM 的「持续监控」一栏:指标退化即拦截。 checkGate的judgeHumanKappa分支:当thresholds.minKappa配了,而current.judgeHumanKappa不是有限值,就记一条 violation('judgeHumanKappa absent or non-finite (minKappa configured)')。这把「裁判必须被校准过」做成了硬门——直接呼应 MRM 的有效挑战:没有 κ 就没有独立验证证据。- 「模型」(2) — SAR 生成器的 HITL 约束:
src/aml/hitl.ts的状态机draft → pending_review → approved → filed。file(r, now)只允许从'approved'状态报送,否则抛'SAR can only be filed after human approval (HITL gate)';approve(r, officer, now)要求前置状态为'pending_review',否则抛'cannot approve ... (needs human review first)';canAutoFile()返回类型级false,任何调用方都翻不动它。这是「模型不得自决法律行为」的代码化——MRM 视角下属于「人工监督」控制。 - 审计可追溯:
hitl.ts每次状态转移都log()一条AuditEvent(at/actor/action),append-only。MRM 的「持续监控 + 可追溯」要求每个验证/决策动作留痕,这条满足。
把这两个模型分别登记进治理图的 inventory,并标注各自的验证证据文件,就是今天的「模型清单」落地动作。具体登记两行:
| 模型 | 用途 | 版本 | 验证证据 | 风险等级 |
|---|---|---|---|---|
| A · agent harness | 任务套件评测 + CI 门控 | DeepSeek-V4 系列 | gate.ts(fail-closed)+ 待补独立 κ | 中(不直接对外报送) |
| B · AML SAR 生成器 | 生成 SAR 草稿供调查员复核 | DeepSeek-V4 系列 | hitl.ts(不可自动报送)+ groundTruthEval.ts(外部金标) | 高(涉法律文件) |
两行都要标版本号与负责人,满足 inventory 的可追溯要求;风险等级=高的模型 B 触发 OCC 2026-13 的「风险匹配」上重控——即必须有独立验证 + HITL,而非自评了事。
三栏 → 本仓控制的逐栏对照(落 GOVERNANCE_MAP 用)。
- inventory →
src/agent/config/providers.ts(命名模型 + 版本号)+ 报告里的commit/model字段;登记模型 A/B 两行。 - validation →
src/aml/groundTruthEval.ts(外部金标 recall/precision/FPR,非自评)替换evalBaseline.ts;现状=wired 未跑。 - effective challenge →
src/agent/eval/cohensKappa.ts(独立裁判 κ 校准)+gate.ts的minKappa硬门;现状=工具就绪,κ 数字待手标。
3. 今日实战
- 通读 OCC Bulletin 2026-13,确认其三栏(inventory / validation / effective challenge)与废止日期 2026-04-17。
- 把三栏映射到本仓两个「模型」:(1) agent harness(
src/agent/eval/gate.ts)、(2) AML SAR 生成器(src/aml/sarDraft.ts)。 - 在
docs/AML_GOVERNANCE_MAP.md起骨架,落「Regulatory baseline」表的 MRM 行:明确写 SR 11-7 RESCINDED 2026-04-17 → OCC Bulletin 2026-13 / Fed SR 26-2,要求「Do NOT cite SR 11-7 as live guidance」。 - 登记 model inventory 两行(模型 A=harness、模型 B=SAR 生成器),各标用途/证据/版本号/风险等级。
- 在「Open items (honest)」段记下整改项:external-ground-truth eval 已 wired 但数字仍 data/key-gated,自评闭环待 Day 154-155 用独立 κ harness 替换。
4. 今日实测 / 产出
docs/AML_GOVERNANCE_MAP.md✅ 已存在并 committed,含 3 控制域骨架(inventory / validation / effective challenge)+ 已核验日期 SR 11-7 rescinded 2026-04-17 → OCC 2026-13。已落地。- 注(诚实状态):external-ground-truth eval wired but not yet run——需公开标注数据集(IBM AMLworld / Elliptic,手动下载)+ 真实模型 run;harness/metrics/CI 已建已测,数字仍 data/key-gated。
- 现有真实评测数字保持不变:DeepSeek-V4-Flash 79.3% / V4-Pro 89.7%(judge=pass);这些不属于「独立验证」证据,正待整改。
本日自检清单(可勾对)。
- GOVERNANCE_MAP 的 MRM 行写明 SR 11-7 rescinded 2026-04-17 → OCC 2026-13。
- 三栏(inventory / validation / effective challenge)各有对应证据文件指针。
- evalBaseline 自评问题被显式标为待整改(非已解决)。
- 独立 κ 数字(待 Day 155 跑,需 key + ≥50 手标)——本日仍 gated,不勾。
5. 常见误区 / 陷阱
- 继续把 SR 11-7 当活指引引用——它已于 2026-04-17 废止,对金融 GenAI 审查人引用废止指引是丢可信度的第一名。
- 把 evalBaseline 自评结果当「独立验证」证据——同源自评违反有效挑战,必须在 Day 154-155 用独立 κ harness 替换。
- 以为「原则化」=「更宽松」——OCC 2026-13 是风险匹配,高风险模型反而要求更强控制;AML SAR 生成属高敏场景。
- 把 inventory 当成一次性文档——MRM 要求持续维护,模型换版本号(如 V4 系列)就要更新清单。
- 把「principles-based」理解成「不用证据」——原则化反而把举证责任压给机构,没有证据文件就过不了有效挑战。
6. 学习资源(每条带 YYYY-MM)
- OCC Bulletin 2026-13 "Model Risk Management"(2026-04)——本日监管底座。
- 美联储 / OCC / FDIC 关于 SR 11-7 废止的联合公告(2026-04,rescission 生效 2026-04-17)。
- Fed SR 26-2(2026,与 OCC 2026-13 对应的联储侧 MRM 指引)——跨机构一致性参照。
- Anthropic "Demystifying evals"(2026-01)——评测独立性论证,Day 155 主线。
- NIST AI RMF Generative AI Profile (NIST AI 600-1)(2024-07)——Day 153 主线,与 MRM 互补。
- 本仓
docs/AML_GOVERNANCE_MAP.md(2026-06)——交叉引用,三框收敛一页纸。
SOTA检查 (2026-06 更新)
- 当前主流方案:OCC Bulletin 2026-13 为当前(2026-04)最新 MRM 框架,仍 current;三栏(inventory / validation / effective challenge)为长效内核。
- 是否仍 SOTA:是。SR 11-7 废止与 OCC 2026-13 接替是 2026 最新体制变更,未被进一步取代。
- 过时黑名单(AVOID):① 继续把 SR 11-7 当活指引引用;② 把 evalBaseline 自评结果当「独立验证」证据——需在 Day 154-155 用独立 κ harness 替换;③ 把「principles-based」当「无需举证」。
- 半衰期提醒:监管文本本身变更慢,但其与 GenAI 的接口(如何用 600-1 落 GenAI 风险)更新快——每阶段末(Day 160)重验 OCC 2026-13 是否出配套 GenAI 附录。
- 下次复查点:复查 OCC 2026-13 / Fed SR 26-2 最终文本措辞(对外发表前必重验);2026-08-02 EU AI Act Art.50 生效点一并复查(见 Day 152)。
衔接
- 昨天:Day 150 — 抵抗率报表 & HITL 闸门固化(把抵抗率/分歧/κ 收敛为一页评审件,OFAC 硬停升级为 fail-closed CI 门)。
- 今天:监管底座从废止的 SR 11-7 换成 OCC 2026-13,点名 evalBaseline 自评违反「有效挑战」,起 GOVERNANCE_MAP 三控制域骨架。
- 明天:Day 152 — EU AI Act Omnibus 时间线(建 governance_dates 表,锁定 Art.50 2026-08-02 披露义务命中点)。