返回 M01~M90 教材库
M78 · 预习教材教材已备 ≠ 学习已完成

M78:Financial Model Lab:场景与范围说明

Financial Model Lab 是一个受控的小型知识整合练习:只选一个场景与 A/B/C 范围,把任务、数据、错误成本、baseline 和候选方法写清,而不是扩建新产品。

2026-11-09financial-model-labscopebaselineerror-costproject-design

内容类型:预习教材(不代表已完成)
日期:2026-11-09
阶段:P1 · AI Model Engineering 90
周次:W12
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签financial-model-lab scope baseline error-cost project-design

一句话定义

Financial Model Lab 是一个受控的小型知识整合练习:只选一个场景与 A/B/C 范围,把任务、数据、错误成本、baseline 和候选方法写清,而不是扩建新产品。

学习目标

  1. 从 AML evidence、支付争议证据、文档分类、链上钱包风险中选择一个场景。
  2. 从 A 分析设计、B 最小比较、C 兴趣扩展中选择唯一范围。
  3. 写出预测时点、样本、标签、证据与决策动作。
  4. 给项目设明确不做清单、时间盒和停止条件。

核心知识

1. 四个候选场景

AML evidence:将交易与文档证据组织为告警线索或排序,不对主体意图下结论。支付争议证据:从合成收据/说明中提取字段并判断材料是否完整。文档分类:识别无敏感信息的合成文档类型或路由类别。链上钱包风险:基于公开、带时效来源的数据生成调查优先级,不把地址风险等同于真实主体违法。

选择依据不是“哪个更酷”,而是现有知识连接、可合法获得的数据、2~3 小时内能否形成最小路径,以及错误是否可定义。

2. A/B/C 三种范围

A 分析设计:不要求运行模型,交付任务定义、数据字典、切分、baseline、指标、错误成本和实验计划。适合资源不足或更想练设计。

B 最小比较:在小型合成/公开数据上跑通 baseline 与一种候选方法,形成真实观察表。方法可以是规则 vs logistic、小 OCR 规则 vs另一种路线,不追求统计显著或生产性能。

C 兴趣扩展:在 B 的基础上加入一个明确兴趣点,如校准、LoRA、VLM、资源测量或图模型。C 不是默认更高级;如果基础路径尚未稳定,应退回 A/B。

3. 一页范围说明的八要素

问题与非目标、样本与数据来源、预测/抽取时点、输出 schema、错误成本、baseline、候选方法、指标与切片、资源与停止条件。可以把“证据不足”列为合法结果。项目名和故事背景不能替代可评估定义。

4. 不做清单比功能清单更重要

典型不做项包括:不使用真实客户数据、不做实时部署、不训练大模型、不声称检测犯罪、不扩建 UI、不调几十组超参数、不把合成性能外推到生产。边界让学习集中在模型工程关系。

机制与推导

任务定义可沿用五元结构:预测/抽取单元 + 可见数据窗口 + 目标/字段 + 标签/真值来源 + 决策动作。再加入错误成本:漏掉关键证据与误报材料完整,哪一个更昂贵?若是排序,则决策容量是 top-K;若是抽取,则错误字段与拒答的代价不同。

Baseline 应最简单且可解释。候选模型必须回答一个明确问题,例如“布局信息是否改善键值关系”或“校准是否改善转人工阈值”,而不是笼统证明 AI 更强。

最小练习或观察步骤

完成一页范围说明:

  1. 圈选一个场景和 A/B/C。
  2. 用一句话定义任务与动作。
  3. 列出可用数据、禁止数据和真值来源。
  4. 写出 baseline、一个候选方法和比较问题。
  5. 定义 2~4 个指标与两个关键切片。
  6. 写至少五项不做清单。
  7. 给 M79~M83 分配时间盒;若超范围,优先退到 A。

常见误区

  • 四个场景都做,导致没有完整路径。
  • 把 C 当成必须达到的“高级等级”。
  • 先写技术栈,再寻找问题。
  • 使用真实敏感数据以获得“真实感”。
  • 合成数据上的结果被宣传为业务效果。
  • 不允许拒答,迫使模型给出风险结论。

场景连接

本项目本身就应体现治理边界:AML 和钱包风险只输出调查线索;支付争议只评证据完整性;文档分类只做路由,不代替法律或合规判断。Web3 公开数据也可能关联个人,仍需最小化存储与谨慎解释。

自检问题

  1. 我为什么选这个场景而不是其他三个?
  2. A/B/C 的范围差别是什么?
  3. baseline 与候选方法要回答哪一个比较问题?
  4. 哪种错误成本最高,拒答是否允许?
  5. 我的不做清单能阻止哪些范围膨胀?

专业课程对齐

  • Stanford CS329S:对应问题定义、数据需求、部署约束与生产风险;用于把 Financial Model Lab 从宽泛想法缩成一个可回答的决策问题。
  • Full Stack Deep Learning:对应 ML 项目的完整生命周期与范围控制;用于明确最小纵切面、输入输出契约、实验边界和不做清单。
  • Stanford CS229:对应监督任务、目标函数和评估基础;用于检查所选场景是否真的有可定义标签、损失和 baseline。

深入学习提示

先用 CS329S 的系统视角写一句部署式问题,例如“在时间 $t$ 可见的信息下,为哪类案件产生什么分数以支持何种人工决定”;再按 FSDL 收缩为一个从 fixture/样本到指标与限制说明的纵切面;最后用 CS229 核对任务和损失是否可计算。范围说明至少包含用户/决策者、样本单位、数据切分、标签成熟时间、候选方法、主指标与代价、输出契约、隐私和不做清单。A 范围可以只做分析与设计,B 范围跑一个 baseline 对照,C 范围才增加兴趣扩展;不要因为“Lab”一词默认建设完整产品。金融场景尤其要标出个人数据、偏差、解释和人工复核边界。今天不要求模型结果,成功标准是别人能据此复现范围并知道何时停止。

学后填写区

  • 场景与 A/B/C 范围:
  • 一句话任务定义:
  • 数据、真值与禁止项:
  • baseline / 候选方法 / 比较问题:
  • 指标、切片、时间盒与停止条件:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。