M78:Financial Model Lab:场景与范围说明
Financial Model Lab 是一个受控的小型知识整合练习:只选一个场景与 A/B/C 范围,把任务、数据、错误成本、baseline 和候选方法写清,而不是扩建新产品。
内容类型:预习教材(不代表已完成)
日期:2026-11-09
阶段:P1 · AI Model Engineering 90
周次:W12
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签:financial-model-labscopebaselineerror-costproject-design
一句话定义
Financial Model Lab 是一个受控的小型知识整合练习:只选一个场景与 A/B/C 范围,把任务、数据、错误成本、baseline 和候选方法写清,而不是扩建新产品。
学习目标
- 从 AML evidence、支付争议证据、文档分类、链上钱包风险中选择一个场景。
- 从 A 分析设计、B 最小比较、C 兴趣扩展中选择唯一范围。
- 写出预测时点、样本、标签、证据与决策动作。
- 给项目设明确不做清单、时间盒和停止条件。
核心知识
1. 四个候选场景
AML evidence:将交易与文档证据组织为告警线索或排序,不对主体意图下结论。支付争议证据:从合成收据/说明中提取字段并判断材料是否完整。文档分类:识别无敏感信息的合成文档类型或路由类别。链上钱包风险:基于公开、带时效来源的数据生成调查优先级,不把地址风险等同于真实主体违法。
选择依据不是“哪个更酷”,而是现有知识连接、可合法获得的数据、2~3 小时内能否形成最小路径,以及错误是否可定义。
2. A/B/C 三种范围
A 分析设计:不要求运行模型,交付任务定义、数据字典、切分、baseline、指标、错误成本和实验计划。适合资源不足或更想练设计。
B 最小比较:在小型合成/公开数据上跑通 baseline 与一种候选方法,形成真实观察表。方法可以是规则 vs logistic、小 OCR 规则 vs另一种路线,不追求统计显著或生产性能。
C 兴趣扩展:在 B 的基础上加入一个明确兴趣点,如校准、LoRA、VLM、资源测量或图模型。C 不是默认更高级;如果基础路径尚未稳定,应退回 A/B。
3. 一页范围说明的八要素
问题与非目标、样本与数据来源、预测/抽取时点、输出 schema、错误成本、baseline、候选方法、指标与切片、资源与停止条件。可以把“证据不足”列为合法结果。项目名和故事背景不能替代可评估定义。
4. 不做清单比功能清单更重要
典型不做项包括:不使用真实客户数据、不做实时部署、不训练大模型、不声称检测犯罪、不扩建 UI、不调几十组超参数、不把合成性能外推到生产。边界让学习集中在模型工程关系。
机制与推导
任务定义可沿用五元结构:预测/抽取单元 + 可见数据窗口 + 目标/字段 + 标签/真值来源 + 决策动作。再加入错误成本:漏掉关键证据与误报材料完整,哪一个更昂贵?若是排序,则决策容量是 top-K;若是抽取,则错误字段与拒答的代价不同。
Baseline 应最简单且可解释。候选模型必须回答一个明确问题,例如“布局信息是否改善键值关系”或“校准是否改善转人工阈值”,而不是笼统证明 AI 更强。
最小练习或观察步骤
完成一页范围说明:
- 圈选一个场景和 A/B/C。
- 用一句话定义任务与动作。
- 列出可用数据、禁止数据和真值来源。
- 写出 baseline、一个候选方法和比较问题。
- 定义 2~4 个指标与两个关键切片。
- 写至少五项不做清单。
- 给 M79~M83 分配时间盒;若超范围,优先退到 A。
常见误区
- 四个场景都做,导致没有完整路径。
- 把 C 当成必须达到的“高级等级”。
- 先写技术栈,再寻找问题。
- 使用真实敏感数据以获得“真实感”。
- 合成数据上的结果被宣传为业务效果。
- 不允许拒答,迫使模型给出风险结论。
场景连接
本项目本身就应体现治理边界:AML 和钱包风险只输出调查线索;支付争议只评证据完整性;文档分类只做路由,不代替法律或合规判断。Web3 公开数据也可能关联个人,仍需最小化存储与谨慎解释。
自检问题
- 我为什么选这个场景而不是其他三个?
- A/B/C 的范围差别是什么?
- baseline 与候选方法要回答哪一个比较问题?
- 哪种错误成本最高,拒答是否允许?
- 我的不做清单能阻止哪些范围膨胀?
专业课程对齐
- Stanford CS329S:对应问题定义、数据需求、部署约束与生产风险;用于把 Financial Model Lab 从宽泛想法缩成一个可回答的决策问题。
- Full Stack Deep Learning:对应 ML 项目的完整生命周期与范围控制;用于明确最小纵切面、输入输出契约、实验边界和不做清单。
- Stanford CS229:对应监督任务、目标函数和评估基础;用于检查所选场景是否真的有可定义标签、损失和 baseline。
深入学习提示
先用 CS329S 的系统视角写一句部署式问题,例如“在时间 $t$ 可见的信息下,为哪类案件产生什么分数以支持何种人工决定”;再按 FSDL 收缩为一个从 fixture/样本到指标与限制说明的纵切面;最后用 CS229 核对任务和损失是否可计算。范围说明至少包含用户/决策者、样本单位、数据切分、标签成熟时间、候选方法、主指标与代价、输出契约、隐私和不做清单。A 范围可以只做分析与设计,B 范围跑一个 baseline 对照,C 范围才增加兴趣扩展;不要因为“Lab”一词默认建设完整产品。金融场景尤其要标出个人数据、偏差、解释和人工复核边界。今天不要求模型结果,成功标准是别人能据此复现范围并知道何时停止。
学后填写区
- 场景与 A/B/C 范围:
- 一句话任务定义:
- 数据、真值与禁止项:
- baseline / 候选方法 / 比较问题:
- 指标、切片、时间盒与停止条件: