M80:Financial Model Lab:只比较一个真正关心的问题
聚焦比较只在 M79 最小路径上增加一种方法或一个维度,用预先定义的指标回答一个问题,而不是证明某技术全面优越。
内容类型:预习教材(不代表已完成)
日期:2026-11-11
阶段:P1 · AI Model Engineering 90
周次:W12
节奏:周三引导练习
状态:教材已备;学习未完成
标签:focused-comparisoncalibrationloravlmresource-measurement
一句话定义
聚焦比较只在 M79 最小路径上增加一种方法或一个维度,用预先定义的指标回答一个问题,而不是证明某技术全面优越。
学习目标
- 按所选 A/B/C 范围决定是否进行真实比较。
- 从第二种方法、校准、LoRA、VLM、资源测量中只选一项。
- 固定数据、切分、输出 schema 与 baseline。
- 将真实观察、不确定性和外推边界写进同一张表。
核心知识
1. 五类可选比较问题
- 第二种方法:“统计 baseline 是否比规则改善固定复核量下的召回?”
- 校准:“校准后 score 能否更稳定地支持自动/复核阈值?”
- LoRA:“小规模领域适配是否改善特定格式,而不破坏通用边界?”
- VLM:“引入视觉与布局是否改善关系抽取,同时保持证据与拒答?”
- 资源测量:“量化/批量/上下文变化如何影响延迟、内存和质量?”
只能选与 M78 场景和 M79 路径直接相关的一项。A 范围可只设计比较表;B 通常加入第二方法或校准;C 才考虑 LoRA/VLM/资源兴趣点。
2. 比较问题必须可证伪
“VLM 更智能”不可评估;“在相同 20 个合成文档上,VLM 是否减少键值关系错误,且冲突样本不增加无证据回答”可以观察。问题应包含对象、条件、指标和代价。
3. 同一输出与后处理
两种方法必须映射到同一 schema,并共享规范化、verifier 与错误定义。若一种方法能拒答而另一种被迫回答,应同时报告 coverage 和条件准确率。若一种使用更多输入(图像、外部标签),应明确这是“方法+信息”的整体比较。
4. 资源与质量共同记录
至少记录一个质量指标与一个资源/复杂度指标:运行时间、峰值内存、调用成本、人工规则量或调试难度。小练习的绝对数不稳定,但能训练把工程代价纳入选择。
机制与推导
一张简短观察表可包含:方法、输入、可训练参数/规则、质量指标、关键错误、coverage、时间/内存、证据支持率、备注。先填写方法与预期字段,实际数值在运行后补。不要只保留最优设置;如果调了多次,应记录选择过程,避免测试集择优。
若做校准,将数据分为训练、校准、测试;不能用测试标签拟合温度或 isotonic。若做 LoRA,明确 frozen base、target module、rank 和训练数据;若做 VLM,固定图像分辨率与 prompt;若测资源,预热和测量口径要一致。
最小练习或观察步骤
- 写一句可证伪比较问题。
- 列出唯一新增项,以及保持不变的六个条件。
- 预建观察表和停止条件。
- 运行一条最小对照,或在 A 范围完成纸上设计。
- 将事实与解释分栏;异常结果也保留。
- 不因结果不符合预期而连续扩展超参数。
常见误区
- 一次加入第二模型、校准和新数据。
- 两种方法输出 schema 不同,靠人工主观判断。
- 只报告条件准确率,不报告拒答覆盖率。
- 用测试集选择 LoRA rank、prompt 或阈值。
- 忽略新增信息和资源带来的优势。
- 为得到正向结果反复调参。
金融、Web3 与文档场景连接
支付争议可比较规则与小模型的证据完整性;AML 可比较规则 score 与校准模型在固定人工容量下的召回;链上钱包可比较单节点特征与图特征,但标签来源必须一致;文档分类/抽取可比较 OCR 文本路线与 VLM 路线,同时单列无证据回答。
自检问题
- 我的比较问题是否包含条件、指标与代价?
- 唯一新增变量是什么?
- 两条路线是否共享 schema、切分和 verifier?
- coverage 与条件准确率为何要一起报告?
- 哪些设置不能在测试集上选择?
专业课程对齐
- Stanford CS229:对应模型选择、正则化、偏差—方差与统计评估;用于把“比较一个问题”写成可证伪假设和受控变量。
- Stanford CS329S:对应生产指标、资源约束和实验设计;用于把质量提升与延迟、成本、覆盖率、维护负担一起观察。
- Full Stack Deep Learning:对应实验追踪与端到端评估;用于确保两条路线共享输入、切分、后处理和输出契约。
深入学习提示
先用 CS229 把问题改写成“在固定 $D_{train},D_{val},D_{test}$ 和预算下,改变变量 $z$ 是否令预先指定指标改善”,再按 CS329S 加入真实资源/风险约束,最后用 FSDL 规范保存配置。只从五类中选一类:规则与统计模型、不同特征、不同切分、文档路线、阈值/拒答策略。比较前写出主指标、关键切片、最小有意义差异和可能推翻结论的结果;运行时固定样本、seed、训练预算、后处理、阈值选择集合与输出 schema。除总体质量外,记录延迟、峰值内存或费用、覆盖率及失败样例。结果无差异同样有价值,可能说明瓶颈不在该变量;结果差异很大时先查泄漏、预处理和样本数量。课程提供方法,最终结论只能基于真实记录,未运行就停在实验协议。
学后填写区
- 可证伪比较问题:
- 新增变量与固定条件:
- 实际观察表(未运行请注明):
- 事实、解释与不确定性:
- 是否触发停止条件: