M73:小神经、图或序列模型的公平比较
小模型比较的核心不是换一个更复杂的名字,而是在相同数据、切分和指标下检验结构归纳偏置是否提供了 baseline 没有的有效信号。
内容类型:预习教材(不代表已完成)
日期:2026-11-04
阶段:P1 · AI Model Engineering 90
周次:W11
节奏:周三引导练习
状态:教材已备;学习未完成
标签:small-modelgnnsequence-modelranking-modelbaseline-comparison
一句话定义
小模型比较的核心不是换一个更复杂的名字,而是在相同数据、切分和指标下检验结构归纳偏置是否提供了 baseline 没有的有效信号。
学习目标
- 为所选任务选择一个与数据结构匹配的小模型。
- 保持 M72 的样本、切分、标签与指标不变。
- 区分模型表达能力、训练随机性和数据泄漏带来的差异。
- 从切片和错误案例判断复杂度是否值得。
核心知识
1. 模型应匹配结构
交易图任务可用一层 message passing:节点聚合邻居特征,再做节点分类/打分。它的假设是邻接关系携带信息。时间序列可用小 MLP 处理滞后窗口、1D CNN、RNN 或轻量 Transformer;关键是严格 causal 输入。排序可用 pointwise logistic、pairwise loss 或小双塔模型;关键是按 query 组织候选。
模型越匹配结构,越可能用少量参数捕捉 baseline 难表达的关系。但如果图边噪声大、序列历史短或排序标签偏差严重,结构模型也可能放大错误。
2. 公平比较的控制变量
固定原始数据版本、切分 ID、特征可见时间、预处理、评估切片和决策预算。Baseline 与模型输出都转换为同一 score 方向。阈值只在验证集选择,测试集只做一次最终观察。小练习可以不设最终测试,但不能边看测试边调参数。
参数量和训练时长可以不同,却应记录资源。若神经模型使用 baseline 没有的邻居或序列特征,应明确它比较的是“方法+新增信息”,不能把收益全归因于模型架构。
3. 小数据上的稳定性
小样本中 seed、初始化和类别采样会造成显著波动。至少预留“不同 seed 是否方向一致”的问题;本课程不要求大量运行。不要把一次较高分当成稳定收益。更重要的是检查:收益是否集中在某类实体、某个时间段,是否以更差的关键错误为代价。
4. 指标与资源一起看
分类/异常任务可比较 PR-AUC、Recall@固定复核量、校准和错误成本;时序可比较 MAE/分位损失及时间切片;排序可比较 NDCG@K、Recall@K。还要记录训练和推理复杂度、特征更新依赖、可解释性和冷启动路径。
机制与推导
图模型的一层示意为 h_v' = f(h_v, AGG({h_u: u∈N(v)}));它把邻居信息引入节点表示。时序模型从 [y(t-k),…,y(t)] 预测未来,必须用 causal window。Pairwise 排序希望正样本分数高于负样本,可用 -log sigmoid(s_pos-s_neg)。
这些公式的共同点是引入任务结构。比较时要问:新增结构是否在真实部署可用?例如全图邻居若只有离线才能获得,就不能直接声称在线收益。
最小练习或观察步骤
- 选择一个最小模型,写下它利用的结构假设。
- 复用 M72 数据与切分,不新增测试期信息。
- 画输入 shape、模型层和输出 score。
- 只设一组简单超参数,先确认一小批可前向。
- 建立 baseline/模型对照表:总体指标、关键切片、资源、失败类型。
- 只记录真实运行结果;资源不足可完成纸上 forward 手算。
常见误区
- 神经模型换了更多特征,却宣称纯粹是架构胜出。
- 图 embedding 在全图上预计算导致测试传播。
- 序列窗口包含预测时点之后的数据。
- 排序候选跨 query 混合采样。
- 只汇报最好 seed 或最好超参数。
- 性能微增就忽略复杂度、更新延迟和审计需求。
金融与 Web3 场景连接
GNN 可捕捉资金网络与共用实体关系,但容易受标签传播和异配图影响;时序模型可用于流动性或告警量预测,但制度变化会造成漂移;排序模型可优化调查队列,在固定人工容量下比独立分类更贴近动作。链上图的公开性不等于地址实体标签可靠,跨链映射也会引入不确定边。
自检问题
- 我的模型加入了什么结构归纳偏置?
- 哪些控制变量必须与 baseline 保持一致?
- 为什么一次 seed 的提升不足以支持结论?
- 新增信息与新增模型能力如何区分?
- 复杂模型的资源和更新代价是什么?
专业课程对齐
- Stanford CS229:对应经验风险、正则化、泛化与模型选择;用于控制容量、理解小数据下方差,并建立经典模型参照。
- Stanford CS224W:对应 message passing、node/edge/graph prediction;若任务具有交易关系,重点核对图构造、时间边界和邻居采样是否符合部署。
- Stanford CS329S:对应模型比较、资源约束和生产维护;用于把质量、稳定性、延迟、内存与可诊断性放在同一选择表。
深入学习提示
先用 CS229 回看容量、正则化和偏差—方差,再按任务结构选一个小模型:表格特征用 MLP 只作受控容量比较,时间依赖用小序列模型,关系依赖才用图模型;图路线再精读 CS224W 对应任务模块。所有候选必须复用 M71 的切分、M72 的特征和阈值选择协议,并限制相近参数量、训练预算、早停规则与随机种子。至少记录多次运行的均值和离散程度,避免把一次幸运初始化当改进。除主指标外,同时观察参数量、训练/推理时间、峰值内存和关键切片;若小幅平均增益来自某一泄漏切片或尾部明显变差,应拒绝升级。最后用 CS329S 的部署视角写清复杂度增加换来的具体业务能力,以及回滚和监控成本。
学后填写区
- 所选模型及结构假设:
- 与 baseline 一致的条件:
- 实际观察(未运行请注明):
- 关键切片与失败案例:
- 是否值得继续及其证据边界: