返回 M01~M90 教材库
M73 · 预习教材教材已备 ≠ 学习已完成

M73:小神经、图或序列模型的公平比较

小模型比较的核心不是换一个更复杂的名字,而是在相同数据、切分和指标下检验结构归纳偏置是否提供了 baseline 没有的有效信号。

2026-11-04small-modelgnnsequence-modelranking-modelbaseline-comparison

内容类型:预习教材(不代表已完成)
日期:2026-11-04
阶段:P1 · AI Model Engineering 90
周次:W11
节奏:周三引导练习
状态:教材已备;学习未完成
标签small-model gnn sequence-model ranking-model baseline-comparison

一句话定义

小模型比较的核心不是换一个更复杂的名字,而是在相同数据、切分和指标下检验结构归纳偏置是否提供了 baseline 没有的有效信号。

学习目标

  1. 为所选任务选择一个与数据结构匹配的小模型。
  2. 保持 M72 的样本、切分、标签与指标不变。
  3. 区分模型表达能力、训练随机性和数据泄漏带来的差异。
  4. 从切片和错误案例判断复杂度是否值得。

核心知识

1. 模型应匹配结构

交易图任务可用一层 message passing:节点聚合邻居特征,再做节点分类/打分。它的假设是邻接关系携带信息。时间序列可用小 MLP 处理滞后窗口、1D CNN、RNN 或轻量 Transformer;关键是严格 causal 输入。排序可用 pointwise logistic、pairwise loss 或小双塔模型;关键是按 query 组织候选。

模型越匹配结构,越可能用少量参数捕捉 baseline 难表达的关系。但如果图边噪声大、序列历史短或排序标签偏差严重,结构模型也可能放大错误。

2. 公平比较的控制变量

固定原始数据版本、切分 ID、特征可见时间、预处理、评估切片和决策预算。Baseline 与模型输出都转换为同一 score 方向。阈值只在验证集选择,测试集只做一次最终观察。小练习可以不设最终测试,但不能边看测试边调参数。

参数量和训练时长可以不同,却应记录资源。若神经模型使用 baseline 没有的邻居或序列特征,应明确它比较的是“方法+新增信息”,不能把收益全归因于模型架构。

3. 小数据上的稳定性

小样本中 seed、初始化和类别采样会造成显著波动。至少预留“不同 seed 是否方向一致”的问题;本课程不要求大量运行。不要把一次较高分当成稳定收益。更重要的是检查:收益是否集中在某类实体、某个时间段,是否以更差的关键错误为代价。

4. 指标与资源一起看

分类/异常任务可比较 PR-AUC、Recall@固定复核量、校准和错误成本;时序可比较 MAE/分位损失及时间切片;排序可比较 NDCG@K、Recall@K。还要记录训练和推理复杂度、特征更新依赖、可解释性和冷启动路径。

机制与推导

图模型的一层示意为 h_v' = f(h_v, AGG({h_u: u∈N(v)}));它把邻居信息引入节点表示。时序模型从 [y(t-k),…,y(t)] 预测未来,必须用 causal window。Pairwise 排序希望正样本分数高于负样本,可用 -log sigmoid(s_pos-s_neg)

这些公式的共同点是引入任务结构。比较时要问:新增结构是否在真实部署可用?例如全图邻居若只有离线才能获得,就不能直接声称在线收益。

最小练习或观察步骤

  1. 选择一个最小模型,写下它利用的结构假设。
  2. 复用 M72 数据与切分,不新增测试期信息。
  3. 画输入 shape、模型层和输出 score。
  4. 只设一组简单超参数,先确认一小批可前向。
  5. 建立 baseline/模型对照表:总体指标、关键切片、资源、失败类型。
  6. 只记录真实运行结果;资源不足可完成纸上 forward 手算。

常见误区

  • 神经模型换了更多特征,却宣称纯粹是架构胜出。
  • 图 embedding 在全图上预计算导致测试传播。
  • 序列窗口包含预测时点之后的数据。
  • 排序候选跨 query 混合采样。
  • 只汇报最好 seed 或最好超参数。
  • 性能微增就忽略复杂度、更新延迟和审计需求。

金融与 Web3 场景连接

GNN 可捕捉资金网络与共用实体关系,但容易受标签传播和异配图影响;时序模型可用于流动性或告警量预测,但制度变化会造成漂移;排序模型可优化调查队列,在固定人工容量下比独立分类更贴近动作。链上图的公开性不等于地址实体标签可靠,跨链映射也会引入不确定边。

自检问题

  1. 我的模型加入了什么结构归纳偏置?
  2. 哪些控制变量必须与 baseline 保持一致?
  3. 为什么一次 seed 的提升不足以支持结论?
  4. 新增信息与新增模型能力如何区分?
  5. 复杂模型的资源和更新代价是什么?

专业课程对齐

  • Stanford CS229:对应经验风险、正则化、泛化与模型选择;用于控制容量、理解小数据下方差,并建立经典模型参照。
  • Stanford CS224W:对应 message passing、node/edge/graph prediction;若任务具有交易关系,重点核对图构造、时间边界和邻居采样是否符合部署。
  • Stanford CS329S:对应模型比较、资源约束和生产维护;用于把质量、稳定性、延迟、内存与可诊断性放在同一选择表。

深入学习提示

先用 CS229 回看容量、正则化和偏差—方差,再按任务结构选一个小模型:表格特征用 MLP 只作受控容量比较,时间依赖用小序列模型,关系依赖才用图模型;图路线再精读 CS224W 对应任务模块。所有候选必须复用 M71 的切分、M72 的特征和阈值选择协议,并限制相近参数量、训练预算、早停规则与随机种子。至少记录多次运行的均值和离散程度,避免把一次幸运初始化当改进。除主指标外,同时观察参数量、训练/推理时间、峰值内存和关键切片;若小幅平均增益来自某一泄漏切片或尾部明显变差,应拒绝升级。最后用 CS329S 的部署视角写清复杂度增加换来的具体业务能力,以及回滚和监控成本。

学后填写区

  • 所选模型及结构假设:
  • 与 baseline 一致的条件:
  • 实际观察(未运行请注明):
  • 关键切片与失败案例:
  • 是否值得继续及其证据边界:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。