返回 M01~M90 教材库
M10 · 预习教材教材已备 ≠ 学习已完成

M10:规则、Logistic Regression 与小 MLP 的公平比较

基线比较是在相同数据切分、特征可见性和指标下,检验复杂模型是否带来值得其成本的增量价值。

2026-09-02Baseline、规则、LogisticRegression、MLP、公平比较

内容类型:预习教材(不代表已完成)
日期:2026-09-02
阶段:P1 · AI Model Engineering 90
周次:W2 · 概率、经典 ML、校准与决策损失
节奏:周三引导练习
状态:教材已备;学习未完成
标签:Baseline、规则、Logistic Regression、MLP、公平比较

一句话定义

基线比较是在相同数据切分、特征可见性和指标下,检验复杂模型是否带来值得其成本的增量价值。

学习目标

  1. 理解规则、线性模型和 MLP 各自的归纳偏置。
  2. 设计相同输入、相同 split、相同指标的比较。
  3. 区分模型容量提升与评估泄漏造成的表面提升。
  4. 用表格同时记录质量、复杂度和可解释性。

核心知识

规则基线用人工阈值和逻辑组合定义决策,优点是明确、可审计、无需训练;缺点是边界生硬、组合爆炸且难从数据学习。Logistic Regression 学习一个线性决策边界,对每个特征赋权,适合作为强而透明的统计基线。小 MLP 增加隐藏层与非线性激活,可以表达特征交互和弯曲边界,但参数更多、对尺度和正则更敏感。

公平比较首先固定信息集:三种方法只能看到同一时点可用的同一特征。其次固定 train/validation split;规则即使不训练,也应只依据训练部分制定,避免偷看验证标签。最后固定指标和阈值选择流程,例如都在训练或校准集选阈值,再在验证集报告结果。

复杂度不仅是参数量,还包括数据需求、训练稳定性、延迟、监控、解释和维护成本。若 MLP 的分数略好,但波动大、校准差或运营成本更高,不能简单宣布它获胜。反之,规则可能在少量明确高风险模式上有不可替代的硬约束作用。

机制与比较设计

可用二维合成数据展示三者差异:规则画轴对齐矩形或多个条件;Logistic Regression 形成一条直线;含非线性的 MLP 可拟合弯曲区域。若真实边界接近线性,MLP 的额外容量可能只拟合噪声;若存在 XOR 式交互,线性模型天然受限。

建议对比表包含:方法、输入特征、训练参数、阈值来源、precision、recall、Brier、预测延迟、可解释性、主要失败模式。指标值必须来自实际运行;预习时只建立空表与计算定义。

最小练习

  1. 复用 M09 的合成数据,不增加额外特征。
  2. 写一条简单规则,例如两个条件的 AND/OR,记录其明确假设。
  3. 训练 Logistic Regression 和只有一个小隐藏层的 MLP。
  4. 使用同一验证集与阈值选择原则,计划计算混淆矩阵和 Brier。
  5. 在结果出现前,先写出三种方法最可能失败的场景。

常见误区

  • 给 MLP 使用更多特征,却称为算法公平比较。
  • 在验证集反复调阈值,再把同一验证结果当作无偏评估。
  • 只比较 accuracy,忽略类别不平衡、校准和错误成本。
  • 把规则视为“零成本”;规则库也有冲突、漂移和维护负担。
  • 小数据上一轮 MLP 更高就得出非线性模型更好的结论。

金融场景连接

支付风控常是规则与模型组合:规则处理法律禁止、明确黑名单或极高确定性模式;模型处理连续风险排序;人工处理灰区。比较的目标不是选一个万能方法,而是识别每种方法在决策链中的适当位置。

自检问题

  1. 什么条件下 Logistic Regression 无法表达真实边界?
  2. 为什么规则也不能查看验证标签后再设计?
  3. 除参数量外,模型复杂度还包含什么?
  4. 若 MLP recall 更高但 Brier 更差,应怎样继续分析?

专业课程对齐

  • Stanford CS229 Materials:对应基线模型、逻辑回归与模型选择,帮助建立可比较的监督学习实验。
  • MIT 6.S191:对应多层感知机、非线性激活与训练,明确 MLP 相对线性模型新增了什么表达能力。
  • Stanford CS231n:对应神经网络架构与训练诊断,用于理解隐藏层宽度、激活和正则化的影响。

深入学习提示

按“规则 → 逻辑回归 → 最小 MLP”顺序建立同一数据切分、同一指标和同一决策阈值下的基线;先精读 CS229,再看 6.S191,CS231n 选读诊断部分。公式观察点是线性 logit wᵀx+b 与 MLP 的 W₂φ(W₁x+b₁)+b₂,真正增加表达力的是非线性激活而非参数数量本身。反例要设计 XOR 或弯曲边界,展示逻辑回归的上限;同时加入小样本噪声,观察 MLP 可能更容易过拟合。代码比较必须报告参数量、训练时间、概率质量和业务代价,不能只凭准确率宣布复杂模型获胜;规则基线的透明性也应被视为可用能力。

学后填写区

  • 三种方法的共同输入:____
  • 比较表位置:____
  • 预先写下的失败模式:____
  • 实际差异(运行后填写):____
  • 实际学习日期与用时:____
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。