返回 M01~M90 教材库
M75 · 预习教材教材已备 ≠ 学习已完成

M75:规则、统计、小模型与 LLM 的选择逻辑

模型选择是一条从任务结构、数据量与切分、错误成本、可验证性和运行约束推导出的决策链,而不是按技术新旧排序。

2026-11-06model-selectionrulesstatistical-modelsmall-modelllm-role

内容类型:预习教材(不代表已完成)
日期:2026-11-06
阶段:P1 · AI Model Engineering 90
周次:W11
节奏:周五一页小结
状态:教材已备;学习未完成
标签model-selection rules statistical-model small-model llm-role

一句话定义

模型选择是一条从任务结构、数据量与切分、错误成本、可验证性和运行约束推导出的决策链,而不是按技术新旧排序。

学习目标

  1. 整理规则→统计→小模型→LLM 的能力与代价阶梯。
  2. 为“主导、辅助、不进入”写出可执行条件。
  3. 用增量价值而非单一离线分数决定是否升级模型。
  4. 总结 W11 所选任务的可信证据边界。

核心知识

规则

适合定义稳定、约束明确、错误可解释、样本不足的场景。规则可直接表达政策和守恒关系,确定性强;缺点是难覆盖复杂交互、长尾维护成本高。规则还常作为 verifier,不只是预测器。

统计 baseline / 经典 ML

适合结构化特征、数据量中等、需要校准和低延迟的任务。Logistic regression、树模型、移动平均、BM25 等往往具有强基线价值。它们可揭示特征信号,但仍受切分、标签偏差和漂移影响。

小神经、图或序列模型

适合邻居、序列或非线性交互确有稳定价值,且有足够数据和维护能力时。它们的优势来自结构归纳偏置和表示学习,代价包括训练、监控、复现与解释复杂度。必须与同数据 baseline 公平比较。

LLM

适合非结构化语言、多任务接口、解释草案与工具编排。它不天然适合精确数值、极低延迟打分和无法验证的高风险决定。LLM 可作为字段/特征生成器或人机界面,但结构化计算应交给确定程序,证据不足时应拒答。

机制与推导

可以用五问选择:

  1. 输入的主结构是规则、表格、图、序列、图像还是开放文本?
  2. 离线数据是否代表未来,标签是否成熟?
  3. 最昂贵的错误是什么,是否允许拒答/人工?
  4. 结果能否用规则、事实或执行器验证?
  5. 延迟、吞吐、成本、隐私和维护预算是什么?

从最简单满足约束的方法开始。升级只有在正确切分、关键切片和真实决策指标上产生稳定增量,并且收益覆盖复杂度时才合理。若复杂模型只提高平均指标却降低关键群体表现或增加不可审计错误,不应自动采用。

“主导”意味着模型的 score/输出直接驱动核心流程;“辅助”意味着它提供候选、特征、摘要或解释,由其他组件收口;“不进入”意味着该步骤应确定性执行或风险不可接受。这三个角色可在同一系统不同步骤并存。

最小练习或观察步骤

把 W11 所选任务写在中央,完成四行选择表:

  1. 规则能解决的部分与盲区。
  2. 统计 baseline 的新增价值。
  3. 小模型利用的结构及额外成本。
  4. LLM 是否进入、放在哪一步、由什么验证。

最后写一个“升级条件”和一个“停止升级条件”。不要用未运行结果支撑结论。

常见误区

  • 把方法按先进程度排成固定层级。
  • 认为规则与模型只能二选一。
  • 只看 ROC-AUC,不看固定复核容量和错误成本。
  • 没有正确切分就比较复杂模型。
  • 让 LLM 负责它不能验证的计算或事实。
  • 把可解释输出当作模型行为的忠实因果解释。

金融与 Web3 场景连接

支付授权常需要规则与低延迟模型主导,LLM 不进入实时数值决策;AML 调查可由图模型排序、规则验证、LLM 辅助摘要;链上钱包分析可用图统计主导候选发现,LLM 组织证据,但地址归属和恶意意图不能凭文本生成确定。文档场景则可让 VLM 生成候选,字段规则与人工完成收口。

自检问题

  1. 四类方法各自最匹配什么输入结构?
  2. 什么证据足以支持从 baseline 升级到小模型?
  3. 主导、辅助和不进入怎样定义?
  4. 为什么正确切分比模型复杂度更基础?
  5. 哪类计算不应交给 LLM 自由生成?

专业课程对齐

  • Stanford CS229:对应经典监督学习、优化、正则化和模型选择;用于判断线性/树/统计方法何时已经匹配任务信号。
  • Stanford CS329S:对应生产约束、数据变化、监控与维护;用于把模型选择从离线最高分转成部署条件下的整体权衡。
  • Full Stack Deep Learning:对应从问题定义到上线的完整生命周期;用于收束规则、经典 ML、小神经/图/序列模型和 LLM 的职责边界。

深入学习提示

按“CS229 回看模型假设 → CS329S 回看生产约束 → FSDL 回看端到端接口”的顺序制作选择矩阵。每一类方法都回答六个问题:需要多少标注、依赖何种结构、对分布变化多敏感、如何解释与审计、推理资源多大、失败时怎样回退。规则适合稳定且高精度约束;统计/经典 ML 适合结构化、样本有限且需要校准的任务;小神经、图或序列模型只有在相应结构确实贡献信号时升级;LLM 优先做非结构化接口、候选生成或受校验说明。选择不以“先进”排序,而以 M71 的部署切分和 M72 baseline 为锚:只有在相同数据、指标和成本下出现稳定且切片可接受的增益,才值得增加复杂度。总结中明确保留不确定性与待验证条件。

学后填写区

  • 我的 W11 任务结构图:
  • 四类方法选择表:
  • 模型升级与停止条件:
  • LLM 的主导/辅助/不进入结论:
  • 进入复习清单的问题:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。