返回 M01~M90 教材库
M85 · 预习教材教材已备 ≠ 学习已完成

M85:模型工程全景图:从数据到决定

模型工程全景图把 `data→representation→objective→optimization→behavior→inference→decision` 视为一条因果链,用来定位能力、错误和工程取舍来自哪一层。

2026-11-16knowledge-mapdatarepresentationobjectiveoptimizationinference

内容类型:预习教材(不代表已完成)
日期:2026-11-16
阶段:P1 · AI Model Engineering 90 · 知识整合
周次:整合周(M85~M90)
节奏:周一知识整合
状态:教材已备;学习未完成
标签knowledge-map data representation objective optimization inference decision

一句话定义

模型工程全景图把 data→representation→objective→optimization→behavior→inference→decision 视为一条因果链,用来定位能力、错误和工程取舍来自哪一层。

学习目标

  1. 合并 W4、W8、W12 三张阶段图,而不是简单拼贴术语。
  2. 解释每一层的输入、选择、可观测量和典型失败。
  3. 看见层间反馈:决策结果如何回到数据和目标。
  4. 为 P1 留下一张可持续修订的模型工程地图。

核心知识

1. Data:模型可见世界的边界

数据层决定样本来自哪里、何时可见、如何许可、怎样切分和混合。清洗、去重、标签定义、token budget、图/序列边界都发生在这里。数据错误可能表现为训练 loss 正常但任务行为错误;错误随机切分会制造虚假的泛化。数据不是模型前的准备工作,而是模型行为的重要组成。

2. Representation:把输入变成可计算状态

文本经 tokenizer 变成 token 与 embedding;图经节点、边和聚合变成表示;图像经 patch/encoder/projector 进入模型;结构化特征经归一化形成向量。表示决定哪些差异被保留、哪些被压缩。Tokenization、layout、坐标、时间和邻接关系都是归纳偏置。

3. Objective:把“想要”变成训练信号

预训练 next-token loss、分类 BCE、pairwise ranking、SFT、DPO 和奖励函数分别优化不同代理目标。代理目标与真实价值之间必有间隙。Reward hacking、类别不平衡和错误成本错配,都是目标没有完整表达业务意图的表现。

4. Optimization:在资源约束下寻找参数

反向传播、optimizer、学习率、batch、regularization、LoRA rank 和训练精度决定搜索轨迹。Loss 下降只说明代理目标被优化,不保证校准、泛化或业务改善。训练曲线、梯度、验证集和 seed 稳定性帮助区分优化问题与数据/目标问题。

5. Behavior:模型在分布上的可观察能力

Behavior 包括准确、错误、拒答、格式、偏差、捷径和 OOD 反应。它通过任务指标、切片、反例和干预被观察。Activation 可以帮助研究内部机制,但不能替代行为与因果验证。Behavior 不是单一 leaderboard 数值。

6. Inference:把参数转成实际服务行为

Prefill、decode、KV cache、量化、batch、context、采样和 verifier cascade 决定延迟、吞吐、内存与质量。训练相同的模型,在不同推理策略下表现和成本可以完全不同。Test-time compute 也是资源分配决策。

7. Decision:模型分数不是最终动作

阈值、校准、错误成本、人工容量、证据规则和治理责任把模型输出转为自动通过、拒答、复核或其他动作。决策反馈会形成新标签,但标签可能延迟、选择偏差或受旧模型影响。因此闭环还要从 decision 回到 data,审查反馈是否可信。

机制与推导

全景图不是线性瀑布。数据和 objective 共同定义学习问题;representation 与 architecture 共同约束可表达模式;optimization 找到一个参数解;inference 把解映射为运行行为;decision 叠加成本与治理。任何异常先问“最早在哪层可检测”,再选择修复层。

例如文档金额错误可能来自像素模糊(data)、OCR 表示丢失(representation)、抽取目标未约束证据(objective)、训练不稳(optimization)、OOD 模板(behavior)、量化损失(inference)或阈值强制通过(decision)。直接换大模型可能绕开但无法定位。

最小练习或观察步骤

  1. 取 W4 Transformer 图、W8 推理图和 W12 Lab 图。
  2. 建立七列:层、输入、关键选择、指标、失败、证据、修复动作。
  3. 把至少 20 个已学概念放入唯一主层,并用箭头标跨层关系。
  4. 选择一个真实/合成案例,沿七层追踪一个错误。
  5. 给图加“反馈回数据”和“人工/治理”两条回路。
  6. 不要求美化,重点是关系准确。

常见误区

  • 把模型工程等同于训练代码。
  • 将所有问题归因于参数或 prompt。
  • 把 objective、metric 和 business value 当同一个概念。
  • 忽略 inference 配置对行为的影响。
  • 图中只有组件,没有错误、证据和反馈。
  • 为做完整图重新学习所有细节,导致整合无法结束。

金融、Web3 与文档场景连接

金融风险模型需要标签成熟、时间切分、校准和人工容量;Web3 图模型需要地址标签来源、链和时间;文档模型需要像素/布局证据回链。三者都说明公开/可用数据不等于标签真实,模型 score 不等于处置理由,最终决定必须匹配错误成本和责任边界。

自检问题

  1. 七层各自最关键的选择和观测量是什么?
  2. Loss 下降为何不能跨越到业务价值结论?
  3. Inference 怎样改变同一模型的行为?
  4. 决策反馈回数据时会引入哪些偏差?
  5. 我能否沿全景图定位一个错误的最早发生层?

专业课程对齐

  • Stanford CS336:回看语言模型从数据、tokenization、架构、训练到推理的完整实现链,定位 Data、Representation、Objective、Optimization 与 Inference 的技术连接。
  • Stanford CS229:回看监督学习、损失、优化、泛化和模型选择,补齐从 objective 到 behavior 的统计学习基础。
  • Stanford CS329S:回看数据、部署、监控和人的决定,把模型输出连接到 Decision 与真实系统约束。

深入学习提示

本日以整合为主,不要求顺序重学三门课。先浏览 CS336 目录,把 P1 中 tokenization、Transformer、训练、适配与推理资产放到主链;再用 CS229 材料核对 loss、regularization、generalization 和 evaluation 的位置;最后用 CS329S 补上数据漂移、服务接口、监控与人工决定。为全景图的七个节点各写三项:核心对象、可观察证据、常见失败,并用箭头标出反馈,例如 Decision 产生的新标签怎样返回 Data,Inference 的资源约束怎样反推模型选择。至少加入三条跨周连接:数据切分影响行为证据,训练目标不等于业务目标,模型分数经阈值/规则/人工才成为决定。课程只作为回看索引,不把未阅读章节写成掌握,保持轻量知识整合即可。

完成后从任意业务决定反向沿图追一次:决定依赖哪个输出,输出来自何种推理,参数受什么目标训练,目标又由哪些数据定义;无法回溯的位置就是后续补课节点。

学后填写区

  • 全景图位置:
  • 我新增的三条跨层关系:
  • 一个错误的七层追踪:
  • 最模糊的一层:
  • 以后修订这张图的触发条件:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。