返回 M01~M90 教材库
M54 · 预习教材教材已备 ≠ 学习已完成

M54:第二阶段复盘:训练、适配、奖励与推理是一条系统链

模型工程第二阶段是一条连续链:预训练形成基础分布,领域适配改变部分行为,偏好/奖励重排输出倾向,推理系统决定这些行为以何种成本被提供。

2026-10-16phase-review、pretraining、lora、preference、inference

内容类型:预习教材(不代表已完成)
日期:2026-10-16
阶段:P1 · AI Model Engineering 90
周次:W8 · 推理、KV Cache、量化与 serving
节奏:周五一页小结 / 阶段复盘
状态:教材已备;学习未完成
标签:phase-review、pretraining、lora、preference、inference

一句话定义

模型工程第二阶段是一条连续链:预训练形成基础分布,领域适配改变部分行为,偏好/奖励重排输出倾向,推理系统决定这些行为以何种成本被提供。

学习目标

  1. 连接 W5~W8 四周概念,而不是孤立记算法。
  2. 能为一个观察到的失败定位训练、适配、奖励或推理层。
  3. 形成第二阶段全景图和轻量复习清单,不做评分。

核心知识

W5 训练回答:模型从哪些 token、通过什么 objective 和优化过程形成参数?关键证据是数据卡、曲线、validation 与单变量对照。

W6 适配回答:在不重做全部预训练的情况下,改变输入、外部证据、任务头或低秩参数中的哪一部分?关键边界是方法选择、数据质量、mask 和通用锚点。

W7 奖励回答:什么反馈定义“更可取”,模型是否学会了代理捷径?关键边界是优化环与独立证据环、reward 分量和 verifier 覆盖。

W8 推理回答:如何在设备、context、batch、precision 与 cache 约束下提供模型?关键证据是正确性对照、工作负载协议以及延迟/吞吐/内存/质量分离。

这些层会相互伪装:量化造成的输出偏移可能被误判为适配退化;训练数据缺失可能被错误地用更大 cache 解决;检索事实过时可能被归咎于 LoRA;reward 鼓励冗长会显著增加服务成本。

机制/推导

可画总链:

data → tokens → objective → optimization → base model → adaptation → preference/reward → policy → inference runtime → decision/use

并在每条箭头旁写一种证据和一种故障。排查应从用户可见症状向前追踪,但先检查最便宜的接口:输入与模板、版本、解码与 runtime,再决定是否需要重新适配或训练。

阶段复盘不是合并所有指标。模型 loss、reward、TTFT 和业务正确率单位不同,各自只能回答局部问题。全景图的价值是保存边界与依赖。

最小练习或观察步骤

  1. 将 W5~W8 的四张图放在一页,按数据流连线。
  2. 为每周写:一个核心变量、一个证据、一个常见越级结论。
  3. 选择案例:“适配模型输出更长,线上更慢且证据错误增加”。
  4. 从数据、mask、reward、解码、context 与 runtime 六处列假设,并按最便宜检查排序。
  5. 标记三类结论:已理解、需回看、目前证据不足。
  6. 把最多五项放入复习清单;不要求今天解决或补实验。

常见误区

  • 用训练 loss 解释部署延迟,用 benchmark 解释事实正确性。
  • 阶段复盘变成重跑所有实验。
  • 只画组件,不画数据、版本和证据边界。
  • 将所有问题归因于模型规模。
  • 为了“闭环”强行给仍不确定的现象一个答案。

金融 / Web3 / 文档场景连接

一个合同证据助手可能由领域数据、LoRA、引用奖励和本地量化服务共同组成。若金额抄错,需依次确认 OCR/输入、训练样例、奖励是否检查数值、量化前后 logits 与解码;不能因为最终界面显示一个答案就把系统当成单一模型。

自检问题

  1. W5~W8 各自主要回答什么问题?
  2. reward 鼓励长答案为何会影响 serving?
  3. 量化后的行为偏移应如何与 adapter 问题区分?
  4. 全景图中哪些指标绝不能直接互相替代?

专业课程对齐

  • 精读 Stanford CS336 的 data、training、scaling 与 systems 主线,用作 base model 从 token 到 runtime 的端到端骨架。
  • 精读 HF PEFT LoRAHF TRL Quickstart 的接口边界,分别标注 adaptation 和 post-training 在总链条中改变的状态。
  • 选读 vLLM PagedAttention 的 KV cache 布局,用于将模型行为连到服务成本。

深入学习提示

先以 CS336 画出 data→tokens→objective→optimization→base model,再接 PEFT→TRL→runtime;每条箭头标一个可观测量、一个资源成本和一个不能越级的结论。案例排查按便宜程度从 input/template、version、decode config、runtime 开始,再查 adapter/reward/data;对 loss、reward、TTFT 和业务正确率保留不同单位。反例是输出变长后线上变慢,便直接重训模型,而未检查 reward 是否偏好长度;或将量化后的 token 差异误认为 LoRA 遗忘。

学后填写区

  • 第二阶段全景图位置:
  • 我最稳固的一条跨周联系:
  • 一个需要回看的层:
  • 最多五项复习清单:
  • 明确保留为证据不足的问题:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。