M54:第二阶段复盘:训练、适配、奖励与推理是一条系统链
模型工程第二阶段是一条连续链:预训练形成基础分布,领域适配改变部分行为,偏好/奖励重排输出倾向,推理系统决定这些行为以何种成本被提供。
内容类型:预习教材(不代表已完成)
日期:2026-10-16
阶段:P1 · AI Model Engineering 90
周次:W8 · 推理、KV Cache、量化与 serving
节奏:周五一页小结 / 阶段复盘
状态:教材已备;学习未完成
标签:phase-review、pretraining、lora、preference、inference
一句话定义
模型工程第二阶段是一条连续链:预训练形成基础分布,领域适配改变部分行为,偏好/奖励重排输出倾向,推理系统决定这些行为以何种成本被提供。
学习目标
- 连接 W5~W8 四周概念,而不是孤立记算法。
- 能为一个观察到的失败定位训练、适配、奖励或推理层。
- 形成第二阶段全景图和轻量复习清单,不做评分。
核心知识
W5 训练回答:模型从哪些 token、通过什么 objective 和优化过程形成参数?关键证据是数据卡、曲线、validation 与单变量对照。
W6 适配回答:在不重做全部预训练的情况下,改变输入、外部证据、任务头或低秩参数中的哪一部分?关键边界是方法选择、数据质量、mask 和通用锚点。
W7 奖励回答:什么反馈定义“更可取”,模型是否学会了代理捷径?关键边界是优化环与独立证据环、reward 分量和 verifier 覆盖。
W8 推理回答:如何在设备、context、batch、precision 与 cache 约束下提供模型?关键证据是正确性对照、工作负载协议以及延迟/吞吐/内存/质量分离。
这些层会相互伪装:量化造成的输出偏移可能被误判为适配退化;训练数据缺失可能被错误地用更大 cache 解决;检索事实过时可能被归咎于 LoRA;reward 鼓励冗长会显著增加服务成本。
机制/推导
可画总链:
data → tokens → objective → optimization → base model → adaptation → preference/reward → policy → inference runtime → decision/use
并在每条箭头旁写一种证据和一种故障。排查应从用户可见症状向前追踪,但先检查最便宜的接口:输入与模板、版本、解码与 runtime,再决定是否需要重新适配或训练。
阶段复盘不是合并所有指标。模型 loss、reward、TTFT 和业务正确率单位不同,各自只能回答局部问题。全景图的价值是保存边界与依赖。
最小练习或观察步骤
- 将 W5~W8 的四张图放在一页,按数据流连线。
- 为每周写:一个核心变量、一个证据、一个常见越级结论。
- 选择案例:“适配模型输出更长,线上更慢且证据错误增加”。
- 从数据、mask、reward、解码、context 与 runtime 六处列假设,并按最便宜检查排序。
- 标记三类结论:已理解、需回看、目前证据不足。
- 把最多五项放入复习清单;不要求今天解决或补实验。
常见误区
- 用训练 loss 解释部署延迟,用 benchmark 解释事实正确性。
- 阶段复盘变成重跑所有实验。
- 只画组件,不画数据、版本和证据边界。
- 将所有问题归因于模型规模。
- 为了“闭环”强行给仍不确定的现象一个答案。
金融 / Web3 / 文档场景连接
一个合同证据助手可能由领域数据、LoRA、引用奖励和本地量化服务共同组成。若金额抄错,需依次确认 OCR/输入、训练样例、奖励是否检查数值、量化前后 logits 与解码;不能因为最终界面显示一个答案就把系统当成单一模型。
自检问题
- W5~W8 各自主要回答什么问题?
- reward 鼓励长答案为何会影响 serving?
- 量化后的行为偏移应如何与 adapter 问题区分?
- 全景图中哪些指标绝不能直接互相替代?
专业课程对齐
- 精读 Stanford CS336 的 data、training、scaling 与 systems 主线,用作 base model 从 token 到 runtime 的端到端骨架。
- 精读 HF PEFT LoRA 与 HF TRL Quickstart 的接口边界,分别标注 adaptation 和 post-training 在总链条中改变的状态。
- 选读 vLLM PagedAttention 的 KV cache 布局,用于将模型行为连到服务成本。
深入学习提示
先以 CS336 画出 data→tokens→objective→optimization→base model,再接 PEFT→TRL→runtime;每条箭头标一个可观测量、一个资源成本和一个不能越级的结论。案例排查按便宜程度从 input/template、version、decode config、runtime 开始,再查 adapter/reward/data;对 loss、reward、TTFT 和业务正确率保留不同单位。反例是输出变长后线上变慢,便直接重训模型,而未检查 reward 是否偏好长度;或将量化后的 token 差异误认为 LoRA 遗忘。
学后填写区
- 第二阶段全景图位置:
- 我最稳固的一条跨周联系:
- 一个需要回看的层:
- 最多五项复习清单:
- 明确保留为证据不足的问题: