M87:训练、适配、奖励与推理关系图
预训练建立通用预测分布,领域适配改变特定任务行为,偏好/奖励塑造输出倾向,推理策略在运行时分配资源;四者作用点不同,却共同决定最终行为。
内容类型:预习教材(不代表已完成)
日期:2026-11-18
阶段:P1 · AI Model Engineering 90 · 知识整合
周次:整合周(M85~M90)
节奏:周三关系整理
状态:教材已备;学习未完成
标签:pretraininglorapreference-optimizationinferencerelationship-map
一句话定义
预训练建立通用预测分布,领域适配改变特定任务行为,偏好/奖励塑造输出倾向,推理策略在运行时分配资源;四者作用点不同,却共同决定最终行为。
学习目标
- 从 W5~W8 选择一个焦点,补出四周之间的联系。
- 区分改变参数、改变训练信号和改变推理过程。
- 解释同一行为问题为何可能有多种干预层。
- 形成一张不以方法名堆砌的关系图。
核心知识
1. 预训练:学习基础分布
Next-token objective 在大规模数据混合上学习语言、模式与部分世界知识。数据 mix、token budget、模型规模和优化决定基础能力。预训练成本高、覆盖广,但代理目标只是预测下一个 token,并不直接保证遵循指令、事实校验或业务决策。
2. SFT/LoRA:用示例改变条件行为
SFT 用输入—目标输出示例教模型按特定格式和任务响应。LoRA 在冻结权重旁学习低秩更新,以较少参数进行适配。它们适合稳定格式、领域术语和任务行为,但数据质量、masking 和 target module 会影响结果。Loss 下降不代表真实任务改善,也可能造成遗忘或过度模板化。
3. Preference / Reward:优化相对选择
DPO、pairwise loss、PPO/GRPO、RLVR 等使用偏好、奖励或 verifier 信号,让某类输出相对更受偏好。Reward 是真实价值的代理,格式、长度和 judge 偏差会产生 shortcut。可执行 verifier 比模糊审美 reward 更容易对齐,但覆盖范围有限。
4. Inference:不改参数也能改行为
Prompt、retrieval、采样、temperature、self-consistency、best-of-N、verifier cascade、量化和 KV cache 都发生在推理侧。它们可以提高覆盖、约束格式或降低资源,却不会把缺失的训练知识可靠写入参数。量化还可能改变小概率行为,test-time compute 则用更多延迟换候选与验证。
机制与推导
面对“模型在金融文档中经常漏掉证据引用”,可有四层干预:预训练增加文档/布局数据;SFT/LoRA 提供带证据输出示例;奖励强调引用可验证性;推理时用检索、schema 与引用 verifier。选择取决于问题普遍性、数据、成本和可验证性,而不是默认微调。
关系图可用横轴“何时发生”:预训练→适配/后训练→推理;纵轴写“改变什么”:数据分布、参数、偏好、运行资源。再为每层写收益、风险和验证指标。方法可以组合,但组合越多越需要消融,才能知道行为来自哪里。
最小练习或观察步骤
- 从 W5~W8 选一个最感兴趣主题作为中心。
- 画四个节点:预训练、适配、奖励、推理。
- 为中心问题分别写四层可选干预。
- 标注每种干预是否改参数、需要何种数据、怎样验证。
- 选择最轻可行路线,并说明为什么暂不升级。
- 写一个组合方案及其最小消融顺序。
常见误区
- 把所有行为缺陷都交给 LoRA。
- 认为推理 prompt 能可靠弥补参数中没有的知识。
- Reward 高就等于业务价值高。
- 将量化、cache 等纯性能技术视为完全不影响质量。
- 组合多个方法后把收益归于其中一个。
- 忽略训练与推理的数据许可和隐私边界。
金融、Web3 与文档场景连接
领域术语与固定输出可用 SFT/LoRA,但实时事实更适合 retrieval;金额计算应由工具/verifier 完成;链上状态必须从节点或索引获取,不能靠参数记忆;风险理由需要证据约束而非偏好模型自由生成。低延迟支付场景可能只允许轻量模型和规则,高复杂度调查摘要才适合追加推理预算。
自检问题
- 四类方法分别改变什么?
- 哪些方法改参数,哪些只改推理过程?
- 一个引用缺失问题可以在哪四层干预?
- 为什么组合方法需要消融?
- 什么条件下 retrieval/工具优于微调?
专业课程对齐
- Stanford CS336:回看预训练数据、语言建模目标、优化与推理,明确 base model 参数能力从何而来,以及训练预算如何约束后续选择。
- ARENA 主课程:回看 Transformer 训练、RL/偏好优化与模型行为相关模块,用于区分 SFT 示例学习、reward/preference 信号和推理时策略。
- Full Stack Deep Learning:回看微调、部署和推理系统,把 LoRA、模型版本、延迟/成本及回滚放回工程生命周期。
深入学习提示
按“CS336 的预训练主干 → ARENA 的适配/偏好视角 → FSDL 的部署推理”回看,但只打开关系图中最不清楚的段落。为预训练、SFT/LoRA、preference/reward、inference 四个节点分别写:是否改参数、需要何种数据、直接优化什么目标、能改变哪些行为、主要风险。特别区分 $\mathcal{L}_{LM}$、监督指令损失、成对偏好目标与推理阶段的温度/采样/搜索:它们可共同影响最终输出,却不是同一种训练。再画出数据与版本流,标明 adapter 是否与 base model 兼容、reward model 偏差如何传递、test-time compute 怎样增加成本。重点是整合既有知识并形成选择语言,不要求重新训练模型;未亲自验证的关系标为课程结论或待验证。
可为四个节点各附一个最适合回看的旧笔记,形成课程、关系图和历史学习证据之间的双向索引。
学后填写区
- 关系图中心主题:
- 四层干预与验证方式:
- 最轻可行路线:
- 组合方案与消融顺序:
- 仍需深入的一个关系: