返回 M01~M90 教材库
M40 · 预习教材教材已备 ≠ 学习已完成

M40:W6 一页小结:低秩假设、领域质量与遗忘

LoRA 改变的是选定线性层中的低秩增量,而适配是否有用取决于基座能力、数据目标、训练过程和独立任务证据的共同作用。

2026-10-02lora、trainable-parameters、domain-quality、forgetting、summary

内容类型:预习教材(不代表已完成)
日期:2026-10-02
阶段:P1 · AI Model Engineering 90
周次:W6 · SFT、LoRA/PEFT 与领域适配
节奏:周五一页小结
状态:教材已备;学习未完成
标签:lora、trainable-parameters、domain-quality、forgetting、summary

一句话定义

LoRA 改变的是选定线性层中的低秩增量,而适配是否有用取决于基座能力、数据目标、训练过程和独立任务证据的共同作用。

学习目标

  1. 用一页图解释 LoRA 改变了什么、没改变什么。
  2. 连接 trainable parameters、领域数据质量与遗忘风险。
  3. 建立从无训练 baseline 到 adapter 的适配决策顺序。

核心知识

LoRA 的四个边界:

  1. 参数边界:原权重冻结,训练 A/B 增量;但运行仍需要完整基座。
  2. 表达边界:低 rank 限制可表达的权重变化;基座没有的基本能力不一定能靠少量数据获得。
  3. 数据边界:适配器忠实学习训练目标,包括错误、偏见、模板和泄漏。
  4. 部署边界:adapter 与基座架构、tokenizer、模板和版本绑定,文件小不代表治理简单。

trainable parameter 比例适合说明优化规模,却不是完整资源指标。长序列的激活仍可能占大量显存;量化基座可降低权重内存,但引入精度与后端约束;多 adapter 服务还涉及加载、路由、隔离和回归观察。

遗忘不只指通用知识彻底消失。领域适配后,模型可能在通用指令遵循、语言、拒答或格式上发生偏移。即使基座被冻结,增量在 forward 中仍可覆盖原行为。需要同时保留领域集与通用锚点集。

机制/推导

把适配行为写成 f_(θ,φ)θ 是冻结基座,φ 是 LoRA。训练只优化 φ,但输出由二者共同决定。因此“基座权重未变”不等于“基座行为不变”。合并 adapter 后得到 W'=W₀+ΔW,便于单体推理,但也失去运行时快速切换与独立版本边界。

领域质量可以从四轴检查:准确性、覆盖度、多样性和一致性。增加低质量数据可能让训练 loss 更平滑,却扩大错误目标。适配前的小规模人工抽检和数据卡,往往比多跑几个 rank 更有价值。

最小练习或观察步骤

  1. 画一张图:输入→基座层 W₀ 与 LoRA BA→输出,并标出冻结/可训练。
  2. 在图旁写出 prompting、retrieval、linear probe、full FT、LoRA 的改变对象。
  3. 为一个领域任务写四项数据质量检查,以及一个通用锚点集。
  4. 写出 adapter 的版本元数据:基座、tokenizer、模板、数据快照、rank、target modules。
  5. 用两句话分别回答:“LoRA 改变了什么?”“LoRA 没有自动解决什么?”

常见误区

  • 基座冻结,所以不需要通用能力回归观察。
  • adapter 很小,所以可以忽略数据和模型许可证。
  • 领域数据越多越好,不分析错误率与重复度。
  • 将训练参数比例等同于总显存节省比例。
  • adapter 能切换,就默认多个 adapter 可任意叠加且互不干扰。

金融 / Web3 / 文档场景连接

不同机构、辖区或文档类型可考虑独立 adapter,但事实证据和规则仍应来自受控数据源。若为 AML 叙述风格做适配,通用锚点应覆盖“不编造交易”“缺证据时拒答”“区分事实与推断”,以免风格一致掩盖证据质量下降。

自检问题

  1. 冻结基座为何仍可能发生行为遗忘?
  2. trainable parameters 不能代表哪些成本?
  3. adapter 与哪些版本必须绑定?
  4. 领域集和通用锚点集分别回答什么问题?

专业课程对齐

  • 精读 HF PEFT LoRA 的 rank、scaling、target modules、adapter 初始化与 merge 语义,用它核对本周的低秩假设。
  • 精读 Hugging Face LLM Course 的 fine-tuning、datasets 和 evaluation 章节,将数据质量、任务目标与指标连成闭环。
  • 选读 Stanford CS336 的参数、优化与资源主题,用于校准“参数高效”与“系统高效”的差别。

深入学习提示

先用 PEFT 文档给出机制边界,再用 HF 课程补数据和评估,CS336 只做系统度量校验。一页总结至少要写出 ΔW=BA、rank 与参数量关系、target module 路径、可训参数比、峰值内存和两类评估:领域任务改善与基础能力回归。遗忘不能仅凭一个样例判断,需固定回归集与生成配置。反例是将不变的训练内存归因于 LoRA 无效,而未检查激活占用;或将领域流畅度提升当成事实正确性提升。

学后填写区

  • 我的 LoRA 一句话解释:
  • 一个领域数据质量风险:
  • 一个通用锚点行为:
  • 必须记录的版本元数据:
  • W6 待复习问题:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。