M36:模型适配方法地图:Prompt、检索、探针、全参微调与 LoRA
模型适配是在“改变输入、外部知识、任务头或模型参数”之间选择最小而足够的干预,使基础模型适合特定任务。
内容类型:预习教材(不代表已完成)
日期:2026-09-28
阶段:P1 · AI Model Engineering 90
周次:W6 · SFT、LoRA/PEFT 与领域适配
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签:prompting、retrieval、linear-probe、fine-tuning、lora
一句话定义
模型适配是在“改变输入、外部知识、任务头或模型参数”之间选择最小而足够的干预,使基础模型适合特定任务。
学习目标
- 能说清五种方法究竟改变了系统的哪一部分。
- 能根据知识时效、行为格式、数据量和资源约束选择起点。
- 理解适配不是从 LoRA 开始,而是从问题类型和最小 baseline 开始。
核心知识
| 方法 | 主要改变对象 | 更适合解决 | 主要边界 |
|---|---|---|---|
| Prompting | 运行时指令与示例 | 任务说明、格式、少量行为引导 | 上下文成本、稳定性有限 |
| Retrieval | 运行时外部证据 | 可更新事实、私有知识、出处 | 检索召回与证据整合错误 |
| Linear probe | 冻结表示上的小任务头 | 判断已有表示是否含任务信号 | 不能深度改变生成行为 |
| Full fine-tuning | 全部或大部分权重 | 大数据、资源充分下的深度适配 | 显存、训练成本、遗忘风险 |
| LoRA/PEFT | 少量增量参数 | 行为、风格、领域模式的经济适配 | 能力仍受基座与数据上限约束 |
选择时先问:缺的是知识、行为还是决策边界?新法规内容经常变化,优先检索;固定 JSON 输出可能先用 prompt;对已有 embedding 做分类可先 linear probe;有稳定高质量示范且需要一致行为时,才考虑 SFT/LoRA。
机制/推导
设基础模型为 f_θ(x):
- prompting 改
x; - retrieval 构造
x' = [query, evidence],仍不改θ; - linear probe 学习
W·h_θ(x),冻结θ; - full fine-tuning 学习
θ'; - LoRA 冻结
W₀,只学习ΔW = BA。
它们并非互斥。一个系统可以用检索提供最新证据,再用 LoRA 学习如何引用证据。但组合越多,故障归因越难,因此应保留最小 baseline,并按层增加复杂度。
适配成本不能只看 trainable parameters,还要考虑数据准备、评估、部署多版本、推理延迟和治理。检索不训练权重,却会引入索引更新与权限控制;LoRA 文件小,却需要版本兼容与行为回归观察。
最小练习或观察步骤
- 选择一个具体任务,如“从支付争议材料抽取原因并引用证据”。
- 将需求拆为事实更新、输出格式、领域术语、分类边界和引用约束。
- 为五种方法分别写出它改变的对象、需要的数据、最可能失败的位置。
- 先选一个不训练参数的 baseline,再选一个参数适配候选。
- 用四个维度比较:信息时效、可追溯性、资源成本、行为稳定性。
- 写出停止条件:何种证据出现时不再需要微调?何种失败说明仅 prompt 不够?
常见误区
- 把所有领域问题称为“模型不知道”,实际上可能是检索或权限问题。
- 认为 LoRA 会可靠注入大量可更新事实。
- 不做 prompt/retrieval baseline 就开始训练,无法判断增益来自哪里。
- 只比较训练成本,不比较线上多适配器管理和评估成本。
- 将 linear probe 的分类效果误解为基础模型能生成可靠解释。
金融 / Web3 / 文档场景连接
法规问答通常需要检索和引用;AML 告警分类可先冻结 embedding 加线性头;合同条款改写可能用 LoRA 学习机构风格;链上实时状态必须来自工具或检索,而不应写入静态权重。把这些需求混成一次微调,会降低可更新性与可解释性。
自检问题
- prompting 与 retrieval 分别改变了什么?
- “最新余额是多少”为什么不是 LoRA 的好任务?
- linear probe 表现好能支持什么结论,不能支持什么?
- 哪些情况下 full fine-tuning 的额外成本可能合理?
专业课程对齐
- 精读 Hugging Face LLM Course 的 fine-tuning 与 task-specific adaptation 相关章节,分清 prompt-only、冻结 encoder/head 和全参更新的代码边界。
- 精读 HF PEFT LoRA 中
LoraConfig、target_modules、r、lora_alpha和 adapter merge 的 API 语义。 - 选读 Stanford CS224N 中 pretraining/fine-tuning 与 prompting 课题,用来建立方法的历史与任务视角。
深入学习提示
顺序先用 HF 课程确定任务与数据,再精读 PEFT 参数,最后用 CS224N 补概念。对每种适配方法同时记录可训参数数量、显存、训练时间、输入 token 成本和推理时是否增加检索依赖。代码路径要找到哪些 requires_grad=True,而不是仅看方法名。反例是把“领域知识更新”一律归结为微调:可更新的事实往往更适合检索,稳定风格或格式才可能适合 adapter。
学后填写区
- 我选择的任务:
- 缺口类型(知识 / 行为 / 决策边界):
- 最小 baseline:
- 候选适配方法及理由:
- 仍需验证的假设: