返回 M01~M90 教材库
M36 · 预习教材教材已备 ≠ 学习已完成

M36:模型适配方法地图:Prompt、检索、探针、全参微调与 LoRA

模型适配是在“改变输入、外部知识、任务头或模型参数”之间选择最小而足够的干预,使基础模型适合特定任务。

2026-09-28prompting、retrieval、linear-probe、fine-tuning、lora

内容类型:预习教材(不代表已完成)
日期:2026-09-28
阶段:P1 · AI Model Engineering 90
周次:W6 · SFT、LoRA/PEFT 与领域适配
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签:prompting、retrieval、linear-probe、fine-tuning、lora

一句话定义

模型适配是在“改变输入、外部知识、任务头或模型参数”之间选择最小而足够的干预,使基础模型适合特定任务。

学习目标

  1. 能说清五种方法究竟改变了系统的哪一部分。
  2. 能根据知识时效、行为格式、数据量和资源约束选择起点。
  3. 理解适配不是从 LoRA 开始,而是从问题类型和最小 baseline 开始。

核心知识

方法主要改变对象更适合解决主要边界
Prompting运行时指令与示例任务说明、格式、少量行为引导上下文成本、稳定性有限
Retrieval运行时外部证据可更新事实、私有知识、出处检索召回与证据整合错误
Linear probe冻结表示上的小任务头判断已有表示是否含任务信号不能深度改变生成行为
Full fine-tuning全部或大部分权重大数据、资源充分下的深度适配显存、训练成本、遗忘风险
LoRA/PEFT少量增量参数行为、风格、领域模式的经济适配能力仍受基座与数据上限约束

选择时先问:缺的是知识行为还是决策边界?新法规内容经常变化,优先检索;固定 JSON 输出可能先用 prompt;对已有 embedding 做分类可先 linear probe;有稳定高质量示范且需要一致行为时,才考虑 SFT/LoRA。

机制/推导

设基础模型为 f_θ(x)

  • prompting 改 x
  • retrieval 构造 x' = [query, evidence],仍不改 θ
  • linear probe 学习 W·h_θ(x),冻结 θ
  • full fine-tuning 学习 θ'
  • LoRA 冻结 W₀,只学习 ΔW = BA

它们并非互斥。一个系统可以用检索提供最新证据,再用 LoRA 学习如何引用证据。但组合越多,故障归因越难,因此应保留最小 baseline,并按层增加复杂度。

适配成本不能只看 trainable parameters,还要考虑数据准备、评估、部署多版本、推理延迟和治理。检索不训练权重,却会引入索引更新与权限控制;LoRA 文件小,却需要版本兼容与行为回归观察。

最小练习或观察步骤

  1. 选择一个具体任务,如“从支付争议材料抽取原因并引用证据”。
  2. 将需求拆为事实更新、输出格式、领域术语、分类边界和引用约束。
  3. 为五种方法分别写出它改变的对象、需要的数据、最可能失败的位置。
  4. 先选一个不训练参数的 baseline,再选一个参数适配候选。
  5. 用四个维度比较:信息时效、可追溯性、资源成本、行为稳定性。
  6. 写出停止条件:何种证据出现时不再需要微调?何种失败说明仅 prompt 不够?

常见误区

  • 把所有领域问题称为“模型不知道”,实际上可能是检索或权限问题。
  • 认为 LoRA 会可靠注入大量可更新事实。
  • 不做 prompt/retrieval baseline 就开始训练,无法判断增益来自哪里。
  • 只比较训练成本,不比较线上多适配器管理和评估成本。
  • 将 linear probe 的分类效果误解为基础模型能生成可靠解释。

金融 / Web3 / 文档场景连接

法规问答通常需要检索和引用;AML 告警分类可先冻结 embedding 加线性头;合同条款改写可能用 LoRA 学习机构风格;链上实时状态必须来自工具或检索,而不应写入静态权重。把这些需求混成一次微调,会降低可更新性与可解释性。

自检问题

  1. prompting 与 retrieval 分别改变了什么?
  2. “最新余额是多少”为什么不是 LoRA 的好任务?
  3. linear probe 表现好能支持什么结论,不能支持什么?
  4. 哪些情况下 full fine-tuning 的额外成本可能合理?

专业课程对齐

  • 精读 Hugging Face LLM Course 的 fine-tuning 与 task-specific adaptation 相关章节,分清 prompt-only、冻结 encoder/head 和全参更新的代码边界。
  • 精读 HF PEFT LoRALoraConfigtarget_modulesrlora_alpha 和 adapter merge 的 API 语义。
  • 选读 Stanford CS224N 中 pretraining/fine-tuning 与 prompting 课题,用来建立方法的历史与任务视角。

深入学习提示

顺序先用 HF 课程确定任务与数据,再精读 PEFT 参数,最后用 CS224N 补概念。对每种适配方法同时记录可训参数数量、显存、训练时间、输入 token 成本和推理时是否增加检索依赖。代码路径要找到哪些 requires_grad=True,而不是仅看方法名。反例是把“领域知识更新”一律归结为微调:可更新的事实往往更适合检索,稳定风格或格式才可能适合 adapter。

学后填写区

  • 我选择的任务:
  • 缺口类型(知识 / 行为 / 决策边界):
  • 最小 baseline:
  • 候选适配方法及理由:
  • 仍需验证的假设:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。