Knowledge Distillation / Small Models:蒸馏、量化与模型组合
小模型策略不是“降级版 AI”,而是把任务复杂度、风险等级、延迟、成本、隐私边界和运行环境映射到合适模型的系统能力。最大模型适合复杂、低频、高价值和不确定任务,但不应默认承担所有生产流量。
Knowledge Distillation / Small Models 解读
本篇为经典论文精读(历史回顾/经典打底定位),机制正文以原论文为锚点;最新进展见文末「SOTA 检查」。
Source Anchors
| Source | Link | 用途 |
|---|---|---|
| Distilling the Knowledge in a Neural Network | https://arxiv.org/abs/1503.02531 | 理解 teacher-student 和 soft target 的基本思想(论文 2015-03) |
| DistilBERT paper | https://arxiv.org/abs/1910.01108 | 理解 Transformer 时代的蒸馏和轻量模型(论文 2019-10) |
| ONNX Runtime quantization docs | https://onnxruntime.ai/docs/performance/model-optimizations/quantization.html | 理解模型量化对部署成本和性能的影响(访问日期: 2026-07-01) |
| Hugging Face quantization docs | https://huggingface.co/docs/transformers/en/main_classes/quantization | 理解 LLM/Transformer 量化生态(访问日期: 2026-07-01) |
| NIST AI RMF | https://www.nist.gov/itl/ai-risk-management-framework | 把模型组合策略纳入风险、测量和治理(访问日期: 2026-07-01) |
核心导读
小模型策略不是“降级版 AI”,而是把任务复杂度、风险等级、延迟、成本、隐私边界和运行环境映射到合适模型的系统能力。最大模型适合复杂、低频、高价值和不确定任务,但不应默认承担所有生产流量。
知识蒸馏、量化、专用小模型、传统 ML、规则和人工流程应该形成一个可路由、可评估、可回滚的模型组合。核心问题不是模型多小,而是每个模型是否只在被批准的任务边界内工作。
系统价值在于把模型能力从“单一大模型入口”拆成可治理的执行层:低风险高频任务由小模型规模化处理,复杂任务升级到更强模型,高影响任务进入人工或正式决策流程。评估证据要覆盖 student-teacher agreement、真实标签表现、OOD 升级、量化退化、路由准确性、成本和延迟,而不是只比较平均准确率。
治理边界是小模型策略的核心:学生模型可以承担窄任务,但不能因为低成本而扩大决策权限;量化可以优化部署,但不能绕过安全和切片评估;路由网关可以选择执行单元,但高影响动作仍应由 policy、workflow 和人工责任边界控制。
问题定义
企业 AI 生产系统面临的约束包括:
- 单次调用成本和月度峰值成本。
- p50/p95/p99 延迟和容量规划。
- 数据是否允许送到外部模型或共享推理环境。
- 任务是否需要确定性、可重复性和审计。
- 高风险输出是否需要人工复核。
- 是否能在边缘、私有云、低显存或批处理环境运行。
- 模型失败时是否能快速降级。
很多任务不需要 frontier model:
| 任务 | 更合适的能力 |
|---|---|
| 客服意图分类 | 专用分类模型或小 transformer |
| 文档类型识别 | 轻量文本/视觉模型 |
| 固定字段抽取 | 小模型 + schema validator |
| RAG 召回/重排 | embedding + reranker |
| 支付风险初筛 | 特征服务 + tree model / 小模型 |
| 低风险话术草稿 | 中小模型 + policy guardrail |
| 代码变更分类 | 专用模型或规则 |
问题不是“大模型 vs 小模型”,而是任务、风险和运行约束如何被路由到正确执行单元。
核心原理
知识蒸馏的基本结构:
teacher model / ensemble / expert system
-> logits, soft labels, rationales, traces, rankings
-> curated distillation dataset
-> student model training
-> eval gate
-> constrained production serving
Soft labels 的价值在于保留类别之间的相似性信息。硬标签只告诉学生“正确类别是什么”,soft targets 还告诉学生“哪些错误更接近正确”。这能把 teacher 的分布知识压缩到更小模型中。
DistilBERT 的启发在于 Transformer 表示可以被压缩,小模型可以保留相当一部分语言理解能力,同时获得更低延迟和部署成本。但压缩不是魔法,学生模型的任务边界必须比 teacher 更窄。
量化的基本思想:
represent weights / activations with lower precision
-> lower memory
-> higher throughput
-> lower latency or cheaper hardware
-> possible quality and stability loss
蒸馏和量化解决不同层面:
| 技术 | 主要目标 | 主要风险 |
|---|---|---|
| Distillation | 把 teacher 行为迁移到 student | 学生复制 teacher 错误或幻觉 |
| Quantization | 降低推理内存和计算成本 | 边界样本、长尾和数值稳定性退化 |
| Model routing | 把请求分配给合适模型 | 错误路由导致低能力模型处理高风险任务 |
| Model cascade | 从低成本到高成本逐级升级 | 升级条件和置信度校准困难 |
| Specialist model | 高频窄任务低成本服务 | out-of-domain 输入需要可靠识别 |
系统/架构模型
成熟 AI 平台应提供模型组合和路由能力:
request
-> task and risk classifier
-> data sensitivity and deployment boundary check
-> cache / deterministic rules
-> specialist small model if in-domain
-> medium model for general tasks
-> frontier model for complex or uncertain tasks
-> human review for high-impact or policy-boundary tasks
-> trace, feedback, monitoring
蒸馏流水线:
production task definition
-> teacher selection
-> distillation data design
-> common cases
-> boundary cases
-> failure cases
-> policy cases
-> minority slices
-> teacher labeling with review
-> student training
-> quantization where justified
-> eval gate
-> limited rollout
-> drift and escalation monitoring
模型组合可以按任务风险组织:
| 执行单元 | 适合任务 | 控制 |
|---|---|---|
| 规则/传统 ML | 结构化、确定性、低延迟 | reason code、规则版本、监控 |
| 专用小模型 | 高频、稳定、边界清晰 | OOD 检测、升级策略、teacher-student eval |
| 中型通用模型 | 常规摘要、分类、RAG answer | 成本/SLO 监控、政策检查 |
| Frontier model | 复杂推理、少见任务、低频高价值 | 强评测、预算、人工复核 |
| 人工流程 | 高影响、模糊、争议、监管敏感 | workflow、evidence、SLA |
模型网关不只是负载均衡。它是成本、风险、隐私、延迟和能力的 policy enforcement point。
关键机制与取舍
| 机制 | 价值 | 取舍 |
|---|---|---|
| Teacher quality | 决定蒸馏上限 | teacher 错误会被系统化复制 |
| Distillation dataset | 定义学生模型任务边界 | 数据分布窄会导致线上泛化失败 |
| Soft labels | 保留类间结构和 teacher 偏好 | 对高风险任务仍需人工或规则验证 |
| Specialist model | 降低成本和延迟 | 必须可靠识别不在能力范围的输入 |
| Quantization | 降低内存、提高吞吐 | 需评估长尾、边界和安全样本退化 |
| Cascade routing | 让简单任务走低成本路径 | 置信度校准和升级阈值决定风险 |
| On-prem / edge serving | 强数据边界和低延迟 | 模型能力、运维和硬件限制更强 |
| Fallback | 控制失败影响 | fallback 不能绕过政策和审计 |
小模型最重要的控制不是“准确率足够高”,而是:
in-domain -> produce bounded output
uncertain -> escalate
out-of-domain -> refuse or route
high-impact -> never self-authorize
如果学生模型不知道自己不知道,低成本会转化为系统性风险。
证据与控制
学生模型上线前应提供:
| 证据 | 检查问题 |
|---|---|
| Task boundary | 批准处理哪些输入、输出和风险等级 |
| Teacher provenance | teacher 模型、prompt、规则、人工标注来源是否可信 |
| Distillation data card | 数据来源、分布、边界案例、敏感数据处理 |
| Agreement metrics | 学生与 teacher 在标准样本、边界样本上的一致性 |
| Ground-truth metrics | 学生不只是像 teacher,也要对真实标签有效 |
| OOD and uncertainty tests | 不确定或越界输入能否升级 |
| Slice evaluation | 客户群、语言、渠道、产品、文档类型是否退化 |
| Safety and policy tests | 隐私、合规、投诉、欺诈、高风险话术 |
| Cost and SLO | p95/p99、吞吐、容量、单位成本 |
| Quantization comparison | 量化前后质量、稳定性和延迟差异 |
| Monitoring | drift、fallback rate、escalation rate、override rate |
| Rollback | 可切回 teacher、中型模型、规则或人工流程 |
评估不能只问“学生是否像老师”。更重要的是: 在批准任务边界内,学生是否足够可靠;在边界外,学生是否稳定升级。
金融零售场景映射
客服意图分类:
- 小模型处理高频意图: 查询余额、更改地址、报失卡、争议交易、投诉入口。
- 隐私、投诉、欺诈、财务困难和监管敏感话题直接升级。
- 大模型可用于复杂摘要或话术草稿,但发送、承诺和补偿动作由 workflow gate 控制。
KYC 文档处理:
- 小模型适合文档类型分类、清晰度评分、缺页检测、字段候选抽取。
- 真伪判断、法规充分性和最终 onboarding 决策不能由小模型单独完成。
- 边界样本和地区差异必须进入蒸馏数据和切片评估。
支付风险:
real-time features
-> low-latency risk model
-> rules and policy
-> approve / step-up / decline / review
毫秒级授权链路通常不适合调用大语言模型。LLM 更适合事后解释、案例摘要和 analyst support,而不是实时拦截主路径。
AML 和投诉处理:
- 小模型可做分类、去重、摘要预处理。
- 高风险判断、监管报告和客户影响动作需要人工和正式规则。
- 模型路由必须记录证据,不能让低成本路径绕过审核。
反模式
- 所有任务默认调用最大模型,成本、延迟和数据边界不可控。
- 把蒸馏当作压缩聊天能力,而不是压缩明确任务能力。
- 使用 teacher 生成标签却没有人工抽检和失败案例设计。
- 学生模型没有 out-of-domain 检测和升级路径。
- 量化后只看平均准确率,不看长尾、少数群体、政策样本和数值稳定性。
- 用成本路由替代风险路由,让高影响任务落到低能力模型。
- 小模型输出直接触发客户影响动作,没有 policy 和 workflow gate。
- 没有模型、prompt、数据、量化配置和路由策略版本证据。
最终心智模型
知识蒸馏和小模型策略是模型组合管理,不是单纯省钱。Teacher 提供高质量行为,student 承担窄边界高频任务,量化优化部署成本,路由决定谁处理什么,升级和人工流程保护高风险边界。
正确的心智模型是: 最大模型负责复杂性,小模型负责规模化,规则负责确定性,人工负责高影响责任,模型网关负责把任务、风险、成本、延迟和隐私边界匹配到正确执行路径。
SOTA 检查 (2026-07-01)
- 蒸馏主线已从"分类 logits 蒸馏"演进为"推理能力蒸馏":当前最有代表性的成功案例是 DeepSeek-R1(2025-01)把长链推理能力蒸馏进 SLM(如 DeepSeek-R1-Distill-Qwen-1.5B),配合 CoT 数据 + RL 引导;LLM 时代蒸馏方法学的系统梳理见 survey "A Survey on Knowledge Distillation of Large Language Models"(arXiv 2402.13116,2024-02),on-policy 蒸馏(MiniLLM,arXiv 2306.08543,2023-06)取代纯 off-policy soft-label 成为白盒蒸馏主流。本篇以 Hinton 2015 soft targets 为锚点的机制解释仍然正确,但生产实践中"非参数蒸馏"(teacher 生成合成数据训练 student)已是最常用形态——Phi-4 14B(2024-12 发布,大量 GPT-4 合成数据训练)即此路线代表。
- 小模型格局(2026 年中):主流选择包括 Phi-4 14B / Phi-4-mini(2024-12 起)、Gemma 4 多模态系列(2026-04)、Qwen3.5 小模型系列 0.8B–9B(Qwen3.5-4B,2026-03)、SmolLM-3(边缘/浏览器场景);Gemma 3 的 QAT int4 版本把 4B 模型从 8GB (BF16) 压到 2.6GB 且质量仅退化数点,"蒸馏 + 量化感知训练"组合已是 on-device 交付标配。本篇"小模型承担窄边界高频任务"的路由结论与 2026 年 on-device agent 趋势一致,仍成立。
- 量化 SOTA 已推进到 FP4:NVFP4(E2M1 权重 + block-16 的 FP8 E4M3 微块 scale + FP32 张量级 scale,NVIDIA Blackwell 原生支持)在多数模型上精度优于 INT4 和 MXFP4;NVIDIA 发布了 Quantization-Aware Distillation (QAD) 用蒸馏恢复 NVFP4 推理精度(arXiv 2601.20088,2026-01;技术报告 2026-03)——本篇分开讨论的"蒸馏"与"量化"两个机制在 2026 年实践中已直接合流。本篇 Source Anchors 里的 ONNX Runtime INT8 路线对 CPU/边缘部署仍有效,但 GPU 上的 LLM 量化主线已是 GPTQ/AWQ(PTQ 打底)→ FP8 → NVFP4/MXFP4。库内配套精读:
docs/llm/day90-gptq-awq-omniquant.md、docs/llm/day92-fp8-training-inference.md、docs/llm/day93-fp4-nvfp4-mxfp.md(均为 2026 年 LLM-150 P4 阶段笔记)。 - 量化评估纪律被 2026 研究强化:FP4 的层级/块级敏感性分析(arXiv 2603.08747,2026-03)证实不同层对 NVFP4/MXFP4 退化差异显著,ReQAT(arXiv 2606.15682,2026-06)显示推理任务(而非平均困惑度)是 4-bit 量化最脆弱的切片——印证本篇"量化后不能只看平均准确率,要看长尾/边界/推理样本"的控制要求,该结论不随格式版本过时。
- 不随版本过时的框架性结论:teacher-student + soft targets 的信息压缩视角(Hinton 2015)、"任务边界 + OOD 升级 + 高影响动作不自授权"的治理模型、模型网关作为成本/风险/隐私 policy enforcement point、cascade 路由的置信度校准风险——这些是本篇的长效骨架,2025-2026 的所有新格式(NVFP4)和新蒸馏范式(推理蒸馏、QAD)都仍装配在这套框架内。金融场景的"毫秒级授权主路径不放 LLM"结论亦未被任何 2026 进展推翻。