返回 Papers
AI 底层逻辑 / 经典论文

Knowledge Distillation / Small Models:蒸馏、量化与模型组合

小模型策略不是“降级版 AI”,而是把任务复杂度、风险等级、延迟、成本、隐私边界和运行环境映射到合适模型的系统能力。最大模型适合复杂、低频、高价值和不确定任务,但不应默认承担所有生产流量。

237ai-foundations/papers/41-knowledge-distillation-small-models-quantization.md

Knowledge Distillation / Small Models 解读

本篇为经典论文精读(历史回顾/经典打底定位),机制正文以原论文为锚点;最新进展见文末「SOTA 检查」。

Source Anchors

SourceLink用途
Distilling the Knowledge in a Neural Networkhttps://arxiv.org/abs/1503.02531理解 teacher-student 和 soft target 的基本思想(论文 2015-03)
DistilBERT paperhttps://arxiv.org/abs/1910.01108理解 Transformer 时代的蒸馏和轻量模型(论文 2019-10)
ONNX Runtime quantization docshttps://onnxruntime.ai/docs/performance/model-optimizations/quantization.html理解模型量化对部署成本和性能的影响(访问日期: 2026-07-01)
Hugging Face quantization docshttps://huggingface.co/docs/transformers/en/main_classes/quantization理解 LLM/Transformer 量化生态(访问日期: 2026-07-01)
NIST AI RMFhttps://www.nist.gov/itl/ai-risk-management-framework把模型组合策略纳入风险、测量和治理(访问日期: 2026-07-01)

核心导读

小模型策略不是“降级版 AI”,而是把任务复杂度、风险等级、延迟、成本、隐私边界和运行环境映射到合适模型的系统能力。最大模型适合复杂、低频、高价值和不确定任务,但不应默认承担所有生产流量。

知识蒸馏、量化、专用小模型、传统 ML、规则和人工流程应该形成一个可路由、可评估、可回滚的模型组合。核心问题不是模型多小,而是每个模型是否只在被批准的任务边界内工作。

系统价值在于把模型能力从“单一大模型入口”拆成可治理的执行层:低风险高频任务由小模型规模化处理,复杂任务升级到更强模型,高影响任务进入人工或正式决策流程。评估证据要覆盖 student-teacher agreement、真实标签表现、OOD 升级、量化退化、路由准确性、成本和延迟,而不是只比较平均准确率。

治理边界是小模型策略的核心:学生模型可以承担窄任务,但不能因为低成本而扩大决策权限;量化可以优化部署,但不能绕过安全和切片评估;路由网关可以选择执行单元,但高影响动作仍应由 policy、workflow 和人工责任边界控制。

问题定义

企业 AI 生产系统面临的约束包括:

  • 单次调用成本和月度峰值成本。
  • p50/p95/p99 延迟和容量规划。
  • 数据是否允许送到外部模型或共享推理环境。
  • 任务是否需要确定性、可重复性和审计。
  • 高风险输出是否需要人工复核。
  • 是否能在边缘、私有云、低显存或批处理环境运行。
  • 模型失败时是否能快速降级。

很多任务不需要 frontier model:

任务更合适的能力
客服意图分类专用分类模型或小 transformer
文档类型识别轻量文本/视觉模型
固定字段抽取小模型 + schema validator
RAG 召回/重排embedding + reranker
支付风险初筛特征服务 + tree model / 小模型
低风险话术草稿中小模型 + policy guardrail
代码变更分类专用模型或规则

问题不是“大模型 vs 小模型”,而是任务、风险和运行约束如何被路由到正确执行单元。

核心原理

知识蒸馏的基本结构:

teacher model / ensemble / expert system
  -> logits, soft labels, rationales, traces, rankings
  -> curated distillation dataset
  -> student model training
  -> eval gate
  -> constrained production serving

Soft labels 的价值在于保留类别之间的相似性信息。硬标签只告诉学生“正确类别是什么”,soft targets 还告诉学生“哪些错误更接近正确”。这能把 teacher 的分布知识压缩到更小模型中。

DistilBERT 的启发在于 Transformer 表示可以被压缩,小模型可以保留相当一部分语言理解能力,同时获得更低延迟和部署成本。但压缩不是魔法,学生模型的任务边界必须比 teacher 更窄。

量化的基本思想:

represent weights / activations with lower precision
  -> lower memory
  -> higher throughput
  -> lower latency or cheaper hardware
  -> possible quality and stability loss

蒸馏和量化解决不同层面:

技术主要目标主要风险
Distillation把 teacher 行为迁移到 student学生复制 teacher 错误或幻觉
Quantization降低推理内存和计算成本边界样本、长尾和数值稳定性退化
Model routing把请求分配给合适模型错误路由导致低能力模型处理高风险任务
Model cascade从低成本到高成本逐级升级升级条件和置信度校准困难
Specialist model高频窄任务低成本服务out-of-domain 输入需要可靠识别

系统/架构模型

成熟 AI 平台应提供模型组合和路由能力:

request
  -> task and risk classifier
  -> data sensitivity and deployment boundary check
  -> cache / deterministic rules
  -> specialist small model if in-domain
  -> medium model for general tasks
  -> frontier model for complex or uncertain tasks
  -> human review for high-impact or policy-boundary tasks
  -> trace, feedback, monitoring

蒸馏流水线:

production task definition
  -> teacher selection
  -> distillation data design
       -> common cases
       -> boundary cases
       -> failure cases
       -> policy cases
       -> minority slices
  -> teacher labeling with review
  -> student training
  -> quantization where justified
  -> eval gate
  -> limited rollout
  -> drift and escalation monitoring

模型组合可以按任务风险组织:

执行单元适合任务控制
规则/传统 ML结构化、确定性、低延迟reason code、规则版本、监控
专用小模型高频、稳定、边界清晰OOD 检测、升级策略、teacher-student eval
中型通用模型常规摘要、分类、RAG answer成本/SLO 监控、政策检查
Frontier model复杂推理、少见任务、低频高价值强评测、预算、人工复核
人工流程高影响、模糊、争议、监管敏感workflow、evidence、SLA

模型网关不只是负载均衡。它是成本、风险、隐私、延迟和能力的 policy enforcement point。

关键机制与取舍

机制价值取舍
Teacher quality决定蒸馏上限teacher 错误会被系统化复制
Distillation dataset定义学生模型任务边界数据分布窄会导致线上泛化失败
Soft labels保留类间结构和 teacher 偏好对高风险任务仍需人工或规则验证
Specialist model降低成本和延迟必须可靠识别不在能力范围的输入
Quantization降低内存、提高吞吐需评估长尾、边界和安全样本退化
Cascade routing让简单任务走低成本路径置信度校准和升级阈值决定风险
On-prem / edge serving强数据边界和低延迟模型能力、运维和硬件限制更强
Fallback控制失败影响fallback 不能绕过政策和审计

小模型最重要的控制不是“准确率足够高”,而是:

in-domain -> produce bounded output
uncertain -> escalate
out-of-domain -> refuse or route
high-impact -> never self-authorize

如果学生模型不知道自己不知道,低成本会转化为系统性风险。

证据与控制

学生模型上线前应提供:

证据检查问题
Task boundary批准处理哪些输入、输出和风险等级
Teacher provenanceteacher 模型、prompt、规则、人工标注来源是否可信
Distillation data card数据来源、分布、边界案例、敏感数据处理
Agreement metrics学生与 teacher 在标准样本、边界样本上的一致性
Ground-truth metrics学生不只是像 teacher,也要对真实标签有效
OOD and uncertainty tests不确定或越界输入能否升级
Slice evaluation客户群、语言、渠道、产品、文档类型是否退化
Safety and policy tests隐私、合规、投诉、欺诈、高风险话术
Cost and SLOp95/p99、吞吐、容量、单位成本
Quantization comparison量化前后质量、稳定性和延迟差异
Monitoringdrift、fallback rate、escalation rate、override rate
Rollback可切回 teacher、中型模型、规则或人工流程

评估不能只问“学生是否像老师”。更重要的是: 在批准任务边界内,学生是否足够可靠;在边界外,学生是否稳定升级。

金融零售场景映射

客服意图分类:

  • 小模型处理高频意图: 查询余额、更改地址、报失卡、争议交易、投诉入口。
  • 隐私、投诉、欺诈、财务困难和监管敏感话题直接升级。
  • 大模型可用于复杂摘要或话术草稿,但发送、承诺和补偿动作由 workflow gate 控制。

KYC 文档处理:

  • 小模型适合文档类型分类、清晰度评分、缺页检测、字段候选抽取。
  • 真伪判断、法规充分性和最终 onboarding 决策不能由小模型单独完成。
  • 边界样本和地区差异必须进入蒸馏数据和切片评估。

支付风险:

real-time features
  -> low-latency risk model
  -> rules and policy
  -> approve / step-up / decline / review

毫秒级授权链路通常不适合调用大语言模型。LLM 更适合事后解释、案例摘要和 analyst support,而不是实时拦截主路径。

AML 和投诉处理:

  • 小模型可做分类、去重、摘要预处理。
  • 高风险判断、监管报告和客户影响动作需要人工和正式规则。
  • 模型路由必须记录证据,不能让低成本路径绕过审核。

反模式

  • 所有任务默认调用最大模型,成本、延迟和数据边界不可控。
  • 把蒸馏当作压缩聊天能力,而不是压缩明确任务能力。
  • 使用 teacher 生成标签却没有人工抽检和失败案例设计。
  • 学生模型没有 out-of-domain 检测和升级路径。
  • 量化后只看平均准确率,不看长尾、少数群体、政策样本和数值稳定性。
  • 用成本路由替代风险路由,让高影响任务落到低能力模型。
  • 小模型输出直接触发客户影响动作,没有 policy 和 workflow gate。
  • 没有模型、prompt、数据、量化配置和路由策略版本证据。

最终心智模型

知识蒸馏和小模型策略是模型组合管理,不是单纯省钱。Teacher 提供高质量行为,student 承担窄边界高频任务,量化优化部署成本,路由决定谁处理什么,升级和人工流程保护高风险边界。

正确的心智模型是: 最大模型负责复杂性,小模型负责规模化,规则负责确定性,人工负责高影响责任,模型网关负责把任务、风险、成本、延迟和隐私边界匹配到正确执行路径。


SOTA 检查 (2026-07-01)

  • 蒸馏主线已从"分类 logits 蒸馏"演进为"推理能力蒸馏":当前最有代表性的成功案例是 DeepSeek-R1(2025-01)把长链推理能力蒸馏进 SLM(如 DeepSeek-R1-Distill-Qwen-1.5B),配合 CoT 数据 + RL 引导;LLM 时代蒸馏方法学的系统梳理见 survey "A Survey on Knowledge Distillation of Large Language Models"(arXiv 2402.13116,2024-02),on-policy 蒸馏(MiniLLM,arXiv 2306.08543,2023-06)取代纯 off-policy soft-label 成为白盒蒸馏主流。本篇以 Hinton 2015 soft targets 为锚点的机制解释仍然正确,但生产实践中"非参数蒸馏"(teacher 生成合成数据训练 student)已是最常用形态——Phi-4 14B(2024-12 发布,大量 GPT-4 合成数据训练)即此路线代表。
  • 小模型格局(2026 年中):主流选择包括 Phi-4 14B / Phi-4-mini(2024-12 起)、Gemma 4 多模态系列(2026-04)、Qwen3.5 小模型系列 0.8B–9B(Qwen3.5-4B,2026-03)、SmolLM-3(边缘/浏览器场景);Gemma 3 的 QAT int4 版本把 4B 模型从 8GB (BF16) 压到 2.6GB 且质量仅退化数点,"蒸馏 + 量化感知训练"组合已是 on-device 交付标配。本篇"小模型承担窄边界高频任务"的路由结论与 2026 年 on-device agent 趋势一致,仍成立。
  • 量化 SOTA 已推进到 FP4:NVFP4(E2M1 权重 + block-16 的 FP8 E4M3 微块 scale + FP32 张量级 scale,NVIDIA Blackwell 原生支持)在多数模型上精度优于 INT4 和 MXFP4;NVIDIA 发布了 Quantization-Aware Distillation (QAD) 用蒸馏恢复 NVFP4 推理精度(arXiv 2601.20088,2026-01;技术报告 2026-03)——本篇分开讨论的"蒸馏"与"量化"两个机制在 2026 年实践中已直接合流。本篇 Source Anchors 里的 ONNX Runtime INT8 路线对 CPU/边缘部署仍有效,但 GPU 上的 LLM 量化主线已是 GPTQ/AWQ(PTQ 打底)→ FP8 → NVFP4/MXFP4。库内配套精读:docs/llm/day90-gptq-awq-omniquant.mddocs/llm/day92-fp8-training-inference.mddocs/llm/day93-fp4-nvfp4-mxfp.md(均为 2026 年 LLM-150 P4 阶段笔记)。
  • 量化评估纪律被 2026 研究强化:FP4 的层级/块级敏感性分析(arXiv 2603.08747,2026-03)证实不同层对 NVFP4/MXFP4 退化差异显著,ReQAT(arXiv 2606.15682,2026-06)显示推理任务(而非平均困惑度)是 4-bit 量化最脆弱的切片——印证本篇"量化后不能只看平均准确率,要看长尾/边界/推理样本"的控制要求,该结论不随格式版本过时。
  • 不随版本过时的框架性结论:teacher-student + soft targets 的信息压缩视角(Hinton 2015)、"任务边界 + OOD 升级 + 高影响动作不自授权"的治理模型、模型网关作为成本/风险/隐私 policy enforcement point、cascade 路由的置信度校准风险——这些是本篇的长效骨架,2025-2026 的所有新格式(NVFP4)和新蒸馏范式(推理蒸馏、QAD)都仍装配在这套框架内。金融场景的"毫秒级授权主路径不放 LLM"结论亦未被任何 2026 进展推翻。