返回 Papers
AI 底层逻辑 / 经典论文

Active Learning / HITL Labeling:专家反馈运营

Active Learning 的核心不是“让人帮模型补标签”,而是用明确的采样策略,把有限专家时间投向最能降低模型风险、暴露盲区、提升覆盖和修正标签口径的样本。模型不确定、模型之间分歧、样本具有代表性、业务风险高、关键 segment 覆盖不足,都可以成为请求人工标签的理由。

350ai-foundations/papers/56-active-learning-human-in-the-loop-labeling.md

Active Learning / Human-in-the-Loop Labeling 解读

Source Anchors

SourceLink读它要抓住什么
Burr Settles, Active Learning Literature Surveyhttps://burrsettles.com/pub/settles.activelearning.pdfActive learning 场景、query strategy、batch mode、noisy oracle、variable cost 和 stopping criteria
Active Learning online referencehttp://active-learning.net/主动学习研究路线和长期参考入口
NIST AI RMFhttps://www.nist.gov/itl/ai-risk-management-framework把人工监督、测量、管理和持续改进纳入 AI 风险管理

核心导读

Active Learning 的核心不是“让人帮模型补标签”,而是用明确的采样策略,把有限专家时间投向最能降低模型风险、暴露盲区、提升覆盖和修正标签口径的样本。模型不确定、模型之间分歧、样本具有代表性、业务风险高、关键 segment 覆盖不足,都可以成为请求人工标签的理由。

难点在于人工也不是天然 ground truth,生产反馈存在选择偏差和标签延迟,评估集容易被污染,专家队列还受到 SLA、成本和疲劳影响。因此 active learning 必须和 HITL 工作流、reviewer calibration、dataset registry、评估隔离、segment coverage、反馈治理和上线门禁一起设计。

核心问题

专家标签很贵,而且经常来得太晚。

AML 调查员时间有限,不可能随机标注海量告警。欺诈专家要优先看新攻击模式和高客户影响样本。KYC 运营团队要处理低质量图片、新地区模板和异常文档。投诉团队要识别监管敏感意图、taxonomy 冲突和多意图样本。RAG 合规助手需要人工验证高风险问题、引用支持和错误答案。

如果只是随机抽样标注,很多专家时间会花在模型已经会判断的样本上。相反,如果只让模型选择最不确定样本,队列又可能充满噪声、离群点和重复案例。

Active learning 要解决的是:

在标签预算有限、专家时间稀缺、生产数据持续变化的情况下,下一批最值得请人标注的样本是什么?

请求人工标签的理由可以有很多:

  • 模型不确定。
  • 多个模型或规则分歧。
  • 样本靠近决策阈值。
  • 样本代表高频新模式。
  • 样本来自覆盖不足的 segment。
  • 样本业务影响高,例如高金额、高投诉风险、高监管风险。
  • 样本可用于校准 reviewer 或保护评估集。

方法/论文贡献

Burr Settles 的综述把 active learning 系统化为多个维度:场景、query strategy、oracle、batch selection、噪声、成本和停止条件。

第一个贡献是把主动学习场景分类。Pool-based active learning 从未标注池中选样本;stream-based selective sampling 在样本流入时决定是否请求标签;membership query synthesis 让系统生成样本请 oracle 标注。金融零售大多数会从 pool-based 开始,因为更容易控制数据、隐私、队列和审计。

第二个贡献是总结 query strategy。Uncertainty sampling、query-by-committee、expected model change、expected error reduction、density-weighted selection 等方法从不同角度定义“样本价值”。

第三个贡献是指出 oracle 并不完美。人工专家可能有噪声、疲劳、口径差异、成本差异和响应延迟。HITL 不是把样本丢给人就结束,而是要管理 reviewer training、gold questions、adjudication 和 label quality。

第四个贡献是强调 stopping criteria 和 cost。Active learning 不是无限标注,必须知道何时继续标注不再划算,或者哪些 segment 需要单独补充。

这些贡献转成企业语言就是:

query strategy
  + reviewer operations
  + dataset governance
  + model evaluation
  + production feedback
  -> continuous learning loop

机制原理:Active Learning 闭环

传统监督学习常见流程是:

random sample -> human label -> train model -> deploy

Active learning 是闭环:

production / unlabeled pool
  -> model scoring and uncertainty
  -> query strategy
  -> sampling constraints
  -> expert review and adjudication
  -> label quality control
  -> dataset registry
  -> model training / eval
  -> monitoring
  -> next query cycle

这个闭环中最重要的是 query strategy 和 human workflow 的结合。算法可以推荐样本,但最终进入专家队列的样本还要经过 eligibility、隐私、风险、SLA、预算和 segment 约束。

例如欺诈系统可能先计算:

  • 模型分数是否靠近阈值。
  • 规则和模型是否分歧。
  • 是否来自新商户类别。
  • 金额和客户影响是否高。
  • 是否属于覆盖不足的地区或渠道。
  • 当前专家队列是否有容量。

最终请求标签的样本,是这些信号共同作用的结果。

机制原理:Uncertainty Sampling

Uncertainty sampling 选择模型最不确定的样本。

常见方式包括:

方法选择标准直觉
Least confidencetop class confidence 最低模型最没把握
Margin sampling第一名和第二名分数差最小决策边界附近
Entropy类别分布最分散多个类别都可能

这种方法简单有效,但有明显风险。

模型不确定的样本可能是噪声、异常格式、坏数据、无意义输入或极端离群点。专家标完这些样本,模型未必提升多少。

在金融场景中,uncertainty 还要和业务价值结合。一个低金额、低影响、孤立且噪声很高的样本,未必值得 AML 专家花时间。一个模型略不确定但金额大、客户影响高、处于新攻击模式中的样本,优先级可能更高。

因此更现实的策略是:

uncertainty
  + business impact
  + representativeness
  + segment coverage
  + queue capacity
  -> query priority

机制原理:Query-by-Committee

Query-by-committee 用多个模型、规则或视角形成委员会,选择分歧最大的样本。

委员会可以是:

  • 规则引擎、GBDT、深度模型和图模型。
  • 不同 prompt 的 LLM evaluator。
  • 文本模型、结构化模型和 embedding classifier。
  • 当前模型和上一版本模型。
  • 业务规则和模型分数。

分歧样本很有价值,因为它们暴露系统边界。

分歧形式可能含义
规则高风险,模型低风险模型缺少政策或新模式信号
模型高风险,规则低风险模型发现新模式,也可能是误报
LLM judge 分歧评估口径或证据不足
新旧模型分歧模型版本变化影响策略
专家之间分歧标签定义或政策口径不清

在产品上,分歧样本不只是训练数据,也可能触发 taxonomy review、规则 review、政策解释或流程改进。

机制原理:Expected Model Change 和 Error Reduction

Expected model change 选择那些标注后最可能改变模型参数的样本。Expected error reduction 选择那些标注后最可能降低未来错误的样本。

这些方法理论上更直接优化学习效果,但工程成本更高。金融零售落地时常用 proxy:

  • near-threshold。
  • high volume pattern。
  • high error cost。
  • known blind spot。
  • high disagreement。
  • under-covered segment。
  • high uncertainty + high density。

关键是 batch diversity。一批样本如果全是同一类相似投诉、同一商户、同一 OCR 错误或同一攻击 cluster,专家时间会被重复消耗。Batch selection 需要去重、聚类和配额控制。

机制原理:Density-Weighted Selection

只选最不确定样本容易选到离群噪声。Density-weighted selection 同时看不确定性和代表性。

它背后的直觉是:

一个样本既难又代表大量相似生产样本,比一个孤立异常样本更值得标注。

金融例子:

  • 大量新型投诉表达集中出现,说明产品或政策变化影响客户。
  • 某类商户设备组合反复出现在欺诈边界附近,值得专家分析。
  • 某地区 KYC 文档模板新增,覆盖多个客户,而不是单个异常图片。
  • RAG 中同一政策域的问题频繁 citation mismatch,说明知识库或 chunking 有系统问题。

代表性不是忽略长尾。高风险长尾样本也需要标注,但它们应通过 risk-based sampling 或 red-team sampling 进入队列,而不是伪装成普通代表性样本。

为什么有效

Active learning 有效的第一层原因,是它提高标签预算效率。专家时间被用于模型最需要帮助的区域,而不是随机消耗。

第二层原因,是它让模型盲区更快暴露。分歧、不确定、阈值附近和新 segment 样本会暴露规则、taxonomy、数据质量和模型边界问题。

第三层原因,是它支持持续学习。生产数据不断变化,active learning 把监控发现的 drift、error、complaint、override 和新模式转化为可标注样本。

第四层原因,是它连接人和模型的责任边界。人工不是兜底按钮,而是高价值判断资源;系统要决定何时请求人、请求谁、提供什么证据、如何仲裁、如何回流。

第五层原因,是它改善评估和治理。通过 gold questions、reviewer calibration、dataset separation 和 label lineage,团队可以知道标签质量和反馈闭环是否可信。

局限和误用

第一类误用,是只做 uncertainty sampling。结果队列里充满噪声、离群点和模型看不懂但业务价值很低的样本。

第二类误用,是忽略 feedback bias。生产中被模型拦截、升级或人工处理的样本更容易获得标签;被放行或未触达的样本结果可能缺失。如果只从有反馈样本学习,模型会强化原策略偏差。

第三类误用,是污染评估集。Active learning 选择的是模型最关心的样本,如果这些样本反复进入 eval set,指标会失去独立性。

第四类误用,是把人工当成绝对真相。专家有疲劳、培训差异、政策理解差异和激励偏差。高风险标签需要 gold questions、双人复核、仲裁和 reviewer calibration。

第五类误用,是没有停止条件。标注永远可以继续,但边际收益可能已经低于成本。需要按 model lift per label、label yield、segment coverage 和风险降低判断是否继续。

第六类误用,是忽略队列运营。专家 SLA、优先级、证据面板、隐私脱敏、仲裁流程和反馈延迟都会决定 active learning 是否能真实运行。

架构/产品价值

Active learning 应作为 AI 运营控制面的一部分。

production data and unlabeled pool
  -> eligibility and privacy filter
  -> scoring, uncertainty and disagreement
  -> query policy
  -> sampling constraints and batch diversity
  -> review queue
  -> labeling UI and evidence panel
  -> adjudication and quality control
  -> dataset registry
  -> training / eval / policy update
  -> monitoring and next cycle

关键组件如下:

组件职责
Query engine计算 uncertainty、disagreement、density、risk、segment gap
Sampling policy约束预算、队列容量、segment、客户影响和多样性
Review queue分配 SME、运营、合规或二线专家,管理 SLA 和优先级
Labeling UI提供证据、上下文、标签定义和历史案例,避免暗示性污染
Adjudication workflow处理 reviewer 分歧,记录最终口径和理由
Reviewer calibrationgold questions、一致率、培训和质量监控
Dataset registry隔离 active labels、training、eval、gold 和 adjudicated labels
Feedback service把标签回流模型、规则、taxonomy 和监控
Evidence binder记录采样策略、标签来源、版本、审批和风险接受

产品价值体现在三方面。

第一,提升专家时间 ROI。不是更多标注,而是更有价值的标注。

第二,建立持续学习机制。模型上线后仍能系统性发现盲区并改进。

第三,形成风险控制。高风险样本、低置信样本和漂移样本有明确人审路径。

金融零售系统案例

欺诈调查标签

欺诈 active learning 的 query signals 可以包括:

  • 模型分数靠近强认证或拒绝阈值。
  • 规则和模型分歧。
  • 新商户类别、新设备模式或新地理组合。
  • 高金额或高客户影响。
  • step-up failure、客户 dispute 或人工 override。
  • score drift 或 segment drift。

标签来源有延迟。Chargeback 可能数天到数周才确认,客户投诉和人工调查也可能滞后。系统应把早期 proxy 和最终 outcome 分开记录。

采样还要包含随机抽检和 counterfactual sampling。否则系统只会学习被拦截的交易,无法理解放行交易中的未观察风险。

KYC 例外审核

KYC active learning 可选样本包括:

  • OCR confidence 低。
  • 文档类型 prediction set 过大。
  • 新国家或地区模板。
  • 人工 override 高。
  • 低质量图片和裁切异常。
  • 客户重新上传多次仍失败。

专家复核不只是给标签,还要判断问题来源:文档模板缺失、OCR 失败、图片质量、欺诈文档、产品流程引导不清,还是标签 taxonomy 不适合。

这些反馈会同时改进模型、上传引导、文档模板库和审核政策。

投诉意图和监管敏感标签

投诉标签常有多意图和政策敏感性。Active learning 不应只选模型不确定文本,还要优先:

  • 涉及费用、欺诈、歧视、脆弱客户和监管关键词的投诉。
  • 客服 disposition 与模型意图分歧的样本。
  • 新产品发布后集中出现的新表达。
  • 多渠道重复投诉。
  • 专家之间分歧高的样本。

这类场景的输出不只是训练标签,还可能触发产品问题、政策说明、客服脚本和监管报告流程改进。

评测与上线门禁

上线 active learning 流程前,要明确:

Gate需要证明什么
Query policy选择样本的目标、信号、权重和限制清楚
Budget policy专家时间、队列容量、优先级和停止条件明确
Privacy filter样本进入人审前完成最小化、脱敏和权限控制
Reviewer governancetraining、gold questions、agreement、adjudication 已建立
Dataset separationactive、training、eval、gold、adjudicated set 隔离
Bias controlsegment sampling、随机抽检和 counterfactual sampling 已设计
Feedback control人工标签进入训练前有版本、质量指标和审批
Monitoringlabel yield、model lift、queue SLA、disagreement 和 harm 指标持续监控
Rollback错误标签批次、模型版本和策略更新可回退

Active learning 的上线门禁要同时覆盖算法、运营、数据和治理。

学习验证

学习这篇后,可以做一个 HITL active learning 设计练习。

  1. 选择欺诈、KYC、投诉、AML 或 RAG QA 场景。
  2. 定义 active learning 的目标:提升模型、发现盲区、补 segment,还是降低风险。
  3. 设计 query signals:uncertainty、disagreement、business impact、density、segment gap。
  4. 说明为什么只用 uncertainty sampling 不够。
  5. 设计 batch selection 的 diversity 和去重规则。
  6. 定义 reviewer role、SLA、证据面板和仲裁流程。
  7. 设计 gold questions 和 reviewer calibration。
  8. 画出 active、training、eval、gold、adjudicated set 的隔离关系。
  9. 识别 feedback bias 和 outcome lag。
  10. 定义 label yield、model lift per label、coverage、queue SLA 和 customer harm 指标。

完成这些任务后,应该能把 active learning 理解为一个受治理的采样和专家运营系统,而不是简单的人机标注循环。

关键结论

Active learning 的核心问题是“下一批最值得标注的样本是什么”。

Uncertainty、disagreement、expected learning value、density、business impact 和 segment gap 都可以成为 query signal,但必须由 sampling policy 统一治理。

HITL 的关键不是有人兜底,而是 reviewer calibration、证据界面、仲裁、SLA、数据隔离和反馈质量。

金融零售场景必须防止 feedback bias、评估集污染、标签延迟和专家口径漂移。

成熟的 active learning 系统,不是让模型随意向人提问,而是把专家判断变成持续改进 AI 系统的数据产品和风险控制能力。


SOTA 状态标注 (2026-07-01)

本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。