返回 M01~M90 教材库
M74 · 预习教材教材已备 ≠ 学习已完成

M74:切分泄漏、分布变化与 LLM 的受限角色

正确切分测试模型面对“真正未见未来或主体”的能力,而错误随机切分常让身份、邻居与未来信息泄漏;LLM 可以辅助解释和操作,但不应无条件取代结构化决策模型。

2026-11-05data-leakagedistribution-shiftentity-splitgraph-splitllm-boundary

内容类型:预习教材(不代表已完成)
日期:2026-11-05
阶段:P1 · AI Model Engineering 90
周次:W11
节奏:周四案例与连接
状态:教材已备;学习未完成
标签data-leakage distribution-shift entity-split graph-split llm-boundary

一句话定义

正确切分测试模型面对“真正未见未来或主体”的能力,而错误随机切分常让身份、邻居与未来信息泄漏;LLM 可以辅助解释和操作,但不应无条件取代结构化决策模型。

学习目标

  1. 对比时间、实体、图感知切分与随机切分的含义。
  2. 识别预处理、标签、特征和图传播中的泄漏路径。
  3. 理解分布变化为何需要时间外和切片评估。
  4. 给 LLM 定义主导、辅助或不进入的明确条件。

核心知识

1. 四类典型泄漏

时间泄漏:使用未来交易、未来均值或事后确认字段。实体泄漏:同一客户、钱包、设备或商户出现在训练与测试。结构泄漏:测试节点的信息经全图聚合进入训练表示。预处理泄漏:在全数据上拟合标准化、缺失填充、特征选择或 tokenizer/vocab。

随机切分只有在样本近似独立同分布、部署也从相同总体随机抽样时才合理。金融和 Web3 行为通常具有时间、主体和网络依赖,因此应从部署机制倒推切分。

2. 分布变化不是单一指标下降

基准率会变、行为策略会适应、产品规则会上线、地址标签会过期。特征分布变化不必然导致性能下降,标签关系变化却更危险。应按时间、实体新旧、地区/链、交易类型和数据质量切片;同时监控 score 分布、拒答/复核量和已成熟标签上的错误。

3. LLM 的三种位置

主导:任务以开放文本理解或生成决策草案为主,且有强 verifier 与人工责任边界。辅助:把非结构化材料转字段、解释已有 score、生成调查摘要、帮助编写特征或查询。不进入:确定性数值计算、极低延迟高吞吐打分、训练标签不可共享、无法验证且错误成本极高的自动决定。

LLM 输出的解释必须来自模型实际输入和证据,不应凭风险 score 编造因果理由。它可说明“哪些已知特征触发了规则/模型”,但不能把相关特征表述为主体意图。

机制与推导

设计一个泄漏审计表:每项特征写明事件时间、入库时间、标签时间、实体范围、拟合数据范围和在线是否可得。对于图特征,再写消息传播边界;对于序列,再写窗口结束时间;对于排序,再写候选集生成时点。

比较错误随机切分与正确切分时,指标下降不是坏消息,而是移除了虚假的容易信息。正确结果可以更低却更可信。真正问题是找到仍有效的信号与合理基线。

最小练习或观察步骤

  1. 为 M71 所选任务列 6 个特征。
  2. 给每个特征填写事件时间与可用时间。
  3. 画一个“错误随机切分”,标出至少两条泄漏箭头。
  4. 重画部署对齐切分,并说明冷启动样本如何出现。
  5. 将 LLM 放入主导/辅助/不进入之一,写出理由和 verifier。
  6. 不需要实际训练;若已有结果,只记录真实比较。

常见误区

  • 认为删除显式标签列就没有泄漏。
  • 时间切分后仍用全期统计特征。
  • 图任务只分目标节点,却允许无限邻居传播。
  • 指标因正确切分下降后,回退到随机切分“恢复效果”。
  • 用 LLM 生成听起来合理但无证据的风险解释。
  • 把“LLM 不主导”误解为“系统不能使用 LLM”。

金融与 Web3 场景连接

欺诈策略会针对规则快速适应,必须时间外评估;AML 调查标签有选择偏差,模型学到的可能是历史调查策略;链上地址标签随时间更新,今天的黑名单不能作为过去预测时点特征。LLM 可摘要交易路径和文档证据,但图统计、金额与时间窗口应由可复现程序计算,最终处置需要明确治理责任。

自检问题

  1. 时间、实体、结构和预处理泄漏各举一例。
  2. 为什么正确切分后指标下降反而可能更好?
  3. 什么是标签关系变化?
  4. LLM 何时适合辅助、何时不应进入?
  5. 风险解释怎样避免把相关性写成主体意图?

专业课程对齐

  • Stanford CS329S:对应数据泄漏、训练—服务偏差、分布变化与生产测试;用于逐项审计时间、实体、标签和预处理泄漏。
  • Stanford CS229:对应泛化、模型评估与误差分析;帮助区分 IID 验证表现、未来窗口表现和子群分布变化。
  • Full Stack Deep Learning:对应数据管线、部署接口与 LLM 应用边界;用于给 LLM 的解释、特征草拟或人工辅助角色加上固定输入输出和复核点。

深入学习提示

先精读 CS329S 的数据与分布问题,画出每个字段从产生到可用的时间线;再用 CS229 的泛化视角比较随机切分、时间切分、实体分组切分的差异;最后按 FSDL 检查 LLM 是否改变了数据边界。审计四类泄漏:未来事件进入特征、同一实体跨集合、标签衍生信息进入输入、全量数据参与标准化/词表/图构造。可做一次最小反事实:移除可疑特征或改为更严格切分,观察性能是否异常坍塌。LLM 只允许承担受约束角色,例如从非敏感文本草拟候选特征、把结构化结果转成说明、辅助人工审阅;它不能看到测试标签,也不能以自由文本覆盖主模型分数。所有 LLM 输出要保留来源、版本与人工/规则校验,不把解释流畅度当预测有效性。

学后填写区

  • 我的泄漏审计表位置:
  • 最危险的两条泄漏路径:
  • 正确切分与冷启动定义:
  • LLM 的角色和边界:
  • 仍需验证的分布变化:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。