返回 M01~M90 教材库
M71 · 预习教材教材已备 ≠ 学习已完成

M71:非 LLM 决策 AI:任务结构与正确切分

非 LLM 决策 AI 首先由数据结构和预测时点定义:图任务看实体关系,时间序列看时间依赖,排序看候选间相对顺序;正确切分比模型复杂度更先决定结果是否可信。

2026-11-02non-llm-aigraph-anomalytime-seriesrankingdata-split

内容类型:预习教材(不代表已完成)
日期:2026-11-02
阶段:P1 · AI Model Engineering 90
周次:W11
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签non-llm-ai graph-anomaly time-series ranking data-split

一句话定义

非 LLM 决策 AI 首先由数据结构和预测时点定义:图任务看实体关系,时间序列看时间依赖,排序看候选间相对顺序;正确切分比模型复杂度更先决定结果是否可信。

学习目标

  1. 从交易图异常、时间序列预测、排序中只选择一个主题贯穿 W11。
  2. 写清样本、标签、特征、预测时点与决策动作。
  3. 为所选任务选择时间、实体或图结构感知的切分方式。
  4. 识别随机切分怎样泄漏未来、主体身份或邻居信息。

核心知识

1. 先选任务,不先选模型

交易图异常把地址/账户视作节点,把转账、共同设备或控制关系视作边。目标可能是节点风险、边风险或子图异常。核心信息是邻居与路径。

时间序列预测把按时间排序的观测作为输入,预测未来数值、事件或区间。核心信息是趋势、季节性、滞后和外生变量,任何未来统计都可能泄漏。

排序针对同一 query/场景下的一组候选学习相对优先级,如告警队列或证据检索。目标不是独立分类准确率,而是重要项目能否排在前面,常用 Recall@K、NDCG 或 MAP。

本周只选一项。若没有偏好,可选“交易图异常”,因为它能连接金融交易与链上地址,但这不是强制路线。

2. 五元任务定义

一个可学习任务至少写清:预测单元、观察窗口、预测窗口、标签可用时间、决策动作。例如:“以账户为单元,使用 T 日之前 30 天交易,在 T 日预测未来 7 天是否被确认高风险,用于人工队列排序。”这句话阻止模型使用 T 日之后信息,也让评估对齐真实使用。

3. 切分必须模拟部署

时间序列通常用滚动或时间前后切分,训练在过去、验证/测试在未来。实体任务若同一账户、设备或商户跨切分,会让模型记忆身份;可按实体分组。图任务更复杂:即使目标节点分开,共享邻居和全图预计算 embedding 也可能传播测试信息。排序数据应按 query、会话或时间分组,避免同一候选组被拆散。

4. 标签延迟与删失

欺诈/风险标签常在事件数周后才确认。若在预测时点把“后来才知道”的标签衍生字段放进特征,就是时间穿越。测试末端样本可能尚未成熟,不能简单当负类。应定义标签成熟窗口,或把未成熟样本排除/标为 unknown。

机制与推导

错误随机切分之所以产生虚高,是因为训练与测试不再独立:同一实体行为模板、未来均值、图邻居表示或重复文档同时出现在两侧。模型看似泛化,实际在识别已见主体或使用未来信息。

一个可靠流程是:先按真实时间冻结原始数据 → 定义每个样本在预测时可见的特征 → 处理标签成熟 → 按任务单位分组 → 最后拟合 normalization/embedding。任何统计量、词表、图表示或采样策略都应只在训练数据上拟合,再应用于验证和测试。

最小练习或观察步骤

  1. 在三个主题中圈选一个,写明为何本周不学另外两个。
  2. 用一句话写五元任务定义。
  3. 画出训练、验证、测试的时间或实体边界。
  4. 列出三项在预测时点不可见的信息。
  5. 设计一个错误随机切分,并解释它会泄漏什么。
  6. 写出一个最简单 baseline 和一个评估指标,今天不实现。

常见误区

  • 根据手头模型倒推任务,导致标签和决策含混。
  • 时序数据随机打散后训练测试。
  • 对全数据先标准化、构图或生成 embedding,再切分。
  • 同一钱包/客户的多条记录分散到训练和测试。
  • 将尚未成熟的风险标签当负类。
  • 同时选择图、时序、排序,结果每项都只停留在术语。

金融与 Web3 场景连接

信用风险需要时间外测试与标签成熟;AML 网络适合实体/图切分,但确认标签稀缺且偏向已调查样本;链上钱包风险具有地址簇、跨链和标签时效问题,同一控制主体可能拥有多个地址。告警排序要关心调查员容量下的 Recall@K,而不是所有样本平均准确率。

自检问题

  1. 我所选任务的预测单元、观察窗口和预测窗口是什么?
  2. 为什么同一实体跨切分会产生记忆型泄漏?
  3. 图任务即使节点分开,仍可能从哪里泄漏?
  4. 标签成熟窗口解决什么问题?
  5. 我的离线切分怎样模拟真实部署?

专业课程对齐

  • Stanford CS229:对应监督学习、分类/回归、偏差—方差与评估基础;用于把业务问题写成输入 $X$、标签 $Y$、预测时点、损失和决策,而不是先挑模型。
  • Stanford CS329S:对应生产 ML 的数据管理、分布变化与部署约束;重点观察训练样本在真实预测时点是否可获得,以及标签延迟如何改变可用窗口。
  • Stanford CS224W:对应图结构数据与图学习;若选择交易图异常任务,用它核对节点、边、时间戳、邻域和 inductive/transductive 边界。

深入学习提示

先精读 CS229 的任务与损失基础,把候选问题写成五元组:样本单位、观察截止时间、标签定义、预测窗口、决策动作;再读 CS329S 的训练—服务一致性内容,按真实部署时间构造 train/validation/test。若选择图任务,再选读 CS224W,确认随机拆边是否让同一实体或未来邻域泄漏到训练集。时间任务优先采用滚动或前向切分,实体风险任务考虑按客户/钱包分组,排序任务应保持同一次请求或候选集合完整。特别记录 delayed label 和 censoring:测试窗末尾尚未成熟的样本不能直接当负例。今天的产出应是可复现的切分规则与时间线,不需要训练复杂模型;若无法说明每个特征在预测时点是否可见,就先停在数据定义层。

学后填写区

  • 本周唯一主题:
  • 五元任务定义:
  • 切分图与泄漏清单:
  • baseline 与指标候选:
  • 仍需确认的数据假设:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。