返回 S01~S90 教材库
S01 · 总 Day 091教材已备 ≠ 学习已完成

S01:本地环境确认与 AI 数据流全景

AI 数据平面是数据从业务来源进入系统,经过原始留存、验证、变换、特征或评测构造,最终支持模型训练与线上决策的可追踪流动路径。

2026-11-23AIDataPlane、环境边界、source→decision

内容类型:预习教材(不代表已完成)
日期:2026-11-23
阶段:P2 · AI Systems Engineering 90
总路线:Day 091 / 360
周次 / 节奏:W1 · 周一概念与阅读
状态:教材已备;学习未完成
主题:AI Data Plane、环境边界、source→decision

一句话定义

AI 数据平面是数据从业务来源进入系统,经过原始留存、验证、变换、特征或评测构造,最终支持模型训练与线上决策的可追踪流动路径。

学习目标

  1. 能画出 source → raw → validated → feature/eval → decision 主链,并说清每一层保存什么事实。
  2. 能区分本地学习环境、数据处理运行环境与未来生产环境,不把本地可运行等同于生产可用。
  3. 能解释 source id、event time、schema version 与 lineage 为什么要在流入系统时建立。
  4. 能为后续 89 天保留一套轻量、可重复但不繁重的观察方式。

核心知识

数据源可能是业务事件、文件、数据库快照、API 响应、人工标签或模型反馈。raw 层的职责不是“把数据洗干净”,而是尽量忠实保存来源事实和接收上下文;validated 层根据契约判断结构、类型、范围和必要字段;feature/eval 层把同一原始事实加工成不同用途的数据产品;decision 层记录系统实际采用了什么输入、版本与策略。

训练数据、线上特征、评测样本和审计证据不能混成一个无边界的数据集。训练集面向参数更新,评测集面向比较,线上特征面向低延迟决策,审计证据面向事后解释。它们可以共享来源,却应拥有各自的版本、保留周期、访问范围和质量规则。

环境确认只记录与学习有关的事实:处理器架构、Node/Python 版本、可用磁盘、是否已有独立虚拟环境,以及哪些工具不存在。没有容器、集群或 GPU 不妨碍学习数据契约、状态和重放;本阶段允许用 Node/TS 与小型 fixture 建立系统心智模型。

机制与推导

把事件写成最小元组:

[ e=(source_id,event_time,ingest_time,schema_version,payload) ]

其中 event_time 表示业务事实发生时间,ingest_time 表示系统看到它的时间。两者差值 lag = ingest_time - event_time 是迟到程度,不应被误当成处理耗时。每次变换可表示为 D_(k+1)=T_k(D_k, config_k);要重现结果,至少需要输入版本、变换代码或配置版本及输出标识。若只保存最终表,便无法判断差异来自源数据、规则还是执行环境。

数据流也有控制流:验证失败是隔离、丢弃还是降级?迟到事件是否更新历史窗口?决策已经产生后是否重算?这些问题决定系统语义,而不仅是 ETL 实现细节。

最小练习或观察步骤

  1. 只读确认本地 Node、Python 和处理器架构,把结果写在个人学习记录,不安装新工具。
  2. 选择一条完全合成的 AML 或支付事件,写出 source id、两类时间、schema version 和 payload。
  3. 画五层数据流,为每层标注输入、输出、所有者、失败去向和是否可重放。
  4. 分别指出同一事件怎样进入训练样本、评测样本与审计证据,圈出用途边界。
  5. 记录一个目前无法回答的问题,例如“决策后迟到标签怎样回填”,不急于设计生产方案。

常见误区与边界

  • 把数据平面理解成一个数据库;它实际上包含流动、变换、质量状态和版本关系。
  • 原始层做不可逆清洗,导致之后无法按新规则重建。
  • 只记录处理时间,造成历史回放时出现时间穿越。
  • 把测试 fixture 叫作真实客户数据,或把本地脚本描述为生产 pipeline。
  • 为了“环境完整”先安装大量平台工具;S01 只需确认边界,不创建运维负担。

系统场景连接

在金融零售反洗钱场景中,交易发生、账务入账、数据入湖、规则评分和人工处置可能处于不同时间。若只保留最终风险分,无法解释当时系统能看到哪些事实。清晰的数据流能连接后续的特征正确性、模型版本、人工审批与审计追溯;Web3 事件也会遇到区块确认、链重组与索引延迟,仍需区分事实时间和观察时间。

自检问题

  1. raw 与 validated 层各自承诺什么,又不承诺什么?
  2. 为什么训练数据和审计证据可以同源,却不能没有用途边界?
  3. event time 与 ingest time 的差异会怎样影响历史重放?
  4. 缺少容器或 GPU 时,本日哪些知识仍可完整学习?

专业课程对齐

  • 阅读 Stanford CS329S 的 ML project lifecycle 与 data management 主题,重点映射“业务目标—数据来源—模型—部署”之间的责任边界,而不是抄工具清单。
  • 阅读 Full Stack Deep Learning 2022 中 infrastructure、data management 相关讲次,观察实验数据与生产输入为何需要不同的可重复路径。
  • 阅读 OpenLineage 官方文档 的 job、run、dataset 核心模型,只理解一条变换怎样留下输入、输出与运行关系,不要求部署后端。

深入学习提示

阅读顺序建议为 CS329S 生命周期→FSDL 数据工程→OpenLineage 元模型。每读一段都回到自己的五层图:课程术语落在哪一层、解决什么失败、需要保存什么证据。特别追问“若明天规则变化,我能否从 raw 重建”“若结果错误,我能否定位到 source、transform 和 decision”。不要把工具名字背诵成能力;真正的能力是清楚描述数据状态和不可逆边界。

学后填写区

  • 实际确认的本地环境事实:
  • 我画出的数据流路径:
  • 最容易混淆的两个时间:
  • 一个尚未解决的边界问题:
  • 下一次准备观察的字段:
重点主线 · H01 · 任务契约与上下文架构本周配套机制实验 · W1 · 历史数据:当时发生,不等于当时已知 →详细讲义、离线示例与源码;按需要选读,不新增必交任务。
本页是未来 P2 的预习教材。等 P1 完成并正式进入 P2 后,再填写真实理解、练习结果和不确定项;现在阅读不会改变P1 唯一进度账本