返回 S01~S90 教材库
S26 · 总 Day 116教材已备 ≠ 学习已完成

S26:W1~W4 第一阶段系统全景连接

第一阶段全景图把数据事实、版本化 artifact、训练资源与在线请求连接成一条可追溯系统链,用于发现层间假设,而不是对四周内容评分。

2026-12-18data→artifact→training→serving、轻量复盘

内容类型:预习教材(不代表已完成)
日期:2026-12-18
阶段:P2 · AI Systems Engineering 90
总路线:Day 116 / 360
周次 / 节奏:W4 · 周五知识整理 / 阶段复盘
状态:教材已备;学习未完成
主题:data→artifact→training→serving、轻量复盘

一句话定义

第一阶段全景图把数据事实、版本化 artifact、训练资源与在线请求连接成一条可追溯系统链,用于发现层间假设,而不是对四周内容评分。

学习目标

  1. 能从一个线上请求向后追到 bundle、模型训练与数据来源。
  2. 能说明 W1~W4 每层的状态、时间、容量和失败如何影响下一层。
  3. 能识别至少三个跨层故障,而非只列术语。
  4. 能把薄弱点加入轻量复习清单,不设 Gate、排名或补考。

核心知识

数据层决定训练与评测能看到什么事实;artifact 层决定这些输入、变换与模型如何被版本化;训练层决定模型怎样在资源和故障约束下产生;serving 层决定已发布 bundle 怎样面对持续请求。线上质量变化可能并非模型参数改变:数据 freshness、index、policy、scheduler 或容量都能改变结果。

四层使用不同时间:event/available time、run/build time、training step/checkpoint time、request/queue time。Correlation 需要把这些时间与身份连接,但不能强行用一个 timestamp 代替。四层也有不同重放:数据重建、artifact 重组、训练续跑和请求重试,它们的副作用与确定性不同。

容量传播同样重要:数据迟到导致特征缺失;训练 checkpoint/资源影响新模型交付时间;bundle 过大影响加载;长上下文与 worker loss影响在线队列。一个系统优化可能转移瓶颈,例如更长 context 提升信息覆盖,却放大 KV cache 和 TTFT。

机制与推导

把一次决策表示为依赖链:

[ decision=Serve(request,B(M_{trained}(D_v),P,I,T,G),runtime) ]

解释需要保存每层关键 version/correlation。端到端可靠性不是各层成功率简单相加;串联系统在近似独立时 R_total≈∏R_i,但故障往往相关,例如存储拥塞同时影响数据、checkpoint 与模型加载。

端到端时延也含跨层准备和在线时延,用户请求时主要看到 queue/prefill/decode/tool,但发布 freshness 取决于更长的数据和训练周期。全景图应标明短路径与慢反馈环。

最小练习或观察步骤

  1. 选“合成 AML 解释请求”,画 source→validated→train/eval→artifacts→bundle→queue→response。
  2. 每层写一个 immutable id、一个 mutable state、一个关键时间和一个失败。
  3. 画三条跨层故障传播,例如 schema drift→训练 skew→线上误判。
  4. 反向回答“这个响应由哪个组合产生、训练用了哪些数据、当时队列怎样”。
  5. 仅记录最多五个薄弱点;不要求本日补齐,也不打分。

常见误区与边界

  • 全景图只列组件,没有状态、时间和版本关系。
  • 所有线上问题都归因模型,忽略数据与 scheduler。
  • 用相关 ID 记录敏感正文,混淆关联与数据复制。
  • 假设各层故障独立,忽略共享存储/网络的共同原因。
  • 阶段复盘变成大考试或生产 readiness review。

系统场景连接

金融 AI 调查中,用户质疑一个答案,需要知道请求、bundle、知识快照、模型、训练数据与当时可用事实。若 serving p95 上升,还需区分模型版本变慢、context 变长、流量 burst 或 worker loss。全景图让产品、数据、模型、平台与风控用同一依赖链沟通。

自检问题

  1. 从 response 反向追踪至少需要哪四类身份?
  2. W1~W4 分别有哪些不同“重放”语义?
  3. 哪些故障可能同时影响多层?
  4. 更长 context 怎样从能力选择传播到容量?

专业课程对齐

  • 阅读 Stanford CS329S 的端到端 ML system design 课程结构,将 stakeholder/data/model/deployment/monitoring 映射到自己的四层图。
  • 阅读 Full Stack Deep Learning 2022 的 development infrastructure、data、deployment 和 monitoring 主线,检查是否漏掉模型外依赖。
  • 阅读 CMU Deep Learning Systems 的训练/推理系统内容,补上底层张量执行、内存与通信怎样进入上层容量。

深入学习提示

采用“向前传播影响、向后追溯证据”两遍阅读。第一遍从 schema 变化走到最终用户;第二遍从一个错误响应反查数据和版本。每个箭头写出契约,而非只写“连接”。最后选一个自己仍说不清的箭头进入复习清单,其他内容允许暂时只知道存在。

学后填写区

  • 我的第一阶段全景图:
  • 三条跨层故障:
  • 反向追踪需要的身份:
  • 最多五个薄弱点:
  • 最有价值的跨层连接:
重点主线 · H02 · Harness 循环、状态与恢复本周配套机制实验 · W4 · 推理服务:吞吐、等待与长尾的交换 →详细讲义、离线示例与源码;按需要选读,不新增必交任务。
本页是未来 P2 的预习教材。等 P1 完成并正式进入 P2 后,再填写真实理解、练习结果和不确定项;现在阅读不会改变P1 唯一进度账本