AI Systems Engineering 90:专业课程参考地图
这份地图不是另一套并行计划。它把“AI 系统工程”放回专业课程与官方系统语义中,避免只记工具名,也避免把本地模拟夸大为生产系统。
P2 · AI Systems Engineering 90:专业课程参考地图
用途:为 S01~S90(总路线 Day 091~180)提供高校课程、官方规范与一手工程文档的学习入口
核验日期:2026-08-23
局部更新:2026-09-12,新增 H01~H04 当前实践参考,详见下方;原课程主干未在本轮逐项重新核验 执行边界:每天只选与当天问题直接相关的片段,不要求修完整门外部课程,不复制外部作业,也不把阅读计为掌握
进度边界:P2 教材可以提前准备,但 P2 尚未启动;当前真实学习进度仍由 P1 唯一账本记录
这份地图不是另一套并行计划。它把“AI 系统工程”放回专业课程与官方系统语义中,避免只记工具名,也避免把本地模拟夸大为生产系统。
Harness 主线:2026-09-12 实践补充
H01~H04 与原日课共用 P2 九十天。原理仍参考专业课程,变化快的接口以官方资料校准,不扩写成额外的认证、考试或 Gate。
| 主教材 | 本轮深入问题 | 一手参考 |
|---|---|---|
| H01 · 上下文 | 推理连续性、计算复用、渐进加载与外部状态为何不同 | OpenAI Compaction、Prompt caching、Build skills |
| H02 · 状态 | 模型请求、工具 job 与任务修订三种生命周期如何协调 | OpenAI Async tool calling、Background mode、Mid-turn steering |
| H03 · 边界 | 发现工具、协议传输、程序编排与执行隔离各有什么责任 | OpenAI Tool search、Programmatic Tool Calling、Sandbox Agents;MCP 2026-07-28 |
| H04 · 开发 | 模型与 Harness 怎样一起调整;如何沿消息与 trace 解释行为 | OpenAI Models/providers、Function calling、观测指南;Anthropic 2026 年长任务与 Managed Agents 工程文章 |
逐条可点击来源、版本范围和采用边界见实践核验记录,或直接访问网页核验区。四章正文已把知识写开,外部资料用于核对与延伸,不是要求读者自行拼出教材。
MCP 特别说明:下方原 W7 与旧笔记可能对应旧协议;当前 H03 保留历史引用,并增加 2026-07-28 无状态核心对照。先确认版本,不把旧握手与会话流程直接用于解释新核心。新协议发布也不代表现有客户端均已升级。
1. 课程与官方材料主干
| 课程 / 官方材料 | 适合解决的问题 | P2 主要位置 |
|---|---|---|
| Stanford CS329S · Machine Learning Systems Design | 从目标、数据、训练、部署、监控到人的完整 ML 系统设计 | W1、W2、W5、W10~W12、S85~S90 |
| Full Stack Deep Learning 2022 | 开发基础设施、实验管理、数据、部署、持续学习、监控与团队 | W1、W2、W5、W8、W10~W12 |
| CMU 10-414/714 · Deep Learning Systems | 自动微分到大模型训练、部署的系统实现与性能思维 | W3、W4 |
| MIT 6.5840 · Distributed Systems | RPC、状态、故障、复制、事务、缓存与分布式系统案例 | W3、W6、W7 |
| Feast · Point-in-time Joins | event time、历史特征回放、TTL 与 point-in-time correctness | W1 |
| OpenLineage | 用 run、job、dataset 与 event 表达数据血缘 | W1、W2 |
| MLflow Documentation | run、artifact、registry、评测、trace 与生命周期版本 | W2、W8、W10 |
| PyTorch Distributed | collective、DDP/FSDP、DeviceMesh 与分布式 checkpoint | W3 |
| vLLM Documentation | KV 管理、continuous batching、scheduler、prefill/decode 与 serving | W4 |
| Kubernetes Documentation | 声明式资源、控制器、调度、隔离与平台运行边界 | W5 |
| Backstage Documentation | service catalog、software template 与 golden path | W5 |
| Temporal Documentation | durable execution、event history、retry、timer、signal 与恢复语义 | W6 |
| Model Context Protocol Specification | host/client/server、资源、工具、能力协商、授权与版本 | W7 |
| A2A Protocol | 独立 Agent 的发现、任务、消息、异步协作与互操作 | W7、S87~S89 |
| OpenAPI Specification | 同步 HTTP API 的契约、schema 与兼容边界 | W7 |
| AsyncAPI Documentation | 异步消息、channel、operation、message schema 与文档化 | W7 |
| CloudEvents | 跨系统事件 envelope 与通用元数据 | W7 |
| OpenTelemetry Documentation | trace、metric、log、context propagation 与 semantic conventions | W8、W10、W12 |
| Google SRE Workbook | SLI/SLO、error budget、容量、过载、事故和可靠性实践 | W4、W8、W10 |
| OWASP GenAI Security Project | prompt injection、敏感信息、供应链、过度代理与系统级威胁 | W9 |
| NIST AI RMF Playbook | Govern、Map、Measure、Manage 与风险上下文 | W9、W10、W11 |
| Google PAIR Guidebook | Human-AI 目标、解释、反馈、失败与信任校准 | W11 |
| DORA | 软件交付性能、组织能力与改进边界 | W5、W11 |
2. 十二周课程对照
W1 · AI Data Plane(S01~S07 / Day 091~097)
以 CS329S 的 data management 视角建立 source → raw → validated → feature/eval → decision 链路;用 FSDL Data Management 观察数据获取、标注、版本和反馈;再用 Feast 与 OpenLineage 核对 event time、point-in-time join、run/job/dataset/event 的精确定义。
本周必须说清楚:processing time 不能替代 event time;“现在查到的最新特征”不等于历史决策时可见特征;lineage 说明来源和变换,却不自动证明数据正确。
W2 · Artifact Registry 与 MLOps / LLMOps(S08~S14 / Day 098~104)
以 FSDL Experiment Management 和 CS329S deployment lifecycle 为骨架,结合 MLflow 的 run、artifact、registered model、alias/tag 与 tracing 语义。AI release bundle 至少可能包含 data、code、weights/adapter、tokenizer、prompt、index、tool contract、policy 与 eval reference。
重点不在安装平台,而在回答:哪些对象需要内容 hash;manifest 怎样引用不可变 artifact;promotion 改变的是指针还是字节;只回滚模型为何可能无法恢复旧行为。
W3 · Distributed Training Systems(S15~S21 / Day 105~111)
CMU DLSys 提供张量程序、训练系统与 deployment 的实现视角;PyTorch Distributed 提供 collective、DDP/FSDP 与 checkpoint 的当前 API 语义;MIT 6.5840 用于补齐进程、RPC、故障和一致性直觉。
围绕内存近似式展开:参数、梯度、优化器状态、activation、通信 buffer 和临时 workspace 分别在哪里;DP、FSDP/ZeRO、TP、PP、EP、CP 切分的对象不同。Apple Silicon 上的表格和 CPU/Gloo 演示只验证语义,不声称多 GPU scaling。
W4 · Distributed Inference & Serving(S22~S28 / Day 112~118)
把 vLLM 文档中的 scheduler、continuous batching、chunked prefill、prefix cache 与 PagedAttention 放入 arrival → admission → queue → prefill → decode → stream 生命周期;用 Google SRE 的过载与容量章节理解 backpressure、load shedding 和 tail latency。
至少区分 TTFT、inter-token latency、end-to-end latency、throughput 与 goodput。平均延迟下降不能证明 p95/p99 改善;batch 更大可能提高吞吐,也可能伤害短请求和交互请求。
W5 · AI Platform Engineering 与 Golden Path(S29~S35 / Day 119~125)
CS329S 和 FSDL 解释 ML/AI 平台为何存在;Backstage 对应 catalog 与 template;Kubernetes 对应声明式控制与运行资源;DORA 用于观察平台是否降低认知负担并改善交付,而不是只统计平台功能数。
学习时把平台拆成 control plane、data plane、runtime plane、evidence plane,并区分 product team 与 platform team 的责任。Golden path 应是低摩擦默认路径,不是禁止合理例外的唯一通道。
W6 · Agent Runtime 与 Durable Workflow(S36~S42 / Day 126~132)
Temporal 的 event history、activity、retry、timer、signal 与 workflow replay 用于理解持久执行;MIT 6.5840 提供分布式故障、事务和状态机背景。把 agent loop、业务 workflow 与真实副作用分开。
必须解释 idempotency key 的作用域、checkpoint 能恢复什么、outbox 如何连接状态提交与消息、saga compensation 为什么不是数据库回滚、timeout 后外部状态为何可能未知。
W7 · Protocols 与 Enterprise Integration(S43~S49 / Day 133~139)
MCP 用于 Agent 与工具/资源集成;A2A 用于独立 Agent 之间的互操作;OpenAPI、AsyncAPI 与 CloudEvents 分别对应同步 API、异步接口和事件 envelope。课程重点是协议层次、业务语义、身份委托、版本兼容和恢复,而不是做多个 hello-world。
任何 schema 变更都要回答 producer、consumer、stored event、replay 和 rollback 如何兼容。协议声明能力,不自动授予权限;工具描述也不能替代策略执行。
W8 · Observability、Cost、SLO 与 Capacity(S50~S56 / Day 140~146)
以 OpenTelemetry 的 trace/metric/log/context 为信号骨架,以 Google SRE 的 SLI/SLO、error budget 和容量方法为决策框架,再用 MLflow tracing/evaluation 观察 AI 特有步骤。
把 request、model、retrieval、tool、policy、human review、business outcome 与 cost 通过 correlation id 连接。token cost 只是输入;更接近业务的分母是 successful task、approved case 或 recovered incident。
W9 · Security、Privacy 与 AI Supply Chain(S57~S63 / Day 147~153)
OWASP GenAI 用于识别 prompt injection、敏感信息泄露、供应链、过度代理等攻击类别;NIST AI RMF 用于把场景、影响、测量和响应放回治理循环;MCP/A2A 规范用于核对具体授权与信任边界。
学习顺序是 asset → actor → trust boundary → threat → independent control → residual risk。模型提示不是权限系统;hash 证明内容未变化,不证明内容安全;隐私增强技术也不替代最小权限和生命周期管理。
W10 · EvalOps、Release Science 与 Rollback(S64~S70 / Day 154~160)
CS329S 与 FSDL 提供 deployment/monitoring 主线;MLflow 提供评测、版本和 trace 的工具语义;Google SRE 补齐渐进发布、错误预算与回滚思维。
明确 offline、shadow、canary、champion/challenger 各自能观察什么,尤其要标记 selection bias、judge drift、business outcome lag 和 traffic mismatch。release decision 是多指标判断,不等于单一 gate。
W11 · Human-AI Operations 与 Engineering Productivity(S71~S77 / Day 161~167)
Google PAIR 用于理解目标、解释、反馈、失败和信任;NIST AI RMF 用于决策权、风险和监测;DORA 用于理解 AI-assisted SDLC 的交付结果,避免用代码生成量替代价值与质量。
HITL 同时是交互设计、权限设计、队列容量和运营系统。比较 evidence-first 与 recommendation-first 时,应观察 anchoring、automation bias、review time、override、appeal 和 feedback provenance。
W12 · 轻量综合学习项目(S78~S84 / Day 168~174)
以 CS329S 的端到端设计顺序和 FSDL 的完整应用视角收束;OpenTelemetry、Temporal、MLflow 或现有仓库组件只选择最能说明问题的 2~4 层。A 级架构理解、B 级最小连接、C 级兴趣扩展都是有效完成方式。
项目必须列出已实现、模拟、仅设计和未知四类内容;不要求建成生产平台,也不因为缺少 Kubernetes/GPU/外部服务而失败。
3. S85~S90:知识整合而不是第二套考试
- S85:用 CS329S 和 FSDL 合并 data、artifact、training、serving、runtime、integration、observability、security、release、human 全景图。
- S86:用 MIT 6.5840、Temporal 与 OTel 检查架构图中的状态、故障、恢复和证据流。
- S87:用 MCP/A2A 规范迁移到 Voice、Web3 Wallet、客服或 Embodied Operations,并写明不可迁移部分。
- S88:从 Feast、Ray、MLflow、Kubernetes、OTel、A2A、PET 或 Human Factors 任选一个浅探,不新增大项目。
- S89:把剩余问题拆成系统工程问题与 P3 的 generality、planning、memory、learning efficiency 问题。
- S90:只写十个联系、三个兴趣方向和下一阶段节奏;不评分、不封存、不补齐全部实验。
4. 推荐的每日使用方式
- 主材料 20~40 分钟:只读当天对应课程或规范片段,回答一个核心问题。
- 辅材料 10~20 分钟:用官方 API/规范核对术语、状态和兼容边界。
- 最小实践 20~60 分钟:选择伪代码、几十行模拟、一张时序图或一次源码阅读。
- 场景迁移 10~20 分钟:放入金融、Web3 或文档场景,说明新增的状态、风险和人工责任。
- 复述 5~10 分钟:写出因果链、一个反例以及本地练习不能证明的结论。
外部课程的实验通常比本计划当天任务重。除非出于兴趣,不需要完成其整套 assignment、集群部署、云端 benchmark 或期末项目。涉及滚动演进的 MCP、A2A、PyTorch、vLLM、MLflow 和 OpenTelemetry 时,在实际学习当天以官方当前版本为准。
5. 2026-09-12 机制实验配套
新增 12 周机制实验室,沿用本图谱,不建立另一条学习主线。每份讲义解释概念、手算例子、输出含义、一个变量改动与外推限制;实际源码在页面中同步展示。
- W1~W2:历史可见性与发布指纹,对应 Feast、MLflow 和 FSDL 数据/实验管理。
- W3~W4:训练状态账本与服务排队;补充 Stanford CS336 2025 的 systems、parallelism 与 inference 方向,保留原 CMU DLSys 入口。
- W5~W7:协调循环、确认丢失后的重试、金额契约版本,对应 Kubernetes、Temporal、MIT 6.5840 与 OpenAPI。
- W8~W11:关联观测、动作授权、配对比较、复核队列,对应 OTel、Google SRE、OWASP、FSDL 与 PAIR。
- W12 与 S85~S90:选取四个机制连接,列出未实现项,再把系统问题转成 P3 的研究问题。
本次补充核对了课程和官方材料入口;滚动文档不固定 SDK 版本。CS329S 的课程范围也可从 Stanford 官方课程目录 查阅。以上示例为本仓库原创教学实现,不是外部课程官方作业,也不宣称完成任何课程认证。
6. 系统设计 × AI 开发 × Harness 重点主线
H01~H04 学习入口 将同一段 90 天重新聚焦为上下文架构、运行状态、工具边界与 AI 开发工作流。12 周机制保留为支撑知识,不追加学习量。
新增一手工程参考:Context Engineering、Effective Harnesses、Writing Tools for Agents、Building Effective Agents。它们分别对应信息选择、跨会话状态、工具语义与复杂度取舍;不照搬外部文章的大规模任务清单或测试工作量。
本地教学实现提供可替换的 ModelPort,但默认只用脚本替身与虚拟仓库;它展示 harness 机制,不宣称真实 AI 开发能力已经验证。