返回 Papers
学习计划 Roadmap

AI Systems Engineering 90:专业课程参考地图

这份地图不是另一套并行计划。它把“AI 系统工程”放回专业课程与官方系统语义中,避免只记工具名,也避免把本地模拟夸大为生产系统。

166ai-deep-mastery/phase-2-systems/PROFESSIONAL_COURSE_REFERENCE_MAP.md

P2 · AI Systems Engineering 90:专业课程参考地图

用途:为 S01~S90(总路线 Day 091~180)提供高校课程、官方规范与一手工程文档的学习入口
核验日期:2026-08-23
局部更新:2026-09-12,新增 H01~H04 当前实践参考,详见下方;原课程主干未在本轮逐项重新核验 执行边界:每天只选与当天问题直接相关的片段,不要求修完整门外部课程,不复制外部作业,也不把阅读计为掌握
进度边界:P2 教材可以提前准备,但 P2 尚未启动;当前真实学习进度仍由 P1 唯一账本记录

这份地图不是另一套并行计划。它把“AI 系统工程”放回专业课程与官方系统语义中,避免只记工具名,也避免把本地模拟夸大为生产系统。

Harness 主线:2026-09-12 实践补充

H01~H04 与原日课共用 P2 九十天。原理仍参考专业课程,变化快的接口以官方资料校准,不扩写成额外的认证、考试或 Gate。

主教材本轮深入问题一手参考
H01 · 上下文推理连续性、计算复用、渐进加载与外部状态为何不同OpenAI Compaction、Prompt caching、Build skills
H02 · 状态模型请求、工具 job 与任务修订三种生命周期如何协调OpenAI Async tool calling、Background mode、Mid-turn steering
H03 · 边界发现工具、协议传输、程序编排与执行隔离各有什么责任OpenAI Tool search、Programmatic Tool Calling、Sandbox Agents;MCP 2026-07-28
H04 · 开发模型与 Harness 怎样一起调整;如何沿消息与 trace 解释行为OpenAI Models/providers、Function calling、观测指南;Anthropic 2026 年长任务与 Managed Agents 工程文章

逐条可点击来源、版本范围和采用边界见实践核验记录,或直接访问网页核验区。四章正文已把知识写开,外部资料用于核对与延伸,不是要求读者自行拼出教材。

MCP 特别说明:下方原 W7 与旧笔记可能对应旧协议;当前 H03 保留历史引用,并增加 2026-07-28 无状态核心对照。先确认版本,不把旧握手与会话流程直接用于解释新核心。新协议发布也不代表现有客户端均已升级。

1. 课程与官方材料主干

课程 / 官方材料适合解决的问题P2 主要位置
Stanford CS329S · Machine Learning Systems Design从目标、数据、训练、部署、监控到人的完整 ML 系统设计W1、W2、W5、W10~W12、S85~S90
Full Stack Deep Learning 2022开发基础设施、实验管理、数据、部署、持续学习、监控与团队W1、W2、W5、W8、W10~W12
CMU 10-414/714 · Deep Learning Systems自动微分到大模型训练、部署的系统实现与性能思维W3、W4
MIT 6.5840 · Distributed SystemsRPC、状态、故障、复制、事务、缓存与分布式系统案例W3、W6、W7
Feast · Point-in-time Joinsevent time、历史特征回放、TTL 与 point-in-time correctnessW1
OpenLineage用 run、job、dataset 与 event 表达数据血缘W1、W2
MLflow Documentationrun、artifact、registry、评测、trace 与生命周期版本W2、W8、W10
PyTorch Distributedcollective、DDP/FSDP、DeviceMesh 与分布式 checkpointW3
vLLM DocumentationKV 管理、continuous batching、scheduler、prefill/decode 与 servingW4
Kubernetes Documentation声明式资源、控制器、调度、隔离与平台运行边界W5
Backstage Documentationservice catalog、software template 与 golden pathW5
Temporal Documentationdurable execution、event history、retry、timer、signal 与恢复语义W6
Model Context Protocol Specificationhost/client/server、资源、工具、能力协商、授权与版本W7
A2A Protocol独立 Agent 的发现、任务、消息、异步协作与互操作W7、S87~S89
OpenAPI Specification同步 HTTP API 的契约、schema 与兼容边界W7
AsyncAPI Documentation异步消息、channel、operation、message schema 与文档化W7
CloudEvents跨系统事件 envelope 与通用元数据W7
OpenTelemetry Documentationtrace、metric、log、context propagation 与 semantic conventionsW8、W10、W12
Google SRE WorkbookSLI/SLO、error budget、容量、过载、事故和可靠性实践W4、W8、W10
OWASP GenAI Security Projectprompt injection、敏感信息、供应链、过度代理与系统级威胁W9
NIST AI RMF PlaybookGovern、Map、Measure、Manage 与风险上下文W9、W10、W11
Google PAIR GuidebookHuman-AI 目标、解释、反馈、失败与信任校准W11
DORA软件交付性能、组织能力与改进边界W5、W11

2. 十二周课程对照

W1 · AI Data Plane(S01~S07 / Day 091~097)

以 CS329S 的 data management 视角建立 source → raw → validated → feature/eval → decision 链路;用 FSDL Data Management 观察数据获取、标注、版本和反馈;再用 Feast 与 OpenLineage 核对 event time、point-in-time join、run/job/dataset/event 的精确定义。

本周必须说清楚:processing time 不能替代 event time;“现在查到的最新特征”不等于历史决策时可见特征;lineage 说明来源和变换,却不自动证明数据正确。

W2 · Artifact Registry 与 MLOps / LLMOps(S08~S14 / Day 098~104)

以 FSDL Experiment Management 和 CS329S deployment lifecycle 为骨架,结合 MLflow 的 run、artifact、registered model、alias/tag 与 tracing 语义。AI release bundle 至少可能包含 data、code、weights/adapter、tokenizer、prompt、index、tool contract、policy 与 eval reference。

重点不在安装平台,而在回答:哪些对象需要内容 hash;manifest 怎样引用不可变 artifact;promotion 改变的是指针还是字节;只回滚模型为何可能无法恢复旧行为。

W3 · Distributed Training Systems(S15~S21 / Day 105~111)

CMU DLSys 提供张量程序、训练系统与 deployment 的实现视角;PyTorch Distributed 提供 collective、DDP/FSDP 与 checkpoint 的当前 API 语义;MIT 6.5840 用于补齐进程、RPC、故障和一致性直觉。

围绕内存近似式展开:参数、梯度、优化器状态、activation、通信 buffer 和临时 workspace 分别在哪里;DP、FSDP/ZeRO、TP、PP、EP、CP 切分的对象不同。Apple Silicon 上的表格和 CPU/Gloo 演示只验证语义,不声称多 GPU scaling。

W4 · Distributed Inference & Serving(S22~S28 / Day 112~118)

把 vLLM 文档中的 scheduler、continuous batching、chunked prefill、prefix cache 与 PagedAttention 放入 arrival → admission → queue → prefill → decode → stream 生命周期;用 Google SRE 的过载与容量章节理解 backpressure、load shedding 和 tail latency。

至少区分 TTFT、inter-token latency、end-to-end latency、throughput 与 goodput。平均延迟下降不能证明 p95/p99 改善;batch 更大可能提高吞吐,也可能伤害短请求和交互请求。

W5 · AI Platform Engineering 与 Golden Path(S29~S35 / Day 119~125)

CS329S 和 FSDL 解释 ML/AI 平台为何存在;Backstage 对应 catalog 与 template;Kubernetes 对应声明式控制与运行资源;DORA 用于观察平台是否降低认知负担并改善交付,而不是只统计平台功能数。

学习时把平台拆成 control plane、data plane、runtime plane、evidence plane,并区分 product team 与 platform team 的责任。Golden path 应是低摩擦默认路径,不是禁止合理例外的唯一通道。

W6 · Agent Runtime 与 Durable Workflow(S36~S42 / Day 126~132)

Temporal 的 event history、activity、retry、timer、signal 与 workflow replay 用于理解持久执行;MIT 6.5840 提供分布式故障、事务和状态机背景。把 agent loop、业务 workflow 与真实副作用分开。

必须解释 idempotency key 的作用域、checkpoint 能恢复什么、outbox 如何连接状态提交与消息、saga compensation 为什么不是数据库回滚、timeout 后外部状态为何可能未知。

W7 · Protocols 与 Enterprise Integration(S43~S49 / Day 133~139)

MCP 用于 Agent 与工具/资源集成;A2A 用于独立 Agent 之间的互操作;OpenAPI、AsyncAPI 与 CloudEvents 分别对应同步 API、异步接口和事件 envelope。课程重点是协议层次、业务语义、身份委托、版本兼容和恢复,而不是做多个 hello-world。

任何 schema 变更都要回答 producer、consumer、stored event、replay 和 rollback 如何兼容。协议声明能力,不自动授予权限;工具描述也不能替代策略执行。

W8 · Observability、Cost、SLO 与 Capacity(S50~S56 / Day 140~146)

以 OpenTelemetry 的 trace/metric/log/context 为信号骨架,以 Google SRE 的 SLI/SLO、error budget 和容量方法为决策框架,再用 MLflow tracing/evaluation 观察 AI 特有步骤。

把 request、model、retrieval、tool、policy、human review、business outcome 与 cost 通过 correlation id 连接。token cost 只是输入;更接近业务的分母是 successful task、approved case 或 recovered incident。

W9 · Security、Privacy 与 AI Supply Chain(S57~S63 / Day 147~153)

OWASP GenAI 用于识别 prompt injection、敏感信息泄露、供应链、过度代理等攻击类别;NIST AI RMF 用于把场景、影响、测量和响应放回治理循环;MCP/A2A 规范用于核对具体授权与信任边界。

学习顺序是 asset → actor → trust boundary → threat → independent control → residual risk。模型提示不是权限系统;hash 证明内容未变化,不证明内容安全;隐私增强技术也不替代最小权限和生命周期管理。

W10 · EvalOps、Release Science 与 Rollback(S64~S70 / Day 154~160)

CS329S 与 FSDL 提供 deployment/monitoring 主线;MLflow 提供评测、版本和 trace 的工具语义;Google SRE 补齐渐进发布、错误预算与回滚思维。

明确 offline、shadow、canary、champion/challenger 各自能观察什么,尤其要标记 selection bias、judge drift、business outcome lag 和 traffic mismatch。release decision 是多指标判断,不等于单一 gate。

W11 · Human-AI Operations 与 Engineering Productivity(S71~S77 / Day 161~167)

Google PAIR 用于理解目标、解释、反馈、失败和信任;NIST AI RMF 用于决策权、风险和监测;DORA 用于理解 AI-assisted SDLC 的交付结果,避免用代码生成量替代价值与质量。

HITL 同时是交互设计、权限设计、队列容量和运营系统。比较 evidence-first 与 recommendation-first 时,应观察 anchoring、automation bias、review time、override、appeal 和 feedback provenance。

W12 · 轻量综合学习项目(S78~S84 / Day 168~174)

以 CS329S 的端到端设计顺序和 FSDL 的完整应用视角收束;OpenTelemetry、Temporal、MLflow 或现有仓库组件只选择最能说明问题的 2~4 层。A 级架构理解、B 级最小连接、C 级兴趣扩展都是有效完成方式。

项目必须列出已实现、模拟、仅设计和未知四类内容;不要求建成生产平台,也不因为缺少 Kubernetes/GPU/外部服务而失败。

3. S85~S90:知识整合而不是第二套考试

  • S85:用 CS329S 和 FSDL 合并 data、artifact、training、serving、runtime、integration、observability、security、release、human 全景图。
  • S86:用 MIT 6.5840、Temporal 与 OTel 检查架构图中的状态、故障、恢复和证据流。
  • S87:用 MCP/A2A 规范迁移到 Voice、Web3 Wallet、客服或 Embodied Operations,并写明不可迁移部分。
  • S88:从 Feast、Ray、MLflow、Kubernetes、OTel、A2A、PET 或 Human Factors 任选一个浅探,不新增大项目。
  • S89:把剩余问题拆成系统工程问题与 P3 的 generality、planning、memory、learning efficiency 问题。
  • S90:只写十个联系、三个兴趣方向和下一阶段节奏;不评分、不封存、不补齐全部实验。

4. 推荐的每日使用方式

  1. 主材料 20~40 分钟:只读当天对应课程或规范片段,回答一个核心问题。
  2. 辅材料 10~20 分钟:用官方 API/规范核对术语、状态和兼容边界。
  3. 最小实践 20~60 分钟:选择伪代码、几十行模拟、一张时序图或一次源码阅读。
  4. 场景迁移 10~20 分钟:放入金融、Web3 或文档场景,说明新增的状态、风险和人工责任。
  5. 复述 5~10 分钟:写出因果链、一个反例以及本地练习不能证明的结论。

外部课程的实验通常比本计划当天任务重。除非出于兴趣,不需要完成其整套 assignment、集群部署、云端 benchmark 或期末项目。涉及滚动演进的 MCP、A2A、PyTorch、vLLM、MLflow 和 OpenTelemetry 时,在实际学习当天以官方当前版本为准。

5. 2026-09-12 机制实验配套

新增 12 周机制实验室,沿用本图谱,不建立另一条学习主线。每份讲义解释概念、手算例子、输出含义、一个变量改动与外推限制;实际源码在页面中同步展示。

  • W1~W2:历史可见性与发布指纹,对应 Feast、MLflow 和 FSDL 数据/实验管理。
  • W3~W4:训练状态账本与服务排队;补充 Stanford CS336 2025 的 systems、parallelism 与 inference 方向,保留原 CMU DLSys 入口。
  • W5~W7:协调循环、确认丢失后的重试、金额契约版本,对应 Kubernetes、Temporal、MIT 6.5840 与 OpenAPI。
  • W8~W11:关联观测、动作授权、配对比较、复核队列,对应 OTel、Google SRE、OWASP、FSDL 与 PAIR。
  • W12 与 S85~S90:选取四个机制连接,列出未实现项,再把系统问题转成 P3 的研究问题。

本次补充核对了课程和官方材料入口;滚动文档不固定 SDK 版本。CS329S 的课程范围也可从 Stanford 官方课程目录 查阅。以上示例为本仓库原创教学实现,不是外部课程官方作业,也不宣称完成任何课程认证。

6. 系统设计 × AI 开发 × Harness 重点主线

H01~H04 学习入口 将同一段 90 天重新聚焦为上下文架构、运行状态、工具边界与 AI 开发工作流。12 周机制保留为支撑知识,不追加学习量。

新增一手工程参考:Context EngineeringEffective HarnessesWriting Tools for AgentsBuilding Effective Agents。它们分别对应信息选择、跨会话状态、工具语义与复杂度取舍;不照搬外部文章的大规模任务清单或测试工作量。

本地教学实现提供可替换的 ModelPort,但默认只用脚本替身与虚拟仓库;它展示 harness 机制,不宣称真实 AI 开发能力已经验证。