返回 Papers
学习计划 Roadmap

AI Deep Mastery P2:AI Systems Engineering 90

本文件描述将来学什么、怎样学。用户已要求提前生成 S01~S90 的详细预习教材,因此教材文件可以存在;它们只提供学习输入,不包含已经发生的阅读、实验结果、项目截图或完成状态。Phase 2 启动前仍不创建新的进度台账,课程执行时也不以测试数量、文档数量或工具数量衡量学习效果。

579ai-deep-mastery/PHASE2_AI_SYSTEMS_ENGINEERING_90.md

AI Deep Mastery 360 · Phase 2:AI Systems Engineering 90

状态:未来阶段;S01~S90 预习教材已备,但尚未启动学习 名义周期:2026-11-23 ~ 2027-02-20,共 90 个自然学习日 阶段编号:S01 ~ S90 结构:12 个完整学习周(S01~S84)+ 6 天知识整合与下一阶段准备(S85~S90) 过渡日:2026-11-22 休息,不计入本阶段 启动条件:完成 Phase 1 AI Model Engineering 90 并做一次轻量回顾;AISA 不是前置条件,如实际进度变化,日期整体顺延 课程目标:掌握 AI 系统工程的核心概念,建立跨层联系,能完成基本实现、阅读架构并解释主要取舍 课程定位:学习路线,不是生产认证、上线验收、求职训练或工程能力考试 教材入口docs/ai-deep-mastery/phase-2-systems/notes/ 与网页 /learn/ai-systems-engineering/notes 专业课程地图docs/ai-deep-mastery/phase-2-systems/PROFESSIONAL_COURSE_REFERENCE_MAP.md 重点主线(2026-09-12)系统设计 × AI 开发 × Harness;目录 phase-2-systems/harness/;沿用本阶段 90 天 机制学习配套(2026-09-12)12 周实验与 6 天整合指南;目录 phase-2-systems/experiments/;12 个离线示例,不增加天数或学习 Gate

本文件描述将来学什么、怎样学。用户已要求提前生成 S01~S90 的详细预习教材,因此教材文件可以存在;它们只提供学习输入,不包含已经发生的阅读、实验结果、项目截图或完成状态。Phase 2 启动前仍不创建新的进度台账,课程执行时也不以测试数量、文档数量或工具数量衡量学习效果。

现有日课负责详细概念;新增的 phase-2-systems/experiments/w01-*.mdw12-*.md 负责机制推导、合成例子、修改观察与延伸阅读。源代码位于 src/learning/ai-systems/,使用 npm run learning:p2 -- w01 等命令逐周选学。讲义中的预期输出是作者教学样例,不冒充个人学习结果;下一阶段实际启动时间仍随 P1 进度调整。


1. 为什么学习 AI Systems Engineering

2026-09-12 重心调整:优先学习系统设计、harness 与 AI 开发。S01~21 以任务契约和上下文架构为视角;S22~42 进入运行循环、状态与恢复;S43~63 进入工具、授权与代码变更边界;S64~84 连接完整 AI 开发工作流;S85~90 轻量整合。原有逐日教材和下文十二条主线全部保留为支撑知识,不再要求同等投入每个领域。四篇 H01~H04 讲义与 npm run learning:harness -- workflow 教学实现已落地;默认是脚本模型与虚拟仓库,不调用真实 LLM、不修改工作区。

Phase 1 关注模型本身:数据怎样改变模型、模型如何训练和适配、推理为什么变快或变慢。Phase 2 把视角向外扩展,理解模型怎样进入一个完整系统:

数据来源与数据质量
    ↓
实验、模型、提示词、索引和工具版本
    ↓
训练与推理基础设施
    ↓
Agent runtime、状态和外部系统集成
    ↓
可观测性、成本、安全、隐私与人工协作
    ↓
评测、发布、反馈和持续改进

贯穿 90 天的主问题是:

一个 AI 能力如何从本地实验逐步成为可理解、可维护、可演进的系统?不同层之间怎样互相影响,哪些概念可以在 Apple Silicon 本地亲手体验,哪些只能通过模拟、架构分析或案例学习建立理解?

1.1 十二条知识主线

  1. AI 数据工程:数据契约、事件时间、质量、lineage、point-in-time correctness、replay。
  2. MLOps / LLMOps:实验追踪、artifact、registry、版本、promotion、rollback。
  3. 分布式训练:内存构成、通信、DP/FSDP/ZeRO、TP/PP/EP、checkpoint。
  4. 分布式推理:scheduler、queue、batching、admission、cache、capacity。
  5. 平台工程:control plane、service catalog、golden path、tenant、platform as product。
  6. Agent runtime:状态、持久化、幂等、暂停恢复、补偿与人工审批。
  7. 协议与集成:MCP、A2A、OpenAPI、AsyncAPI、event、schema evolution、DLQ。
  8. 可观测性与 FinOps:trace、metric、log、SLO、tail latency、unit cost。
  9. 安全、隐私与供应链:身份、权限、egress、retention、AI BOM、provenance、PET。
  10. EvalOps 与发布:offline、shadow、canary、champion/challenger、release evidence。
  11. Human-AI 与工程生产力:review queue、automation bias、override、feedback、DORA/SPACE/DevEx。
  12. 系统整合:用一个小案例把若干层连起来,并能说明没有实现的部分。

2. 与 AISA、Phase 1 的去重边界

已有阶段已覆盖内容Phase 2 的新视角
AISA W4数据契约、RAG、权限与 freshness批流数据、event time、point-in-time join、lineage 和 replay 怎样共同工作
AISA W5指标、校准、slice 和 judge评测结果怎样进入版本比较、shadow、canary 和发布过程
AISA W6retry、fallback、SLO 与故障传播排队、容量、持久状态、证据关联和运行成本
AISA W7MCP、安全、权限与威胁模型协议版本、企业集成、授权委托、供应链和数据生命周期
Phase 1 W1~W7模型原理、训练、LoRA、preference把模型视为系统中的一个可版本化 artifact,不重讲训练算法
Phase 1 W8KV cache、量化、batching 与单机 serving多请求、多租户、scheduler、queue、routing 和 capacity
Phase 1 W9~W11机制解释、多模态、非 LLM 决策模型不再比较模型能力,转而理解统一的平台与运行环境

Phase 2 不重复 Transformer、LoRA、DPO/GRPO、RAG 基础或 MCP hello-world。已有代码和笔记是学习起点,不是需要全部重写的作业。


3. 已有资产怎样复用

仓库已经有丰富的阅读材料和一批可运行的教学组件。Phase 2 重点是理解它们之间的联系,在有学习价值时做小改动。

3.1 可复用代码

能力真实路径适合学习什么
Eval / 版本比较src/agent/eval/gate.tssrc/agent/eval/abCompare.tssrc/agent/eval/stats.ts指标比较、简单回归规则和不确定性
Runtime resiliencesrc/agent/runtime/resilience.tssrc/agent/runtime/cascade.tsretry、circuit breaker、fallback 和模型级联
Durable executionsrc/agent/durable/checkpointMachine.tscheckpoint、重放和恢复语义;源码明确标注为内存教学模拟
Agent platformsrc/agent/platform/agentRegistry.tspolicyEngine.tstoolGateway.tssessionRuntime.tstco.tsregistry、policy、gateway、session、quota 和成本模型
MCP / authsrc/agent/mcp/server.tssrc/agent/mcp/auth.tssrc/agent/mcp/toolRegistry.tsMCP SDK、工具契约、scope 和 audience
Cache / costsrc/agent/gateway/semanticCache.tssrc/agent/shared/cost.tscache policy、相似命中与 token 成本估算
Audit / HITLsrc/aml/auditTrail.tssrc/aml/hitl.ts审计事件、人工审批、override 和状态迁移
Observability shapesrc/aml/observability/attributeMap.tssrc/agent/trace/types.tsOTel-like 属性、trace/span/event 的关系
合成业务数据src/aml/generator.tssrc/aml/types.ts安全的本地数据 fixture 与金融案例

3.2 重点补齐的连接

  • 数据契约怎样连接到训练数据、评测集和线上输入。
  • 多个 artifact 怎样共同组成一个可解释的 AI 版本。
  • 模型的单机性能怎样变成队列、并发、容量和成本问题。
  • Agent 的状态、工具调用、业务副作用和人工审批怎样连接。
  • trace、eval、业务结果和成本怎样形成同一条观察链。
  • 安全、隐私和供应链控制怎样分布在不同系统层,而不是集中在一个“安全模块”。
  • 平台和 golden path 怎样帮助第二个用例复用能力。

4. Apple Silicon 本地执行与降级

规划时的只读环境审计:

  • Apple Silicon arm64,macOS 26.5.1。
  • Node.js 24.19.0,pnpm 11.19.0。
  • 系统 Python 3.9.6;Phase 2 可复用 Phase 1 的独立 Python 3.11+ 环境。
  • 当前没有 Docker、Podman、kubectl、kind、minikube 或 uv。

这些信息到 2027 年可能变化,S01 只需做一次轻量环境确认。

4.1 三档学习方式

档位本地条件学习方式
A · Node/TS 主线不安装容器、不下载模型也可进行JSONL 数据管线、artifact manifest、离散事件 scheduler、runtime、协议、telemetry 和 human queue 小实现
B · Python / Apple SiliconPhase 1 Python 环境仍可用PyTorch 单机练习、CPU/Gloo 两进程演示、MPS 单设备 profiling、可选 MLX/llama.cpp
C · 可选外部体验有明确兴趣、时间和预算Docker/kind、云 GPU、托管 telemetry 或远端 serving;只作选修,不影响主线

本地模拟是正式的学习方式,不是“低配替代品”。课程目标是理解状态、调度、版本、恢复和取舍,不是跑出生产吞吐数字。

4.2 始终保留的安全边界

  • 只使用公开、合成或许可明确的数据;不使用真实客户、账户、调查或支付数据。
  • 不把 simulator、两进程 CPU 或本地 MCP demo 描述成生产平台。
  • 不提交模型权重、缓存、secret、真实身份信息或含敏感正文的 telemetry。
  • MPS 只作为本地单设备后端;不假设其支持多机 collective。
  • vLLM、NCCL、CUDA、真实多 GPU 和 Kubernetes 集群都不是必修条件。
  • 安全、隐私和副作用案例默认只做无真实外部写入的模拟。

5. 轻量学习节奏

5.1 每周固定节奏

星期学习方式
周一概念与阅读:建立问题、术语和心智模型
周二最小实现:只实现最能说明原理的一小部分
周三引导练习:复用现有代码、框架或给定 fixture
周四案例与连接:分析真实架构问题,连接此前知识
周五知识整理 / 小结:整理概念图、对比表和仍不清楚的问题
周六可选探索或补学:按兴趣深入;忙碌时可以不做
周日休息:不安排必修任务

建议每天 2~3 小时。周二的“实现”可以是几十行代码、一个小模拟、一张可计算表或一次配置练习,不要求每周建立新项目。周五只需要一份简短周小结,可直接追加到当周笔记。

5.2 每四周一次低压力复盘

W4、W8、W12 的周五进行阶段复盘,不打分、不排名,也没有“不过关”。复盘只回答:

  1. 我现在能用自己的话解释哪些概念?
  2. 哪几层已经形成连接,哪几层仍是孤立术语?
  3. 哪个最小实现真正帮助了理解?
  4. 哪些内容只需要知道存在,不需要现在深入?
  5. 哪些概念要加入下一阶段的复习清单?

未掌握内容只加入当周笔记末尾的复习清单;不新建评分表、补考表或第二份进度台账。


6. 90 天总览

周 / Day日期核心知识主要连接
W1 · S01~S0711-23~11-29AI Data Plane数据源→契约→质量→特征/评测→lineage
W2 · S08~S1411-30~12-06Artifact Registry 与 MLOps / LLMOps实验→artifact→bundle→版本→发布
W3 · S15~S2112-07~12-13Distributed Training Systems内存→并行→通信→checkpoint
W4 · S22~S2812-14~12-20Distributed Inference & Serving单机推理→队列→调度→容量;第一次阶段复盘
W5 · S29~S3512-21~12-27AI Platform Engineering & Golden Path共享能力→catalog→tenant→开发体验
W6 · S36~S4212-28~01-03Agent Runtime & Durable Workflow状态→工具→副作用→恢复→人工审批
W7 · S43~S4901-04~01-10Protocols & Enterprise IntegrationMCP/API/event→版本→授权→系统边界
W8 · S50~S5601-11~01-17Observability、Cost、SLO、Capacitytrace→指标→业务结果→成本;第二次阶段复盘
W9 · S57~S6301-18~01-24Security、Privacy、AI Supply Chain身份→数据→artifact→tool→egress/retention
W10 · S64~S7001-25~01-31EvalOps、Release Science、Rollbackoffline eval→shadow→canary→release decision
W11 · S71~S7702-01~02-07Human-AI Operations & Productivity人机分工→review queue→feedback→DevEx
W12 · S78~S8402-08~02-14可选综合学习项目选择 2~4 层做连接;第三次阶段复盘
S85~S9002-15~02-20知识整合与兴趣延伸全景图→案例迁移→选修→Phase 3 准备

7. 十二周详细课程

W1 · AI Data Plane(S01~S07)

核心问题

  • event time、processing time、late arrival、duplicate 和 schema drift 分别意味着什么?
  • feature、label、eval、feedback 和审计 evidence 为什么需要不同边界?
  • 如何理解 point-in-time correctness 和 training-serving skew?

建议输入

  • docs/AI_DATA_CONTRACTS_LINEAGE_QUALITY_PLAYBOOK.md
  • docs/AI_REAL_TIME_FEATURE_STORE_DECISIONING_PLAYBOOK.md
  • docs/ai-foundations/papers/45-data-lineage-contracts-openlineage-ai-data-quality.md
  • src/aml/generator.ts
  • src/aml/types.ts
Day日期 / 节奏学习内容轻量产出
S012026-11-23 · 周一概念与阅读确认本地环境;画 source→raw→validated→feature/eval→decision 数据流一张数据流草图和术语表
S0211-24 · 周二最小实现用 Node/TS 读取一小段 JSONL,做 schema 检查和简单转换一个可重复运行的小脚本
S0311-25 · 周三引导练习用 AML generator 生成合成事件,记录 source id、时间和 schema version一份带 lineage 字段的示例数据
S0411-26 · 周四案例与连接观察迟到、乱序、重复、缺失和未来字段如何改变结果一张“问题→影响→处理思路”表
S0511-27 · 周五知识整理整理 event time、point-in-time、lineage、freshness 和 skew 的关系W1 概念图与仍不清楚的问题
S0611-28 · 周六可选探索 / 补学可选:比较 batch rebuild 与 event replay;或只复习最难概念一条新观察即可,忙时休息
S0711-29 · 周日休息不安排必修任务

W2 · Artifact Registry 与 MLOps / LLMOps(S08~S14)

核心问题

  • experiment、artifact、registry、release bundle 各自解决什么问题?
  • 为什么一个 AI 版本不只是 model version?
  • data、prompt、index、tool、policy 和 eval 怎样建立 lineage?

建议输入

  • docs/AI_MLOPS_CONTINUOUS_DELIVERY_RELEASE_PLAYBOOK.md
  • docs/AI_SUPPLY_CHAIN_AI_BOM_PROVENANCE_PLAYBOOK.md
  • src/agent/platform/agentRegistry.ts
  • src/aml/auditTrail.ts
Day日期 / 节奏学习内容轻量产出
S0811-30 · 周一概念与阅读区分实验 run、artifact、model registry、composite bundle 和 promotion一张五概念对比表
S0912-01 · 周二最小实现为三个小文件生成 hash,并写一个最小 bundle manifest一份可读的 JSON manifest
S1012-02 · 周三引导练习复用 agentRegistry 或 auditTrail,观察版本切换和历史记录一张版本生命周期图
S1112-03 · 周四案例与连接分析 prompt、index 或 policy 改变但模型未变时,系统版本为何仍改变一个 release bundle 案例
S1212-04 · 周五知识整理连接 reproducibility、lineage、AI BOM、promotion 和 rollbackW2 小结与关键字段清单
S1312-05 · 周六可选探索 / 补学可选:模拟 artifact 缺失或 hash 不一致;或阅读一个 MLOps 案例记录处理思路,不要求完整工具
S1412-06 · 周日休息不安排必修任务

W3 · Distributed Training Systems(S15~S21)

核心问题

  • 参数、梯度、optimizer state 和 activation 怎样占用内存?
  • DP、FSDP/ZeRO、TP、PP、EP、CP 分别切分什么?
  • 通信、straggler 和 checkpoint 为什么会影响训练效率?

建议输入

  • docs/llm/day31-grad-checkpoint-zero-fsdp.md
  • docs/llm/day32-5d-parallelism-megatron.md
  • docs/AI_MODEL_ENGINEERING_90_PLAN.md
  • src/agent/durable/checkpointMachine.ts
Day日期 / 节奏学习内容轻量产出
S1512-07 · 周一概念与阅读学习训练内存构成、collective 和常见并行轴一张内存与并行概念图
S1612-08 · 周二最小实现写一个简单表格或函数,估算参数、梯度、optimizer 和 activation 内存一个小型 memory calculator
S1712-09 · 周三引导练习可行时运行两进程 CPU/Gloo 演示;否则跟随 collective 模拟示例一份单进程/双进程观察记录
S1812-10 · 周四案例与连接比较 DP/FSDP/TP/PP 在不同模型和互联条件下的选择一张适用场景矩阵
S1912-11 · 周五知识整理连接 memory、communication、throughput、checkpoint 和 failure recoveryW3 学习小结
S2012-12 · 周六可选探索 / 补学可选:观察不同 batch 或 checkpoint 配置;或重看最难并行概念一条可解释的观察即可
S2112-13 · 周日休息不安排必修任务

W4 · Distributed Inference & Serving(S22~S28)

核心问题

  • queue、scheduler、continuous batching、prefill/decode 和 cache 怎样共同影响延迟?
  • TTFT、inter-token latency、throughput、tail latency 分别表示什么?
  • admission、backpressure、load shedding 和公平性何时重要?

建议输入

  • docs/llm/day83-continuous-batching.md
  • docs/llm/day88-prefill-decode-disaggregation.md
  • docs/llm/PHASE4_LONGREAD_llm-inference-2026.md
  • src/agent/gateway/semanticCache.ts
  • src/agent/runtime/resilience.ts
  • src/agent/eval/stats.ts
Day日期 / 节奏学习内容轻量产出
S2212-14 · 周一概念与阅读画 arrival→queue→prefill→decode→response 流程,学习主要 serving 指标一张请求生命周期图
S2312-15 · 周二最小实现实现一个只有 arrival、service time 和 FIFO queue 的离散事件小模拟一个最小 queue simulator
S2412-16 · 周三引导练习在给定 fixture 上比较 FIFO、priority 或 fair-share 中的两种策略一张延迟/公平性观察表
S2512-17 · 周四案例与连接分析 burst、长上下文、cache、batch 和 worker loss 对用户体验的影响一个容量与降级案例
S2612-18 · 周五知识整理 / 阶段复盘连接 W1 数据、W2 artifact、W3 training 与 W4 serving第一阶段全景图;不清楚内容加入复习清单
S2712-19 · 周六可选探索 / 补学可选:为 simulator 增加 backpressure;或补学 W1~W4 任一概念自选,不要求完成
S2812-20 · 周日休息不安排必修任务

W5 · AI Platform Engineering & Golden Path(S29~S35)

核心问题

  • control plane、data plane、runtime plane 和 evidence plane 怎样分工?
  • service catalog、tenant、quota、golden path 分别解决什么问题?
  • 平台怎样同时服务开发体验与治理?

建议输入

  • docs/AI_PLATFORM_SERVICE_CATALOG_GOLDEN_PATHS_PLAYBOOK.md
  • docs/AI_DORA_SPACE_ENGINEERING_PRODUCTIVITY_SDLC_PLAYBOOK.md
  • docs/AI_ENGINEERING_PRODUCTIVITY_CODE_AGENT_OPERATING_SYSTEM_PLAYBOOK.md
  • src/agent/platform/agentRegistry.ts
  • src/agent/platform/policyEngine.ts
  • src/agent/platform/tco.ts
Day日期 / 节奏学习内容轻量产出
S2912-21 · 周一概念与阅读学习 AI 平台分层、service catalog、golden path 和 platform as product一张平台能力地图
S3012-22 · 周二最小实现定义一个简短 use-case manifest,包含 owner、数据、模型、工具和 SLO一份 manifest 示例
S3112-23 · 周三引导练习复用 agentRegistry、policyEngine 或 tco,观察版本、策略和成本参数一张组件关系图
S3212-24 · 周四案例与连接对比手工接入与 golden path;讨论标准化、灵活性和锁定一个第二用例接入案例
S3312-25 · 周五知识整理连接平台边界、团队认知负担、DevEx、质量和安全W5 小结与平台产品问题清单
S3412-26 · 周六可选探索 / 补学可选:为 manifest 加 validator;或研究一个平台服务目录自选小练习
S3512-27 · 周日休息不安排必修任务

W6 · Agent Runtime & Durable Workflow(S36~S42)

核心问题

  • agent loop、workflow、state machine 和 business transaction 有什么区别?
  • checkpoint、idempotency、outbox、saga 和 compensation 怎样连接?
  • pause/resume、approval、timeout 和外部未知状态如何处理?

建议输入

  • docs/AI_DURABLE_AGENT_WORKFLOW_STATE_MACHINE_PLAYBOOK.md
  • src/agent/durable/checkpointMachine.ts
  • src/agent/platform/sessionRuntime.ts
  • src/agent/runtime/resilience.ts
  • src/aml/hitl.ts
Day日期 / 节奏学习内容轻量产出
S3612-28 · 周一概念与阅读画 collect→propose→approve→effect→verify/reconcile 状态机一张状态图与术语表
S3712-29 · 周二最小实现为一个小工作流增加 checkpoint 或 idempotency key一段最小状态处理代码
S3812-30 · 周三引导练习跟随 checkpointMachine、sessionRuntime 和 HITL 示例,观察 pause/resume一份状态变化记录
S3912-31 · 周四案例与连接分析重复消息、partial success、timeout 和人工审批案例一张“状态→处理方式”表
S4001-01 · 周五知识整理连接重放、幂等、对账、补偿、审计和人工升级W6 小结与一张恢复路径图
S4101-02 · 周六可选探索 / 补学可选:模拟一次 crash/resume;或补学 exactly-once 的边界自选,不要求覆盖所有边界
S4201-03 · 周日休息不安排必修任务

W7 · Protocols & Enterprise Integration(S43~S49)

核心问题

  • MCP、A2A、OpenAPI、AsyncAPI 和 CloudEvents 分别位于哪一层?
  • capability discovery、schema evolution、delegated identity 和 idempotency 怎样配合?
  • API、event、workflow engine 和 human queue 如何选择?

建议输入

  • docs/AI_AGENT_PROTOCOLS_MCP_A2A_PLAYBOOK.md
  • docs/AI_ENTERPRISE_INTEGRATION_EVENT_DRIVEN_AGENT_PLAYBOOK.md
  • docs/AI_CONTRACT_FIRST_TOOL_API_DESIGN_OPENAPI_ASYNCAPI_PLAYBOOK.md
  • src/agent/mcp/server.ts
  • src/agent/mcp/auth.ts
  • src/agent/platform/toolGateway.ts
Day日期 / 节奏学习内容轻量产出
S4301-04 · 周一概念与阅读画 Agent→tool→case/core system→event→human queue 集成图一张协议与系统边界图
S4401-05 · 周二最小实现定义一个 v1/v2 tool contract 或 event envelope一份小型 schema 示例
S4501-06 · 周三引导练习运行现有 MCP server/auth 示例,观察 discovery、call、scope 和 audience一份调用过程记录
S4601-07 · 周四案例与连接分析同步 API、异步 event、schema 变化、重复投递和 DLQ一张集成模式选择表
S4701-08 · 周五知识整理连接 protocol、business semantics、identity、version 和 recoveryW7 小结与一个序列图
S4801-09 · 周六可选探索 / 补学可选:做一次兼容版本变更;或阅读 A2A/MCP 最新规范摘要自选观察
S4901-10 · 周日休息不安排必修任务

W8 · Observability、Cost、SLO、Capacity(S50~S56)

核心问题

  • trace、span、event、metric、log、eval 和 audit 分别回答什么问题?
  • uptime、tail latency、quality、cost 和 human workload 如何形成 AI SLO?
  • token cost 为什么不等于 cost per successful task?

建议输入

  • docs/AI_OBSERVABILITY_COST_SLO_PLAYBOOK.md
  • docs/AI_RUNTIME_EVIDENCE_OBSERVABILITY_ARCHITECTURE_PLAYBOOK.md
  • docs/AI_INCIDENT_POSTMORTEM_RELIABILITY_PLAYBOOK.md
  • src/aml/observability/attributeMap.ts
  • src/agent/trace/types.ts
  • src/agent/eval/dashboard.ts
Day日期 / 节奏学习内容轻量产出
S5001-11 · 周一概念与阅读学习 AI telemetry、correlation、SLI/SLO、error budget 和 unit cost一张信号分类表
S5101-12 · 周二最小实现把几条本地事件写入 JSONL,并按 correlation id 聚合一个最小 telemetry 示例
S5201-13 · 周三引导练习将现有 trace 映射到 OTel-like 属性,计算 p50/p95 或 cost/success一张小型指标表
S5301-14 · 周四案例与连接分析慢、贵、答错、工具错误和人工 backlog 在信号上的差别一个 incident walkthrough
S5401-15 · 周五知识整理 / 阶段复盘连接 W5 platform、W6 runtime、W7 integration 与 W8 observability第二阶段全景图;薄弱内容加入复习清单
S5501-16 · 周六可选探索 / 补学可选:添加一个 dashboard 指标;或补学 W5~W8 任一主题自选,不追求完整 dashboard
S5601-17 · 周日休息不安排必修任务

W9 · Security、Privacy、AI Supply Chain(S57~S63)

核心问题

  • data、model、artifact、tool、agent、human 和 provider 的 trust boundary 在哪里?
  • identity、authentication、authorization、delegation、approval 和 purpose 有何不同?
  • DP、TEE、FHE、tokenization 和普通访问控制各解决哪类问题?

建议输入

  • docs/AI_PLATFORM_SECURITY_GATEWAY_LAB.md
  • docs/AI_CONTEXT_SUPPLY_CHAIN_PROVENANCE_POISONING_DEFENSE_PLAYBOOK.md
  • docs/AI_PRIVACY_ENHANCING_TECH_CONFIDENTIAL_AI_PLAYBOOK.md
  • docs/AI_AGENT_IDENTITY_DELEGATED_AUTHORIZATION_PLAYBOOK.md
  • src/agent/mcp/auth.ts
  • src/agent/platform/policyEngine.ts
  • src/aml/auditTrail.ts
Day日期 / 节奏学习内容轻量产出
S5701-18 · 周一概念与阅读学习资产、攻击面、trust boundary、least privilege、purpose 和 retention一张简化威胁图
S5801-19 · 周二最小实现为一个 artifact 生成 provenance/hash,或写一个最小 egress/purpose policy一份小型安全控制示例
S5901-20 · 周三引导练习跟随 auth、policyEngine 和 auditTrail 示例,观察 allow/deny/escalate一份权限流记录
S6001-21 · 周四案例与连接分析 prompt injection、confused deputy、artifact tamper、PII egress 和 retention一张 threat→control→residual risk 表
S6101-22 · 周五知识整理连接 identity、data lifecycle、AI BOM、tool security 与 privacy technologyW9 小结与安全分层图
S6201-23 · 周六可选探索 / 补学可选:模拟一个无真实数据的攻击案例;或研究一种 PET 的适用边界一条学习结论即可
S6301-24 · 周日休息不安排必修任务

W10 · EvalOps、Release Science、Rollback(S64~S70)

核心问题

  • offline eval、shadow、canary、champion/challenger 各能回答什么?
  • model、prompt、retrieval、tool 和 policy 改动怎样组合成一次 release?
  • data drift、judge drift、业务 outcome lag 怎样影响发布判断?

建议输入

  • docs/AI_EVALOPS_PLATFORM_ARCHITECTURE_PLAYBOOK.md
  • docs/AI_EXPERIMENTATION_PLATFORM_RELEASE_SCIENCE_PLAYBOOK.md
  • docs/AI_SHADOW_MODE_COUNTERFACTUAL_EVALUATION_SILENT_LAUNCH_PLAYBOOK.md
  • src/agent/eval/gate.ts
  • src/agent/eval/abCompare.ts
  • scripts/eval-gate.ts
  • scripts/ab-compare.ts
Day日期 / 节奏学习内容轻量产出
S6401-25 · 周一概念与阅读画 offline→shadow→canary→release/rollback 生命周期一张发布路径图
S6501-26 · 周二最小实现定义一个包含 candidate、baseline、metrics 和 decision 的 release record一份简短 JSON/Markdown 记录
S6601-27 · 周三引导练习运行现有 eval/AB 脚本或阅读其实现,理解版本比较一份结果解释,不要求新增测试集
S6701-28 · 周四案例与连接分析质量改善但延迟/成本变差、judge drift 或 rollback 的案例一张多指标取舍表
S6801-29 · 周五知识整理连接 eval、risk tier、release evidence、shadow、canary 和 rollbackW10 小结与发布决策问题清单
S6901-30 · 周六可选探索 / 补学可选:模拟一次简单 champion/challenger;或研究一个 release science 案例自选观察
S7001-31 · 周日休息不安排必修任务

W11 · Human-AI Operations & Engineering Productivity(S71~S77)

核心问题

  • HITL 同时包含权限、交互、容量和运营中的哪些问题?
  • evidence、confidence 和 recommendation 的呈现怎样影响 automation bias?
  • override、appeal、feedback 与 active learning 怎样保持可追溯?
  • AI-assisted SDLC 怎样兼顾交付速度、质量、安全和开发者体验?

建议输入

  • docs/AI_HUMAN_AI_INTERACTION_PRODUCT_DESIGN_PLAYBOOK.md
  • docs/AI_HUMAN_FACTORS_OPERATIONS_COGNITIVE_LOAD_AUTOMATION_BIAS_PLAYBOOK.md
  • docs/AI_HUMAN_REVIEW_OPERATIONS_CAPACITY_PLAYBOOK.md
  • docs/AI_ACTIVE_LEARNING_HUMAN_FEEDBACK_OPERATIONS_PLAYBOOK.md
  • docs/AI_ENGINEERING_PRODUCTIVITY_CODE_AGENT_OPERATING_SYSTEM_PLAYBOOK.md
  • src/aml/hitl.ts
Day日期 / 节奏学习内容轻量产出
S7102-01 · 周一概念与阅读学习 decision rights、review tier、queue、override、appeal、automation bias 和 DevEx一张人机职责图
S7202-02 · 周二最小实现实现一个简单 reviewer queue,或为 HITL 事件增加 override/appeal 字段一个小型队列/状态示例
S7302-03 · 周三引导练习比较 evidence-first 与 recommendation-first 两种 review 流程一张体验与风险观察表
S7402-04 · 周四案例与连接分析 backlog、fatigue、冲突证据、active learning 和 code-agent review一个人机运营案例
S7502-05 · 周五知识整理连接 human capacity、trust calibration、feedback provenance、DORA/SPACE 和 DevExW11 小结与改进问题树
S7602-06 · 周六可选探索 / 补学可选:调整 queue capacity;或研究一个 AI-assisted SDLC 案例自选,不要求用户实验
S7702-07 · 周日休息不安排必修任务

W12 · 可选综合学习项目(S78~S84)

W12 用于把知识连接起来,不要求构建完整平台,也不是生产 readiness 项目。可以继续使用 AML Investigation Copilot,也可以选 Payment Dispute、KYC、客服知识助手或 Web3 Wallet 风险案例。

从以下三个范围任选其一:

范围内容适合情况
A · 架构理解问题说明、系统图、数据流、关键取舍和安全边界时间有限,重点是建立全景理解
B · 最小连接从 data、runtime、observability、release、human 中任选 2~3 层,做一个可运行的小路径希望把若干概念连接到代码
C · 兴趣扩展在 B 基础上再加入一个自选层或第二个案例时间充足且确实感兴趣

没有必要同时实现九个 plane。未实现的部分只需在架构图中标出位置、职责和未来问题。

Day日期 / 节奏学习内容轻量产出
S782027-02-08 · 周一概念与阅读选择案例和 A/B/C 范围,整理用户、数据、模型、工具、人工与风险边界一页项目范围说明
S7902-09 · 周二最小实现完成最小连接,例如 data→runtime、runtime→trace 或 eval→release record一条小而完整的学习路径
S8002-10 · 周三引导练习复用现有 generator、registry、runtime、MCP、trace 或 HITL 组件一张“复用了什么”清单
S8102-11 · 周四案例与连接讨论 timeout、重复消息、数据过期、权限或人工 backlog 中的两种情况一张场景与处理思路表
S8202-12 · 周五知识整理 / 阶段复盘总结 W9~W12,并回看三次阶段全景图之间的变化第三阶段复盘;薄弱内容加入复习清单
S8302-13 · 周六可选探索 / 补学可选:完善示意图、补一个小功能、写一页案例总结;也可以直接休息自选,不做封存或压力演练
S8402-14 · 周日休息不安排必修任务

8. S85~S90:知识整合、兴趣延伸与 Phase 3 准备

这六天不是考试周,也不要求隔离资料或闭卷作答。可以查阅全部笔记和代码,目标是把 12 周知识整理成长期可复用的理解。

Day日期 / 节奏学习内容轻量产出
S852027-02-15 · 周一知识整合合并 W4、W8、W12 三张阶段图,整理数据、artifact、training、serving、runtime、integration、observability、security、release 和 human 的关系一张 Phase 2 全景知识图
S8602-16 · 周二架构图选择一个熟悉案例,画 context、container、数据流、状态流或 sequence 中最有帮助的两张图两张解释性架构图
S8702-17 · 周三案例迁移把系统工程方法迁移到 Voice Agent、Web3 Wallet Agent、AI 客服或 Embodied Operations 中的一个场景一页“可迁移 / 不可迁移”分析
S8802-18 · 周四兴趣选修从 feature store、Ray、MLflow、Kubernetes、OTel、A2A、PET、human factors 等主题中任选一个浅探一份短读书卡或小练习
S8902-19 · 周五下一阶段准备整理仍不理解的问题,并区分“系统工程问题”和“AGI/认知/智能本质问题”Phase 3 问题树与复习清单
S902027-02-20 · 周六轻量回顾浏览 90 天笔记,写下最重要的 10 个联系、3 个仍想深入的方向和下一阶段节奏建议一页阶段总结;不做量化考核

9. 学习完成的轻量标准

Phase 2 的完成不代表具备生产认证,也不意味着已经能独立运营大型 AI 平台。达到以下学习结果即可进入下一阶段:

  • 能用自己的话解释十二周主要概念,并把它们放进一张全景图。
  • 能说明 data、artifact、training、serving、runtime、integration、observability、security、release 和 human 之间的主要依赖。
  • 完成若干真正帮助理解的最小实现;数量不作统一要求。
  • 能为一个金融或 Web3 案例画出基本架构,并解释两到三个重要取舍。
  • 知道 Apple Silicon 本地模拟证明了什么、没有证明什么。
  • 能识别真实数据、敏感日志、外部副作用和权限设计中的基本安全边界。
  • 保留一份诚实的复习清单和 Phase 3 问题树。

如果某些主题仍然模糊,直接把它们留在复习清单中,不需要延长整个阶段或重复全部课程。


10. 目录与记录规则

阶段入口和将来学习材料位置:

docs/ai-deep-mastery/
├── PHASE2_AI_SYSTEMS_ENGINEERING_90.md
└── phase-2-systems/
    ├── PROFESSIONAL_COURSE_REFERENCE_MAP.md
    ├── notes/       # S01~S90 预习教材;不代表学习完成
    ├── experiments/
    ├── reflections/
    ├── capstone/
    └── gates/        # 仅为兼容旧结构

阶段复盘优先放入 reflections/capstone/ 只在选择综合项目时使用。gates/ 是历史兼容目录,不再承担学习任务。

规则:

  1. 本文件定义计划,notes/ 保存预习教材;目录与教材存在都不代表学习开始。
  2. Phase 2 启动前不创建 S01~S90 的完成证据、实验结果或第二份进度台账。
  3. 启动后仍由项目总入口指定唯一状态来源。
  4. 每周建议最多一篇综合笔记;小实现和案例按需要保存,不追求数量。
  5. 大权重、缓存、运行环境、secret、真实客户数据和未授权 telemetry 不进入 Git。
  6. 时间敏感的协议、工具和平台能力在相关周开始时轻量复核;旧笔记继续作为历史输入。

11. SOTA 检查(2026-08-23 更新)

  • MLflow 官方文档当前同时覆盖传统 ML 与 LLM/Agent 的 tracking、tracing、evaluation 和 model lifecycle;课程先从本地最小概念和 manifest 学起,再按兴趣体验产品工具。
  • PyTorch FSDP、distributed checkpoint、OpenTelemetry semantic conventions、MCP/A2A 和推理 scheduler 都是滚动演进接口;相关周开始时只需复核重要 breaking change、许可与本机支持。
  • 本阶段不预设 Kubernetes、vLLM、SGLang、NCCL 或某个托管平台是唯一先进解。理解状态、排队、恢复、版本和证据之间的关系更重要。
  • 资料口径来自 2026-08-23 的项目审计;阶段启动时以当时官方文档为准。