AI Deep Mastery P2:AI Systems Engineering 90
本文件描述将来学什么、怎样学。用户已要求提前生成 S01~S90 的详细预习教材,因此教材文件可以存在;它们只提供学习输入,不包含已经发生的阅读、实验结果、项目截图或完成状态。Phase 2 启动前仍不创建新的进度台账,课程执行时也不以测试数量、文档数量或工具数量衡量学习效果。
AI Deep Mastery 360 · Phase 2:AI Systems Engineering 90
状态:未来阶段;S01~S90 预习教材已备,但尚未启动学习 名义周期:2026-11-23 ~ 2027-02-20,共 90 个自然学习日 阶段编号:S01 ~ S90 结构:12 个完整学习周(S01~S84)+ 6 天知识整合与下一阶段准备(S85~S90) 过渡日:2026-11-22 休息,不计入本阶段 启动条件:完成 Phase 1
AI Model Engineering 90并做一次轻量回顾;AISA 不是前置条件,如实际进度变化,日期整体顺延 课程目标:掌握 AI 系统工程的核心概念,建立跨层联系,能完成基本实现、阅读架构并解释主要取舍 课程定位:学习路线,不是生产认证、上线验收、求职训练或工程能力考试 教材入口:docs/ai-deep-mastery/phase-2-systems/notes/与网页/learn/ai-systems-engineering/notes专业课程地图:docs/ai-deep-mastery/phase-2-systems/PROFESSIONAL_COURSE_REFERENCE_MAP.md重点主线(2026-09-12):系统设计 × AI 开发 × Harness;目录phase-2-systems/harness/;沿用本阶段 90 天 机制学习配套(2026-09-12):12 周实验与 6 天整合指南;目录phase-2-systems/experiments/;12 个离线示例,不增加天数或学习 Gate
本文件描述将来学什么、怎样学。用户已要求提前生成 S01~S90 的详细预习教材,因此教材文件可以存在;它们只提供学习输入,不包含已经发生的阅读、实验结果、项目截图或完成状态。Phase 2 启动前仍不创建新的进度台账,课程执行时也不以测试数量、文档数量或工具数量衡量学习效果。
现有日课负责详细概念;新增的 phase-2-systems/experiments/w01-*.md~w12-*.md 负责机制推导、合成例子、修改观察与延伸阅读。源代码位于 src/learning/ai-systems/,使用 npm run learning:p2 -- w01 等命令逐周选学。讲义中的预期输出是作者教学样例,不冒充个人学习结果;下一阶段实际启动时间仍随 P1 进度调整。
1. 为什么学习 AI Systems Engineering
2026-09-12 重心调整:优先学习系统设计、harness 与 AI 开发。S01~21 以任务契约和上下文架构为视角;S22~42 进入运行循环、状态与恢复;S43~63 进入工具、授权与代码变更边界;S64~84 连接完整 AI 开发工作流;S85~90 轻量整合。原有逐日教材和下文十二条主线全部保留为支撑知识,不再要求同等投入每个领域。四篇 H01~H04 讲义与 npm run learning:harness -- workflow 教学实现已落地;默认是脚本模型与虚拟仓库,不调用真实 LLM、不修改工作区。
Phase 1 关注模型本身:数据怎样改变模型、模型如何训练和适配、推理为什么变快或变慢。Phase 2 把视角向外扩展,理解模型怎样进入一个完整系统:
数据来源与数据质量
↓
实验、模型、提示词、索引和工具版本
↓
训练与推理基础设施
↓
Agent runtime、状态和外部系统集成
↓
可观测性、成本、安全、隐私与人工协作
↓
评测、发布、反馈和持续改进
贯穿 90 天的主问题是:
一个 AI 能力如何从本地实验逐步成为可理解、可维护、可演进的系统?不同层之间怎样互相影响,哪些概念可以在 Apple Silicon 本地亲手体验,哪些只能通过模拟、架构分析或案例学习建立理解?
1.1 十二条知识主线
- AI 数据工程:数据契约、事件时间、质量、lineage、point-in-time correctness、replay。
- MLOps / LLMOps:实验追踪、artifact、registry、版本、promotion、rollback。
- 分布式训练:内存构成、通信、DP/FSDP/ZeRO、TP/PP/EP、checkpoint。
- 分布式推理:scheduler、queue、batching、admission、cache、capacity。
- 平台工程:control plane、service catalog、golden path、tenant、platform as product。
- Agent runtime:状态、持久化、幂等、暂停恢复、补偿与人工审批。
- 协议与集成:MCP、A2A、OpenAPI、AsyncAPI、event、schema evolution、DLQ。
- 可观测性与 FinOps:trace、metric、log、SLO、tail latency、unit cost。
- 安全、隐私与供应链:身份、权限、egress、retention、AI BOM、provenance、PET。
- EvalOps 与发布:offline、shadow、canary、champion/challenger、release evidence。
- Human-AI 与工程生产力:review queue、automation bias、override、feedback、DORA/SPACE/DevEx。
- 系统整合:用一个小案例把若干层连起来,并能说明没有实现的部分。
2. 与 AISA、Phase 1 的去重边界
| 已有阶段 | 已覆盖内容 | Phase 2 的新视角 |
|---|---|---|
| AISA W4 | 数据契约、RAG、权限与 freshness | 批流数据、event time、point-in-time join、lineage 和 replay 怎样共同工作 |
| AISA W5 | 指标、校准、slice 和 judge | 评测结果怎样进入版本比较、shadow、canary 和发布过程 |
| AISA W6 | retry、fallback、SLO 与故障传播 | 排队、容量、持久状态、证据关联和运行成本 |
| AISA W7 | MCP、安全、权限与威胁模型 | 协议版本、企业集成、授权委托、供应链和数据生命周期 |
| Phase 1 W1~W7 | 模型原理、训练、LoRA、preference | 把模型视为系统中的一个可版本化 artifact,不重讲训练算法 |
| Phase 1 W8 | KV cache、量化、batching 与单机 serving | 多请求、多租户、scheduler、queue、routing 和 capacity |
| Phase 1 W9~W11 | 机制解释、多模态、非 LLM 决策模型 | 不再比较模型能力,转而理解统一的平台与运行环境 |
Phase 2 不重复 Transformer、LoRA、DPO/GRPO、RAG 基础或 MCP hello-world。已有代码和笔记是学习起点,不是需要全部重写的作业。
3. 已有资产怎样复用
仓库已经有丰富的阅读材料和一批可运行的教学组件。Phase 2 重点是理解它们之间的联系,在有学习价值时做小改动。
3.1 可复用代码
| 能力 | 真实路径 | 适合学习什么 |
|---|---|---|
| Eval / 版本比较 | src/agent/eval/gate.ts、src/agent/eval/abCompare.ts、src/agent/eval/stats.ts | 指标比较、简单回归规则和不确定性 |
| Runtime resilience | src/agent/runtime/resilience.ts、src/agent/runtime/cascade.ts | retry、circuit breaker、fallback 和模型级联 |
| Durable execution | src/agent/durable/checkpointMachine.ts | checkpoint、重放和恢复语义;源码明确标注为内存教学模拟 |
| Agent platform | src/agent/platform/agentRegistry.ts、policyEngine.ts、toolGateway.ts、sessionRuntime.ts、tco.ts | registry、policy、gateway、session、quota 和成本模型 |
| MCP / auth | src/agent/mcp/server.ts、src/agent/mcp/auth.ts、src/agent/mcp/toolRegistry.ts | MCP SDK、工具契约、scope 和 audience |
| Cache / cost | src/agent/gateway/semanticCache.ts、src/agent/shared/cost.ts | cache policy、相似命中与 token 成本估算 |
| Audit / HITL | src/aml/auditTrail.ts、src/aml/hitl.ts | 审计事件、人工审批、override 和状态迁移 |
| Observability shape | src/aml/observability/attributeMap.ts、src/agent/trace/types.ts | OTel-like 属性、trace/span/event 的关系 |
| 合成业务数据 | src/aml/generator.ts、src/aml/types.ts | 安全的本地数据 fixture 与金融案例 |
3.2 重点补齐的连接
- 数据契约怎样连接到训练数据、评测集和线上输入。
- 多个 artifact 怎样共同组成一个可解释的 AI 版本。
- 模型的单机性能怎样变成队列、并发、容量和成本问题。
- Agent 的状态、工具调用、业务副作用和人工审批怎样连接。
- trace、eval、业务结果和成本怎样形成同一条观察链。
- 安全、隐私和供应链控制怎样分布在不同系统层,而不是集中在一个“安全模块”。
- 平台和 golden path 怎样帮助第二个用例复用能力。
4. Apple Silicon 本地执行与降级
规划时的只读环境审计:
- Apple Silicon
arm64,macOS 26.5.1。 - Node.js 24.19.0,pnpm 11.19.0。
- 系统 Python 3.9.6;Phase 2 可复用 Phase 1 的独立 Python 3.11+ 环境。
- 当前没有 Docker、Podman、kubectl、kind、minikube 或 uv。
这些信息到 2027 年可能变化,S01 只需做一次轻量环境确认。
4.1 三档学习方式
| 档位 | 本地条件 | 学习方式 |
|---|---|---|
| A · Node/TS 主线 | 不安装容器、不下载模型也可进行 | JSONL 数据管线、artifact manifest、离散事件 scheduler、runtime、协议、telemetry 和 human queue 小实现 |
| B · Python / Apple Silicon | Phase 1 Python 环境仍可用 | PyTorch 单机练习、CPU/Gloo 两进程演示、MPS 单设备 profiling、可选 MLX/llama.cpp |
| C · 可选外部体验 | 有明确兴趣、时间和预算 | Docker/kind、云 GPU、托管 telemetry 或远端 serving;只作选修,不影响主线 |
本地模拟是正式的学习方式,不是“低配替代品”。课程目标是理解状态、调度、版本、恢复和取舍,不是跑出生产吞吐数字。
4.2 始终保留的安全边界
- 只使用公开、合成或许可明确的数据;不使用真实客户、账户、调查或支付数据。
- 不把 simulator、两进程 CPU 或本地 MCP demo 描述成生产平台。
- 不提交模型权重、缓存、secret、真实身份信息或含敏感正文的 telemetry。
- MPS 只作为本地单设备后端;不假设其支持多机 collective。
- vLLM、NCCL、CUDA、真实多 GPU 和 Kubernetes 集群都不是必修条件。
- 安全、隐私和副作用案例默认只做无真实外部写入的模拟。
5. 轻量学习节奏
5.1 每周固定节奏
| 星期 | 学习方式 |
|---|---|
| 周一 | 概念与阅读:建立问题、术语和心智模型 |
| 周二 | 最小实现:只实现最能说明原理的一小部分 |
| 周三 | 引导练习:复用现有代码、框架或给定 fixture |
| 周四 | 案例与连接:分析真实架构问题,连接此前知识 |
| 周五 | 知识整理 / 小结:整理概念图、对比表和仍不清楚的问题 |
| 周六 | 可选探索或补学:按兴趣深入;忙碌时可以不做 |
| 周日 | 休息:不安排必修任务 |
建议每天 2~3 小时。周二的“实现”可以是几十行代码、一个小模拟、一张可计算表或一次配置练习,不要求每周建立新项目。周五只需要一份简短周小结,可直接追加到当周笔记。
5.2 每四周一次低压力复盘
W4、W8、W12 的周五进行阶段复盘,不打分、不排名,也没有“不过关”。复盘只回答:
- 我现在能用自己的话解释哪些概念?
- 哪几层已经形成连接,哪几层仍是孤立术语?
- 哪个最小实现真正帮助了理解?
- 哪些内容只需要知道存在,不需要现在深入?
- 哪些概念要加入下一阶段的复习清单?
未掌握内容只加入当周笔记末尾的复习清单;不新建评分表、补考表或第二份进度台账。
6. 90 天总览
| 周 / Day | 日期 | 核心知识 | 主要连接 |
|---|---|---|---|
| W1 · S01~S07 | 11-23~11-29 | AI Data Plane | 数据源→契约→质量→特征/评测→lineage |
| W2 · S08~S14 | 11-30~12-06 | Artifact Registry 与 MLOps / LLMOps | 实验→artifact→bundle→版本→发布 |
| W3 · S15~S21 | 12-07~12-13 | Distributed Training Systems | 内存→并行→通信→checkpoint |
| W4 · S22~S28 | 12-14~12-20 | Distributed Inference & Serving | 单机推理→队列→调度→容量;第一次阶段复盘 |
| W5 · S29~S35 | 12-21~12-27 | AI Platform Engineering & Golden Path | 共享能力→catalog→tenant→开发体验 |
| W6 · S36~S42 | 12-28~01-03 | Agent Runtime & Durable Workflow | 状态→工具→副作用→恢复→人工审批 |
| W7 · S43~S49 | 01-04~01-10 | Protocols & Enterprise Integration | MCP/API/event→版本→授权→系统边界 |
| W8 · S50~S56 | 01-11~01-17 | Observability、Cost、SLO、Capacity | trace→指标→业务结果→成本;第二次阶段复盘 |
| W9 · S57~S63 | 01-18~01-24 | Security、Privacy、AI Supply Chain | 身份→数据→artifact→tool→egress/retention |
| W10 · S64~S70 | 01-25~01-31 | EvalOps、Release Science、Rollback | offline eval→shadow→canary→release decision |
| W11 · S71~S77 | 02-01~02-07 | Human-AI Operations & Productivity | 人机分工→review queue→feedback→DevEx |
| W12 · S78~S84 | 02-08~02-14 | 可选综合学习项目 | 选择 2~4 层做连接;第三次阶段复盘 |
| S85~S90 | 02-15~02-20 | 知识整合与兴趣延伸 | 全景图→案例迁移→选修→Phase 3 准备 |
7. 十二周详细课程
W1 · AI Data Plane(S01~S07)
核心问题
- event time、processing time、late arrival、duplicate 和 schema drift 分别意味着什么?
- feature、label、eval、feedback 和审计 evidence 为什么需要不同边界?
- 如何理解 point-in-time correctness 和 training-serving skew?
建议输入
docs/AI_DATA_CONTRACTS_LINEAGE_QUALITY_PLAYBOOK.mddocs/AI_REAL_TIME_FEATURE_STORE_DECISIONING_PLAYBOOK.mddocs/ai-foundations/papers/45-data-lineage-contracts-openlineage-ai-data-quality.mdsrc/aml/generator.tssrc/aml/types.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S01 | 2026-11-23 · 周一概念与阅读 | 确认本地环境;画 source→raw→validated→feature/eval→decision 数据流 | 一张数据流草图和术语表 |
| S02 | 11-24 · 周二最小实现 | 用 Node/TS 读取一小段 JSONL,做 schema 检查和简单转换 | 一个可重复运行的小脚本 |
| S03 | 11-25 · 周三引导练习 | 用 AML generator 生成合成事件,记录 source id、时间和 schema version | 一份带 lineage 字段的示例数据 |
| S04 | 11-26 · 周四案例与连接 | 观察迟到、乱序、重复、缺失和未来字段如何改变结果 | 一张“问题→影响→处理思路”表 |
| S05 | 11-27 · 周五知识整理 | 整理 event time、point-in-time、lineage、freshness 和 skew 的关系 | W1 概念图与仍不清楚的问题 |
| S06 | 11-28 · 周六可选探索 / 补学 | 可选:比较 batch rebuild 与 event replay;或只复习最难概念 | 一条新观察即可,忙时休息 |
| S07 | 11-29 · 周日休息 | 不安排必修任务 | — |
W2 · Artifact Registry 与 MLOps / LLMOps(S08~S14)
核心问题
- experiment、artifact、registry、release bundle 各自解决什么问题?
- 为什么一个 AI 版本不只是 model version?
- data、prompt、index、tool、policy 和 eval 怎样建立 lineage?
建议输入
docs/AI_MLOPS_CONTINUOUS_DELIVERY_RELEASE_PLAYBOOK.mddocs/AI_SUPPLY_CHAIN_AI_BOM_PROVENANCE_PLAYBOOK.mdsrc/agent/platform/agentRegistry.tssrc/aml/auditTrail.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S08 | 11-30 · 周一概念与阅读 | 区分实验 run、artifact、model registry、composite bundle 和 promotion | 一张五概念对比表 |
| S09 | 12-01 · 周二最小实现 | 为三个小文件生成 hash,并写一个最小 bundle manifest | 一份可读的 JSON manifest |
| S10 | 12-02 · 周三引导练习 | 复用 agentRegistry 或 auditTrail,观察版本切换和历史记录 | 一张版本生命周期图 |
| S11 | 12-03 · 周四案例与连接 | 分析 prompt、index 或 policy 改变但模型未变时,系统版本为何仍改变 | 一个 release bundle 案例 |
| S12 | 12-04 · 周五知识整理 | 连接 reproducibility、lineage、AI BOM、promotion 和 rollback | W2 小结与关键字段清单 |
| S13 | 12-05 · 周六可选探索 / 补学 | 可选:模拟 artifact 缺失或 hash 不一致;或阅读一个 MLOps 案例 | 记录处理思路,不要求完整工具 |
| S14 | 12-06 · 周日休息 | 不安排必修任务 | — |
W3 · Distributed Training Systems(S15~S21)
核心问题
- 参数、梯度、optimizer state 和 activation 怎样占用内存?
- DP、FSDP/ZeRO、TP、PP、EP、CP 分别切分什么?
- 通信、straggler 和 checkpoint 为什么会影响训练效率?
建议输入
docs/llm/day31-grad-checkpoint-zero-fsdp.mddocs/llm/day32-5d-parallelism-megatron.mddocs/AI_MODEL_ENGINEERING_90_PLAN.mdsrc/agent/durable/checkpointMachine.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S15 | 12-07 · 周一概念与阅读 | 学习训练内存构成、collective 和常见并行轴 | 一张内存与并行概念图 |
| S16 | 12-08 · 周二最小实现 | 写一个简单表格或函数,估算参数、梯度、optimizer 和 activation 内存 | 一个小型 memory calculator |
| S17 | 12-09 · 周三引导练习 | 可行时运行两进程 CPU/Gloo 演示;否则跟随 collective 模拟示例 | 一份单进程/双进程观察记录 |
| S18 | 12-10 · 周四案例与连接 | 比较 DP/FSDP/TP/PP 在不同模型和互联条件下的选择 | 一张适用场景矩阵 |
| S19 | 12-11 · 周五知识整理 | 连接 memory、communication、throughput、checkpoint 和 failure recovery | W3 学习小结 |
| S20 | 12-12 · 周六可选探索 / 补学 | 可选:观察不同 batch 或 checkpoint 配置;或重看最难并行概念 | 一条可解释的观察即可 |
| S21 | 12-13 · 周日休息 | 不安排必修任务 | — |
W4 · Distributed Inference & Serving(S22~S28)
核心问题
- queue、scheduler、continuous batching、prefill/decode 和 cache 怎样共同影响延迟?
- TTFT、inter-token latency、throughput、tail latency 分别表示什么?
- admission、backpressure、load shedding 和公平性何时重要?
建议输入
docs/llm/day83-continuous-batching.mddocs/llm/day88-prefill-decode-disaggregation.mddocs/llm/PHASE4_LONGREAD_llm-inference-2026.mdsrc/agent/gateway/semanticCache.tssrc/agent/runtime/resilience.tssrc/agent/eval/stats.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S22 | 12-14 · 周一概念与阅读 | 画 arrival→queue→prefill→decode→response 流程,学习主要 serving 指标 | 一张请求生命周期图 |
| S23 | 12-15 · 周二最小实现 | 实现一个只有 arrival、service time 和 FIFO queue 的离散事件小模拟 | 一个最小 queue simulator |
| S24 | 12-16 · 周三引导练习 | 在给定 fixture 上比较 FIFO、priority 或 fair-share 中的两种策略 | 一张延迟/公平性观察表 |
| S25 | 12-17 · 周四案例与连接 | 分析 burst、长上下文、cache、batch 和 worker loss 对用户体验的影响 | 一个容量与降级案例 |
| S26 | 12-18 · 周五知识整理 / 阶段复盘 | 连接 W1 数据、W2 artifact、W3 training 与 W4 serving | 第一阶段全景图;不清楚内容加入复习清单 |
| S27 | 12-19 · 周六可选探索 / 补学 | 可选:为 simulator 增加 backpressure;或补学 W1~W4 任一概念 | 自选,不要求完成 |
| S28 | 12-20 · 周日休息 | 不安排必修任务 | — |
W5 · AI Platform Engineering & Golden Path(S29~S35)
核心问题
- control plane、data plane、runtime plane 和 evidence plane 怎样分工?
- service catalog、tenant、quota、golden path 分别解决什么问题?
- 平台怎样同时服务开发体验与治理?
建议输入
docs/AI_PLATFORM_SERVICE_CATALOG_GOLDEN_PATHS_PLAYBOOK.mddocs/AI_DORA_SPACE_ENGINEERING_PRODUCTIVITY_SDLC_PLAYBOOK.mddocs/AI_ENGINEERING_PRODUCTIVITY_CODE_AGENT_OPERATING_SYSTEM_PLAYBOOK.mdsrc/agent/platform/agentRegistry.tssrc/agent/platform/policyEngine.tssrc/agent/platform/tco.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S29 | 12-21 · 周一概念与阅读 | 学习 AI 平台分层、service catalog、golden path 和 platform as product | 一张平台能力地图 |
| S30 | 12-22 · 周二最小实现 | 定义一个简短 use-case manifest,包含 owner、数据、模型、工具和 SLO | 一份 manifest 示例 |
| S31 | 12-23 · 周三引导练习 | 复用 agentRegistry、policyEngine 或 tco,观察版本、策略和成本参数 | 一张组件关系图 |
| S32 | 12-24 · 周四案例与连接 | 对比手工接入与 golden path;讨论标准化、灵活性和锁定 | 一个第二用例接入案例 |
| S33 | 12-25 · 周五知识整理 | 连接平台边界、团队认知负担、DevEx、质量和安全 | W5 小结与平台产品问题清单 |
| S34 | 12-26 · 周六可选探索 / 补学 | 可选:为 manifest 加 validator;或研究一个平台服务目录 | 自选小练习 |
| S35 | 12-27 · 周日休息 | 不安排必修任务 | — |
W6 · Agent Runtime & Durable Workflow(S36~S42)
核心问题
- agent loop、workflow、state machine 和 business transaction 有什么区别?
- checkpoint、idempotency、outbox、saga 和 compensation 怎样连接?
- pause/resume、approval、timeout 和外部未知状态如何处理?
建议输入
docs/AI_DURABLE_AGENT_WORKFLOW_STATE_MACHINE_PLAYBOOK.mdsrc/agent/durable/checkpointMachine.tssrc/agent/platform/sessionRuntime.tssrc/agent/runtime/resilience.tssrc/aml/hitl.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S36 | 12-28 · 周一概念与阅读 | 画 collect→propose→approve→effect→verify/reconcile 状态机 | 一张状态图与术语表 |
| S37 | 12-29 · 周二最小实现 | 为一个小工作流增加 checkpoint 或 idempotency key | 一段最小状态处理代码 |
| S38 | 12-30 · 周三引导练习 | 跟随 checkpointMachine、sessionRuntime 和 HITL 示例,观察 pause/resume | 一份状态变化记录 |
| S39 | 12-31 · 周四案例与连接 | 分析重复消息、partial success、timeout 和人工审批案例 | 一张“状态→处理方式”表 |
| S40 | 01-01 · 周五知识整理 | 连接重放、幂等、对账、补偿、审计和人工升级 | W6 小结与一张恢复路径图 |
| S41 | 01-02 · 周六可选探索 / 补学 | 可选:模拟一次 crash/resume;或补学 exactly-once 的边界 | 自选,不要求覆盖所有边界 |
| S42 | 01-03 · 周日休息 | 不安排必修任务 | — |
W7 · Protocols & Enterprise Integration(S43~S49)
核心问题
- MCP、A2A、OpenAPI、AsyncAPI 和 CloudEvents 分别位于哪一层?
- capability discovery、schema evolution、delegated identity 和 idempotency 怎样配合?
- API、event、workflow engine 和 human queue 如何选择?
建议输入
docs/AI_AGENT_PROTOCOLS_MCP_A2A_PLAYBOOK.mddocs/AI_ENTERPRISE_INTEGRATION_EVENT_DRIVEN_AGENT_PLAYBOOK.mddocs/AI_CONTRACT_FIRST_TOOL_API_DESIGN_OPENAPI_ASYNCAPI_PLAYBOOK.mdsrc/agent/mcp/server.tssrc/agent/mcp/auth.tssrc/agent/platform/toolGateway.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S43 | 01-04 · 周一概念与阅读 | 画 Agent→tool→case/core system→event→human queue 集成图 | 一张协议与系统边界图 |
| S44 | 01-05 · 周二最小实现 | 定义一个 v1/v2 tool contract 或 event envelope | 一份小型 schema 示例 |
| S45 | 01-06 · 周三引导练习 | 运行现有 MCP server/auth 示例,观察 discovery、call、scope 和 audience | 一份调用过程记录 |
| S46 | 01-07 · 周四案例与连接 | 分析同步 API、异步 event、schema 变化、重复投递和 DLQ | 一张集成模式选择表 |
| S47 | 01-08 · 周五知识整理 | 连接 protocol、business semantics、identity、version 和 recovery | W7 小结与一个序列图 |
| S48 | 01-09 · 周六可选探索 / 补学 | 可选:做一次兼容版本变更;或阅读 A2A/MCP 最新规范摘要 | 自选观察 |
| S49 | 01-10 · 周日休息 | 不安排必修任务 | — |
W8 · Observability、Cost、SLO、Capacity(S50~S56)
核心问题
- trace、span、event、metric、log、eval 和 audit 分别回答什么问题?
- uptime、tail latency、quality、cost 和 human workload 如何形成 AI SLO?
- token cost 为什么不等于 cost per successful task?
建议输入
docs/AI_OBSERVABILITY_COST_SLO_PLAYBOOK.mddocs/AI_RUNTIME_EVIDENCE_OBSERVABILITY_ARCHITECTURE_PLAYBOOK.mddocs/AI_INCIDENT_POSTMORTEM_RELIABILITY_PLAYBOOK.mdsrc/aml/observability/attributeMap.tssrc/agent/trace/types.tssrc/agent/eval/dashboard.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S50 | 01-11 · 周一概念与阅读 | 学习 AI telemetry、correlation、SLI/SLO、error budget 和 unit cost | 一张信号分类表 |
| S51 | 01-12 · 周二最小实现 | 把几条本地事件写入 JSONL,并按 correlation id 聚合 | 一个最小 telemetry 示例 |
| S52 | 01-13 · 周三引导练习 | 将现有 trace 映射到 OTel-like 属性,计算 p50/p95 或 cost/success | 一张小型指标表 |
| S53 | 01-14 · 周四案例与连接 | 分析慢、贵、答错、工具错误和人工 backlog 在信号上的差别 | 一个 incident walkthrough |
| S54 | 01-15 · 周五知识整理 / 阶段复盘 | 连接 W5 platform、W6 runtime、W7 integration 与 W8 observability | 第二阶段全景图;薄弱内容加入复习清单 |
| S55 | 01-16 · 周六可选探索 / 补学 | 可选:添加一个 dashboard 指标;或补学 W5~W8 任一主题 | 自选,不追求完整 dashboard |
| S56 | 01-17 · 周日休息 | 不安排必修任务 | — |
W9 · Security、Privacy、AI Supply Chain(S57~S63)
核心问题
- data、model、artifact、tool、agent、human 和 provider 的 trust boundary 在哪里?
- identity、authentication、authorization、delegation、approval 和 purpose 有何不同?
- DP、TEE、FHE、tokenization 和普通访问控制各解决哪类问题?
建议输入
docs/AI_PLATFORM_SECURITY_GATEWAY_LAB.mddocs/AI_CONTEXT_SUPPLY_CHAIN_PROVENANCE_POISONING_DEFENSE_PLAYBOOK.mddocs/AI_PRIVACY_ENHANCING_TECH_CONFIDENTIAL_AI_PLAYBOOK.mddocs/AI_AGENT_IDENTITY_DELEGATED_AUTHORIZATION_PLAYBOOK.mdsrc/agent/mcp/auth.tssrc/agent/platform/policyEngine.tssrc/aml/auditTrail.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S57 | 01-18 · 周一概念与阅读 | 学习资产、攻击面、trust boundary、least privilege、purpose 和 retention | 一张简化威胁图 |
| S58 | 01-19 · 周二最小实现 | 为一个 artifact 生成 provenance/hash,或写一个最小 egress/purpose policy | 一份小型安全控制示例 |
| S59 | 01-20 · 周三引导练习 | 跟随 auth、policyEngine 和 auditTrail 示例,观察 allow/deny/escalate | 一份权限流记录 |
| S60 | 01-21 · 周四案例与连接 | 分析 prompt injection、confused deputy、artifact tamper、PII egress 和 retention | 一张 threat→control→residual risk 表 |
| S61 | 01-22 · 周五知识整理 | 连接 identity、data lifecycle、AI BOM、tool security 与 privacy technology | W9 小结与安全分层图 |
| S62 | 01-23 · 周六可选探索 / 补学 | 可选:模拟一个无真实数据的攻击案例;或研究一种 PET 的适用边界 | 一条学习结论即可 |
| S63 | 01-24 · 周日休息 | 不安排必修任务 | — |
W10 · EvalOps、Release Science、Rollback(S64~S70)
核心问题
- offline eval、shadow、canary、champion/challenger 各能回答什么?
- model、prompt、retrieval、tool 和 policy 改动怎样组合成一次 release?
- data drift、judge drift、业务 outcome lag 怎样影响发布判断?
建议输入
docs/AI_EVALOPS_PLATFORM_ARCHITECTURE_PLAYBOOK.mddocs/AI_EXPERIMENTATION_PLATFORM_RELEASE_SCIENCE_PLAYBOOK.mddocs/AI_SHADOW_MODE_COUNTERFACTUAL_EVALUATION_SILENT_LAUNCH_PLAYBOOK.mdsrc/agent/eval/gate.tssrc/agent/eval/abCompare.tsscripts/eval-gate.tsscripts/ab-compare.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S64 | 01-25 · 周一概念与阅读 | 画 offline→shadow→canary→release/rollback 生命周期 | 一张发布路径图 |
| S65 | 01-26 · 周二最小实现 | 定义一个包含 candidate、baseline、metrics 和 decision 的 release record | 一份简短 JSON/Markdown 记录 |
| S66 | 01-27 · 周三引导练习 | 运行现有 eval/AB 脚本或阅读其实现,理解版本比较 | 一份结果解释,不要求新增测试集 |
| S67 | 01-28 · 周四案例与连接 | 分析质量改善但延迟/成本变差、judge drift 或 rollback 的案例 | 一张多指标取舍表 |
| S68 | 01-29 · 周五知识整理 | 连接 eval、risk tier、release evidence、shadow、canary 和 rollback | W10 小结与发布决策问题清单 |
| S69 | 01-30 · 周六可选探索 / 补学 | 可选:模拟一次简单 champion/challenger;或研究一个 release science 案例 | 自选观察 |
| S70 | 01-31 · 周日休息 | 不安排必修任务 | — |
W11 · Human-AI Operations & Engineering Productivity(S71~S77)
核心问题
- HITL 同时包含权限、交互、容量和运营中的哪些问题?
- evidence、confidence 和 recommendation 的呈现怎样影响 automation bias?
- override、appeal、feedback 与 active learning 怎样保持可追溯?
- AI-assisted SDLC 怎样兼顾交付速度、质量、安全和开发者体验?
建议输入
docs/AI_HUMAN_AI_INTERACTION_PRODUCT_DESIGN_PLAYBOOK.mddocs/AI_HUMAN_FACTORS_OPERATIONS_COGNITIVE_LOAD_AUTOMATION_BIAS_PLAYBOOK.mddocs/AI_HUMAN_REVIEW_OPERATIONS_CAPACITY_PLAYBOOK.mddocs/AI_ACTIVE_LEARNING_HUMAN_FEEDBACK_OPERATIONS_PLAYBOOK.mddocs/AI_ENGINEERING_PRODUCTIVITY_CODE_AGENT_OPERATING_SYSTEM_PLAYBOOK.mdsrc/aml/hitl.ts
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S71 | 02-01 · 周一概念与阅读 | 学习 decision rights、review tier、queue、override、appeal、automation bias 和 DevEx | 一张人机职责图 |
| S72 | 02-02 · 周二最小实现 | 实现一个简单 reviewer queue,或为 HITL 事件增加 override/appeal 字段 | 一个小型队列/状态示例 |
| S73 | 02-03 · 周三引导练习 | 比较 evidence-first 与 recommendation-first 两种 review 流程 | 一张体验与风险观察表 |
| S74 | 02-04 · 周四案例与连接 | 分析 backlog、fatigue、冲突证据、active learning 和 code-agent review | 一个人机运营案例 |
| S75 | 02-05 · 周五知识整理 | 连接 human capacity、trust calibration、feedback provenance、DORA/SPACE 和 DevEx | W11 小结与改进问题树 |
| S76 | 02-06 · 周六可选探索 / 补学 | 可选:调整 queue capacity;或研究一个 AI-assisted SDLC 案例 | 自选,不要求用户实验 |
| S77 | 02-07 · 周日休息 | 不安排必修任务 | — |
W12 · 可选综合学习项目(S78~S84)
W12 用于把知识连接起来,不要求构建完整平台,也不是生产 readiness 项目。可以继续使用 AML Investigation Copilot,也可以选 Payment Dispute、KYC、客服知识助手或 Web3 Wallet 风险案例。
从以下三个范围任选其一:
| 范围 | 内容 | 适合情况 |
|---|---|---|
| A · 架构理解 | 问题说明、系统图、数据流、关键取舍和安全边界 | 时间有限,重点是建立全景理解 |
| B · 最小连接 | 从 data、runtime、observability、release、human 中任选 2~3 层,做一个可运行的小路径 | 希望把若干概念连接到代码 |
| C · 兴趣扩展 | 在 B 基础上再加入一个自选层或第二个案例 | 时间充足且确实感兴趣 |
没有必要同时实现九个 plane。未实现的部分只需在架构图中标出位置、职责和未来问题。
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S78 | 2027-02-08 · 周一概念与阅读 | 选择案例和 A/B/C 范围,整理用户、数据、模型、工具、人工与风险边界 | 一页项目范围说明 |
| S79 | 02-09 · 周二最小实现 | 完成最小连接,例如 data→runtime、runtime→trace 或 eval→release record | 一条小而完整的学习路径 |
| S80 | 02-10 · 周三引导练习 | 复用现有 generator、registry、runtime、MCP、trace 或 HITL 组件 | 一张“复用了什么”清单 |
| S81 | 02-11 · 周四案例与连接 | 讨论 timeout、重复消息、数据过期、权限或人工 backlog 中的两种情况 | 一张场景与处理思路表 |
| S82 | 02-12 · 周五知识整理 / 阶段复盘 | 总结 W9~W12,并回看三次阶段全景图之间的变化 | 第三阶段复盘;薄弱内容加入复习清单 |
| S83 | 02-13 · 周六可选探索 / 补学 | 可选:完善示意图、补一个小功能、写一页案例总结;也可以直接休息 | 自选,不做封存或压力演练 |
| S84 | 02-14 · 周日休息 | 不安排必修任务 | — |
8. S85~S90:知识整合、兴趣延伸与 Phase 3 准备
这六天不是考试周,也不要求隔离资料或闭卷作答。可以查阅全部笔记和代码,目标是把 12 周知识整理成长期可复用的理解。
| Day | 日期 / 节奏 | 学习内容 | 轻量产出 |
|---|---|---|---|
| S85 | 2027-02-15 · 周一知识整合 | 合并 W4、W8、W12 三张阶段图,整理数据、artifact、training、serving、runtime、integration、observability、security、release 和 human 的关系 | 一张 Phase 2 全景知识图 |
| S86 | 02-16 · 周二架构图 | 选择一个熟悉案例,画 context、container、数据流、状态流或 sequence 中最有帮助的两张图 | 两张解释性架构图 |
| S87 | 02-17 · 周三案例迁移 | 把系统工程方法迁移到 Voice Agent、Web3 Wallet Agent、AI 客服或 Embodied Operations 中的一个场景 | 一页“可迁移 / 不可迁移”分析 |
| S88 | 02-18 · 周四兴趣选修 | 从 feature store、Ray、MLflow、Kubernetes、OTel、A2A、PET、human factors 等主题中任选一个浅探 | 一份短读书卡或小练习 |
| S89 | 02-19 · 周五下一阶段准备 | 整理仍不理解的问题,并区分“系统工程问题”和“AGI/认知/智能本质问题” | Phase 3 问题树与复习清单 |
| S90 | 2027-02-20 · 周六轻量回顾 | 浏览 90 天笔记,写下最重要的 10 个联系、3 个仍想深入的方向和下一阶段节奏建议 | 一页阶段总结;不做量化考核 |
9. 学习完成的轻量标准
Phase 2 的完成不代表具备生产认证,也不意味着已经能独立运营大型 AI 平台。达到以下学习结果即可进入下一阶段:
- 能用自己的话解释十二周主要概念,并把它们放进一张全景图。
- 能说明 data、artifact、training、serving、runtime、integration、observability、security、release 和 human 之间的主要依赖。
- 完成若干真正帮助理解的最小实现;数量不作统一要求。
- 能为一个金融或 Web3 案例画出基本架构,并解释两到三个重要取舍。
- 知道 Apple Silicon 本地模拟证明了什么、没有证明什么。
- 能识别真实数据、敏感日志、外部副作用和权限设计中的基本安全边界。
- 保留一份诚实的复习清单和 Phase 3 问题树。
如果某些主题仍然模糊,直接把它们留在复习清单中,不需要延长整个阶段或重复全部课程。
10. 目录与记录规则
阶段入口和将来学习材料位置:
docs/ai-deep-mastery/
├── PHASE2_AI_SYSTEMS_ENGINEERING_90.md
└── phase-2-systems/
├── PROFESSIONAL_COURSE_REFERENCE_MAP.md
├── notes/ # S01~S90 预习教材;不代表学习完成
├── experiments/
├── reflections/
├── capstone/
└── gates/ # 仅为兼容旧结构
阶段复盘优先放入 reflections/;capstone/ 只在选择综合项目时使用。gates/ 是历史兼容目录,不再承担学习任务。
规则:
- 本文件定义计划,
notes/保存预习教材;目录与教材存在都不代表学习开始。 - Phase 2 启动前不创建 S01~S90 的完成证据、实验结果或第二份进度台账。
- 启动后仍由项目总入口指定唯一状态来源。
- 每周建议最多一篇综合笔记;小实现和案例按需要保存,不追求数量。
- 大权重、缓存、运行环境、secret、真实客户数据和未授权 telemetry 不进入 Git。
- 时间敏感的协议、工具和平台能力在相关周开始时轻量复核;旧笔记继续作为历史输入。
11. SOTA 检查(2026-08-23 更新)
- MLflow 官方文档当前同时覆盖传统 ML 与 LLM/Agent 的 tracking、tracing、evaluation 和 model lifecycle;课程先从本地最小概念和 manifest 学起,再按兴趣体验产品工具。
- PyTorch FSDP、distributed checkpoint、OpenTelemetry semantic conventions、MCP/A2A 和推理 scheduler 都是滚动演进接口;相关周开始时只需复核重要 breaking change、许可与本机支持。
- 本阶段不预设 Kubernetes、vLLM、SGLang、NCCL 或某个托管平台是唯一先进解。理解状态、排队、恢复、版本和证据之间的关系更重要。
- 资料口径来自 2026-08-23 的项目审计;阶段启动时以当时官方文档为准。