P2 · DAY 091—180 · READ / RUN / EXPLAIN
把 AI 系统知识变成可解释的机制
12 周详细讲义与离线示例,沿用已有 90 天课程。每次只改一个变量,理解数据、版本、资源、状态、权限和人的协作如何影响系统。
这是下一阶段的内容准备,不额外增加学习天数。P2 尚未启动;阅读、运行作者示例不会改动 P1 进度。网页展示讲义与源码,命令在本地终端运行。
十二周:从局部机制到系统连接
W01 · S01—S07
历史数据:当时发生,不等于当时已知
用迟到、回填与过期特征理解训练数据泄漏。
event time · available time · TTL
讲义 · 示例 · 延伸阅读W02 · S08—S14
制品版本:回滚的对象不是一个模型名
用内容指纹和发布指针连接模型、Prompt、数据与策略。
artifact · fingerprint · bundle
讲义 · 示例 · 延伸阅读W03 · S15—S21
分布式训练:先算内存,再谈并行
拆解混合精度状态与 ZeRO 分片,估算通信下界。
DDP · ZeRO · collective
讲义 · 示例 · 延伸阅读W04 · S22—S28
推理服务:吞吐、等待与长尾的交换
比较逐请求与固定窗口批处理,逐条追踪等待时间。
queue · batching · p95
讲义 · 示例 · 延伸阅读W05 · S29—S35
平台工程:声明需求与协调实际状态
用服务目录、租户配额和协调计划理解控制平面。
catalog · reconcile · quota
讲义 · 示例 · 延伸阅读W06 · S36—S42
Agent 恢复:请求重试不等于副作用重做
模拟副作用成功后丢失确认,观察接收方幂等去重。
checkpoint · retry · idempotency
讲义 · 示例 · 延伸阅读W07 · S43—S49
协议集成:JSON 相同,含义未必相同
把两个版本的金额契约转换为明确的内部语义。
schema · units · adapter
讲义 · 示例 · 延伸阅读W08 · S50—S56
系统观测:一次成功任务到底花了什么
从合成 trace 计算端到端延迟、成功成本与服务目标。
trace · SLI · unit cost
讲义 · 示例 · 延伸阅读W09 · S57—S63
安全边界:模型建议不携带权限
在可信执行层检查租户、scope、目的地和敏感字段。
identity · authorization · egress
讲义 · 示例 · 延伸阅读W10 · S64—S70
发布判断:平均提升掩盖了什么
对齐样本 ID,比较总体和子群,辨认丢失的困难案例。
paired data · slices · uncertainty
讲义 · 示例 · 延伸阅读W11 · S71—S77
人机协作:有人复核,也可能无人及时处理
用确定性队列观察复核人数、等待和反馈标签的边界。
review capacity · waiting · feedback
讲义 · 示例 · 延伸阅读W12 · S78—S84
综合连接:一条可解释的本地学习链路
连接历史特征、版本指纹、动作授权与重试去重。
data → bundle → policy → effect
讲义 · 示例 · 延伸阅读学习安排与 S85~S90 整合
更新:2026-09-12
定位:第 91~180 天原计划的实践配套,不追加 90 天、不替换已有 S01~S90 教材
状态:讲义与作者示例已准备;P2 尚未启动;生成内容与运行示例不等于学习者掌握
方式:详细理解 + 小步修改 + 可选延伸;不设考试、分数、周 Gate 或必交作业
1. 这一阶段具体补什么
学习重心已按用户要求聚焦为系统设计 + AI 开发。 先从 Harness 主线 的 H01~H04 进入;本页 12 周机制用于补充对应知识。两者共享同一段 P2 时间,不要求把两套内容全量并行执行。
P1 主要回答“模型如何工作”,P2 转向“模型与数据、状态、权限、资源、人的协作如何共同决定系统行为”。已有 90 篇日课负责展开概念;本学习包补上跨日的机制练习,帮助你从阅读进入可解释、可修改的实现。
学习重点不是把更多工具装进电脑,而是形成六种能力:辨认时间与数据语义、复现系统版本、做资源数量级估算、分析失败后的状态、划清可信边界、用观察结果修正判断。这些能力也会进入后续 AGI 研究实验和具身系统,但不会自动等同于通用智能或真机控制能力。
网页入口:P2 机制实验室。每周页面连接对应 7 篇日课、讲义、运行命令与真实源码;无需在页面中填写 API Key。页面提供阅读,不在浏览器内执行 Node 脚本。
2. 如何开始:保留原日程,选择自己的深度
每天可以只用 45~90 分钟:20~30 分钟读当前日课,15~30 分钟看本周实验的一部分,10~20 分钟改一个变量,最后用几句话说明变化。时间充裕时再按原计划扩展到 2~3 小时。不要求一天完成整篇长讲义。
- 理解档:读原理和预期输出,手算一个例子,不运行也可以。
- 动手档:运行一个实验,只改输入、参数或一处规则,解释前后差异。
- 深入档:只在有兴趣时查官方实现、增加一个失败场景或接入已有代码;不要求部署完整平台。
每周前两天建立术语,第三、四天运行与修改,第五天联系已有系统,第六天任选一个延伸问题,第七天休息或轻复述。这只是使用建议,不是新增排期约束。
3. 12 周路线与能力连接
| 周 / 日课 / 总日 | 机制讲义 | 本周值得形成的理解 | 向后连接 |
|---|---|---|---|
| W1 · S01~07 · 091~097 | 历史可见特征 | 事件发生、数据到达、纠正版本和过期不是同一件事 | 研究数据泄漏、机器人迟到观测 |
| W2 · S08~14 · 098~104 | 完整发布指纹 | 行为变化需要追踪整组依赖,不能只盯权重 | 可复现研究、策略版本与环境版本 |
| W3 · S15~21 · 105~111 | 训练内存账本 | 分片省下什么,通信又付出什么 | 大模型扩展与硬件约束 |
| W4 · S22~28 · 112~118 | 排队与批处理 | 服务速度、等待、吞吐和长尾需要同时看 | 在线推理预算、实时闭环 |
| W5 · S29~35 · 119~125 | 平台协调循环 | 声明、计划、执行和实际状态各有责任 | 多任务实验平台、机器人 fleet 管理 |
| W6 · S36~42 · 126~132 | 丢失确认后的重试 | 可恢复状态不自动保证副作用只发生一次 | 长任务 Agent、动作确认 |
| W7 · S43~49 · 133~139 | 契约版本与单位 | 兼容性必须覆盖含义、版本和重放 | 工具协议、坐标与单位边界 |
| W8 · S50~56 · 140~146 | Trace 与成功成本 | 相关联的证据比孤立指标更能解释系统 | 实验归因、在线诊断 |
| W9 · S57~63 · 147~153 | 执行授权边界 | 模型输出不能自授权限,允许字段也可能含敏感内容 | Agent 控制与物理安全边界 |
| W10 · S64~70 · 154~160 | 配对与子群比较 | 总体提升可能伴随困难样本退步 | 能力泛化与研究比较 |
| W11 · S71~77 · 161~167 | 人工复核容量 | 人的参与需要时间、权力和反馈来源 | 人机协同、接管与纠错 |
| W12 · S78~84 · 168~174 | 本地链路整合 | 从局部函数走到因果链,同时诚实列出未实现项 | 进入 P3 的研究问题 |
4. 本地运行与目录
在仓库根目录运行。沿用项目现有 Node.js 与已锁定的 tsx 依赖,本次作者验证使用 Node 24.19.0;其他版本未在本次验证。若依赖尚未安装,先按仓库 README 安装,不需要额外 Python 环境、GPU、Docker、模型下载或云账号。
npm run learning:p2 -- list
npm run learning:p2 -- w01
npm run learning:p2 -- w06
npm run learning:p2 -- w12
all 可以一次运行 12 个作者示例,但不是学习进度命令,也不是达标测试。所有输入都是合成数据;程序只向终端输出结果,不写进度、不保存客户资料、不调用网络、不进行链上操作。每次执行从相同初始状态开始。
docs/ai-deep-mastery/phase-2-systems/
notes/ 原有 90 篇日课
experiments/STUDY_GUIDE.md 本路线
experiments/w01-*.md … w12-*.md 12 份讲义
src/learning/ai-systems/
catalog.ts 周次、标题与页面唯一映射
w01-*.ts … w12-*.ts 可独立阅读的实现
scripts/ai-systems-lab.ts 命令行入口
app/learn/ai-systems-engineering/labs/
page.tsx 实验索引与学习指南
[slug]/page.tsx 讲义、日课、命令与源码
若出现 Cannot find package 'tsx',先确认终端在仓库根目录且依赖已安装。看到 Usage 则检查周次格式,应为 w01 而不是 s01。无需为运行这些示例升级整套系统或购买算力。
5. S85~S90:整合与 P3 桥接
| 日课 | 只做一件轻量的事 | 可带入 P3 的问题 |
|---|---|---|
| S85 / Day175 | 从 12 个机制挑 4 个,用箭头连起输入、状态、输出 | 能力是模型独有,还是系统共同产生? |
| S86 / Day176 | 选一次失败,解释故障在哪一层、恢复依赖什么 | 失败来自知识、规划、记忆还是工具执行? |
| S87 / Day177 | 把草稿案例换成文档助手或仿真机器人,不接真机 | 跨任务迁移时,哪些假设已经失效? |
| S88 / Day178 | 任选一个官方材料片段深入,不开启第二门完整课程 | 哪一个问题值得做更小、更清楚的实验? |
| S89 / Day179 | 把未知分成“系统能修复”与“需要研究能力机制”两栏 | 观测改善和模型能力改善怎样区分? |
| S90 / Day180 | 写三个兴趣方向和下一阶段的合理节奏 | 下一步优先研究泛化、规划、学习效率还是世界模型? |
这些是阅读与思考建议,不要求全部完成。P3 的 G01~G90 教材已存在,不在本次重写,也不把 P2 toy 实验当作 AGI 证据。
6. 参考课程怎么用
本路线参考 Stanford CS329S 的系统设计范围、FSDL 2022 的实验管理、部署和持续学习内容、Stanford CS336 2025 的系统方向与 MIT 6.5840 的故障、状态和一致性主题。这是作者自编的配套学习包,不是这些课程的官方作业或等效学分。
每周讲义另给主题对应的官方文档。只选能回答当前问题的一节;滚动文档在真正接入 SDK 前重新核对版本。专业材料的意义在于概念准确、边界清晰,不在于复制课程工作量。
7. 记什么,不记什么
学习记录可以只有三句话:“我原先认为……;改动……后观察到……;这还不能说明……”。没有运行就写推测,运行后再写观察。已有 P1 唯一账本保持不变,P2 尚未启动时不新建学习进度账本。本目录的预期输出是作者示例说明,不是你的实验结果。