AI Deep Mastery 360:AI 工程、AGI 研究与具身智能长期主线
AI Model Engineering 90 解决的是第一层断层:模型如何从数据、目标和优化中学习,以及怎样训练、适配和推理。但 AI 时代真正完整的工程与研究能力还包括三层:
AI Deep Mastery 360:AI 工程、AGI 研究与具身智能长期主线
定位:当前正式执行的四阶段长期学习路线;学习优先,不含求职、投递或作品集包装
路线长度:4 个连续 90 天阶段,共 360 个阶段日;阶段之间各保留 1 个过渡休息日
执行日历:2026-08-24 ~ 2027-08-21,共 363 个自然日(360 个阶段日 + 3 个过渡休息日)
当前阶段:P1 · AI Model Engineering 90,2026-08-24 启动,当前任务 M01
启动记录:用户于 2026-08-23 决定直接启动 360;AISA 保留为暂停的历史学习资产,不与 P1 并行
执行原则:同一时间只执行一个阶段;以理解、连接和实践为主,不设置周周考试,不用分数驱动学习
认识论边界:本路线研究 AGI 相关能力,不预测 AGI 到达时间,也不把单项 benchmark、语言流畅度或仿真成功称为 AGI
1. 为什么从 90 天扩展为 360 天
AI Model Engineering 90 解决的是第一层断层:模型如何从数据、目标和优化中学习,以及怎样训练、适配和推理。但 AI 时代真正完整的工程与研究能力还包括三层:
模型会不会学
↓
系统能不能稳定、低成本、可追踪地运行
↓
智能体能不能跨任务规划、积累知识、适应新问题
↓
能力能不能进入带噪声、时延、动力学和安全约束的物理世界
把四层压进同一个 90 天计划会导致每个主题都只停留在阅读。360 天路线保留季度节奏:每 90 天整理一次知识地图、回顾实践和兴趣变化,再决定直接进入下一阶段、补充薄弱主题或调整选修内容。
2. 四阶段总路线
| 阶段 | 名义日期 | 核心问题 | 主要能力 | 可选综合项目 |
|---|---|---|---|---|
| P1 · AI Model Engineering 90 | 2026-08-24 ~ 2026-11-21 | 模型为什么会学习,怎样改变与测量模型 | 梯度、Transformer、预训练、LoRA、preference、推理、可解释性、多模态、非 LLM 模型 | Financial Model Lab |
| 过渡日 | 2026-11-22 | 休息与 P1 学习回顾 | 浏览知识地图与仍有兴趣的问题,不新增学习 | 继续 / 补充 / 调整 |
| P2 · AI Systems Engineering 90 | 2026-11-23 ~ 2027-02-20 | 怎样把模型变成可复现、可发布、可观察、可恢复的系统 | 数据与制品、分布式训练、Serving、平台、Agent runtime、EvalOps、SRE、安全与 Human-AI | Local AI Systems Platform |
| 过渡日 | 2027-02-21 | 休息与 P3 兴趣选择 | 从系统学习中选择一个最想理解的智能问题 | 继续 / 补充 / 调整 |
| P3 · AGI Foundations 90 | 2027-02-22 ~ 2027-05-22 | 怎样严谨研究泛化、规划、记忆、适应和自我改进 | 能力测量、scaling、推理搜索、RL、world model、continual learning、多智能体、AI scientist、alignment | General Learning Agent Lab |
| 过渡日 | 2027-05-23 | 休息与具身方向准备 | 选择导航、操作或空间感知主线,并确认只做安全仿真 | 继续 / 补充 / 调整 |
| P4 · Embodied Intelligence 90 | 2027-05-24 ~ 2027-08-21 | 智能如何在感知、动力学、控制和安全约束中行动 | 几何、状态估计、控制、SLAM、感知、模仿/RL、world model、操作、VLA、sim-to-real、HRI | Embodied Simulation Study |
完整入口:
- P1:
docs/AI_MODEL_ENGINEERING_90_PLAN.md - P2:
docs/ai-deep-mastery/PHASE2_AI_SYSTEMS_ENGINEERING_90.md - P2 教材与课程地图:
docs/ai-deep-mastery/phase-2-systems/notes/、docs/ai-deep-mastery/phase-2-systems/PROFESSIONAL_COURSE_REFERENCE_MAP.md(教材已备,阶段未启动) - P3:
docs/ai-deep-mastery/PHASE3_AGI_FOUNDATIONS_90.md - P3 教材与课程地图:
docs/ai-deep-mastery/phase-3-agi/notes/、docs/ai-deep-mastery/phase-3-agi/PROFESSIONAL_COURSE_REFERENCE_MAP.md(教材已备,阶段未启动) - P4:
docs/ai-deep-mastery/PHASE4_EMBODIED_INTELLIGENCE_90.md - P4 教材与课程地图:
docs/ai-deep-mastery/phase-4-embodied/notes/、docs/ai-deep-mastery/phase-4-embodied/PROFESSIONAL_COURSE_REFERENCE_MAP.md(教材已备,阶段未启动)
日期用于当前执行安排。任何阶段延长,后续日期整体顺延,不并行补课。P1 的唯一进度账本为 docs/daily/AI_MODEL_ENGINEERING_PROGRESS.md。
3. AI 时代需要补齐的工程能力
这条路线不是“再学几个框架”,而是建立九层工程能力栈:
| 能力层 | 重点学习什么 | 轻量学习方式 | 主要阶段 |
|---|---|---|---|
| 数学与优化 | 概率、线代、梯度、优化、信息论、几何、控制 | 手推、数值检查、反例 | P1 / P3 / P4 |
| 软件工程 | 模块边界、类型、基本测试、并发、API、包与依赖、性能分析 | 阅读代码、最小实现、简单 profile | 全阶段 |
| 数据工程 | schema、quality、lineage、version、split、label、feedback、privacy | 小数据管线、案例追踪、概念图 | P1 / P2 |
| 模型工程 | 训练、微调、后训练、压缩、校准、推理与选择 | tiny baseline、少量对照、结果解释 | P1 |
| 分布式与平台 | 进程/网络/存储、checkpoint、调度、registry、gateway、serving | 本地演示、架构图、容量直觉 | P2 |
| Agent 与协议 | 状态机、durable execution、memory、tools、MCP/A2A、权限 | 小工作流、trace 阅读、场景推演 | P2 / P3 |
| 科学研究 | 可证伪问题、effect size、复现意识、负结果 | 论文对照、小实验、研究日志 | 全阶段 |
| 安全与人因 | threat model、隐私、控制、HITL、automation bias、可访问性 | 典型案例、安全边界和必要检查 | P2 / P3 / P4 |
| 物理智能 | 坐标系、估计、规划、动力学、控制、接触与安全停机 | 仿真轨迹、扰动、约束与恢复 | P4 |
不可被工具替代的底层能力
- 问题分解:把“做一个智能体”拆成状态、动作、观测、目标、约束和评测。
- 因果调试:从数据、目标、优化、系统、交互五层定位失败,而不是只换模型。
- 实验判断:能接受“更大的模型没有增益”“多 Agent 更差”“VLA 不如模块化管线”。
- 系统取舍:同时考虑质量、延迟、吞吐、成本、隐私、恢复和维护复杂度。
- 跨域迁移:说明语言、金融决策、软件 Agent 与机器人控制之间哪些结构相同、哪些完全不同。
4. 四阶段的深度递进
P1:AI Model Engineering
建议形成的能力:
- 从张量、目标函数和梯度解释模型怎样学习。
- 从零实现 attention 或等价核心机制,并能解释关键步骤。
- 训练一个 tiny model,体验 LoRA 与 preference 学习的基本流程。
- 观察量化、KV cache、延迟、吞吐和内存之间的关系。
- 用非 LLM baseline 与简单对照理解“最小充分模型”。
详细路线与 M01~M90 课程已在现有 P1 文件中落地,本总纲不复制第二份课程。
P2:AI Systems Engineering
从“单次实验可运行”推进到“系统生命周期可重复”:
data contract → pipeline → run/artifact → registry → release flow
→ serving/gateway → trace/metric/log → incident/recovery
核心工程深度:
- 训练与服务数据一致性、point-in-time correctness、lineage 和回放。
- 单机多进程理解 DDP/FSDP/ZeRO 的通信、内存和 checkpoint 取舍;本机不伪造多 GPU 吞吐。
- 本地模型服务器的 queue、continuous batching、cache、backpressure 和 overload。
- 模型/提示/adapter/eval/data 一起版本化,而不是只登记一个权重文件。
- Agent durable execution、幂等、重试、补偿、状态恢复、工具权限和协议兼容。
- shadow/canary/ramp/rollback、质量回归、SLO、成本和事故证据。
P3:AGI Foundations & Research Systems
把“AGI”拆成可测量能力,而不是一个二元标签:
breadth / generality
performance / robustness
learning efficiency
memory / continual adaptation
planning / tool use
autonomy / risk
核心研究深度:
- 区分 benchmark performance、任务广度、样本效率、自主性和真实泛化。
- 研究 scaling law 适用边界及“涌现”是否来自度量离散化。
- 比较直接生成、search、verifier、RL 和 model-based planning。
- 实现小型 world model,在未知动力学环境中比较 model-free/model-based。
- 测量 continual learning 的遗忘、迁移、稳定—可塑性,而不是只看最终平均分。
- 构造小型 evaluator-bounded 改进循环,理解 reward hacking、数据污染和错误放大。
- 研究 multi-agent 协作何时提高覆盖,何时只增加 token、延迟和协调失败。
- 用 capability profile 和安全案例报告结果,绝不宣布“做出了 AGI”。
P4:Embodied Intelligence
把智能置于部分可观测、连续时间、有接触和不可逆后果的环境:
sensor → state estimation → world representation → planning / policy
→ control → actuator / environment → new sensor evidence
核心工程深度:
- SE(2)/SE(3)、坐标变换、Jacobian、运动学、动力学和约束。
- Kalman/particle filter、传感器噪声、延迟、漂移与状态不确定性。
- PID/LQR/MPC、轨迹优化、碰撞约束和安全停机。
- 视觉/深度/点云、定位建图、导航和操作的误差传播。
- behavior cloning、DAgger、offline RL、world-model control 的数据与分布偏移。
- VLA 的语言接地、动作 token、跨 embodiment 数据和长时序失败。
- simulation fidelity、domain randomization、sim-to-real gap 与真机安全边界。
- Human-Robot Interaction、可撤销性、最小伤害状态和人工接管。
5. 统一学习节奏与轻量复盘
每阶段沿用 12 周主题学习 + 6 天知识整合尾段。日程提供方向,不要求每天都形成正式产物:
建议主学习日每天 2~3 小时;周六投入 0~2 小时,周日不安排任务。忙碌周只保留核心阅读、一个最小练习和周五小结即可,不需要追赶形式进度。
| 组成 | 每个 90 天阶段 | 四阶段合计 |
|---|---|---|
| 周一~周五主题学习 | 60 天 | 240 天 |
| 周六可选探索 / 补学 | 12 天 | 48 天 |
| 周日休息 | 12 天 | 48 天 |
| 阶段末知识整合 | 6 天 | 24 天 |
| 阶段日合计 | 90 天 | 360 天 |
因此主线实际安排 264 个核心学习/整合日;48 个周六可选,48 个周日休息。再加三个阶段间过渡休息日,名义日历共 363 个自然日。
| 日程 | 固定职责 |
|---|---|
| 周一 | 建立概念图,阅读一份核心材料 |
| 周二 | 从零实现一个最小机制;复杂主题可改成手算或伪代码 |
| 周三 | 跟随框架做一个引导练习,理解真实接口 |
| 周四 | 阅读案例、失败或争议,把知识连接到系统场景 |
| 周五 | 用一页笔记整理“我理解了什么、还不清楚什么” |
| 周六 | 可选探索、补学或休息;不强制产出 |
| 周日 | 休息 |
每四周一次低压力复盘
W4、W8、W12 各做一次 60~90 分钟复盘,不评分,也不设置“不过关”:
- 画出最近四周的知识关系图。
- 选一个最有价值的最小实现或案例,说明它帮助理解了什么。
- 列出三个仍不清楚的问题,加入后续复习清单。
- 决定下一阶段哪些内容继续深入、哪些只保留概览。
必要的技术检查只服务于理解,例如确认梯度方向、坐标系或数据泄漏;不把大量测试、封存材料和考试分数作为学习目标。需要诚实区分本地演示、仿真和真实系统,但不要求为每个主题制作完整证据包。
6. 四个可选综合学习项目
综合项目用于串联知识,不是强制大作业。每阶段可按时间和兴趣只做一个缩小版本,也可以用架构图、讲解稿或 notebook 代替完整系统。
C1 · Financial Model Lab
规则、经典 ML、小模型与可选 LLM 在同一金融任务上公平比较,回答“什么是最小充分模型”。
C2 · Local AI Systems Platform
从以下内容中选择 3~4 项,建立一条能帮助理解的本地 AI 生命周期:
- versioned dataset + data contract;
- repeatable training pipeline + local experiment tracking;
- model/adapter/prompt/eval bundle registry;
- local serving gateway + bounded Agent workflow;
- offline eval + shadow fixture + release/rollback;
- trace/metric/log + cost/SLO + incident replay。
学习重点是理解数据、制品、运行、观测和发布之间如何连接,不要求实现生产级平台。
C3 · General Learning Agent Lab
从下列方向中选择 2~3 项,在小型环境中比较:
- reactive baseline;
- search/planning;
- memory;
- model-free RL;
- learned world model;
- continual adaptation;
- evaluator-bounded self-improvement。
可以观察 generalization、sample efficiency、forgetting、compute 和失败类型,最终产物是一张 capability map 或学习报告,不是“AGI demo”。
C4 · Embodied Simulation Study
从导航、操作或空间感知中选择一个仿真主题,理解模块化方法与学习策略:
- 带噪声传感器与状态估计;
- 路径/动作规划和低层控制;
- behavior cloning 或小型 RL/world-model policy;
- 语言或视觉目标接地;
- 扰动、遮挡、延迟、失败恢复和人工接管;
- 换一个布局、物体或任务条件,观察方法如何变化。
项目可以只做到概念演示或 sim-to-sim。没有独立硬件与安全评审时,结论只限仿真,禁止外推为真机能力。
7. 算力、仿真与硬件降级
| 档位 | 资源 | 允许完成什么 | 禁止声称什么 |
|---|---|---|---|
| A · CPU / 纯本地 | NumPy、PyTorch CPU、小环境、录制 fixture | 数学实现、tiny model、本地多进程、gridworld、2D 控制、离线轨迹 | 多 GPU scaling、真实 serving 容量、真机泛化 |
| B · Apple Silicon | MPS/MLX、MuJoCo、可行的 LeRobot 数据/策略 | 小模型训练、MPS 推理、仿真控制、模仿学习、小型 VLA 组件 | CUDA kernel 结论、Isaac Lab GPU 吞吐、真实机器人安全 |
| C · 可选远程资源 | 短时 GPU、Linux/ROS 2、Isaac Lab 或真实硬件 | 只有本地无法回答的受控验证 | 无预算长训、无人监督真机动作、把单次成功外推 |
默认始终选择最低可回答问题的档位。P4 不要求购买机器人;若未来希望进入真实硬件,应另立独立安全计划,本路线不作要求。
8. 官方与原始研究锚点
这些来源只定义研究和工程锚点。具体库、模型和 benchmark 在每阶段 Day 0 重新检查版本、许可、硬件和维护状态,不提前锁死一年后的选型。
SOTA检查(2026-08-23 更新)
- P2:MLflow 当前文档已覆盖传统 ML 以及 LLM/Agent 的 tracking、tracing 与 evaluation,但课程不会把单一平台 API 当作 MLOps 原理;P2 启动日重新比较 MLflow、原生本地 store 和当时仍维护的替代品。
- P3:AGI 仍没有可由单一 benchmark 判定的统一工程终点;
Levels of AGI继续作为能力分解框架,而不是“最新模型排行榜”。Scaling、world model、test-time search 和 AI Scientist 均按可证伪实验研究。 - P4:前沿已从 RT-2 / Open X-Embodiment 推进到 2026 年 Gemini Robotics-ER 1.6 与 Gemini Robotics 2 的空间推理、whole-body 和协作主张;开放本地主线则以 LeRobot v0.4+、SmolVLA、MuJoCo 和小型经典/学习混合实验为主。厂商真机演示只算外部证据,不能充当本阶段结果。
- 复核规则:P2/P3/P4 分别在 S01/G01/E01 重查最近 12 个月原始论文、官方 release、许可和硬件支持,并在当周记录“继续采用 / 替换 / 降级”的理由。
9. 360 天之后的延伸池
以下内容范围重要,但不与四阶段并行。完成 P4 学习回顾后,可按兴趣从中选择一条:
| 延伸方向 | 先决条件 | 可研究问题 |
|---|---|---|
| AI for Science / 自动化发现 | evaluator 与因果实验能力成熟 | 形式验证、材料、药物、算法发现怎样避免自证循环 |
| Spatial Intelligence / Digital Twin | 已学 P4 状态估计与 world model | 3D 场景、预测仿真和现实校准怎样闭环 |
| Edge / On-device AI | 已学 P1 推理与 P2 平台基础 | 蒸馏、量化、能耗、隐私和离线可靠性 |
| Neuro-symbolic / Formal AI | 已了解 search、solver 和 verifier | 神经模型如何与约束、证明、规划器协作 |
| Privacy-preserving Learning | 已学数据与分布式系统基础 | 联邦学习、差分隐私、安全聚合与效用边界 |
| Computational Neuroscience | 已了解 P3 continual learning / world model | 记忆、注意、预测编码与人工系统的可检验对应 |
| Collective / Multi-agent Intelligence | 已学 P3 社会智能主题 | 协作、通信、制度、激励、涌现与系统性风险 |
| Autonomous Labs / Robotics for Science | 已学 P4 安全与 HRI 基础 | 机器人实验、闭环测量、科学证据和人类监督 |
10. 最终学习回顾
走完四个 90 天阶段不等于掌握所有 AI。理想情况下,这条路线帮助形成以下能力:
- 从数据与梯度解释模型学习,从系统状态解释运行失败,从物理状态解释控制失败。
- 在规则、优化、传统 ML、小模型、LLM、Agent 和机器人策略之间选择最小充分方法。
- 解释可复现、可观测、可恢复、可回滚的 AI 系统由哪些部分组成,并实现其中若干关键环节。
- 用未知任务族测量泛化、记忆、规划、适应和自我改进,而不是只看单一排行榜。
- 在仿真中理解感知—估计—规划—控制—恢复闭环,并准确限制结论边界。
- 对 AGI 与具身智能保持研究开放,同时不夸大能力或把仿真当真机。
- 生成下一轮兴趣与问题清单,明确继续深挖、暂缓或转向的理由。
阶段不以分数或 Gate 判定。若某些主题仍模糊,把它们加入复习清单即可,不必阻断整条路线;真正重要的是知识关系逐渐清楚、能做基本实践,并保持继续学习的兴趣。