返回 Papers
学习计划 Roadmap

AI Deep Mastery 360:AI 工程、AGI 研究与具身智能长期主线

AI Model Engineering 90 解决的是第一层断层:模型如何从数据、目标和优化中学习,以及怎样训练、适配和推理。但 AI 时代真正完整的工程与研究能力还包括三层:

323AI_DEEP_MASTERY_360_PLAN.md

AI Deep Mastery 360:AI 工程、AGI 研究与具身智能长期主线

定位:当前正式执行的四阶段长期学习路线;学习优先,不含求职、投递或作品集包装
路线长度:4 个连续 90 天阶段,共 360 个阶段日;阶段之间各保留 1 个过渡休息日
执行日历:2026-08-24 ~ 2027-08-21,共 363 个自然日(360 个阶段日 + 3 个过渡休息日)
当前阶段:P1 · AI Model Engineering 90,2026-08-24 启动,当前任务 M01
启动记录:用户于 2026-08-23 决定直接启动 360;AISA 保留为暂停的历史学习资产,不与 P1 并行
执行原则:同一时间只执行一个阶段;以理解、连接和实践为主,不设置周周考试,不用分数驱动学习
认识论边界:本路线研究 AGI 相关能力,不预测 AGI 到达时间,也不把单项 benchmark、语言流畅度或仿真成功称为 AGI


1. 为什么从 90 天扩展为 360 天

AI Model Engineering 90 解决的是第一层断层:模型如何从数据、目标和优化中学习,以及怎样训练、适配和推理。但 AI 时代真正完整的工程与研究能力还包括三层:

模型会不会学
    ↓
系统能不能稳定、低成本、可追踪地运行
    ↓
智能体能不能跨任务规划、积累知识、适应新问题
    ↓
能力能不能进入带噪声、时延、动力学和安全约束的物理世界

把四层压进同一个 90 天计划会导致每个主题都只停留在阅读。360 天路线保留季度节奏:每 90 天整理一次知识地图、回顾实践和兴趣变化,再决定直接进入下一阶段、补充薄弱主题或调整选修内容。


2. 四阶段总路线

阶段名义日期核心问题主要能力可选综合项目
P1 · AI Model Engineering 902026-08-24 ~ 2026-11-21模型为什么会学习,怎样改变与测量模型梯度、Transformer、预训练、LoRA、preference、推理、可解释性、多模态、非 LLM 模型Financial Model Lab
过渡日2026-11-22休息与 P1 学习回顾浏览知识地图与仍有兴趣的问题,不新增学习继续 / 补充 / 调整
P2 · AI Systems Engineering 902026-11-23 ~ 2027-02-20怎样把模型变成可复现、可发布、可观察、可恢复的系统数据与制品、分布式训练、Serving、平台、Agent runtime、EvalOps、SRE、安全与 Human-AILocal AI Systems Platform
过渡日2027-02-21休息与 P3 兴趣选择从系统学习中选择一个最想理解的智能问题继续 / 补充 / 调整
P3 · AGI Foundations 902027-02-22 ~ 2027-05-22怎样严谨研究泛化、规划、记忆、适应和自我改进能力测量、scaling、推理搜索、RL、world model、continual learning、多智能体、AI scientist、alignmentGeneral Learning Agent Lab
过渡日2027-05-23休息与具身方向准备选择导航、操作或空间感知主线,并确认只做安全仿真继续 / 补充 / 调整
P4 · Embodied Intelligence 902027-05-24 ~ 2027-08-21智能如何在感知、动力学、控制和安全约束中行动几何、状态估计、控制、SLAM、感知、模仿/RL、world model、操作、VLA、sim-to-real、HRIEmbodied Simulation Study

完整入口:

  • P1:docs/AI_MODEL_ENGINEERING_90_PLAN.md
  • P2:docs/ai-deep-mastery/PHASE2_AI_SYSTEMS_ENGINEERING_90.md
  • P2 教材与课程地图:docs/ai-deep-mastery/phase-2-systems/notes/docs/ai-deep-mastery/phase-2-systems/PROFESSIONAL_COURSE_REFERENCE_MAP.md(教材已备,阶段未启动)
  • P3:docs/ai-deep-mastery/PHASE3_AGI_FOUNDATIONS_90.md
  • P3 教材与课程地图:docs/ai-deep-mastery/phase-3-agi/notes/docs/ai-deep-mastery/phase-3-agi/PROFESSIONAL_COURSE_REFERENCE_MAP.md(教材已备,阶段未启动)
  • P4:docs/ai-deep-mastery/PHASE4_EMBODIED_INTELLIGENCE_90.md
  • P4 教材与课程地图:docs/ai-deep-mastery/phase-4-embodied/notes/docs/ai-deep-mastery/phase-4-embodied/PROFESSIONAL_COURSE_REFERENCE_MAP.md(教材已备,阶段未启动)

日期用于当前执行安排。任何阶段延长,后续日期整体顺延,不并行补课。P1 的唯一进度账本为 docs/daily/AI_MODEL_ENGINEERING_PROGRESS.md


3. AI 时代需要补齐的工程能力

这条路线不是“再学几个框架”,而是建立九层工程能力栈:

能力层重点学习什么轻量学习方式主要阶段
数学与优化概率、线代、梯度、优化、信息论、几何、控制手推、数值检查、反例P1 / P3 / P4
软件工程模块边界、类型、基本测试、并发、API、包与依赖、性能分析阅读代码、最小实现、简单 profile全阶段
数据工程schema、quality、lineage、version、split、label、feedback、privacy小数据管线、案例追踪、概念图P1 / P2
模型工程训练、微调、后训练、压缩、校准、推理与选择tiny baseline、少量对照、结果解释P1
分布式与平台进程/网络/存储、checkpoint、调度、registry、gateway、serving本地演示、架构图、容量直觉P2
Agent 与协议状态机、durable execution、memory、tools、MCP/A2A、权限小工作流、trace 阅读、场景推演P2 / P3
科学研究可证伪问题、effect size、复现意识、负结果论文对照、小实验、研究日志全阶段
安全与人因threat model、隐私、控制、HITL、automation bias、可访问性典型案例、安全边界和必要检查P2 / P3 / P4
物理智能坐标系、估计、规划、动力学、控制、接触与安全停机仿真轨迹、扰动、约束与恢复P4

不可被工具替代的底层能力

  1. 问题分解:把“做一个智能体”拆成状态、动作、观测、目标、约束和评测。
  2. 因果调试:从数据、目标、优化、系统、交互五层定位失败,而不是只换模型。
  3. 实验判断:能接受“更大的模型没有增益”“多 Agent 更差”“VLA 不如模块化管线”。
  4. 系统取舍:同时考虑质量、延迟、吞吐、成本、隐私、恢复和维护复杂度。
  5. 跨域迁移:说明语言、金融决策、软件 Agent 与机器人控制之间哪些结构相同、哪些完全不同。

4. 四阶段的深度递进

P1:AI Model Engineering

建议形成的能力:

  • 从张量、目标函数和梯度解释模型怎样学习。
  • 从零实现 attention 或等价核心机制,并能解释关键步骤。
  • 训练一个 tiny model,体验 LoRA 与 preference 学习的基本流程。
  • 观察量化、KV cache、延迟、吞吐和内存之间的关系。
  • 用非 LLM baseline 与简单对照理解“最小充分模型”。

详细路线与 M01~M90 课程已在现有 P1 文件中落地,本总纲不复制第二份课程。

P2:AI Systems Engineering

从“单次实验可运行”推进到“系统生命周期可重复”:

data contract → pipeline → run/artifact → registry → release flow
             → serving/gateway → trace/metric/log → incident/recovery

核心工程深度:

  • 训练与服务数据一致性、point-in-time correctness、lineage 和回放。
  • 单机多进程理解 DDP/FSDP/ZeRO 的通信、内存和 checkpoint 取舍;本机不伪造多 GPU 吞吐。
  • 本地模型服务器的 queue、continuous batching、cache、backpressure 和 overload。
  • 模型/提示/adapter/eval/data 一起版本化,而不是只登记一个权重文件。
  • Agent durable execution、幂等、重试、补偿、状态恢复、工具权限和协议兼容。
  • shadow/canary/ramp/rollback、质量回归、SLO、成本和事故证据。

P3:AGI Foundations & Research Systems

把“AGI”拆成可测量能力,而不是一个二元标签:

breadth / generality
performance / robustness
learning efficiency
memory / continual adaptation
planning / tool use
autonomy / risk

核心研究深度:

  • 区分 benchmark performance、任务广度、样本效率、自主性和真实泛化。
  • 研究 scaling law 适用边界及“涌现”是否来自度量离散化。
  • 比较直接生成、search、verifier、RL 和 model-based planning。
  • 实现小型 world model,在未知动力学环境中比较 model-free/model-based。
  • 测量 continual learning 的遗忘、迁移、稳定—可塑性,而不是只看最终平均分。
  • 构造小型 evaluator-bounded 改进循环,理解 reward hacking、数据污染和错误放大。
  • 研究 multi-agent 协作何时提高覆盖,何时只增加 token、延迟和协调失败。
  • 用 capability profile 和安全案例报告结果,绝不宣布“做出了 AGI”。

P4:Embodied Intelligence

把智能置于部分可观测、连续时间、有接触和不可逆后果的环境:

sensor → state estimation → world representation → planning / policy
       → control → actuator / environment → new sensor evidence

核心工程深度:

  • SE(2)/SE(3)、坐标变换、Jacobian、运动学、动力学和约束。
  • Kalman/particle filter、传感器噪声、延迟、漂移与状态不确定性。
  • PID/LQR/MPC、轨迹优化、碰撞约束和安全停机。
  • 视觉/深度/点云、定位建图、导航和操作的误差传播。
  • behavior cloning、DAgger、offline RL、world-model control 的数据与分布偏移。
  • VLA 的语言接地、动作 token、跨 embodiment 数据和长时序失败。
  • simulation fidelity、domain randomization、sim-to-real gap 与真机安全边界。
  • Human-Robot Interaction、可撤销性、最小伤害状态和人工接管。

5. 统一学习节奏与轻量复盘

每阶段沿用 12 周主题学习 + 6 天知识整合尾段。日程提供方向,不要求每天都形成正式产物:

建议主学习日每天 2~3 小时;周六投入 0~2 小时,周日不安排任务。忙碌周只保留核心阅读、一个最小练习和周五小结即可,不需要追赶形式进度。

组成每个 90 天阶段四阶段合计
周一~周五主题学习60 天240 天
周六可选探索 / 补学12 天48 天
周日休息12 天48 天
阶段末知识整合6 天24 天
阶段日合计90 天360 天

因此主线实际安排 264 个核心学习/整合日;48 个周六可选,48 个周日休息。再加三个阶段间过渡休息日,名义日历共 363 个自然日。

日程固定职责
周一建立概念图,阅读一份核心材料
周二从零实现一个最小机制;复杂主题可改成手算或伪代码
周三跟随框架做一个引导练习,理解真实接口
周四阅读案例、失败或争议,把知识连接到系统场景
周五用一页笔记整理“我理解了什么、还不清楚什么”
周六可选探索、补学或休息;不强制产出
周日休息

每四周一次低压力复盘

W4、W8、W12 各做一次 60~90 分钟复盘,不评分,也不设置“不过关”:

  1. 画出最近四周的知识关系图。
  2. 选一个最有价值的最小实现或案例,说明它帮助理解了什么。
  3. 列出三个仍不清楚的问题,加入后续复习清单。
  4. 决定下一阶段哪些内容继续深入、哪些只保留概览。

必要的技术检查只服务于理解,例如确认梯度方向、坐标系或数据泄漏;不把大量测试、封存材料和考试分数作为学习目标。需要诚实区分本地演示、仿真和真实系统,但不要求为每个主题制作完整证据包。


6. 四个可选综合学习项目

综合项目用于串联知识,不是强制大作业。每阶段可按时间和兴趣只做一个缩小版本,也可以用架构图、讲解稿或 notebook 代替完整系统。

C1 · Financial Model Lab

规则、经典 ML、小模型与可选 LLM 在同一金融任务上公平比较,回答“什么是最小充分模型”。

C2 · Local AI Systems Platform

从以下内容中选择 3~4 项,建立一条能帮助理解的本地 AI 生命周期:

  • versioned dataset + data contract;
  • repeatable training pipeline + local experiment tracking;
  • model/adapter/prompt/eval bundle registry;
  • local serving gateway + bounded Agent workflow;
  • offline eval + shadow fixture + release/rollback;
  • trace/metric/log + cost/SLO + incident replay。

学习重点是理解数据、制品、运行、观测和发布之间如何连接,不要求实现生产级平台。

C3 · General Learning Agent Lab

从下列方向中选择 2~3 项,在小型环境中比较:

  • reactive baseline;
  • search/planning;
  • memory;
  • model-free RL;
  • learned world model;
  • continual adaptation;
  • evaluator-bounded self-improvement。

可以观察 generalization、sample efficiency、forgetting、compute 和失败类型,最终产物是一张 capability map 或学习报告,不是“AGI demo”。

C4 · Embodied Simulation Study

从导航、操作或空间感知中选择一个仿真主题,理解模块化方法与学习策略:

  • 带噪声传感器与状态估计;
  • 路径/动作规划和低层控制;
  • behavior cloning 或小型 RL/world-model policy;
  • 语言或视觉目标接地;
  • 扰动、遮挡、延迟、失败恢复和人工接管;
  • 换一个布局、物体或任务条件,观察方法如何变化。

项目可以只做到概念演示或 sim-to-sim。没有独立硬件与安全评审时,结论只限仿真,禁止外推为真机能力。


7. 算力、仿真与硬件降级

档位资源允许完成什么禁止声称什么
A · CPU / 纯本地NumPy、PyTorch CPU、小环境、录制 fixture数学实现、tiny model、本地多进程、gridworld、2D 控制、离线轨迹多 GPU scaling、真实 serving 容量、真机泛化
B · Apple SiliconMPS/MLX、MuJoCo、可行的 LeRobot 数据/策略小模型训练、MPS 推理、仿真控制、模仿学习、小型 VLA 组件CUDA kernel 结论、Isaac Lab GPU 吞吐、真实机器人安全
C · 可选远程资源短时 GPU、Linux/ROS 2、Isaac Lab 或真实硬件只有本地无法回答的受控验证无预算长训、无人监督真机动作、把单次成功外推

默认始终选择最低可回答问题的档位。P4 不要求购买机器人;若未来希望进入真实硬件,应另立独立安全计划,本路线不作要求。


8. 官方与原始研究锚点

主题发布 / 核验入口本路线怎样使用
AGI 能力定义2023-11https://arxiv.org/abs/2311.02462把 performance、generality、autonomy 分开,不做二元 AGI 宣称
Scaling laws2020-01https://arxiv.org/abs/2001.08361学习经验尺度关系及外推限制
MuZero2019-11https://arxiv.org/abs/1911.08265学习未知动力学中的表示、预测与搜索
DreamerV32025-02https://www.nature.com/articles/s41586-025-08744-2学习 world model、imagined rollouts 与跨任务鲁棒性
AlphaEvolve2025-05https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/研究生成—自动评测—选择—变异的受验证改进循环
Open X-Embodiment2023-10https://deepmind.google/blog/scaling-up-learning-across-many-different-robot-types理解跨机器人数据、技能和 embodiment transfer
RT-22023-07https://robotics-transformer2.github.io/理解 Vision-Language-Action 与动作 token 化的历史转折
Gemini Robotics-ER 1.62026-04https://deepmind.google/blog/gemini-robotics-er-1-6/研究空间/物理推理、工具调用与低层控制器的分层边界
Gemini Robotics 22026-07https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/跟踪 whole-body、灵巧操作、协作和跨 embodiment 的最新官方主张并设计反证
MuJoCo滚动;2026-08 核验https://github.com/google-deepmind/mujocoP4 本地物理仿真主线
LeRobot v0.4+2025-10;2026-08 核验https://huggingface.co/blog/lerobot-release-v040数据集、模仿/RL、策略评测与无硬件入口
ROS 2 interfaces滚动;2026-08 核验https://docs.ros.org/en/ros2_documentation/rolling/Concepts/Basic/Interfaces-Topics-Services-Actions.html区分连续数据、同步服务和长任务控制协议
PyTorch FSDP滚动;2026-08 核验https://docs.pytorch.org/docs/stable/fsdp.htmlP2 理解参数、梯度和优化器状态分片;本机只做机制模拟
MLflow 3.15.1 docs2026-08 核验https://mlflow.org/docs/latest/P2 本地 run、数据、模型、指标、制品和 Agent trace 追踪
OpenTelemetry滚动;2026-08 核验https://opentelemetry.io/docs/specs/semconv/P2 统一 trace、metric、log 的语义与关联

这些来源只定义研究和工程锚点。具体库、模型和 benchmark 在每阶段 Day 0 重新检查版本、许可、硬件和维护状态,不提前锁死一年后的选型。

SOTA检查(2026-08-23 更新)

  • P2:MLflow 当前文档已覆盖传统 ML 以及 LLM/Agent 的 tracking、tracing 与 evaluation,但课程不会把单一平台 API 当作 MLOps 原理;P2 启动日重新比较 MLflow、原生本地 store 和当时仍维护的替代品。
  • P3:AGI 仍没有可由单一 benchmark 判定的统一工程终点;Levels of AGI 继续作为能力分解框架,而不是“最新模型排行榜”。Scaling、world model、test-time search 和 AI Scientist 均按可证伪实验研究。
  • P4:前沿已从 RT-2 / Open X-Embodiment 推进到 2026 年 Gemini Robotics-ER 1.6 与 Gemini Robotics 2 的空间推理、whole-body 和协作主张;开放本地主线则以 LeRobot v0.4+、SmolVLA、MuJoCo 和小型经典/学习混合实验为主。厂商真机演示只算外部证据,不能充当本阶段结果。
  • 复核规则:P2/P3/P4 分别在 S01/G01/E01 重查最近 12 个月原始论文、官方 release、许可和硬件支持,并在当周记录“继续采用 / 替换 / 降级”的理由。

9. 360 天之后的延伸池

以下内容范围重要,但不与四阶段并行。完成 P4 学习回顾后,可按兴趣从中选择一条:

延伸方向先决条件可研究问题
AI for Science / 自动化发现evaluator 与因果实验能力成熟形式验证、材料、药物、算法发现怎样避免自证循环
Spatial Intelligence / Digital Twin已学 P4 状态估计与 world model3D 场景、预测仿真和现实校准怎样闭环
Edge / On-device AI已学 P1 推理与 P2 平台基础蒸馏、量化、能耗、隐私和离线可靠性
Neuro-symbolic / Formal AI已了解 search、solver 和 verifier神经模型如何与约束、证明、规划器协作
Privacy-preserving Learning已学数据与分布式系统基础联邦学习、差分隐私、安全聚合与效用边界
Computational Neuroscience已了解 P3 continual learning / world model记忆、注意、预测编码与人工系统的可检验对应
Collective / Multi-agent Intelligence已学 P3 社会智能主题协作、通信、制度、激励、涌现与系统性风险
Autonomous Labs / Robotics for Science已学 P4 安全与 HRI 基础机器人实验、闭环测量、科学证据和人类监督

10. 最终学习回顾

走完四个 90 天阶段不等于掌握所有 AI。理想情况下,这条路线帮助形成以下能力:

  • 从数据与梯度解释模型学习,从系统状态解释运行失败,从物理状态解释控制失败。
  • 在规则、优化、传统 ML、小模型、LLM、Agent 和机器人策略之间选择最小充分方法。
  • 解释可复现、可观测、可恢复、可回滚的 AI 系统由哪些部分组成,并实现其中若干关键环节。
  • 用未知任务族测量泛化、记忆、规划、适应和自我改进,而不是只看单一排行榜。
  • 在仿真中理解感知—估计—规划—控制—恢复闭环,并准确限制结论边界。
  • 对 AGI 与具身智能保持研究开放,同时不夸大能力或把仿真当真机。
  • 生成下一轮兴趣与问题清单,明确继续深挖、暂缓或转向的理由。

阶段不以分数或 Gate 判定。若某些主题仍模糊,把它们加入复习清单即可,不必阻断整条路线;真正重要的是知识关系逐渐清楚、能做基本实践,并保持继续学习的兴趣。