AI Deep Mastery P4:Embodied Intelligence 90
配套入口:
Phase 4 · Embodied Intelligence 90:机器人基础、世界模型与具身智能深度学习路线
状态:E01~E90 详细教材与专业课程地图已预制;P4 尚未开始,本文不代表任何课程或实验已经完成 所属路线:AI Deep Mastery 360 · Phase 4 名义周期:2027-05-24 ~ 2027-08-21,共 90 个自然日 阶段编号:E01 ~ E90 结构:12 周主题学习 E01~E84 + 6 天知识整理与长期延伸 E85~E90 启动条件:完成前三阶段后再启动;如前序学习顺延,本阶段日期整体顺延 默认环境:Apple Silicon、本地仿真、零机器人硬件、零云成本 学习定位:以知识理解、工程能力和长期兴趣为主,不包含求职、投递、证书或作品集包装 证据边界:仿真、日志回放、论文结果和厂商演示都不能描述成自己的真机结果
配套入口:
- 逐日教材:
docs/ai-deep-mastery/phase-4-embodied/notes/README.md - 专业课程地图:
docs/ai-deep-mastery/phase-4-embodied/PROFESSIONAL_COURSE_REFERENCE_MAP.md - 网页主页:
/learn/embodied-intelligence - 网页教材库:
/learn/embodied-intelligence/notes
1. 为什么要学习具身智能
前三阶段主要研究模型、AI 系统和未来 AGI。本阶段把学习对象进一步扩展到具有身体、空间、时间、动作和物理后果的智能体。
具身智能的完整闭环是:
感知 Perception
↓
状态估计 State Estimation
↓
地图、世界状态与记忆
↓
任务规划与运动规划
↓
控制和动作
↓
环境反馈与学习
↓
安全、人机协作与多机器人协作
本阶段重点回答:
一个智能体如何在观测不完整、传感器有噪声、动力学不确定和物理约束存在的环境中,持续形成可理解、可调试的感知—估计—规划—控制闭环?
1.1 与未来 AGI 的关系
机器人不等于 AGI,一次成功演示也不能证明通用智能。但具身研究可以帮助理解纯文本模型较难充分验证的能力:
- Grounding:概念如何落到空间、物体、力、接触和动作。
- 长期行动:智能体如何在连续时间中行动并承担结果。
- 因果预测:采取不同动作时,环境会发生什么变化。
- 闭环修正:如何根据反馈更新状态、重规划和恢复。
- 跨身体迁移:不同机器人、传感器和动作空间之间如何共享能力。
- 社会智能:如何与人以及其他机器人安全协作。
本计划只帮助建立这些问题的知识框架和小型仿真实践,不宣称解决开放世界 AGI。
1.2 90 天后希望获得的能力
- 能读懂机器人论文中的坐标系、姿态、Jacobian、状态空间和控制框图。
- 能实现最小正逆运动学、PID、LQR、Kalman/EKF、A* 和动作策略。
- 能解释 odometry、localization、SLAM、mapping 和 loop closure 的差异。
- 能区分识别、定位、跟踪、空间 grounding 和 affordance。
- 能比较经典规划、学习 policy、world model 和混合系统。
- 能理解 imitation learning、RL、Diffusion Policy、VLA 与 robot foundation model。
- 能设计具身系统的日志、回放、延迟、故障恢复和安全底线。
- 能理解 navigation、manipulation、HRI 和 multi-robot 的主要研究问题。
- 能跟踪 Gemini Robotics、GR00T、π0、OpenVLA、V-JEPA 等前沿路线。
1.3 非目标
- 不要求购买机械臂、移动底盘、传感器或 humanoid。
- 不要求训练完整 OpenVLA、π0、GR00T、Gemini Robotics 或大型 world model。
- 不要求每周考试、评分或高压验收。
- 不要求构建完整机器人产品或生产系统。
- 不为了做演示跳过坐标系、控制、安全和失败理解。
- 不创建第二份进度台账。
- 不提前创建未来实验结果、成功率、截图或完成标记。
2. 统一学习节奏
十二个主题周采用低压力但持续输出的固定节奏:
| 星期 | 节奏 | 建议动作 |
|---|---|---|
| 周一 | 概念与数学 | 阅读核心材料,理解问题、公式、假设和术语 |
| 周二 | 最小实现 | 从零实现一个关键机制,代码可以很小 |
| 周三 | 仿真练习 | 在轻量环境中观察机制如何工作 |
| 周四 | 案例与故障理解 | 阅读真实案例,故意改变一个条件并解释失败 |
| 周五 | 知识整理与演示 | 整理图、表、笔记或 5~10 分钟小演示 |
| 周六 | 可选探索或补学 | 按兴趣深入前沿,也可以休息或补基础 |
| 周日 | 休息 | 不增加新主题 |
没有每周分数。周五的作用是把知识讲清楚,不是考试。某周没有完成实验时,可以保留问题并继续;优先保证理解,而不是为了打勾赶进度。
2.1 日期总览
| 周 | 日期 | Day | 主题 |
|---|---|---|---|
| W1 | 05-24 ~ 05-30 | E01~E07 | 机器人数学、坐标系与仿真入门 |
| W2 | 05-31 ~ 06-06 | E08~E14 | 运动学、动力学、轨迹与反馈控制 |
| W3 | 06-07 ~ 06-13 | E15~E21 | 状态估计、传感器融合与 SLAM |
| W4 | 06-14 ~ 06-20 | E22~E28 | 感知、多模态表征与第一阶段复盘 |
| W5 | 06-21 ~ 06-27 | E29~E35 | Navigation、规划与主动感知 |
| W6 | 06-28 ~ 07-04 | E36~E42 | Manipulation、接触、抓取与技能 |
| W7 | 07-05 ~ 07-11 | E43~E49 | 模仿学习、强化学习与动作生成 |
| W8 | 07-12 ~ 07-18 | E50~E56 | World Model、物理推理与第二阶段复盘 |
| W9 | 07-19 ~ 07-25 | E57~E63 | VLA 与 Robot Foundation Models |
| W10 | 07-26 ~ 08-01 | E64~E70 | 仿真、sim2real 与具身系统工程 |
| W11 | 08-02 ~ 08-08 | E71~E77 | 具身安全、HRI 与人在回路 |
| W12 | 08-09 ~ 08-15 | E78~E84 | Multi-Robot 与全阶段低压力复盘 |
| 延伸 | 08-16 ~ 08-21 | E85~E90 | 知识地图、前沿阅读与长期兴趣路线 |
3. Apple Silicon 与无硬件学习方案
3.1 A 档:Apple 原生主线
建议使用:
- Python 3.11 或启动时仍受支持的更新版本。
- 独立虚拟环境,不污染现有 Next.js 工程。
- NumPy、SciPy、Matplotlib、OpenCV。
- PyTorch MPS。
- MuJoCo 原生 Python bindings。
- Gymnasium、Gymnasium-Robotics。
- PettingZoo MPE。
- 自写小型 SE(2)、planar arm 和 grid world。
学习原则:
- 状态输入优先,理解机制后再加入图像。
- 视觉实验使用低分辨率、小 batch 和冻结 encoder。
- 可训练 policy 以小网络为主。
- 不下载无明确用途的大模型和大数据集。
- 不要求完整训练 Dreamer、OpenVLA、π0 或 GR00T。
MuJoCo 提供 macOS universal binary,Gymnasium-Robotics 官方支持 macOS,因此它们适合作为本阶段主仿真路线:
- MuJoCo:https://github.com/google-deepmind/mujoco
- MuJoCo Python:https://mujoco.readthedocs.io/en/latest/python.html
- Gymnasium-Robotics:https://github.com/Farama-Foundation/Gymnasium-Robotics
3.2 B 档:轻量降级
如果 MuJoCo、MPS、视觉模型或编译依赖不顺利:
- 使用 CPU、NumPy 和小型 PyTorch 网络。
- 使用自写 2D 移动机器人、2-link arm 和离散 grid world。
- 图像降级为小图、OpenCV 特征或预计算 embedding。
- SLAM 使用合成 landmark、odometry 和轨迹。
- manipulation 使用 reach、push 或有限状态技能。
- multi-robot 使用自写网格或 PettingZoo。
轻量实现并不妨碍深入学习。一个能解释清楚的 2D EKF 或 planar arm,通常比跑通但无法解释的大型框架更有价值。
3.3 C 档:阅读与回放
如果某周没有条件训练或运行模拟器:
- 使用固定轨迹和公开数据小切片。
- 阅读论文中的结构图、损失函数和实验设计。
- 使用预计算模型输出理解 action、embedding 或 trajectory。
- 实现评估器、可视化或故障分析。
- 用 deterministic replay 理解系统行为。
C 档不需要制造实验结论。官方论文、视频和 benchmark 只作为学习材料。
3.4 可选远程扩展
Habitat、Isaac、OpenVLA、GR00T 或大型 VLA inference 可能更适合 Linux/NVIDIA。它们只作为可选探索,不是完成要求。使用前先回答:
- 本地无法理解的具体问题是什么?
- 是否可以用论文、预计算结果或小模型替代?
- 预计花费多少时间和费用?
- 运行结果能说明什么,不能说明什么?
4. W1 · 机器人数学、坐标系与仿真入门
日期:2027-05-24 ~ 2027-05-30 Day:E01 ~ E07
本周核心问题
- 机器人如何表示位置、姿态、速度和坐标变换?
- 为什么 frame、unit 和 timestamp 会影响整个闭环?
- 如何从数学模型进入最小仿真?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E01 | 05-24 周一 | 概念数学 | 具身闭环;state、observation、action;向量、旋转矩阵、SO(2)、SO(3)、SE(2)、SE(3) |
| E02 | 05-25 周二 | 最小实现 | 实现 compose、inverse、transform_point、2D pose 和 quaternion normalization |
| E03 | 05-26 周三 | 仿真练习 | 建立 2D 移动机器人或 2-link arm,画出 frame tree 和轨迹 |
| E04 | 05-27 周四 | 案例故障 | 比较 world/body frame、左乘/右乘、degree/radian 和单位错误 |
| E05 | 05-28 周五 | 整理演示 | 画一张坐标系知识图,演示一个 frame bug 如何传播到动作 |
| E06 | 05-29 周六 | 可选探索 | 学习 quaternion、twist、adjoint 或 Modern Robotics 习题;也可补线性代数 |
| E07 | 05-30 周日 | 休息 | 不增加新主题 |
建议理解
- rotation matrix 的正交性。
- quaternion 的归一化和双覆盖。
- homogeneous transform 的组合和逆。
- frame notation。
- 数值误差和 condition number。
- 仿真环境中的 observation/action contract。
最小练习
让一个 2D 机器人把局部坐标点变换到世界坐标;再故意交换 frame 或角度单位,观察轨迹如何偏离。
5. W2 · 运动学、动力学、轨迹与反馈控制
日期:2027-05-31 ~ 2027-06-06 Day:E08 ~ E14
本周核心问题
- 目标 pose 如何转成关节和控制信号?
- 运动学可达为什么不等于动力学可执行?
- feedback 如何抵抗误差和扰动?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E08 | 05-31 周一 | 概念数学 | Forward/Inverse Kinematics、configuration space、Jacobian、singularity、刚体动力学和状态空间 |
| E09 | 06-01 周二 | 最小实现 | 实现 planar FK/IK、Jacobian、PID 和简单 anti-windup |
| E10 | 06-02 周三 | 仿真练习 | 在 Reacher、InvertedPendulum 或 2-link arm 中比较 open-loop 与 feedback |
| E11 | 06-03 周四 | 案例故障 | 改变 mass、friction、delay、control frequency、noise 和 actuator saturation |
| E12 | 06-04 周五 | 整理演示 | 整理 PID、LQR、trajectory optimization、MPC 的关系;演示一个 controller |
| E13 | 06-05 周六 | 可选探索 | 学习 LQR、MPC、underactuated system 或 trajectory optimization |
| E14 | 06-06 周日 | 休息 | 不增加新主题 |
建议比较
- open-loop trajectory;
- joint-space PID;
- task-space Jacobian controller;
- LQR 或最小 MPC。
观察指标
指标只用于帮助理解,不设强制阈值:
- tracking error;
- overshoot;
- settling time;
- control effort;
- action saturation;
- disturbance recovery。
重点工程认识
学习 policy 不会自动消除控制问题。真实机器人通常仍需要低层频率更高、边界更明确的 controller。
6. W3 · 状态估计、传感器融合与 SLAM
日期:2027-06-07 ~ 2027-06-13 Day:E15 ~ E21
本周核心问题
- 机器人无法直接看到真实 state 时怎么办?
- filtering、smoothing、odometry、localization 和 SLAM 有什么区别?
- loop closure 为什么既能纠正漂移,也可能造成严重错误?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E15 | 06-07 周一 | 概念数学 | Bayes filter、process/measurement model、Kalman、EKF、particle filter、pose/factor graph |
| E16 | 06-08 周二 | 最小实现 | 实现 1D Kalman 和 2D EKF localization,显示 mean 与 covariance |
| E17 | 06-09 周三 | 仿真练习 | 比较 dead reckoning、EKF 和 batch least-squares/factor graph |
| E18 | 06-10 周四 | 案例故障 | 注入 bias、dropout、timestamp offset、错误 data association 和 false loop closure |
| E19 | 06-11 周五 | 整理演示 | 整理 ATE、RPE、innovation、不确定性;演示一次漂移与修正 |
| E20 | 06-12 周六 | 可选探索 | GTSAM、IMU preintegration、TUM RGB-D 或 EuRoC 小切片 |
| E21 | 06-13 周日 | 休息 | 不增加新主题 |
推荐练习
合成一个有 noisy odometry 和 landmarks 的 2D 机器人:
- 只用 odometry 画轨迹。
- 加入 landmark measurement。
- 观察 covariance 如何变化。
- 添加错误 loop closure。
- 比较全局一致性和局部漂移。
资料
- GTSAM:https://gtsam.org/tutorials/intro.html
- ORB-SLAM3:https://arxiv.org/abs/2007.11898
- TUM RGB-D:https://cvg.cit.tum.de/data/datasets/rgbd-dataset
- EuRoC MAV:https://projects.asl.ethz.ch/datasets/euroc-mav/
- evo APE/RPE:https://github.com/MichaelGrupp/evo/wiki/Metrics
不要求在 Apple Silicon 编译 ORB-SLAM3。理解 SLAM 管线比解决大型编译依赖更重要。
7. W4 · 感知、多模态空间表征与第一阶段复盘
日期:2027-06-14 ~ 2027-06-20 Day:E22 ~ E28 节奏说明:低压力复盘周;减少新内容,优先串联 W1~W3。
本周核心问题
- 识别物体与知道物体在哪里、能否操作有什么区别?
- 几何、视觉 embedding 和语言表征各自保留什么?
- 坐标、感知和状态估计如何连接?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E22 | 06-14 周一 | 概念数学 | camera model、intrinsics/extrinsics、projection、depth、point cloud、CNN/ViT、自监督视觉 |
| E23 | 06-15 周二 | 最小实现 | 实现 pinhole projection/back-projection 和简单像素到空间坐标映射 |
| E24 | 06-16 周三 | 仿真练习 | 比较 color/shape rule、OpenCV feature、frozen embedding、segmentation-assisted localization |
| E25 | 06-17 周四 | 案例故障 | 光照、遮挡、视角、背景、相似干扰物、depth 缺失和语言歧义 |
| E26 | 06-18 周五 | 阶段整理 | 画出 perception→frame→estimation→control 链路;做一个轻量演示 |
| E27 | 06-19 周六 | 可选复盘 | 补 W1~W3 中最感兴趣或最薄弱的一个主题,不引入大型项目 |
| E28 | 06-20 周日 | 休息 | 不增加新主题 |
推荐比较
- classical geometry;
- OpenCV/local feature;
- CLIP-style language alignment;
- DINO-style frozen visual representation;
- SAM-style promptable segmentation。
重点认识
- 分类准确不等于空间定位准确。
- 语义相似不等于 affordance 相同。
- perception 输出必须明确 frame、timestamp 和 confidence。
- 感知模型更强不一定让下游导航或 manipulation 更好。
资料
- CLIP:https://openai.com/index/clip/
- DINOv2:https://github.com/facebookresearch/dinov2
- Segment Anything:https://ai.meta.com/research/publications/segment-anything/
8. W5 · Navigation、规划与主动感知
日期:2027-06-21 ~ 2027-06-27 Day:E29 ~ E35
本周核心问题
- 已知地图、未知地图、部分可观测和语言导航分别需要什么?
- global planner、local planner 和 controller 如何分工?
- 机器人什么时候应先获得信息再行动?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E29 | 06-21 周一 | 概念数学 | Dijkstra、A*、occupancy map、configuration space、RRT、POMDP、active perception |
| E30 | 06-22 周二 | 最小实现 | 实现 A*、collision checking、occupancy update 和简单 replanning |
| E31 | 06-23 周三 | 仿真练习 | 在 grid world 中完成 point-goal、object-goal 或 semantic-goal navigation |
| E32 | 06-24 周四 | 案例故障 | dynamic obstacle、localization drift、blocked path、模糊目标和错误语义地图 |
| E33 | 06-25 周五 | 整理演示 | 比较 global/local/reactive planning,演示一次 replan 或 clarification |
| E34 | 06-26 周六 | 可选探索 | VLMaps、Habitat、vision-language navigation 或 frontier exploration |
| E35 | 06-27 周日 | 休息 | 不增加新主题 |
推荐比较
- oracle pose + A*;
- noisy pose + A*;
- reactive policy;
- semantic map hybrid;
- 可选 learned navigation。
可观察指标
- success;
- path length;
- SPL;
- collision/near-miss;
- replan 次数;
- localization dependency;
- clarification。
资料
- AI Habitat:https://aihabitat.org/
- Habitat 2.0:https://aihabitat.org/docs/habitat-lab/habitat2.html
- VLMaps:https://vlmaps.github.io/
9. W6 · Manipulation、接触、抓取与技能组合
日期:2027-06-28 ~ 2027-07-04 Day:E36 ~ E42
本周核心问题
- 接触为什么让 manipulation 比 free-space motion 更难?
- 抓取稳定、轨迹无碰撞和任务完成如何分别理解?
- 高层任务如何组合低层技能?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E36 | 06-28 周一 | 概念数学 | wrench、contact、friction cone、grasp、impedance、task and motion planning |
| E37 | 06-29 周二 | 最小实现 | 实现 planar reach/push、IK trajectory、PD/impedance-like controller 和 skill precondition |
| E38 | 06-30 周三 | 仿真练习 | 在 Fetch、Reacher、Pusher 或 planar arm 中完成 reach/push/pick-place 子任务 |
| E39 | 07-01 周四 | 案例故障 | object pose、mass/friction、grasp offset、delay、distractor、action clipping |
| E40 | 07-02 周五 | 整理演示 | 比较 scripted state machine、IK+feedback 和小型 learned policy |
| E41 | 07-03 周六 | 可选探索 | Diffusion Policy、dexterous hand、tactile、deformable object 或 task-motion planning |
| E42 | 07-04 周日 | 休息 | 不增加新主题 |
重点认识
- 接触模型只是现实接触的近似。
- 碰到物体不等于抓取成功。
- manipulation 成功应关心最终 object pose、稳定性和动作约束。
- skill 需要 precondition、termination 和 recovery。
10. W7 · 模仿学习、强化学习与动作生成
日期:2027-07-05 ~ 2027-07-11 Day:E43 ~ E49
本周核心问题
- 离线 loss 很低的 BC 为什么会在闭环中失效?
- imitation、offline RL、online RL 与经典控制各自适合什么条件?
- action chunk、diffusion 和 flow-based policy 解决什么问题?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E43 | 07-05 周一 | 概念数学 | MDP/POMDP、BC、covariate shift、DAgger、offline RL、PPO/SAC、action distribution |
| E44 | 07-06 周二 | 最小实现 | 实现小型 BC loop、episode dataset、closed-loop rollout 和 DAgger-like data aggregation |
| E45 | 07-07 周三 | 仿真练习 | 用经典 controller 生成 demonstration,比较 expert、BC、BC+noise、DAgger |
| E46 | 07-08 周四 | 案例故障 | demonstration 数量/质量、初态偏移、dynamics shift、action chunk、inference delay |
| E47 | 07-09 周五 | 整理演示 | 整理 distribution shift、on/off-policy、sample efficiency;演示一个 compounding error |
| E48 | 07-10 周六 | 可选探索 | 小型 PPO/SAC、Diffusion Policy、ACT、HER 或 offline dataset |
| E49 | 07-11 周日 | 休息 | 不增加新主题 |
推荐实践
不用追求算法数量。完成以下一条即可:
- BC 与 DAgger 对照。
- BC 与小型 PPO/SAC 对照。
- state-based behavior cloning 与 action chunk 对照。
- 只阅读 Diffusion Policy,并用小数据观察多模态 action。
资料
- DAgger:https://arxiv.org/abs/1011.0686
- Diffusion Policy:https://diffusion-policy.cs.columbia.edu/
- Robomimic:https://robomimic.github.io/
- LeRobot:https://huggingface.co/docs/lerobot/main/index
11. W8 · World Model、物理推理与第二阶段复盘
日期:2027-07-12 ~ 2027-07-18 Day:E50 ~ E56 节奏说明:低压力复盘周;world model 只做最小机制,不要求复现大型训练。
本周核心问题
- world model 应预测 pixel、latent、state、reward 还是 task consequence?
- 预测得像是否意味着适合 planning?
- planner 如何利用模型误差?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E50 | 07-12 周一 | 概念数学 | forward/inverse model、system ID、latent dynamics、MPC/CEM、Dreamer、TD-MPC、JEPA |
| E51 | 07-13 周二 | 最小实现 | 实现 linear 或小型 MLP action-conditioned dynamics,以及 random shooting/CEM |
| E52 | 07-14 周三 | 仿真练习 | 比较 simulator dynamics、learned dynamics 和 model-free policy 的短 horizon 行为 |
| E53 | 07-15 周四 | 案例故障 | horizon、OOD action、contact、sparse reward、model size、uncertainty |
| E54 | 07-16 周五 | 阶段整理 | 画出 model-based control、Dreamer、TD-MPC、V-JEPA 的关系图 |
| E55 | 07-17 周六 | 可选复盘 | 阅读 V-JEPA 2、Genie、DreamerV3;或补 W5~W7 中一个主题 |
| E56 | 07-18 周日 | 休息 | 不增加新主题 |
推荐观察
- one-step 与 multi-step prediction 的差异。
- horizon 变长后的误差累积。
- imagined reward 与实际 reward 的差异。
- ensemble disagreement 或 uncertainty。
- 为什么 planning value 比视频逼真度更重要。
资料
- DreamerV3:https://www.nature.com/articles/s41586-025-08744-2
- DreamerV3 code:https://github.com/danijar/dreamerv3
- TD-MPC2:https://www.tdmpc2.com/
- V-JEPA 2:https://ai.meta.com/research/publications/v-jepa-2-self-supervised-video-models-enable-understanding-prediction-and-planning/
- Genie 2:https://deepmind.google/blog/genie-2-a-large-scale-foundation-world-model/
12. W9 · VLA 与 Robot Foundation Models
日期:2027-07-19 ~ 2027-07-25 Day:E57 ~ E63
本周核心问题
- VLM 如何转成输出动作的 VLA?
- action token、chunk、diffusion、flow matching 有什么差异?
- 跨任务、跨环境、跨 embodiment 的泛化如何理解?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E57 | 07-19 周一 | 概念数学 | robot episode schema、state/action normalization、RT-2、RT-X、Octo、OpenVLA、π0、SmolVLA |
| E58 | 07-20 周二 | 最小实现 | 将仿真轨迹整理为最小 RLDS/LeRobot-like schema;实现 language-conditioned action head |
| E59 | 07-21 周三 | 仿真练习 | 比较 state-only、vision-only、language+state、frozen multimodal features |
| E60 | 07-22 周四 | 案例故障 | paraphrase、distractor、camera shift、action scaling、impossible task、cross-embodiment mismatch |
| E61 | 07-23 周五 | 整理演示 | 画出 VLM→reasoner→VLA→controller 链路;演示 action decode 和闭环差异 |
| E62 | 07-24 周六 | 可选探索 | SmolVLA/Octo inference、OpenVLA/π0 代码阅读、Open X 数据格式或最新 SOTA |
| E63 | 07-25 周日 | 休息 | 不增加新主题 |
经典到前沿的路线
| 路线 | 重点理解 |
|---|---|
| RT-1 / RT-2 | 将 web-scale 视觉语言知识迁移到动作输出 |
| Open X-Embodiment / RT-X | 多机器人、多数据源、统一数据格式 |
| Octo | 开放 generalist policy、diffusion action head、轻量适配 |
| OpenVLA | 开源 VLA、action tokenization、LoRA 适配 |
| π0 / OpenPI | flow-based action generation、generalist policy |
| SmolVLA | 更小、更开放、面向可负担机器人学习 |
| GR00T | humanoid、多模态数据、双系统或分层 policy |
| Gemini Robotics | VLA、embodied reasoning、tool orchestration 和多机器人协作 |
2026 SOTA 更新
阶段执行时应重新检查模型版本,不把本计划写死为永远最新。当前资料包括:
- Gemini Robotics-ER 1.6:强调多视角理解、空间推理、任务成功检测、仪表读取和 agentic vision。 https://deepmind.google/blog/gemini-robotics-er-1-6/
- Gemini Robotics 2:面向从双臂到 humanoid 的 whole-body VLA。 https://deepmind.google/models/gemini-robotics/
- Gemini Robotics ER 2:高层 embodied reasoning、复杂任务规划、人机沟通和多机器人协作。 https://deepmind.google/models/gemini-robotics/embodied-reasoning/
- Gemini Robotics On-Device 2:面向机器人本地运行的轻量 VLA。 https://deepmind.google/models/gemini-robotics/
- GR00T N1.6:NVIDIA 的 generalist humanoid foundation model 更新。 https://research.nvidia.com/labs/gear/gr00t-n1_6/
这些官方能力描述用于理解路线,不等于本地已经复现,也不能单独证明开放世界可靠性。
重点认识
- 单步 action prediction 不等于闭环任务成功。
- action coordinate、normalization、frequency 和 termination 非常重要。
- 高层 embodied reasoner 与低层 VLA/controller 是不同角色。
- foundation model 仍需要 robot data、adaptation、安全和运行工程。
13. W10 · 仿真、sim2real 与具身系统工程
日期:2027-07-26 ~ 2027-08-01 Day:E64 ~ E70
本周核心问题
- 仿真中的哪些假设最容易在现实中失效?
- 机器人 AI 为什么也是实时、分布式和可观测的软件工程问题?
- 如何利用日志和故障注入理解系统,而不把课程扩张为生产认证?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E64 | 07-26 周一 | 概念数学 | physics/contact/solver 边界、domain randomization、system ID、ROS 2、time/QoS、logging |
| E65 | 07-27 周二 | 最小实现 | 建立 perception/estimation/planning/control 的小型接口和 timestamped event log |
| E66 | 07-28 周三 | 仿真练习 | 比较 nominal 参数与轻量 domain randomization;进行 log replay |
| E67 | 07-29 周四 | 案例故障 | stale frame、dropout、out-of-order timestamp、timeout、localization divergence |
| E68 | 07-30 周五 | 整理演示 | 画出 high/low-level split、latency budget、watchdog 和 degraded mode |
| E69 | 07-31 周六 | 可选探索 | ROS 2 topic/service/action、MCAP、MuJoCo Playground 或 sim-to-sim |
| E70 | 08-01 周日 | 休息 | 不增加新主题 |
重点工程能力
- observation/action interface。
- frame 与 timestamp。
- sensor rate 和 control rate。
- latency、stale data 和 timeout。
- log、replay 和可视化。
- high-level planning 与 low-level control 分层。
- 简单 watchdog、stop 和 degraded mode。
仿真证据边界
| 学习环境 | 可以说 | 不能说 |
|---|---|---|
| 数学或 trace | 实现满足预期性质 | 机器人任务已成功 |
| 2D simulator | 方法在该简化环境有效 | 3D 接触或真机有效 |
| MuJoCo/Gymnasium | 指定仿真任务中的表现 | 真实硬件成功 |
| sim-to-sim | 对未见模拟参数或另一模拟器的变化 | sim-to-real 已解决 |
| 官方真机视频 | 官方展示了某种能力 | 自己完成了真机实验 |
本阶段默认最高证据层级是 simulation 或 sim-to-sim。
资料
- Dynamics Randomization:https://openai.com/index/sim-to-real-transfer-of-robotic-control-with-dynamics-randomization/
- MuJoCo Playground:https://playground.mujoco.org/
- ROS 2 Interfaces:https://docs.ros.org/en/ros2_documentation/rolling/Concepts/Basic/Interfaces-Topics-Services-Actions.html
- MCAP:https://github.com/foxglove/mcap
14. W11 · 具身安全、HRI 与人在回路
日期:2027-08-02 ~ 2027-08-08 Day:E71 ~ E77
本周核心问题
- 语义上合理的指令为什么可能在物理上危险?
- semantic、physical、operational safety 有什么区别?
- 机器人何时应拒绝、停止、降级或请求帮助?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E71 | 08-02 周一 | 概念数学 | ODD、hazard、constrained decision、shield、HRI、proxemics、uncertainty escalation |
| E72 | 08-03 周二 | 最小实现 | 实现简单 action limit、collision stop、timeout 和 clarification state |
| E73 | 08-04 周三 | 仿真练习 | 在 scripted human avatar 环境中观察距离、停止、绕行和 handoff |
| E74 | 08-05 周四 | 案例故障 | human crossing、危险物、模糊 handoff、冲突指令、遮挡和 localization loss |
| E75 | 08-06 周五 | 整理演示 | 整理 semantic/physical/operational 三层安全和人在回路位置 |
| E76 | 08-07 周六 | 可选探索 | Safety-Gymnasium、ASIMOV、social navigation 或 HRI 论文 |
| E77 | 08-08 周日 | 休息 | 不增加新主题 |
少数必要安全底线
本阶段不做认证,只保留以下学习底线:
- 不连接和控制真实电机、机械臂或移动底盘。
- 不让真实人员进入未经评审的控制闭环。
- 仿真中保留 action limit、collision/timeout stop 和人工终止入口。
- 危险、模糊或不可行的语言任务允许拒绝或请求澄清。
- 自然语言 reasoning 不能作为唯一物理安全层。
- 不使用真实人脸、家庭、客户或敏感场所数据。
标准边界
- ISO 10218 面向工业机器人特定范围。
- ISO 13482 面向 personal care robot 特定范围。
- 本周只学习 hazard 和 risk reduction 思路。
- 不声称标准合规、产品认证、法律意见或部署许可。
资料
- Safety-Gymnasium:https://safety-gymnasium.readthedocs.io/en/stable/
- Google DeepMind Robotics Safety:https://deepmind.google/models/gemini-robotics/responsibly-advancing-ai-and-robotics/
- ASIMOV v1:https://asimov-benchmark.github.io/
- ASIMOV v2:https://asimov-benchmark.github.io/v2/
- ISO 10218-1:2025:https://www.iso.org/standard/73933.html
- ISO 13482:2014:https://www.iso.org/standard/53820.html
15. W12 · Multi-Robot 与全阶段低压力复盘
日期:2027-08-09 ~ 2027-08-15 Day:E78 ~ E84 节奏说明:低压力复盘周;理解协作问题并串联全阶段,不要求综合大项目。
本周核心问题
- 多机器人为什么不是复制两个单机器人?
- path conflict、task allocation、通信和 non-stationarity 如何耦合?
- 单机器人知识如何扩展到 fleet 和 collective intelligence?
| Day | 日期 | 节奏 | 内容 |
|---|---|---|---|
| E78 | 08-09 周一 | 概念数学 | Dec-POMDP、MAPF、CBS、ORCA、task allocation、CTDE、fleet metrics |
| E79 | 08-10 周二 | 最小实现 | 实现 prioritized planning 或简化 CBS;加入简单 auction 或 task assignment |
| E80 | 08-11 周三 | 仿真练习 | 比较 independent greedy、centralized planner、prioritized planning 或 ORCA |
| E81 | 08-12 周四 | 案例故障 | communication delay、agent unavailable、stale shared map、narrow corridor、duplicate task |
| E82 | 08-13 周五 | 阶段整理 | 画出单机器人→多机器人能力图,整理全 12 周知识关系 |
| E83 | 08-14 周六 | 可选探索 | PettingZoo、MADDPG、Gemini Robotics ER 2 多机器人协作;或整理兴趣项目 |
| E84 | 08-15 周日 | 休息 | 不增加新主题 |
推荐比较
- independent greedy;
- centralized planner;
- prioritized planning;
- Conflict-Based Search;
- ORCA local avoidance;
- auction task allocation;
- CTDE/MADDPG 只做概念或可选小实验。
可观察指标
- makespan;
- throughput;
- total travel;
- collision/deadlock;
- communication;
- reassignment;
- fairness。
这些指标用于理解 trade-off,不设置统一成绩线。
资料
- PettingZoo:https://pettingzoo.farama.org/
- PettingZoo MPE:https://pettingzoo.farama.org/1.24.2/environments/mpe/
- MADDPG:https://proceedings.neurips.cc/paper_files/paper/2017/file/68a9750337a418a86fe06c1991a1d64c-Paper.pdf
- ORCA:https://gamma-web.iacs.umd.edu/ORCA/
- Conflict-Based Search:https://doi.org/10.1016/j.artint.2014.11.006
16. E85~E90 · 知识地图与长期延伸
这六天用于把 12 周内容沉淀为可以长期复习和继续探索的知识结构,整体保持轻松整理节奏。
| Day | 日期 | 主题 | 建议活动 |
|---|---|---|---|
| E85 | 08-16 周一 | 具身智能知识地图 | 画出数学、感知、估计、规划、控制、学习、安全和多机器人之间的依赖 |
| E86 | 08-17 周二 | 经典方法比较 | 比较 classical、learning-based、foundation model 和 hybrid 四类路线 |
| E87 | 08-18 周三 | 前沿阅读日 | 阅读 Gemini Robotics 2/ER 2、ER 1.6、GR00T N1.6、π0、V-JEPA 2 或 Genie |
| E88 | 08-19 周四 | 兴趣项目整理 | 从导航、操作或感知中选一个,整理代码、图、问题和下一步,不要求完善 |
| E89 | 08-20 周五 | 长期路线设计 | 建立 3/6/12 个月阅读与实践清单,确定最感兴趣的 1~2 条主线 |
| E90 | 08-21 周六 | 阶段总结 | 写一篇轻量总结:已理解什么、仍困惑什么、未来继续学什么 |
E86 建议比较框架
| 维度 | 经典方法 | 学习方法 | Foundation Model | Hybrid |
|---|---|---|---|---|
| 先验 | 显式模型较强 | 从数据学习 | 大规模预训练 | 显式约束 + 数据 |
| 可解释性 | 通常较强 | 依任务而定 | 行为复杂 | 可分层分析 |
| 数据需求 | 较低 | 中到高 | 很高 | 可控制 |
| OOD | 取决于模型假设 | 可能脆弱 | 有迁移但不稳定 | 可设计 fallback |
| 实时性 | 通常可控 | 依模型大小 | 可能较重 | 分层部署 |
| 安全边界 | 可显式约束 | 需要额外机制 | 不应单独承担 | 更适合工程实践 |
17. 可选项目:Embodied Simulation Study
这个项目完全可选。只选择 感知、导航、操作 中一个方向,不要求构建完整机器人堆栈。
17.1 方向 P:Perception Study
可选问题:
- classical feature、frozen embedding 和 segmentation 对空间定位有什么差异?
- 光照、遮挡、视角变化会如何影响结果?
- perception score 和下游任务是否一致?
最小内容:
- 一个小型图像或仿真数据集。
- 两种方法对比。
- 一个故障切片。
- 一张结果图和失败说明。
17.2 方向 N:Navigation Study
可选问题:
- A*、reactive policy 和 semantic map 在部分可观测环境中如何取舍?
- localization noise 如何影响 path planning?
- 什么时候 replan 或 clarification 更重要?
最小内容:
- 一个 grid/2D/MuJoCo navigation 环境。
- 两个 baseline。
- 一个动态障碍或定位故障。
- 一段轨迹可视化和学习总结。
17.3 方向 M:Manipulation Study
可选问题:
- scripted/IK controller 与 behavior cloning 在 reach/push 中有什么差异?
- friction、object pose 或 delay 如何改变动作?
- action chunk 对平滑度和延迟有何影响?
最小内容:
- 一个 planar arm、Reacher、Pusher 或 Fetch 子任务。
- 两种方法。
- 一个参数变化。
- 一段 rollout 和失败分析。
17.4 项目不要求
- 不要求专门准备陌生评测集。
- 不要求固定成功率。
- 不要求 30 个 episodes。
- 不要求多模态、world model、VLA、安全和多机器人全部接入。
- 不要求部署、发布或真机。
- 不要求为了“完整”增加云成本。
完成其中一个方向,或者只完成前 12 周知识整理,都符合本阶段的学习定位。
18. 工程能力补齐清单
本阶段除了算法,也关注 AI 时代具身系统常见的工程能力:
18.1 数据与时间
- episode、step、observation、action 和 metadata。
- state/action normalization。
- camera、proprioception 和 language alignment。
- timestamp、sampling rate 和 dropped frame。
- RLDS、LeRobotDataset、rosbag/MCAP 的设计思想。
18.2 系统接口
- continuous stream、request/response 和 long-running action。
- perception、estimation、planner、controller 的边界。
- high-level reasoner 与 low-level VLA/controller 的边界。
- frame tree、action space 和 termination contract。
18.3 运行与调试
- reproducible seed 和 environment version。
- event log、trajectory replay 和可视化。
- latency、timeout 和 stale data。
- failure taxonomy。
- degraded mode 和人工终止。
18.4 模型工程
- frozen encoder + small head。
- action token/chunk/diffusion/flow。
- offline prediction 与 closed-loop behavior 的差异。
- quantization、on-device inference 和 control frequency。
- world model uncertainty 与 planner exploitation。
这些能力以理解和小练习为主,不扩张成生产平台建设。
19. 长期前沿研究雷达
- Humanoid whole-body control、balance、locomotion 和 mobile manipulation。
- Dexterous hand、tactile、force、audio 与 deformable objects。
- Embodied reasoning、long-horizon task decomposition 和 tool use。
- World-action models、JEPA 与 action-conditioned video models。
- Generative simulation、Genie 和自动生成交互环境。
- Cross-embodiment、morphology adapter 和 universal action representation。
- Lifelong robot learning、skill memory 和 catastrophic forgetting。
- Autonomous data engines、active sampling 和 failure mining。
- Edge VLA、quantization、real-time chunking 和 hardware-aware inference。
- Collective embodied intelligence、fleet learning 和共享世界模型。
- Physical AI safety、uncertainty escalation 和 corrigibility。
- Human-compatible intelligence、legibility、trust calibration 和共同决策。
阅读前沿时持续区分:
- task transfer;
- environment generalization;
- online adaptation;
- causal reasoning;
- open-world autonomy;
- AGI。
这些不是同一个证据层级。
20. 原始论文与官方资料索引
20.1 机器人基础与控制
- Modern Robotics:https://hades.mech.northwestern.edu/index.php/Modern_Robotics
- MIT Underactuated Robotics:https://underactuated.csail.mit.edu/
- MuJoCo:https://github.com/google-deepmind/mujoco
- Gymnasium-Robotics:https://github.com/Farama-Foundation/Gymnasium-Robotics
20.2 状态估计与 SLAM
- GTSAM:https://gtsam.org/tutorials/intro.html
- GTSAM IMU Preintegration:https://borglab.github.io/gtsam/preintegratedimumeasurements/
- ORB-SLAM3:https://arxiv.org/abs/2007.11898
- TUM RGB-D:https://cvg.cit.tum.de/data/datasets/rgbd-dataset
- EuRoC MAV:https://projects.asl.ethz.ch/datasets/euroc-mav/
20.3 感知与 Navigation
- CLIP:https://openai.com/index/clip/
- DINOv2:https://github.com/facebookresearch/dinov2
- Segment Anything:https://ai.meta.com/research/publications/segment-anything/
- AI Habitat:https://aihabitat.org/
- VLMaps:https://vlmaps.github.io/
20.4 Robot Learning 与 World Model
- DAgger:https://arxiv.org/abs/1011.0686
- Diffusion Policy:https://diffusion-policy.cs.columbia.edu/
- DreamerV3:https://github.com/danijar/dreamerv3
- TD-MPC2:https://www.tdmpc2.com/
- V-JEPA 2:https://ai.meta.com/research/publications/v-jepa-2-self-supervised-video-models-enable-understanding-prediction-and-planning/
- Genie 2:https://deepmind.google/blog/genie-2-a-large-scale-foundation-world-model/
20.5 Robot Data、VLA 与最新 SOTA
- RLDS:https://github.com/google-research/rlds
- LeRobot:https://huggingface.co/docs/lerobot/main/index
- Open X-Embodiment:https://github.com/google-deepmind/open_x_embodiment
- RT-2:https://deepmind.google/blog/rt-2-new-model-translates-vision-and-language-into-action/
- Octo:https://github.com/octo-models/octo
- OpenVLA:https://github.com/openvla/openvla
- OpenPI / π0:https://www.pi.website/blog/openpi
- SmolVLA:https://huggingface.co/blog/smolvla
- Gemini Robotics-ER 1.6:https://deepmind.google/blog/gemini-robotics-er-1-6/
- Gemini Robotics 2 family:https://deepmind.google/models/gemini-robotics/
- Gemini Robotics ER 2:https://deepmind.google/models/gemini-robotics/embodied-reasoning/
- Gemini Robotics ER 2 model card:https://deepmind.google/models/model-cards/gemini-robotics-er-2/
- GR00T N1.6:https://research.nvidia.com/labs/gear/gr00t-n1_6/
20.6 系统、安全与多机器人
- MuJoCo Playground:https://playground.mujoco.org/
- ROS 2 Interfaces:https://docs.ros.org/en/ros2_documentation/rolling/Concepts/Basic/Interfaces-Topics-Services-Actions.html
- MCAP:https://github.com/foxglove/mcap
- Safety-Gymnasium:https://safety-gymnasium.readthedocs.io/en/stable/
- ASIMOV:https://asimov-benchmark.github.io/
- PettingZoo:https://pettingzoo.farama.org/
- MADDPG:https://proceedings.neurips.cc/paper_files/paper/2017/file/68a9750337a418a86fe06c1991a1d64c-Paper.pdf
- ORCA:https://gamma-web.iacs.umd.edu/ORCA/
21. 阶段结束后的轻量完成定义
本阶段不按分数判定。到 E90 时,满足以下大部分即可认为学习路线已经发挥作用:
- 能画出具身智能完整知识地图。
- 能解释至少一个控制、一个估计、一个规划和一个学习方法。
- 运行过若干最小实现或仿真练习。
- 能说清 classical、learning、foundation model 和 hybrid 的取舍。
- 能辨认仿真与真机证据边界。
- 能说明 Gemini Robotics、GR00T、π0、OpenVLA、V-JEPA 的路线差异。
- 已找到最感兴趣的 1~2 个长期方向。
- 可选完成一个感知、导航或操作小研究。
在真正执行前,本文件始终保持“计划中”。进度仍由 AI Deep Mastery 360 的唯一主入口管理,不为 Phase 4 创建并行进度台账。