学习计划 Roadmap
Embodied Intelligence 90:专业课程与官方资料地图
这五条线不是五门并行课程。每天只回答一个问题:哪一个课程片段最能帮助我解释当天机制、失败和边界? 如果项目内教材已经足够,就不额外增加观看时长。
111 行ai-deep-mastery/phase-4-embodied/PROFESSIONAL_COURSE_REFERENCE_MAP.md
P4 · Embodied Intelligence 90 专业课程与官方资料映射
适用范围:E01~E90,对应 AI Deep Mastery 总路线 Day 271~360
内容状态:预习地图已就绪;P4 尚未启动,不代表已修读课程或完成实验
使用原则:以项目内当天教材为主,外部课程按问题选读;不要求完整修读外部课程,不追证书、不照搬作业、不设置考试式 Gate
实践边界:默认 Apple Silicon、本地仿真、无机器人硬件;仿真与厂商演示都不能写成自己的真机结果
1. 课程骨架:为什么选这五条主线
| 主线 | 官方入口 | 最适合补齐什么 | 对应阶段 | 本计划的取用方式 |
|---|---|---|---|---|
| Northwestern Modern Robotics | 课程与教材入口 | 刚体运动、运动学、Jacobian、动力学、规划、控制、操作与移动机器人 | W1、W2、W5、W6 | 用作机器人数学的统一语言;先学 2D/planar,再按需进入 SE(3) |
| MIT Underactuated Robotics | 开放课程讲义 | 非线性动力学、LQR、最优控制、轨迹优化、接触、系统辨识与学习控制 | W2、W6、W8、W10 | 只选与当天系统相符的章节;不要求复刻 Drake 作业 |
| Stanford CS237A · Principles of Robot Autonomy I | 官方课程说明 | 感知、定位、SLAM、非线性控制、运动规划、POMDP 与 ROS | W2~W5、W10 | 用于把 perception→estimation→planning→control 串成闭环 |
| Stanford CS237B · Principles of Robot Autonomy II | 官方课程站点 | robot learning、physical interaction、HRI 与高级自主系统 | W6~W11 | 用作学习策略、接触与人机协作的课程级参考 |
| CMU 16-831 · Introduction to Robot Learning | CMU Robotics 课程目录 | imitation、online/offline RL、视觉学习、生成模型、simulation 与 sim-to-real | W7~W10 | 先做 BC/DAgger 小闭环,再阅读 VLA/world model;不从大模型起步 |
这五条线不是五门并行课程。每天只回答一个问题:哪一个课程片段最能帮助我解释当天机制、失败和边界? 如果项目内教材已经足够,就不额外增加观看时长。
2. 官方工具与研究资料层
| 资料层 | 官方入口 | 学习用途 | 证据边界 |
|---|---|---|---|
| MuJoCo | Overview · Python | 刚体、接触、状态、控制和参数扰动 | 只能说明指定模型与 solver 下的仿真行为 |
| Gymnasium-Robotics | 官方文档 | Reacher、Fetch、Maze 等标准化 observation/action 环境 | benchmark 成功不等于现实可靠性 |
| GTSAM | Factor Graph 入门 | factor、variable、noise model、smoothing、SLAM | 图优化结果依赖测量模型与 data association |
| Stanford CS231A | 官方课程页 | camera geometry、3D reconstruction、深度与空间感知 | 视觉分数不自动转化为控制效果 |
| Habitat | 官方平台 | embodied navigation、semantic goal 与可复现实验环境 | 模拟场景的传感器与交互仍是抽象 |
| LeRobot | 官方文档 | episode dataset、action/state、ACT、SmolVLA、π0 与仿真学习 | 数据格式与预训练策略不保证跨 embodiment 成功 |
| ROS 2 | Interfaces | topic/service/action、反馈、取消、时间和组件边界 | 本计划只学接口和事件模型,不声称生产部署 |
| Safety-Gymnasium | 官方文档 | constrained decision、cost、shield 与安全失败观察 | 仿真约束不是标准合规或认证 |
| PettingZoo | 官方文档 | multi-agent API、通信、协调与非平稳性 | toy environment 不代表真实 fleet |
前沿论文和官方模型说明只用于建立概念对照:
- Open X-Embodiment / RT-X:观察跨机器人数据、动作空间和迁移的难点。
- RT-2:理解 VLM 知识如何进入动作 token,以及闭环评测为何仍必要。
- LeRobot:从统一 episode schema、模仿学习到轻量 VLA 的开放实践入口。
- Gemini Robotics:跟踪 VLA、whole-body 与 on-device 路线,但官方演示只算外部证据。
- GR00T:理解 humanoid foundation model、数据与分层控制路线。
- V-JEPA 2:理解表征预测、物理理解与规划之间的研究假设。
3. E01~E90 周级映射
| 周 / Day | 核心学习问题 | 专业课程主锚点 | 官方工具 / 原始资料 | 轻量落地 |
|---|---|---|---|---|
| W1 · E01~E07 | pose、frame、SE(2)/SE(3) 为什么是整个闭环的语言 | Modern Robotics:Foundations of Robot Motion | MuJoCo model/data;NumPy | 2D transform、frame tree、故意制造单位与左右乘错误 |
| W2 · E08~E14 | 从目标 pose 到可执行、可纠偏的动作需要什么 | Modern Robotics:Kinematics/Dynamics/Control;MIT Underactuated | Gymnasium Reacher/Pendulum | planar FK/IK、Jacobian、PID;选做 LQR/MPC 阅读 |
| W3 · E15~E21 | 不可直接观测的 state 如何由噪声测量估计 | Stanford CS237A:Localization/SLAM | GTSAM、TUM/EuRoC 小切片 | 1D Kalman、2D EKF、漂移与 false loop closure |
| W4 · E22~E28 | 识别、定位、空间 grounding 与 affordance 有何不同 | Stanford CS231A;CS237A perception | OpenCV、冻结视觉表征 | projection/back-projection;串联 frame、estimate 与 control |
| W5 · E29~E35 | 规划何时需要地图、belief、重规划或主动获取信息 | CS237A:Motion Planning/POMDP | Habitat、VLMaps | A*、occupancy update、dynamic obstacle 与 clarification |
| W6 · E36~E42 | 接触、摩擦、抓取和技能组合为何比 free-space motion 难 | Modern Robotics:Manipulation;CS237B;MIT Underactuated | MuJoCo / Gymnasium-Robotics | planar reach/push、PD/impedance、skill precondition/recovery |
| W7 · E43~E49 | 低离线 loss 的 policy 为什么会在闭环累积误差 | CMU 16-831;CS237B | DAgger、LeRobot、Robomimic | BC、BC+noise、DAgger-like 对照;RL 只作选读或小实验 |
| W8 · E50~E56 | learned dynamics 怎样支持预测、规划又可能被 planner 利用 | MIT Underactuated:System ID/Learning;CMU 16-831 | Dreamer、TD-MPC、V-JEPA 2 | action-conditioned dynamics、random shooting/CEM、horizon/OOD 失败 |
| W9 · E57~E63 | VLM 怎样变成 VLA,跨任务与跨 embodiment 泛化如何评估 | CMU 16-831;CS237B | LeRobot、RT-2、Open X、Octo、OpenVLA、π0 | RLDS/LeRobot-like schema、language-conditioned head、action decode |
| W10 · E64~E70 | 仿真到现实差距为何也是时间、接口、日志与故障恢复问题 | MIT Underactuated:System ID;CS237A:ROS | MuJoCo、ROS 2、MCAP | timestamped event log、domain randomization、replay、watchdog |
| W11 · E71~E77 | 语义合理的任务为何仍可能物理危险 | CS237B:HRI/physical interaction | Safety-Gymnasium、ASIMOV、DeepMind Robotics Safety | action limit、collision/timeout stop、clarification、human handoff |
| W12 · E78~E84 | 多机器人为何增加冲突、通信、任务分配与非平稳性 | CS237A/237B 的 autonomy 系统视角 | PettingZoo、MAPF/CBS、ORCA、MADDPG | prioritized/CBS、auction、延迟/失联/窄通道失败 |
| 整合 · E85~E90 | 如何形成可长期延伸而不夸大证据的具身知识图谱 | 回看五门主课程,不新增必修 | Gemini Robotics、GR00T、π0、V-JEPA 2、Genie | 知识地图、四类范式比较、兴趣方向与 3/6/12 月路线 |
4. 每日使用方法:30~120 分钟弹性版
4.1 标准学习日
- 10 分钟预判:先用自己的话解释当天问题,并写下一个不确定点。
- 25~45 分钟教材:读项目内 E 日教材;公式只推到能解释变量、假设和失败。
- 20~45 分钟最小动作:运行或手写一个 transform、filter、planner、controller、policy 或 event trace。
- 10~20 分钟课程片段:只在不理解时打开上表对应的官方章节。
- 5 分钟收束:记录“机制、观察、边界、与上一周连接”四句话。
4.2 时间不足日
只做三件事:读“一句话定义”、看一张机制图或公式、回答一个自检问题。不要为了保持连续天数伪造实验或完成状态。
4.3 周日恢复日
不引入新知识,不补作业,不形成欠债。最多 15 分钟回看一张图、一个轨迹或一个课程片段;也可以完全休息。
5. 四条深入路线
| 兴趣路线 | 核心周 | 后续优先课程 / 资料 | 深入问题 |
|---|---|---|---|
| 控制与操作 | W1、W2、W6、W10 | Modern Robotics → MIT Underactuated → CS237B | 接触、约束、系统辨识和学习控制如何组合 |
| 空间感知与导航 | W3、W4、W5、W10 | CS231A → CS237A → Habitat/GTSAM | 不确定性、地图、语义与主动感知怎样闭环 |
| Robot Learning / VLA | W7、W8、W9 | CMU 16-831 → LeRobot → RT-X/开放 VLA | 数据分布、动作表征、跨 embodiment 和实时部署 |
| 安全协作与 collective intelligence | W10、W11、W12 | CS237B → Safety-Gymnasium → PettingZoo/MAPF | 人在回路、任务冲突、通信失败和可恢复协作 |
E90 后只选 1~2 条继续。掌握具身智能不等于同时精通机械、控制、视觉、RL、基础模型和硬件。
6. 资料时效与能力主张规则
- 在正式进入 E01 时重查课程页面、工具版本、Apple Silicon 支持和许可证。
- 在 E57 重查最近 12 个月的 VLA、robot foundation model 与数据格式,不把 2026 名称写成永久 SOTA。
- 所有练习都标明证据层级:纸面推导、2D toy、指定 simulator、sim-to-sim、外部真机结果。
- “跑通官方 demo”只表示环境与接口可用;“在一个 seed 成功”不表示稳定;“厂商视频展示”不表示独立复现。
- 不连接真实执行器,不采集敏感家庭/客户/人脸数据,不把语言模型作为唯一安全层。
本地图的目标是让 90 天每天都有专业锚点,又保持学习轻量。真正的主线始终是:理解机制 → 做最小观察 → 解释失败 → 建立跨层连接。