返回 Papers
学习计划 Roadmap

Embodied Intelligence 90:专业课程与官方资料地图

这五条线不是五门并行课程。每天只回答一个问题:哪一个课程片段最能帮助我解释当天机制、失败和边界? 如果项目内教材已经足够,就不额外增加观看时长。

111ai-deep-mastery/phase-4-embodied/PROFESSIONAL_COURSE_REFERENCE_MAP.md

P4 · Embodied Intelligence 90 专业课程与官方资料映射

适用范围:E01~E90,对应 AI Deep Mastery 总路线 Day 271~360
内容状态:预习地图已就绪;P4 尚未启动,不代表已修读课程或完成实验
使用原则:以项目内当天教材为主,外部课程按问题选读;不要求完整修读外部课程,不追证书、不照搬作业、不设置考试式 Gate
实践边界:默认 Apple Silicon、本地仿真、无机器人硬件;仿真与厂商演示都不能写成自己的真机结果


1. 课程骨架:为什么选这五条主线

主线官方入口最适合补齐什么对应阶段本计划的取用方式
Northwestern Modern Robotics课程与教材入口刚体运动、运动学、Jacobian、动力学、规划、控制、操作与移动机器人W1、W2、W5、W6用作机器人数学的统一语言;先学 2D/planar,再按需进入 SE(3)
MIT Underactuated Robotics开放课程讲义非线性动力学、LQR、最优控制、轨迹优化、接触、系统辨识与学习控制W2、W6、W8、W10只选与当天系统相符的章节;不要求复刻 Drake 作业
Stanford CS237A · Principles of Robot Autonomy I官方课程说明感知、定位、SLAM、非线性控制、运动规划、POMDP 与 ROSW2~W5、W10用于把 perception→estimation→planning→control 串成闭环
Stanford CS237B · Principles of Robot Autonomy II官方课程站点robot learning、physical interaction、HRI 与高级自主系统W6~W11用作学习策略、接触与人机协作的课程级参考
CMU 16-831 · Introduction to Robot LearningCMU Robotics 课程目录imitation、online/offline RL、视觉学习、生成模型、simulation 与 sim-to-realW7~W10先做 BC/DAgger 小闭环,再阅读 VLA/world model;不从大模型起步

这五条线不是五门并行课程。每天只回答一个问题:哪一个课程片段最能帮助我解释当天机制、失败和边界? 如果项目内教材已经足够,就不额外增加观看时长。


2. 官方工具与研究资料层

资料层官方入口学习用途证据边界
MuJoCoOverview · Python刚体、接触、状态、控制和参数扰动只能说明指定模型与 solver 下的仿真行为
Gymnasium-Robotics官方文档Reacher、Fetch、Maze 等标准化 observation/action 环境benchmark 成功不等于现实可靠性
GTSAMFactor Graph 入门factor、variable、noise model、smoothing、SLAM图优化结果依赖测量模型与 data association
Stanford CS231A官方课程页camera geometry、3D reconstruction、深度与空间感知视觉分数不自动转化为控制效果
Habitat官方平台embodied navigation、semantic goal 与可复现实验环境模拟场景的传感器与交互仍是抽象
LeRobot官方文档episode dataset、action/state、ACT、SmolVLA、π0 与仿真学习数据格式与预训练策略不保证跨 embodiment 成功
ROS 2Interfacestopic/service/action、反馈、取消、时间和组件边界本计划只学接口和事件模型,不声称生产部署
Safety-Gymnasium官方文档constrained decision、cost、shield 与安全失败观察仿真约束不是标准合规或认证
PettingZoo官方文档multi-agent API、通信、协调与非平稳性toy environment 不代表真实 fleet

前沿论文和官方模型说明只用于建立概念对照:

  • Open X-Embodiment / RT-X:观察跨机器人数据、动作空间和迁移的难点。
  • RT-2:理解 VLM 知识如何进入动作 token,以及闭环评测为何仍必要。
  • LeRobot:从统一 episode schema、模仿学习到轻量 VLA 的开放实践入口。
  • Gemini Robotics:跟踪 VLA、whole-body 与 on-device 路线,但官方演示只算外部证据。
  • GR00T:理解 humanoid foundation model、数据与分层控制路线。
  • V-JEPA 2:理解表征预测、物理理解与规划之间的研究假设。

3. E01~E90 周级映射

周 / Day核心学习问题专业课程主锚点官方工具 / 原始资料轻量落地
W1 · E01~E07pose、frame、SE(2)/SE(3) 为什么是整个闭环的语言Modern Robotics:Foundations of Robot MotionMuJoCo model/data;NumPy2D transform、frame tree、故意制造单位与左右乘错误
W2 · E08~E14从目标 pose 到可执行、可纠偏的动作需要什么Modern Robotics:Kinematics/Dynamics/Control;MIT UnderactuatedGymnasium Reacher/Pendulumplanar FK/IK、Jacobian、PID;选做 LQR/MPC 阅读
W3 · E15~E21不可直接观测的 state 如何由噪声测量估计Stanford CS237A:Localization/SLAMGTSAM、TUM/EuRoC 小切片1D Kalman、2D EKF、漂移与 false loop closure
W4 · E22~E28识别、定位、空间 grounding 与 affordance 有何不同Stanford CS231A;CS237A perceptionOpenCV、冻结视觉表征projection/back-projection;串联 frame、estimate 与 control
W5 · E29~E35规划何时需要地图、belief、重规划或主动获取信息CS237A:Motion Planning/POMDPHabitat、VLMapsA*、occupancy update、dynamic obstacle 与 clarification
W6 · E36~E42接触、摩擦、抓取和技能组合为何比 free-space motion 难Modern Robotics:Manipulation;CS237B;MIT UnderactuatedMuJoCo / Gymnasium-Roboticsplanar reach/push、PD/impedance、skill precondition/recovery
W7 · E43~E49低离线 loss 的 policy 为什么会在闭环累积误差CMU 16-831;CS237BDAgger、LeRobot、RobomimicBC、BC+noise、DAgger-like 对照;RL 只作选读或小实验
W8 · E50~E56learned dynamics 怎样支持预测、规划又可能被 planner 利用MIT Underactuated:System ID/Learning;CMU 16-831Dreamer、TD-MPC、V-JEPA 2action-conditioned dynamics、random shooting/CEM、horizon/OOD 失败
W9 · E57~E63VLM 怎样变成 VLA,跨任务与跨 embodiment 泛化如何评估CMU 16-831;CS237BLeRobot、RT-2、Open X、Octo、OpenVLA、π0RLDS/LeRobot-like schema、language-conditioned head、action decode
W10 · E64~E70仿真到现实差距为何也是时间、接口、日志与故障恢复问题MIT Underactuated:System ID;CS237A:ROSMuJoCo、ROS 2、MCAPtimestamped event log、domain randomization、replay、watchdog
W11 · E71~E77语义合理的任务为何仍可能物理危险CS237B:HRI/physical interactionSafety-Gymnasium、ASIMOV、DeepMind Robotics Safetyaction limit、collision/timeout stop、clarification、human handoff
W12 · E78~E84多机器人为何增加冲突、通信、任务分配与非平稳性CS237A/237B 的 autonomy 系统视角PettingZoo、MAPF/CBS、ORCA、MADDPGprioritized/CBS、auction、延迟/失联/窄通道失败
整合 · E85~E90如何形成可长期延伸而不夸大证据的具身知识图谱回看五门主课程,不新增必修Gemini Robotics、GR00T、π0、V-JEPA 2、Genie知识地图、四类范式比较、兴趣方向与 3/6/12 月路线

4. 每日使用方法:30~120 分钟弹性版

4.1 标准学习日

  1. 10 分钟预判:先用自己的话解释当天问题,并写下一个不确定点。
  2. 25~45 分钟教材:读项目内 E 日教材;公式只推到能解释变量、假设和失败。
  3. 20~45 分钟最小动作:运行或手写一个 transform、filter、planner、controller、policy 或 event trace。
  4. 10~20 分钟课程片段:只在不理解时打开上表对应的官方章节。
  5. 5 分钟收束:记录“机制、观察、边界、与上一周连接”四句话。

4.2 时间不足日

只做三件事:读“一句话定义”、看一张机制图或公式、回答一个自检问题。不要为了保持连续天数伪造实验或完成状态。

4.3 周日恢复日

不引入新知识,不补作业,不形成欠债。最多 15 分钟回看一张图、一个轨迹或一个课程片段;也可以完全休息。


5. 四条深入路线

兴趣路线核心周后续优先课程 / 资料深入问题
控制与操作W1、W2、W6、W10Modern Robotics → MIT Underactuated → CS237B接触、约束、系统辨识和学习控制如何组合
空间感知与导航W3、W4、W5、W10CS231A → CS237A → Habitat/GTSAM不确定性、地图、语义与主动感知怎样闭环
Robot Learning / VLAW7、W8、W9CMU 16-831 → LeRobot → RT-X/开放 VLA数据分布、动作表征、跨 embodiment 和实时部署
安全协作与 collective intelligenceW10、W11、W12CS237B → Safety-Gymnasium → PettingZoo/MAPF人在回路、任务冲突、通信失败和可恢复协作

E90 后只选 1~2 条继续。掌握具身智能不等于同时精通机械、控制、视觉、RL、基础模型和硬件。


6. 资料时效与能力主张规则

  1. 在正式进入 E01 时重查课程页面、工具版本、Apple Silicon 支持和许可证。
  2. E57 重查最近 12 个月的 VLA、robot foundation model 与数据格式,不把 2026 名称写成永久 SOTA。
  3. 所有练习都标明证据层级:纸面推导、2D toy、指定 simulator、sim-to-sim、外部真机结果。
  4. “跑通官方 demo”只表示环境与接口可用;“在一个 seed 成功”不表示稳定;“厂商视频展示”不表示独立复现。
  5. 不连接真实执行器,不采集敏感家庭/客户/人脸数据,不把语言模型作为唯一安全层。

本地图的目标是让 90 天每天都有专业锚点,又保持学习轻量。真正的主线始终是:理解机制 → 做最小观察 → 解释失败 → 建立跨层连接。