返回 Papers
学习计划 Roadmap

AI Deep Mastery P4:Embodied Intelligence 90

配套入口:

2027-05-24
959ai-deep-mastery/PHASE4_EMBODIED_INTELLIGENCE_90.md

Phase 4 · Embodied Intelligence 90:机器人基础、世界模型与具身智能深度学习路线

状态:E01~E90 详细教材与专业课程地图已预制;P4 尚未开始,本文不代表任何课程或实验已经完成 所属路线:AI Deep Mastery 360 · Phase 4 名义周期:2027-05-24 ~ 2027-08-21,共 90 个自然日 阶段编号:E01 ~ E90 结构:12 周主题学习 E01~E84 + 6 天知识整理与长期延伸 E85~E90 启动条件:完成前三阶段后再启动;如前序学习顺延,本阶段日期整体顺延 默认环境:Apple Silicon、本地仿真、零机器人硬件、零云成本 学习定位:以知识理解、工程能力和长期兴趣为主,不包含求职、投递、证书或作品集包装 证据边界:仿真、日志回放、论文结果和厂商演示都不能描述成自己的真机结果

配套入口:

  • 逐日教材:docs/ai-deep-mastery/phase-4-embodied/notes/README.md
  • 专业课程地图:docs/ai-deep-mastery/phase-4-embodied/PROFESSIONAL_COURSE_REFERENCE_MAP.md
  • 网页主页:/learn/embodied-intelligence
  • 网页教材库:/learn/embodied-intelligence/notes

1. 为什么要学习具身智能

前三阶段主要研究模型、AI 系统和未来 AGI。本阶段把学习对象进一步扩展到具有身体、空间、时间、动作和物理后果的智能体。

具身智能的完整闭环是:

感知 Perception
    ↓
状态估计 State Estimation
    ↓
地图、世界状态与记忆
    ↓
任务规划与运动规划
    ↓
控制和动作
    ↓
环境反馈与学习
    ↓
安全、人机协作与多机器人协作

本阶段重点回答:

一个智能体如何在观测不完整、传感器有噪声、动力学不确定和物理约束存在的环境中,持续形成可理解、可调试的感知—估计—规划—控制闭环?

1.1 与未来 AGI 的关系

机器人不等于 AGI,一次成功演示也不能证明通用智能。但具身研究可以帮助理解纯文本模型较难充分验证的能力:

  1. Grounding:概念如何落到空间、物体、力、接触和动作。
  2. 长期行动:智能体如何在连续时间中行动并承担结果。
  3. 因果预测:采取不同动作时,环境会发生什么变化。
  4. 闭环修正:如何根据反馈更新状态、重规划和恢复。
  5. 跨身体迁移:不同机器人、传感器和动作空间之间如何共享能力。
  6. 社会智能:如何与人以及其他机器人安全协作。

本计划只帮助建立这些问题的知识框架和小型仿真实践,不宣称解决开放世界 AGI。

1.2 90 天后希望获得的能力

  • 能读懂机器人论文中的坐标系、姿态、Jacobian、状态空间和控制框图。
  • 能实现最小正逆运动学、PID、LQR、Kalman/EKF、A* 和动作策略。
  • 能解释 odometry、localization、SLAM、mapping 和 loop closure 的差异。
  • 能区分识别、定位、跟踪、空间 grounding 和 affordance。
  • 能比较经典规划、学习 policy、world model 和混合系统。
  • 能理解 imitation learning、RL、Diffusion Policy、VLA 与 robot foundation model。
  • 能设计具身系统的日志、回放、延迟、故障恢复和安全底线。
  • 能理解 navigation、manipulation、HRI 和 multi-robot 的主要研究问题。
  • 能跟踪 Gemini Robotics、GR00T、π0、OpenVLA、V-JEPA 等前沿路线。

1.3 非目标

  • 不要求购买机械臂、移动底盘、传感器或 humanoid。
  • 不要求训练完整 OpenVLA、π0、GR00T、Gemini Robotics 或大型 world model。
  • 不要求每周考试、评分或高压验收。
  • 不要求构建完整机器人产品或生产系统。
  • 不为了做演示跳过坐标系、控制、安全和失败理解。
  • 不创建第二份进度台账。
  • 不提前创建未来实验结果、成功率、截图或完成标记。

2. 统一学习节奏

十二个主题周采用低压力但持续输出的固定节奏:

星期节奏建议动作
周一概念与数学阅读核心材料,理解问题、公式、假设和术语
周二最小实现从零实现一个关键机制,代码可以很小
周三仿真练习在轻量环境中观察机制如何工作
周四案例与故障理解阅读真实案例,故意改变一个条件并解释失败
周五知识整理与演示整理图、表、笔记或 5~10 分钟小演示
周六可选探索或补学按兴趣深入前沿,也可以休息或补基础
周日休息不增加新主题

没有每周分数。周五的作用是把知识讲清楚,不是考试。某周没有完成实验时,可以保留问题并继续;优先保证理解,而不是为了打勾赶进度。

2.1 日期总览

日期Day主题
W105-24 ~ 05-30E01~E07机器人数学、坐标系与仿真入门
W205-31 ~ 06-06E08~E14运动学、动力学、轨迹与反馈控制
W306-07 ~ 06-13E15~E21状态估计、传感器融合与 SLAM
W406-14 ~ 06-20E22~E28感知、多模态表征与第一阶段复盘
W506-21 ~ 06-27E29~E35Navigation、规划与主动感知
W606-28 ~ 07-04E36~E42Manipulation、接触、抓取与技能
W707-05 ~ 07-11E43~E49模仿学习、强化学习与动作生成
W807-12 ~ 07-18E50~E56World Model、物理推理与第二阶段复盘
W907-19 ~ 07-25E57~E63VLA 与 Robot Foundation Models
W1007-26 ~ 08-01E64~E70仿真、sim2real 与具身系统工程
W1108-02 ~ 08-08E71~E77具身安全、HRI 与人在回路
W1208-09 ~ 08-15E78~E84Multi-Robot 与全阶段低压力复盘
延伸08-16 ~ 08-21E85~E90知识地图、前沿阅读与长期兴趣路线

3. Apple Silicon 与无硬件学习方案

3.1 A 档:Apple 原生主线

建议使用:

  • Python 3.11 或启动时仍受支持的更新版本。
  • 独立虚拟环境,不污染现有 Next.js 工程。
  • NumPy、SciPy、Matplotlib、OpenCV。
  • PyTorch MPS。
  • MuJoCo 原生 Python bindings。
  • Gymnasium、Gymnasium-Robotics。
  • PettingZoo MPE。
  • 自写小型 SE(2)、planar arm 和 grid world。

学习原则:

  • 状态输入优先,理解机制后再加入图像。
  • 视觉实验使用低分辨率、小 batch 和冻结 encoder。
  • 可训练 policy 以小网络为主。
  • 不下载无明确用途的大模型和大数据集。
  • 不要求完整训练 Dreamer、OpenVLA、π0 或 GR00T。

MuJoCo 提供 macOS universal binary,Gymnasium-Robotics 官方支持 macOS,因此它们适合作为本阶段主仿真路线:

3.2 B 档:轻量降级

如果 MuJoCo、MPS、视觉模型或编译依赖不顺利:

  • 使用 CPU、NumPy 和小型 PyTorch 网络。
  • 使用自写 2D 移动机器人、2-link arm 和离散 grid world。
  • 图像降级为小图、OpenCV 特征或预计算 embedding。
  • SLAM 使用合成 landmark、odometry 和轨迹。
  • manipulation 使用 reach、push 或有限状态技能。
  • multi-robot 使用自写网格或 PettingZoo。

轻量实现并不妨碍深入学习。一个能解释清楚的 2D EKF 或 planar arm,通常比跑通但无法解释的大型框架更有价值。

3.3 C 档:阅读与回放

如果某周没有条件训练或运行模拟器:

  • 使用固定轨迹和公开数据小切片。
  • 阅读论文中的结构图、损失函数和实验设计。
  • 使用预计算模型输出理解 action、embedding 或 trajectory。
  • 实现评估器、可视化或故障分析。
  • 用 deterministic replay 理解系统行为。

C 档不需要制造实验结论。官方论文、视频和 benchmark 只作为学习材料。

3.4 可选远程扩展

Habitat、Isaac、OpenVLA、GR00T 或大型 VLA inference 可能更适合 Linux/NVIDIA。它们只作为可选探索,不是完成要求。使用前先回答:

  • 本地无法理解的具体问题是什么?
  • 是否可以用论文、预计算结果或小模型替代?
  • 预计花费多少时间和费用?
  • 运行结果能说明什么,不能说明什么?

4. W1 · 机器人数学、坐标系与仿真入门

日期:2027-05-24 ~ 2027-05-30 Day:E01 ~ E07

本周核心问题

  • 机器人如何表示位置、姿态、速度和坐标变换?
  • 为什么 frame、unit 和 timestamp 会影响整个闭环?
  • 如何从数学模型进入最小仿真?
Day日期节奏内容
E0105-24 周一概念数学具身闭环;state、observation、action;向量、旋转矩阵、SO(2)、SO(3)、SE(2)、SE(3)
E0205-25 周二最小实现实现 compose、inverse、transform_point、2D pose 和 quaternion normalization
E0305-26 周三仿真练习建立 2D 移动机器人或 2-link arm,画出 frame tree 和轨迹
E0405-27 周四案例故障比较 world/body frame、左乘/右乘、degree/radian 和单位错误
E0505-28 周五整理演示画一张坐标系知识图,演示一个 frame bug 如何传播到动作
E0605-29 周六可选探索学习 quaternion、twist、adjoint 或 Modern Robotics 习题;也可补线性代数
E0705-30 周日休息不增加新主题

建议理解

  • rotation matrix 的正交性。
  • quaternion 的归一化和双覆盖。
  • homogeneous transform 的组合和逆。
  • frame notation。
  • 数值误差和 condition number。
  • 仿真环境中的 observation/action contract。

最小练习

让一个 2D 机器人把局部坐标点变换到世界坐标;再故意交换 frame 或角度单位,观察轨迹如何偏离。


5. W2 · 运动学、动力学、轨迹与反馈控制

日期:2027-05-31 ~ 2027-06-06 Day:E08 ~ E14

本周核心问题

  • 目标 pose 如何转成关节和控制信号?
  • 运动学可达为什么不等于动力学可执行?
  • feedback 如何抵抗误差和扰动?
Day日期节奏内容
E0805-31 周一概念数学Forward/Inverse Kinematics、configuration space、Jacobian、singularity、刚体动力学和状态空间
E0906-01 周二最小实现实现 planar FK/IK、Jacobian、PID 和简单 anti-windup
E1006-02 周三仿真练习在 Reacher、InvertedPendulum 或 2-link arm 中比较 open-loop 与 feedback
E1106-03 周四案例故障改变 mass、friction、delay、control frequency、noise 和 actuator saturation
E1206-04 周五整理演示整理 PID、LQR、trajectory optimization、MPC 的关系;演示一个 controller
E1306-05 周六可选探索学习 LQR、MPC、underactuated system 或 trajectory optimization
E1406-06 周日休息不增加新主题

建议比较

  • open-loop trajectory;
  • joint-space PID;
  • task-space Jacobian controller;
  • LQR 或最小 MPC。

观察指标

指标只用于帮助理解,不设强制阈值:

  • tracking error;
  • overshoot;
  • settling time;
  • control effort;
  • action saturation;
  • disturbance recovery。

重点工程认识

学习 policy 不会自动消除控制问题。真实机器人通常仍需要低层频率更高、边界更明确的 controller。


6. W3 · 状态估计、传感器融合与 SLAM

日期:2027-06-07 ~ 2027-06-13 Day:E15 ~ E21

本周核心问题

  • 机器人无法直接看到真实 state 时怎么办?
  • filtering、smoothing、odometry、localization 和 SLAM 有什么区别?
  • loop closure 为什么既能纠正漂移,也可能造成严重错误?
Day日期节奏内容
E1506-07 周一概念数学Bayes filter、process/measurement model、Kalman、EKF、particle filter、pose/factor graph
E1606-08 周二最小实现实现 1D Kalman 和 2D EKF localization,显示 mean 与 covariance
E1706-09 周三仿真练习比较 dead reckoning、EKF 和 batch least-squares/factor graph
E1806-10 周四案例故障注入 bias、dropout、timestamp offset、错误 data association 和 false loop closure
E1906-11 周五整理演示整理 ATE、RPE、innovation、不确定性;演示一次漂移与修正
E2006-12 周六可选探索GTSAM、IMU preintegration、TUM RGB-D 或 EuRoC 小切片
E2106-13 周日休息不增加新主题

推荐练习

合成一个有 noisy odometry 和 landmarks 的 2D 机器人:

  1. 只用 odometry 画轨迹。
  2. 加入 landmark measurement。
  3. 观察 covariance 如何变化。
  4. 添加错误 loop closure。
  5. 比较全局一致性和局部漂移。

资料

不要求在 Apple Silicon 编译 ORB-SLAM3。理解 SLAM 管线比解决大型编译依赖更重要。


7. W4 · 感知、多模态空间表征与第一阶段复盘

日期:2027-06-14 ~ 2027-06-20 Day:E22 ~ E28 节奏说明:低压力复盘周;减少新内容,优先串联 W1~W3。

本周核心问题

  • 识别物体与知道物体在哪里、能否操作有什么区别?
  • 几何、视觉 embedding 和语言表征各自保留什么?
  • 坐标、感知和状态估计如何连接?
Day日期节奏内容
E2206-14 周一概念数学camera model、intrinsics/extrinsics、projection、depth、point cloud、CNN/ViT、自监督视觉
E2306-15 周二最小实现实现 pinhole projection/back-projection 和简单像素到空间坐标映射
E2406-16 周三仿真练习比较 color/shape rule、OpenCV feature、frozen embedding、segmentation-assisted localization
E2506-17 周四案例故障光照、遮挡、视角、背景、相似干扰物、depth 缺失和语言歧义
E2606-18 周五阶段整理画出 perception→frame→estimation→control 链路;做一个轻量演示
E2706-19 周六可选复盘补 W1~W3 中最感兴趣或最薄弱的一个主题,不引入大型项目
E2806-20 周日休息不增加新主题

推荐比较

  • classical geometry;
  • OpenCV/local feature;
  • CLIP-style language alignment;
  • DINO-style frozen visual representation;
  • SAM-style promptable segmentation。

重点认识

  • 分类准确不等于空间定位准确。
  • 语义相似不等于 affordance 相同。
  • perception 输出必须明确 frame、timestamp 和 confidence。
  • 感知模型更强不一定让下游导航或 manipulation 更好。

资料


8. W5 · Navigation、规划与主动感知

日期:2027-06-21 ~ 2027-06-27 Day:E29 ~ E35

本周核心问题

  • 已知地图、未知地图、部分可观测和语言导航分别需要什么?
  • global planner、local planner 和 controller 如何分工?
  • 机器人什么时候应先获得信息再行动?
Day日期节奏内容
E2906-21 周一概念数学Dijkstra、A*、occupancy map、configuration space、RRT、POMDP、active perception
E3006-22 周二最小实现实现 A*、collision checking、occupancy update 和简单 replanning
E3106-23 周三仿真练习在 grid world 中完成 point-goal、object-goal 或 semantic-goal navigation
E3206-24 周四案例故障dynamic obstacle、localization drift、blocked path、模糊目标和错误语义地图
E3306-25 周五整理演示比较 global/local/reactive planning,演示一次 replan 或 clarification
E3406-26 周六可选探索VLMaps、Habitat、vision-language navigation 或 frontier exploration
E3506-27 周日休息不增加新主题

推荐比较

  • oracle pose + A*;
  • noisy pose + A*;
  • reactive policy;
  • semantic map hybrid;
  • 可选 learned navigation。

可观察指标

  • success;
  • path length;
  • SPL;
  • collision/near-miss;
  • replan 次数;
  • localization dependency;
  • clarification。

资料


9. W6 · Manipulation、接触、抓取与技能组合

日期:2027-06-28 ~ 2027-07-04 Day:E36 ~ E42

本周核心问题

  • 接触为什么让 manipulation 比 free-space motion 更难?
  • 抓取稳定、轨迹无碰撞和任务完成如何分别理解?
  • 高层任务如何组合低层技能?
Day日期节奏内容
E3606-28 周一概念数学wrench、contact、friction cone、grasp、impedance、task and motion planning
E3706-29 周二最小实现实现 planar reach/push、IK trajectory、PD/impedance-like controller 和 skill precondition
E3806-30 周三仿真练习在 Fetch、Reacher、Pusher 或 planar arm 中完成 reach/push/pick-place 子任务
E3907-01 周四案例故障object pose、mass/friction、grasp offset、delay、distractor、action clipping
E4007-02 周五整理演示比较 scripted state machine、IK+feedback 和小型 learned policy
E4107-03 周六可选探索Diffusion Policy、dexterous hand、tactile、deformable object 或 task-motion planning
E4207-04 周日休息不增加新主题

重点认识

  • 接触模型只是现实接触的近似。
  • 碰到物体不等于抓取成功。
  • manipulation 成功应关心最终 object pose、稳定性和动作约束。
  • skill 需要 precondition、termination 和 recovery。

10. W7 · 模仿学习、强化学习与动作生成

日期:2027-07-05 ~ 2027-07-11 Day:E43 ~ E49

本周核心问题

  • 离线 loss 很低的 BC 为什么会在闭环中失效?
  • imitation、offline RL、online RL 与经典控制各自适合什么条件?
  • action chunk、diffusion 和 flow-based policy 解决什么问题?
Day日期节奏内容
E4307-05 周一概念数学MDP/POMDP、BC、covariate shift、DAgger、offline RL、PPO/SAC、action distribution
E4407-06 周二最小实现实现小型 BC loop、episode dataset、closed-loop rollout 和 DAgger-like data aggregation
E4507-07 周三仿真练习用经典 controller 生成 demonstration,比较 expert、BC、BC+noise、DAgger
E4607-08 周四案例故障demonstration 数量/质量、初态偏移、dynamics shift、action chunk、inference delay
E4707-09 周五整理演示整理 distribution shift、on/off-policy、sample efficiency;演示一个 compounding error
E4807-10 周六可选探索小型 PPO/SAC、Diffusion Policy、ACT、HER 或 offline dataset
E4907-11 周日休息不增加新主题

推荐实践

不用追求算法数量。完成以下一条即可:

  • BC 与 DAgger 对照。
  • BC 与小型 PPO/SAC 对照。
  • state-based behavior cloning 与 action chunk 对照。
  • 只阅读 Diffusion Policy,并用小数据观察多模态 action。

资料


11. W8 · World Model、物理推理与第二阶段复盘

日期:2027-07-12 ~ 2027-07-18 Day:E50 ~ E56 节奏说明:低压力复盘周;world model 只做最小机制,不要求复现大型训练。

本周核心问题

  • world model 应预测 pixel、latent、state、reward 还是 task consequence?
  • 预测得像是否意味着适合 planning?
  • planner 如何利用模型误差?
Day日期节奏内容
E5007-12 周一概念数学forward/inverse model、system ID、latent dynamics、MPC/CEM、Dreamer、TD-MPC、JEPA
E5107-13 周二最小实现实现 linear 或小型 MLP action-conditioned dynamics,以及 random shooting/CEM
E5207-14 周三仿真练习比较 simulator dynamics、learned dynamics 和 model-free policy 的短 horizon 行为
E5307-15 周四案例故障horizon、OOD action、contact、sparse reward、model size、uncertainty
E5407-16 周五阶段整理画出 model-based control、Dreamer、TD-MPC、V-JEPA 的关系图
E5507-17 周六可选复盘阅读 V-JEPA 2、Genie、DreamerV3;或补 W5~W7 中一个主题
E5607-18 周日休息不增加新主题

推荐观察

  • one-step 与 multi-step prediction 的差异。
  • horizon 变长后的误差累积。
  • imagined reward 与实际 reward 的差异。
  • ensemble disagreement 或 uncertainty。
  • 为什么 planning value 比视频逼真度更重要。

资料


12. W9 · VLA 与 Robot Foundation Models

日期:2027-07-19 ~ 2027-07-25 Day:E57 ~ E63

本周核心问题

  • VLM 如何转成输出动作的 VLA?
  • action token、chunk、diffusion、flow matching 有什么差异?
  • 跨任务、跨环境、跨 embodiment 的泛化如何理解?
Day日期节奏内容
E5707-19 周一概念数学robot episode schema、state/action normalization、RT-2、RT-X、Octo、OpenVLA、π0、SmolVLA
E5807-20 周二最小实现将仿真轨迹整理为最小 RLDS/LeRobot-like schema;实现 language-conditioned action head
E5907-21 周三仿真练习比较 state-only、vision-only、language+state、frozen multimodal features
E6007-22 周四案例故障paraphrase、distractor、camera shift、action scaling、impossible task、cross-embodiment mismatch
E6107-23 周五整理演示画出 VLM→reasoner→VLA→controller 链路;演示 action decode 和闭环差异
E6207-24 周六可选探索SmolVLA/Octo inference、OpenVLA/π0 代码阅读、Open X 数据格式或最新 SOTA
E6307-25 周日休息不增加新主题

经典到前沿的路线

路线重点理解
RT-1 / RT-2将 web-scale 视觉语言知识迁移到动作输出
Open X-Embodiment / RT-X多机器人、多数据源、统一数据格式
Octo开放 generalist policy、diffusion action head、轻量适配
OpenVLA开源 VLA、action tokenization、LoRA 适配
π0 / OpenPIflow-based action generation、generalist policy
SmolVLA更小、更开放、面向可负担机器人学习
GR00Thumanoid、多模态数据、双系统或分层 policy
Gemini RoboticsVLA、embodied reasoning、tool orchestration 和多机器人协作

2026 SOTA 更新

阶段执行时应重新检查模型版本,不把本计划写死为永远最新。当前资料包括:

这些官方能力描述用于理解路线,不等于本地已经复现,也不能单独证明开放世界可靠性。

重点认识

  • 单步 action prediction 不等于闭环任务成功。
  • action coordinate、normalization、frequency 和 termination 非常重要。
  • 高层 embodied reasoner 与低层 VLA/controller 是不同角色。
  • foundation model 仍需要 robot data、adaptation、安全和运行工程。

13. W10 · 仿真、sim2real 与具身系统工程

日期:2027-07-26 ~ 2027-08-01 Day:E64 ~ E70

本周核心问题

  • 仿真中的哪些假设最容易在现实中失效?
  • 机器人 AI 为什么也是实时、分布式和可观测的软件工程问题?
  • 如何利用日志和故障注入理解系统,而不把课程扩张为生产认证?
Day日期节奏内容
E6407-26 周一概念数学physics/contact/solver 边界、domain randomization、system ID、ROS 2、time/QoS、logging
E6507-27 周二最小实现建立 perception/estimation/planning/control 的小型接口和 timestamped event log
E6607-28 周三仿真练习比较 nominal 参数与轻量 domain randomization;进行 log replay
E6707-29 周四案例故障stale frame、dropout、out-of-order timestamp、timeout、localization divergence
E6807-30 周五整理演示画出 high/low-level split、latency budget、watchdog 和 degraded mode
E6907-31 周六可选探索ROS 2 topic/service/action、MCAP、MuJoCo Playground 或 sim-to-sim
E7008-01 周日休息不增加新主题

重点工程能力

  • observation/action interface。
  • frame 与 timestamp。
  • sensor rate 和 control rate。
  • latency、stale data 和 timeout。
  • log、replay 和可视化。
  • high-level planning 与 low-level control 分层。
  • 简单 watchdog、stop 和 degraded mode。

仿真证据边界

学习环境可以说不能说
数学或 trace实现满足预期性质机器人任务已成功
2D simulator方法在该简化环境有效3D 接触或真机有效
MuJoCo/Gymnasium指定仿真任务中的表现真实硬件成功
sim-to-sim对未见模拟参数或另一模拟器的变化sim-to-real 已解决
官方真机视频官方展示了某种能力自己完成了真机实验

本阶段默认最高证据层级是 simulation 或 sim-to-sim。

资料


14. W11 · 具身安全、HRI 与人在回路

日期:2027-08-02 ~ 2027-08-08 Day:E71 ~ E77

本周核心问题

  • 语义上合理的指令为什么可能在物理上危险?
  • semantic、physical、operational safety 有什么区别?
  • 机器人何时应拒绝、停止、降级或请求帮助?
Day日期节奏内容
E7108-02 周一概念数学ODD、hazard、constrained decision、shield、HRI、proxemics、uncertainty escalation
E7208-03 周二最小实现实现简单 action limit、collision stop、timeout 和 clarification state
E7308-04 周三仿真练习在 scripted human avatar 环境中观察距离、停止、绕行和 handoff
E7408-05 周四案例故障human crossing、危险物、模糊 handoff、冲突指令、遮挡和 localization loss
E7508-06 周五整理演示整理 semantic/physical/operational 三层安全和人在回路位置
E7608-07 周六可选探索Safety-Gymnasium、ASIMOV、social navigation 或 HRI 论文
E7708-08 周日休息不增加新主题

少数必要安全底线

本阶段不做认证,只保留以下学习底线:

  1. 不连接和控制真实电机、机械臂或移动底盘。
  2. 不让真实人员进入未经评审的控制闭环。
  3. 仿真中保留 action limit、collision/timeout stop 和人工终止入口。
  4. 危险、模糊或不可行的语言任务允许拒绝或请求澄清。
  5. 自然语言 reasoning 不能作为唯一物理安全层。
  6. 不使用真实人脸、家庭、客户或敏感场所数据。

标准边界

  • ISO 10218 面向工业机器人特定范围。
  • ISO 13482 面向 personal care robot 特定范围。
  • 本周只学习 hazard 和 risk reduction 思路。
  • 不声称标准合规、产品认证、法律意见或部署许可。

资料


15. W12 · Multi-Robot 与全阶段低压力复盘

日期:2027-08-09 ~ 2027-08-15 Day:E78 ~ E84 节奏说明:低压力复盘周;理解协作问题并串联全阶段,不要求综合大项目。

本周核心问题

  • 多机器人为什么不是复制两个单机器人?
  • path conflict、task allocation、通信和 non-stationarity 如何耦合?
  • 单机器人知识如何扩展到 fleet 和 collective intelligence?
Day日期节奏内容
E7808-09 周一概念数学Dec-POMDP、MAPF、CBS、ORCA、task allocation、CTDE、fleet metrics
E7908-10 周二最小实现实现 prioritized planning 或简化 CBS;加入简单 auction 或 task assignment
E8008-11 周三仿真练习比较 independent greedy、centralized planner、prioritized planning 或 ORCA
E8108-12 周四案例故障communication delay、agent unavailable、stale shared map、narrow corridor、duplicate task
E8208-13 周五阶段整理画出单机器人→多机器人能力图,整理全 12 周知识关系
E8308-14 周六可选探索PettingZoo、MADDPG、Gemini Robotics ER 2 多机器人协作;或整理兴趣项目
E8408-15 周日休息不增加新主题

推荐比较

  • independent greedy;
  • centralized planner;
  • prioritized planning;
  • Conflict-Based Search;
  • ORCA local avoidance;
  • auction task allocation;
  • CTDE/MADDPG 只做概念或可选小实验。

可观察指标

  • makespan;
  • throughput;
  • total travel;
  • collision/deadlock;
  • communication;
  • reassignment;
  • fairness。

这些指标用于理解 trade-off,不设置统一成绩线。

资料


16. E85~E90 · 知识地图与长期延伸

这六天用于把 12 周内容沉淀为可以长期复习和继续探索的知识结构,整体保持轻松整理节奏。

Day日期主题建议活动
E8508-16 周一具身智能知识地图画出数学、感知、估计、规划、控制、学习、安全和多机器人之间的依赖
E8608-17 周二经典方法比较比较 classical、learning-based、foundation model 和 hybrid 四类路线
E8708-18 周三前沿阅读日阅读 Gemini Robotics 2/ER 2、ER 1.6、GR00T N1.6、π0、V-JEPA 2 或 Genie
E8808-19 周四兴趣项目整理从导航、操作或感知中选一个,整理代码、图、问题和下一步,不要求完善
E8908-20 周五长期路线设计建立 3/6/12 个月阅读与实践清单,确定最感兴趣的 1~2 条主线
E9008-21 周六阶段总结写一篇轻量总结:已理解什么、仍困惑什么、未来继续学什么

E86 建议比较框架

维度经典方法学习方法Foundation ModelHybrid
先验显式模型较强从数据学习大规模预训练显式约束 + 数据
可解释性通常较强依任务而定行为复杂可分层分析
数据需求较低中到高很高可控制
OOD取决于模型假设可能脆弱有迁移但不稳定可设计 fallback
实时性通常可控依模型大小可能较重分层部署
安全边界可显式约束需要额外机制不应单独承担更适合工程实践

17. 可选项目:Embodied Simulation Study

这个项目完全可选。只选择 感知、导航、操作 中一个方向,不要求构建完整机器人堆栈。

17.1 方向 P:Perception Study

可选问题:

  • classical feature、frozen embedding 和 segmentation 对空间定位有什么差异?
  • 光照、遮挡、视角变化会如何影响结果?
  • perception score 和下游任务是否一致?

最小内容:

  • 一个小型图像或仿真数据集。
  • 两种方法对比。
  • 一个故障切片。
  • 一张结果图和失败说明。

17.2 方向 N:Navigation Study

可选问题:

  • A*、reactive policy 和 semantic map 在部分可观测环境中如何取舍?
  • localization noise 如何影响 path planning?
  • 什么时候 replan 或 clarification 更重要?

最小内容:

  • 一个 grid/2D/MuJoCo navigation 环境。
  • 两个 baseline。
  • 一个动态障碍或定位故障。
  • 一段轨迹可视化和学习总结。

17.3 方向 M:Manipulation Study

可选问题:

  • scripted/IK controller 与 behavior cloning 在 reach/push 中有什么差异?
  • friction、object pose 或 delay 如何改变动作?
  • action chunk 对平滑度和延迟有何影响?

最小内容:

  • 一个 planar arm、Reacher、Pusher 或 Fetch 子任务。
  • 两种方法。
  • 一个参数变化。
  • 一段 rollout 和失败分析。

17.4 项目不要求

  • 不要求专门准备陌生评测集。
  • 不要求固定成功率。
  • 不要求 30 个 episodes。
  • 不要求多模态、world model、VLA、安全和多机器人全部接入。
  • 不要求部署、发布或真机。
  • 不要求为了“完整”增加云成本。

完成其中一个方向,或者只完成前 12 周知识整理,都符合本阶段的学习定位。


18. 工程能力补齐清单

本阶段除了算法,也关注 AI 时代具身系统常见的工程能力:

18.1 数据与时间

  • episode、step、observation、action 和 metadata。
  • state/action normalization。
  • camera、proprioception 和 language alignment。
  • timestamp、sampling rate 和 dropped frame。
  • RLDS、LeRobotDataset、rosbag/MCAP 的设计思想。

18.2 系统接口

  • continuous stream、request/response 和 long-running action。
  • perception、estimation、planner、controller 的边界。
  • high-level reasoner 与 low-level VLA/controller 的边界。
  • frame tree、action space 和 termination contract。

18.3 运行与调试

  • reproducible seed 和 environment version。
  • event log、trajectory replay 和可视化。
  • latency、timeout 和 stale data。
  • failure taxonomy。
  • degraded mode 和人工终止。

18.4 模型工程

  • frozen encoder + small head。
  • action token/chunk/diffusion/flow。
  • offline prediction 与 closed-loop behavior 的差异。
  • quantization、on-device inference 和 control frequency。
  • world model uncertainty 与 planner exploitation。

这些能力以理解和小练习为主,不扩张成生产平台建设。


19. 长期前沿研究雷达

  1. Humanoid whole-body control、balance、locomotion 和 mobile manipulation。
  2. Dexterous hand、tactile、force、audio 与 deformable objects。
  3. Embodied reasoning、long-horizon task decomposition 和 tool use。
  4. World-action models、JEPA 与 action-conditioned video models。
  5. Generative simulation、Genie 和自动生成交互环境。
  6. Cross-embodiment、morphology adapter 和 universal action representation。
  7. Lifelong robot learning、skill memory 和 catastrophic forgetting。
  8. Autonomous data engines、active sampling 和 failure mining。
  9. Edge VLA、quantization、real-time chunking 和 hardware-aware inference。
  10. Collective embodied intelligence、fleet learning 和共享世界模型。
  11. Physical AI safety、uncertainty escalation 和 corrigibility。
  12. Human-compatible intelligence、legibility、trust calibration 和共同决策。

阅读前沿时持续区分:

  • task transfer;
  • environment generalization;
  • online adaptation;
  • causal reasoning;
  • open-world autonomy;
  • AGI。

这些不是同一个证据层级。


20. 原始论文与官方资料索引

20.1 机器人基础与控制

20.2 状态估计与 SLAM

20.3 感知与 Navigation

20.4 Robot Learning 与 World Model

20.5 Robot Data、VLA 与最新 SOTA

20.6 系统、安全与多机器人


21. 阶段结束后的轻量完成定义

本阶段不按分数判定。到 E90 时,满足以下大部分即可认为学习路线已经发挥作用:

  • 能画出具身智能完整知识地图。
  • 能解释至少一个控制、一个估计、一个规划和一个学习方法。
  • 运行过若干最小实现或仿真练习。
  • 能说清 classical、learning、foundation model 和 hybrid 的取舍。
  • 能辨认仿真与真机证据边界。
  • 能说明 Gemini Robotics、GR00T、π0、OpenVLA、V-JEPA 的路线差异。
  • 已找到最感兴趣的 1~2 个长期方向。
  • 可选完成一个感知、导航或操作小研究。

在真正执行前,本文件始终保持“计划中”。进度仍由 AI Deep Mastery 360 的唯一主入口管理,不为 Phase 4 创建并行进度台账。