返回 G01~G90 教材库
G90 · 总 Day 270教材已备 ≠ 学习已完成

G90:Phase 4 问题树:把离散 Agent 转译为具身闭环

P4 问题树把 P3 的 state、world model、memory、planning、action permission 与 human fallback 转译成感知—状态估计—规划—控制—反馈闭环,并把连续动力学、延迟、接触和不可逆后果加入证据边界。

2027-05-22

内容类型:知识整合教材(不代表已完成)
日期:2027-05-22
阶段:P3 · AGI Foundations 90
总路线:Day 270
周次节奏:知识整合 · 周六轻量阶段小结
状态:教材已备;学习未完成

一句话定义

P4 问题树把 P3 的 state、world model、memory、planning、action permission 与 human fallback 转译成感知—状态估计—规划—控制—反馈闭环,并把连续动力学、延迟、接触和不可逆后果加入证据边界。

学习目标

  1. 解释 observation、state、belief、dynamics、plan、controller 与 actuator 的责任分界。
  2. 推导模型误差、控制延迟与安全约束怎样沿闭环传播。
  3. 为零硬件、本地仿真的 P4 起点写出 workspace、速度、动作与人工接管边界。

核心知识

文本 Agent 常假设离散 observation 完整、action 可撤销、环境可重放;具身系统看到的是带噪声、延迟、遮挡和坐标系的传感器读数。真实 state (x_t) 通常不可直接观测,estimator 根据历史形成 \hat{x}_t 或 belief (b_t)。Memory 不再只是检索文本,还包括 timestamp、frame、odometry 与不确定性;过期但语义相似的记录可能导致错误动作。

World model 从 p(x_{t+1}|x_t,u_t) 预测动力学。长 horizon open-loop rollout 会累积误差,receding-horizon planner 用新观察重规划;但 estimator error、compute latency 和 actuator saturation 会削弱校正。运动学可达不等于动力学可执行,计划轨迹还需低层 controller 按高频反馈跟踪。

Permission 在 P4 变成物理边界:允许哪些 actuator、workspace、速度、力矩、持续时间和接触类型。Safety controller/constraint layer 应在学习策略之外强制,emergency stop 是独立可达的最后防线。模型输出只能是 action proposal;控制器验证后才执行。仿真中通过不能外推真机,因为 friction、mass、sensor noise、delay 和接触模型存在 reality gap。

Human takeover 也受时间约束。文本审批可等待分钟,移动机器人可能在数十毫秒内需要安全动作;系统应先自动进入 safe stop,再让人接管,而不是等待人类实时判断所有动作。人机界面需提供 state estimate、不确定性、计划、控制模式和 stop 状态,而非模型长 rationale。

G90 不是 P3 考试,也不提前启动 P4。可以选择休息、回看或只留问题树;进入 P4 的决定不影响 P3 教材状态,真实进度仍由主线唯一账本未来记录。

机制与推导

最小闭环:

o_t → estimator → x̂_t/b_t → planner/policy → u*_t → safety filter/controller → u_t → dynamics → o_{t+1}

线性状态空间近似:x_{t+1}=Ax_t+Bu_t+w_ty_t=Cx_t+v_t。Estimator 处理 (w,v) 与部分可观测;controller 根据误差 e_t=x_ref-x̂_t 产生动作。若延迟 Δ 使控制基于旧状态,实际误差近似增加 ||x_t-x_{t-Δ}||,高速时更危险。

World-model rollout 误差仍可写 ||e_{t+1}||≤L_f||e_t||+ε_t,但 action 还通过真实动力学放大。Safety filter 可表达约束优化:

u_t = argmin_u ||u-u*_t||² subject to h(x̂_t,u)≥0, u∈U_safe

这不保证绝对安全:(x̂_t) 可能错、约束 h 不完整、求解有延迟。故还需 speed/force limit、watchdog、safe-stop 与仿真 fault injection。

P4 问题树可分五枝:grounding/frame;belief/uncertainty;planning/control;learning/sim2real;safety/HRI。每枝写 P3 已有概念、具身新增变量、最小仿真与禁止外推。

最小练习或观察步骤

  1. 画最小闭环,给每条边标 unit、frame、timestamp、frequency 与 uncertainty;缺一项就写风险。
  2. 以 2D 移动机器人为 toy,设 observation noise、100ms delay 和最大速度,描述误差怎样传播。
  3. 写 action contract:proposal、safety-filtered、executed、observed 四种动作状态,不能互相覆盖。
  4. 为 world model、memory/belief、planning、permission、human takeover 各写一个 P4 问题和一个最小仿真。
  5. 规定零硬件、无真实 actuator、有限 workspace、safe stop、运行预算和“仿真不能证明真机”的声明。

常见误区与边界

  • 把 observation 当真实 state,忽略遮挡、噪声和 timestamp。
  • 学习 policy 输出 action 就直达 actuator,没有 controller 与约束层。
  • 仿真成功视频被写成真机或现实安全证据。
  • 认为 world model 像真就能安全控制,未测 action-sensitive error。
  • Human-in-the-loop 被设计成每步人工批准,忽略反应时间与队列;或完全没有 safe stop。

研究/系统场景连接

金融 Agent 的提议→审批→执行结构可迁移为 policy→safety filter→actuator,但物理闭环更快且不可逆;Web3 签名的不可逆性帮助理解 action boundary,却没有动力学与接触。P4 默认 Apple Silicon、本地仿真、零硬件:先用 NumPy 2D robot、planar arm 或 MuJoCo,学习坐标系、PID/LQR、Kalman/EKF、A*、MPC 与安全停机,再接触 VLA 等前沿。

自检问题

  1. Observation、state estimate 与 belief 分别是什么?
  2. Replanning 为什么不能消除延迟和模型误差?
  3. Safety filter 的约束优化留下哪些 residual risk?
  4. Human takeover 为什么通常需要先自动 safe stop?
  5. 哪些 P3 结论不能直接带到真机?

专业课程对齐

  • Modern Robotics:从坐标系、运动学、动力学、轨迹与控制建立 P4 数学主线,优先理解 frame 和反馈。
  • Berkeley CS285:连接 model-based RL、policy learning、control 与机器人问题,保留学习算法相对经典控制的边界。
  • MuJoCo 官方文档:用于本地仿真的物理、模型与运行边界;仿真只作为机制学习和故障注入环境。

深入学习提示

进入 P4 前先问“闭环中哪个状态是真实拥有的、哪个只是估计、哪个动作真正执行”。任何算法名都应落在这条链上的一个责任位置。若暂时不想进入 P4,可以停在问题树或回到 P3 兴趣方向,不需要用阶段完成感驱动硬件或大模型投入。

学后填写区

  • 五枝 P4 问题树:
  • 闭环与 frame/timestamp/frequency:
  • Action contract:
  • 仿真安全边界:
  • 是否愿意进入 P4(可留空):
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本