G83:可选 General Learning Agent Lab:只组合能回答一个问题的组件
General Learning Agent Lab 是可选的小型研究架,用 2~3 个必要组件回答一个可证伪问题,而不是把搜索、RL、记忆、自改进和多 Agent 全部拼成 AGI demo。
内容类型:预习教材(不代表已完成)
日期:2027-05-15
阶段:P3 · AGI Foundations 90
总路线:Day 263
周次节奏:W12 · 周六可选探索
状态:教材已备;学习未完成
一句话定义
General Learning Agent Lab 是可选的小型研究架,用 2~3 个必要组件回答一个可证伪问题,而不是把搜索、RL、记忆、自改进和多 Agent 全部拼成 AGI demo。
学习目标
- 从候选问题中选择一个最小、可本地运行且证据边界清晰的问题。
- 用 research question 决定组件,而不是按技术新颖度堆栈。
- 设计 baseline、artifact、failure archive、人类 checkpoint 与停止条件。
核心知识
候选问题可选其一:exact-match 是否制造表观涌现;adaptive test-time compute 在什么难度下优于固定预算;world-model rollout error 怎样随 horizon 传导;clean anchor 是否减缓合成递归的 tail degradation;replay 与 EWC 的排序怎样随 task similarity 翻转。每个问题只需少数组件。
例如研究 adaptive compute:需要程序化任务生成器、greedy/fixed/adaptive 三个 baseline、确定性 verifier、预算记录和难度切片;不需要 memory、multi-agent 或 self-training。研究 clean anchor:需要可控长尾分布、generate/filter/retrain、lineage 与冻结评估;不需要 tool runtime。删掉无关组件会增加可解释性。
Lab 的“general”指用统一接口比较学习与适应机制,不表示系统通用。接口可为 reset(task_spec,seed), observe, act, learn, evaluate;但不同算法的可用信息、预算和训练数据必须记录,不能因统一 API 假装公平。
可选项目允许停在论文对照表、实验 spec 或一个组件。环境配置、README 和 planned notebook 的存在不代表运行;失败、不显著或结果翻转都可作为学习材料。标题与结论不出现“实现 AGI”。
机制与推导
组件选择原则:对研究问题 (Q),每个组件 (c_i) 必须对应一个可观察因果角色:
Keep(c_i) iff removing(c_i) makes Q untestable or a key confound uncontrolled
若移除组件不影响问题可检验性,就延后。研究 spec 固定:Q, H, baselines, independent variable, metrics, budget, seeds, split, falsifier, stop。举例 world-model 问题可设:
H:在相同环境调用预算下,open-loop planner 的 action failure 随 horizon 增长快于 receding-horizon replanning。
变量为 horizon/重规划频率,指标含 state prediction error 与 task failure;反例是 prediction error 增长但行为不变,说明任务对误差不敏感。不要只测最终 reward。
停止条件包括最大运行数、最大本地时间、无外部权限、连续失败后的诊断暂停。Human checkpoint 只决定是否值得继续或缩小,不要求通过评分。
最小练习或观察步骤
- 从五个候选问题选一个,用两句话写 Q 和可否定 H;也可以只说明为何暂不选。
- 列所有想到的组件,然后用 Keep 规则删到 2~3 个核心组件。
- 定义两个强 baseline、一个混杂和一个 holdout slice。
- 写目录草图:spec、src、runs、artifacts、negative-results、unknowns;不需要创建全部文件。
- 规定最大预算、沙箱权限和停止条件,并写明任何结果不能证明 AGI。
常见误区与边界
- 将 P3 每周模块都接入,系统复杂到无法归因。
- 因为 API 统一就忽略训练数据、预算和信息差异。
- 把单次最好 demo 作为 general learning 证据。
- 没有失败 archive,只保留顺利轨迹和最好 seed。
- 可选项目变成毕业 Gate;不做项目也不妨碍知识整合。
研究/系统场景连接
金融零售数据可提供抽象任务结构,但应使用无客户信息 toy 数据;目标是理解机制而非做产品。统一 registry、sandbox 与 verifier 可复用 P2 系统工程知识。P4 若继续 Lab,应先将离散环境迁到仿真,加入 observation noise、control rate、safety controller 和 emergency stop,再考虑任何硬件。
自检问题
- 你的研究问题为何需要当前 2~3 个组件?
- 哪个强 baseline 最可能推翻“复杂方法更好”?
- 统一接口隐藏了哪些资源或信息差异?
- 什么停止条件能防止项目无限扩张?
专业课程对齐
- Stanford CS330: Deep Multi-Task and Meta Learning:选读 task distribution、transfer 与 meta-learning 主题,为“general”限定成跨任务适应问题。
- Stanford CS234: Reinforcement Learning:对齐 MDP、planning、evaluation 与 exploration 基础,仅取所选问题需要的部分。
- The AI Scientist:借鉴实验规格和自动执行结构,同时以其限制提醒 Lab 保留人类责任与负结果。
深入学习提示
先写一页“删除列表”:本项目明确不做哪些模型、环境、自动发布和外部动作。范围越清楚,越能看见一个机制是否真正改变。若只完成 spec,也已经形成可继续的学习资产。
学后填写区
- 选择的问题与 H:
- 保留的 2~3 个组件:
- Baseline / confound / holdout:
- 预算与停止条件:
- 明确不做: