AI Deep Mastery P3:AGI Foundations 90
本文件描述未来学什么、怎样学。按用户要求提前生成的 G01~G90 文件只提供学习输入,不包含已经发生的阅读、实验结果、模型成绩或完成状态;P3 启动前仍不创建独立进度台账。
Phase 3 · AGI Foundations & Research Systems 90
中文名:通用智能基础与研究系统 90 天
状态:未来阶段;G01~G90 预习教材已备,但尚未启动学习
名义日期:2027-02-22 ~ 2027-05-22
编号:G01 ~ G90
前置条件:Phase 2 阶段复盘完成,并在 2027-02-21 过渡日确认愿意继续
定位:研究 AGI 相关能力的定义、机制、实验方法和控制边界;不预测 AGI 到达时间,不把任何单项 benchmark、语言流畅度、Agent demo 或仿真成功称为 AGI
学习原则:学习优先;不含求职、投递、面试冲刺或作品集包装
教材入口:
docs/ai-deep-mastery/phase-3-agi/notes/
专业课程地图:docs/ai-deep-mastery/phase-3-agi/PROFESSIONAL_COURSE_REFERENCE_MAP.md
本文件描述未来学什么、怎样学。按用户要求提前生成的 G01~G90 文件只提供学习输入,不包含已经发生的阅读、实验结果、模型成绩或完成状态;P3 启动前仍不创建独立进度台账。
1. 阶段目标与边界
本阶段不是“90 天造出 AGI”,而是把容易被宏大叙事混在一起的能力拆成可以定义、实现、测量和证伪的研究问题:
能力广度 / generality
×
任务性能 / performance
×
学习与适应效率 / learning efficiency
×
记忆、规划与工具 / memory, planning, tool use
×
持续与社会学习 / continual and social learning
×
自主程度与风险 / autonomy and risk
完成后应能:
- 区分 skill、intelligence、generality、autonomy 和 deployment risk。
- 理解 scaling、涌现、推理、world model、自改进等主张的证据、争议与可验证方式。
- 从零实现小型 search、RL、model-based planning、memory、continual learning 和 causal intervention。
- 学会使用 baseline、合理切分、随机种子、effect size、置信区间、负结果和外推边界阅读实验。
- 可选构建一个小型
General Learning Agent Lab,也可以只深入其中 2~3 个感兴趣的组件;无论做到哪一步,都不把它宣传为 AGI。 - 解释哪些研究问题会在 Phase 4 进入具身环境后发生根本变化,例如部分可观测、连续动力学、接触、安全停机和 sim-to-real。
明确不做
- 不预测 AGI、ASI 或“奇点”的日期。
- 不依据厂商宣传、单次 demo 或 leaderboard 排名判断 AGI。
- 不为复现 frontier-scale 数字购买云 GPU,也不伪造大规模实验。
- 不让实验 Agent 获得无界网络、文件、凭证、资金或外部执行权限。
- 不把模型生成的自评、思维链或自动 reviewer 分数当作独立真值。
- 不预先填写模型成绩、实验结论或“预期成功”结果。
2. 研究认识论与轻量记录
2.1 五类证据标签
建议在重要笔记和实验中使用以下标签。它们是帮助思考的工具,不是评分表:
| 标签 | 含义 | 可否写成已掌握结论 |
|---|---|---|
R | 本阶段按固定配置复现,并保存原始证据 | 只能在复现范围内陈述 |
E | 原始论文或研究机构官方材料提供实证,本人未复现 | 注明“外部证据” |
C | 原始研究之间存在冲突、指标依赖或开放争议 | 保留双方论据与未知点 |
H | 可证伪假设,尚未完成实验 | 只能写预测与判定条件 |
S | 推测性方向或长期研究问题 | 与已证实能力分开记录 |
2.2 轻量学习记录
未来真正启动后,只记录真实读过、做过和仍然不理解的内容;预制教材不预造结果:
docs/ai-deep-mastery/phase-3-agi/
├── PROFESSIONAL_COURSE_REFERENCE_MAP.md
├── notes/gNN-topic.md
└── experiments/week-NN-experiment.md
一次引导实验可以只用一页记录以下内容:
- 想理解的问题和实验前的直觉;
- 使用的任务、baseline、主要变量和环境;
- 关键配置、seed、现象、失败或反常结果;
- 结果可能支持什么、不支持什么、能否跨任务外推;
- 来源与本人工作之间的明确分界。
不是每周都要完成代码实验。若数学推导、交互式演示或论文图表复现已经回答问题,可以停在相应深度,并把尚未解决的疑问留给后续。
2.3 小规模复现原则
本阶段默认使用程序化任务、toy environment、小网络和本地 CPU/MPS。小规模实验的目标是帮助理解机制、测量方法和失败模式,不是复现大模型绝对性能。涉及大规模模型的结论保留 E 或 C 标签,除非确实完成了对应范围的复现。
3. 固定周节奏:轻量但深入
每周围绕一个问题逐步加深,不打分,也不要求所有可选实验都完成:
| 星期 | 固定职责 | 建议产出 |
|---|---|---|
| 周一 | 概念地图、原始论文与研究问题 | 三个关键概念、一个仍不懂的问题 |
| 周二 | 最小机制:推导、伪代码或从零小实现 | 能运行的小例子或手推过程 |
| 周三 | 引导实验或标准 baseline | 一张图、一个对照或一段观察 |
| 周四 | 争议、失败案例、反方论文与现实边界 | “支持 / 反对 / 尚未知”三栏记录 |
| 周五 | 更新知识图谱与一页小结 | 本周理解、疑问、兴趣和下周连接 |
| 周六 | 可选探索或补学;精力不足时直接休息 | 可选,不要求产出 |
| 周日 | 休息 | 无 |
轻量复盘问题
周五只需回答:
- 我现在能用自己的话解释什么?
- 哪个最小机制帮助我真正理解了它?
- 哪个实验、论文或案例与我的直觉冲突?
- 证据能支持到哪里,不能支持到哪里?
- 哪个方向让我想继续深挖?
负结果、没跑通的代码和仍然模糊的概念都可以保留。它们用于调整学习路线,不构成失败或扣分。
4. 12 周总览
| 周 | 编号与日期 | 核心主题 | Capstone 增量 |
|---|---|---|---|
| W1 | G01~G07 · 02-22~02-28 | AGI 定义、能力分解与测量有效性 | Capability Ontology |
| W2 | G08~G14 · 03-01~03-07 | Scaling law 与涌现争议 | Scaling & Emergence Harness |
| W3 | G15~G21 · 03-08~03-14 | 推理、搜索、verifier 与 test-time compute | Adaptive Inference Controller |
| W4 | G22~G28 · 03-15~03-21 | RL、奖励与 model-based RL;阶段复盘一 | RL Baselines |
| W5 | G29~G35 · 03-22~03-28 | World model、反事实与长程规划 | Learned Dynamics Planner |
| W6 | G36~G42 · 03-29~04-04 | Memory、planning 与 tool use | Auditable Agent Runtime |
| W7 | G43~G49 · 04-05~04-11 | 多智能体、合作与社会泛化 | Social Generalization Arena |
| W8 | G50~G56 · 04-12~04-18 | Continual、meta 与 transfer learning;阶段复盘二 | Lifelong Adaptation Protocol |
| W9 | G57~G63 · 04-19~04-25 | 自改进、合成数据与递归风险 | Controlled Improvement Loop |
| W10 | G64~G70 · 04-26~05-02 | Mechanistic interpretability | Causal Inspection Panel |
| W11 | G71~G77 · 05-03~05-09 | Alignment、control 与 evaluation science | Alignment & Control Plane |
| W12 | G78~G84 · 05-10~05-16 | AI Scientist;阶段复盘三 | 可选 General Learning Agent Lab |
| 知识整合 | G85~G90 · 05-17~05-22 | 论文串联、开放问题、兴趣选题与 P4 准备 | 个人后续学习地图 |
5. W1 · AGI 定义、能力分解与测量有效性
范围:G01~G07,2027-02-22 ~ 2027-02-28
研究问题:什么算 generality,什么只是训练分布内 skill?性能、学习效率和自主性如何分开测量?
建议带着这些问题阅读
- skill、intelligence、generality、autonomy、agency 和 deployment risk 有什么区别?
- 固定任务得分、学习新任务的样本效率和跨分布适应为何不能混成一个分数?
- 训练先验、测试污染、提示工程和人类脚手架会怎样改变“智能”判断?
- Benchmark 的 construct validity、ecological validity 和 saturation 应如何审计?
- 为什么一个流畅回答、单项高分或长程 demo 不能单独证明 AGI?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G01 · 周一 | 02-22 | 概念/论文:先写下自己目前对 AGI 的理解,再研读定义与测量框架;建立 generality × performance × learning efficiency × autonomy 概念图。 |
| G02 · 周二 | 02-23 | 最小机制:从零编写一个程序化规则任务生成器;先完成一种规则,再按兴趣扩展组合 OOD 和规则 OOD。 |
| G03 · 周三 | 02-24 | 引导实验:建立 memorization、固定规则和 search/adaptation baseline,观察准确率、适应样本数、compute 和校准。 |
| G04 · 周四 | 02-25 | 争议/案例:改变先验、示例数、指标阈值或污染比例,寻找“训练高分但陌生适应差”的反例。 |
| G05 · 周五 | 02-26 | 更新知识图谱:比较三类 baseline,并用一页小结审视三条“某系统已达到 AGI”式主张。 |
| G06 · 周六 | 02-27 | 可选探索/补学:不用术语堆砌解释为什么 intelligence 不能只看 skill;也可以只整理尚未理解的测量问题。 |
| G07 · 周日 | 02-28 | 休息;最多轻回忆五个核心定义。 |
最小实现与实验
最小实现是 capability_eval:程序化任务生成器、三个 baseline、合理切分和多指标报告。引导实验可改变 demonstrations、priors 和 task composition,比较 IID、compositional OOD 与 rule OOD。重点是观察准确率与适应效率是否一致;没有出现预想现象也如实记录。
W1 一页小结
- 尝试给出可计算的能力定义,而非“像人一样聪明”。
- 能指出 benchmark contamination、metric saturation 和 scaffolding 三类混杂。
- 对三条前沿主张分别标
E/C/H/S,写出缺失控制实验。 - 明确列出本周 toy benchmark 不能证明什么。
Capstone 增量
建立 Capability Ontology、Claim–Evidence Ledger 和统一任务接口。此时只定义 schema 与待测假设,不填写未来成绩。
原始/官方来源
- Levels of AGI for Operationalizing Progress on the Path to AGI
- On the Measure of Intelligence
- Evaluating Cognitive Maps and Planning in Large Language Models with CogEval
- ARC-AGI-2 Technical Report
- Holistic Evaluation of Language Models
6. W2 · Scaling Laws 与涌现争议
范围:G08~G14,2027-03-01 ~ 2027-03-07
研究问题:哪些性能随模型、数据和计算平滑变化?所谓涌现何时是机制现象,何时是指标和统计现象?
建议带着这些问题阅读
- 参数、数据、compute 和训练 loss 的经验关系是什么,适用区间在哪里?
- Compute-optimal training 为什么不同于只增加参数?
- 连续 loss 改进为何会在 exact-match 指标上看似突然跃迁?
- 模型尺度、pre-training loss、任务结构和测量函数分别可能造成什么现象?
- 为什么小规模拟合不能直接外推 frontier model 或 AGI 时间线?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G08 · 周一 | 03-01 | 概念/论文:阅读 power-law 拟合和 compute/data/model 预算关系;记下直觉、拟合区间和可能失效的条件。 |
| G09 · 周二 | 03-02 | 最小机制:从零实现一个微型序列学习模型和训练循环,记录 token loss、partial credit、exact match 与 compute。 |
| G10 · 周三 | 03-03 | 引导实验:使用标准训练框架建立 baseline;先跑 2~3 个预算组合,有兴趣再扩展。 |
| G11 · 周四 | 03-04 | 争议/案例:比较连续与离散指标、改变阈值或注入 under-training,观察“涌现”是否随 metric 消失或移动。 |
| G12 · 周五 | 03-05 | 更新知识图谱:用额外预算点观察拟合误差和残差,整理哪些结论只适用于观测区间。 |
| G13 · 周六 | 03-06 | 可选探索/补学:并列讲述 Emergent Abilities 与 Mirage 两方论证,或补看不熟悉的统计概念。 |
| G14 · 周日 | 03-07 | 休息。 |
最小实现与实验
训练多个微型模型,在固定计算预算下改变模型与数据分配;拟合 loss 曲线,同时报告连续 loss、partial credit 和 threshold/exact-match。使用多个 seed、误差区间和残差分析。实验目标是判断观察到的跃迁对指标、任务和训练充分性的敏感度,不预设一定存在或一定不存在涌现。
W2 一页小结
- 能解释 Kaplan scaling 与 Chinchilla compute-optimal 结论的研究对象和差异。
- 至少完成一次 metric sensitivity test。
- 报告拟合区间、残差和外推禁区。
- 不把 downstream threshold 直接解释为模型内部出现新机制。
Capstone 增量
加入 Scaling & Emergence Measurement Harness:预算、模型、数据、连续指标、阈值指标和置信区间使用同一运行协议。
原始/官方来源
- Scaling Laws for Neural Language Models
- Training Compute-Optimal Large Language Models
- Emergent Abilities of Large Language Models
- Are Emergent Abilities of Large Language Models a Mirage?
- Understanding Emergent Abilities from the Loss Perspective
7. W3 · 推理、搜索、Verifier 与 Test-Time Compute
范围:G15~G21,2027-03-08 ~ 2027-03-14
研究问题:模型的直接生成、外部搜索、过程验证和增加推理计算分别贡献了什么?
建议带着这些问题阅读
- Greedy、sampling、self-consistency、tree search 和 adaptive compute 有何区别?
- Outcome verifier 与 process verifier 各会遗漏或放大什么错误?
- 为什么“输出更多 token”不等于获得更多有效计算?
- Task difficulty、base success rate 和 verifier quality 如何决定 test-time compute 收益?
- 可见推理文本、隐式计算和可验证解题轨迹为何不能混为一谈?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G15 · 周一 | 03-08 | 概念/论文:理解推理预算、搜索空间、difficulty、verifier precision/recall 和停止条件。 |
| G16 · 周二 | 03-09 | 最小机制:从零实现 Game of 24、算术或程序化逻辑题中的一种搜索与确定性 verifier。 |
| G17 · 周三 | 03-10 | 引导实验:从 greedy、best-of-N、self-consistency、tree search 中选 2~3 种,使用相近预算比较。 |
| G18 · 周四 | 03-11 | 争议/案例:消融 verifier 或回溯,并观察 false-positive verifier 与预算过量带来的失败。 |
| G19 · 周五 | 03-12 | 更新知识图谱:按难度画 accuracy–compute–latency 曲线,整理不同策略的适用条件。 |
| G20 · 周六 | 03-13 | 可选探索/补学:解释何时搜索可能胜过直接生成、何时 verifier 会让搜索更坏。 |
| G21 · 周日 | 03-14 | 休息。 |
最小实现与实验
实现一个带确定性验证器的可搜索任务,比较直接生成、best-of-N、self-consistency、树搜索和按难度动态预算。建议按 difficulty 分层,观察候选数、展开节点、token、时延、成功率以及 verifier 的 precision/recall;若时间允许,再测试错误 verifier 是否会随搜索扩大而放大错误。
W3 一页小结
- 区分 sampling、search、verification、online learning 和参数更新。
- 用证据说明 test-time compute 是否单调、在哪些 difficulty bin 有收益。
- 不能只以最终准确率隐藏计算和延迟成本。
- 不把模型生成的解释文字当作正确过程的充分证据。
Capstone 增量
加入 Adaptive Inference Controller,按任务难度和 verifier confidence 分配有上限的搜索预算。
原始/官方来源
- Scaling LLM Test-Time Compute Optimally Can Be More Effective than Scaling Model Parameters
- Let’s Verify Step by Step
- Tree of Thoughts
- STaR: Bootstrapping Reasoning With Reasoning
- Quiet-STaR
8. W4 · Reinforcement Learning 与 Model-Based RL
范围:G22~G28,2027-03-15 ~ 2027-03-21
研究问题:Agent 如何通过交互学习;奖励、value、策略和环境模型怎样共同决定行为与失效?
建议带着这些问题阅读
- MDP 中 state、action、transition、reward、return、policy 和 value 分别是什么?
- Model-free 与 model-based 方法在样本效率、计算和 model bias 上如何取舍?
- Reward misspecification、shortcut 和 goal misgeneralization 有何差异?
- Planning、policy learning 和 online adaptation 如何分界?
- 为什么高训练回报不能证明目标被正确学习?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G22 · 周一 | 03-15 | 概念/论文:从图示理解 Bellman expectation/optimality update,并认识几类 OOD shift。 |
| G23 · 周二 | 03-16 | 最小机制:从零实现 tabular Q-learning 和一个很小的 Gridworld。 |
| G24 · 周三 | 03-17 | 引导实验:实现 Dyna-Q 或简化 learned transition + planning,并与 Q-learning 对照。 |
| G25 · 周四 | 03-18 | 争议/案例:改变奖励位置、障碍、转移概率或 proxy feature,观察 model error 与目标错配。 |
| G26 · 周五 | 03-19 | 阶段复盘一:比较 model-free、learned-model 和 oracle-model;只整理目前的理解、疑问与最感兴趣的方向。 |
| G27 · 周六 | 03-20 | 可选探索/补学:解释 model bias 如何经过 planning 影响决策,或回看最不熟悉的 RL 概念。 |
| G28 · 周日 | 03-21 | 休息。 |
最小实现与实验
在同一 Gridworld 中公平比较 Q-learning、带学习模型的 planning 和 oracle model。训练后分别改变 reward、transition 和 observation proxy,报告 learning curve、sample efficiency、OOD return、模型误差和错误路径。目标是寻找能力失效与目标失效之间的差异,而非追求最高 reward。
W4 低压力阶段复盘
- 我能否用自己的话解释 Bellman update 和 model-based / model-free 的差异?
- 哪个实现或案例最能帮助我理解 model bias?
- Capability generalization 与 goal generalization 还有哪些没想清楚?
- 接下来更想深入 RL、world model,还是只保留概念理解?
这次复盘不打分、不要求重做;只整理理解、疑问和兴趣。Reward 最大化仍不应直接写成“理解了目标”。
Capstone 增量
加入统一的 Reactive / Model-Free / Model-Based agent 接口、轨迹记录和环境 shift 机制。
原始/官方来源
- Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model — MuZero
- Goal Misgeneralization in Deep Reinforcement Learning
- Concrete Problems in AI Safety
9. W5 · World Models、反事实与长程规划
范围:G29~G35,2027-03-22 ~ 2027-03-28
研究问题:预测世界、压缩状态和为行动规划之间是什么关系?
建议带着这些问题阅读
- 能预测下一观察是否等于学到可用于控制的世界模型?
- Observation model、latent dynamics、reward/value model 和 policy 分别承担什么职责?
- 部分可观测环境为何需要 belief、memory 或 recurrent state?
- Rollout error 如何随 horizon 累积并改变 action ranking?
- 逼真生成、动力学一致性和 task relevance 为什么是不同目标?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G29 · 周一 | 03-22 | 概念/论文:画出 observation→latent→transition→prediction/planning 关系图,记录 counterfactual 问题。 |
| G30 · 周二 | 03-23 | 最小机制:从零实现 toy POMDP 与一步 transition predictor;状态编码可保持简单。 |
| G31 · 周三 | 03-24 | 引导实验:建立短 horizon world-model planner,并与 reactive 或 oracle-state 对照。 |
| G32 · 周四 | 03-25 | 争议/案例:扰动 horizon、随机动力学或 observation aliasing,观察 rollout error 如何累积。 |
| G33 · 周五 | 03-26 | 更新知识图谱:比较预测准确率、action ranking 与实际 return,整理三者可能不一致的原因。 |
| G34 · 周六 | 03-27 | 可选探索/补学:解释“看起来像真实”为什么不等于可规划,或回看状态表示与 POMDP。 |
| G35 · 周日 | 03-28 | 休息。 |
最小实现与实验
训练一个小型 observation encoder、latent transition 与 reward/value predictor,并在 latent space 做有限 horizon planning。比较一步误差、多步误差、counterfactual action prediction、计划 action 与真实 return。若观察到“预测指标高但控制失败”,重点分析原因;若未发生,也记录实验范围。
W5 一页小结
- 区分 simulator、generative model、predictive model 和 task-relevant world model。
- 能画出模型误差传导到错误决策的证据链。
- 完成至少一个未见 action sequence 的反事实测试。
- 不以帧质量或重建质量单独评价规划能力。
Capstone 增量
加入 Learned Dynamics & Counterfactual Planner,保留 oracle 与真实环境回放作为校验。
原始/官方来源
- World Models
- Mastering Diverse Domains through World Models — DreamerV3
- MuZero
- Genie: Generative Interactive Environments
- Genie 2: A Large-Scale Foundation World Model
10. W6 · Memory、Planning 与 Tool Use
范围:G36~G42,2027-03-29 ~ 2027-04-04
研究问题:受限上下文中的 Agent 如何积累状态、调用外部能力并在失败后恢复?
建议带着这些问题阅读
- Working、episodic、semantic 和 procedural memory 如何区分?
- 长上下文、检索、摘要和持久状态分别解决什么问题?
- 何时调用工具、如何验证返回、如何处理超时和重复执行?
- Planner–executor、state machine 与自由循环 Agent 有何取舍?
- Memory poisoning、stale state 和 tool error 如何传播?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G36 · 周一 | 03-29 | 概念/论文:理解 memory schema、tool contract、权限、状态转移和 replay。 |
| G37 · 周二 | 03-30 | 最小机制:从零实现一个 planner–executor 状态机、working memory 和单一工具 stub。 |
| G38 · 周三 | 03-31 | 引导实验:加入一种检索/分层记忆,与 no-memory 或 full-transcript 对照。 |
| G39 · 周四 | 04-01 | 争议/案例:从过期记忆、矛盾记忆、timeout、重复调用和权限拒绝中选 2~3 类观察。 |
| G40 · 周五 | 04-02 | 更新知识图谱:观察跨 session 任务中的 task success、retrieval、恢复和权限边界。 |
| G41 · 周六 | 04-03 | 可选探索/补学:用结构化 state/action/result 回看一个失败,或补学检索、幂等与权限概念。 |
| G42 · 周日 | 04-04 | 休息。 |
最小实现与实验
实现显式状态机、短期状态、事件记忆、语义索引和三个确定性工具;不要求记录或暴露隐藏思维链。比较无记忆、完整 transcript、检索记忆和分层记忆,在长任务、干扰事件和多 session 上测成功、检索质量、时延、状态漂移和恢复能力。
W6 一页小结
- 不只看最终成功率,也关注 retrieval 和 tool reliability。
- 任一失败可由保存的结构化状态确定性重放。
- 明确 memory retention、write policy、tool permission 和 side-effect boundary。
- 能说明模型内部 context 与系统持久记忆的差异。
Capstone 增量
加入 Hierarchical Memory + Auditable Tool Runtime,所有有副作用动作默认关闭,仅用本地 stub。
原始/官方来源
- ReAct: Synergizing Reasoning and Acting in Language Models
- Toolformer
- MemGPT: Towards LLMs as Operating Systems
- Generative Agents
11. W7 · 多智能体、合作与社会泛化
范围:G43~G49,2027-04-05 ~ 2027-04-11
研究问题:多智能体交互什么时候产生合作与泛化,什么时候只增加协调成本、串谋或不稳定?
建议带着这些问题阅读
- Coordination、cooperation、competition、negotiation、deception 和 collusion 如何区分?
- 与固定伙伴配合良好是否代表能与陌生伙伴合作?
- 通信是否总有价值;何时造成操纵、过拟合或协调开销?
- 个体回报、社会福利、公平性、exploitability 和稳定性如何共同报告?
- 为什么“更多 Agent”不是“更多智能”的充分条件?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G43 · 周一 | 04-05 | 概念/论文:理解社会泛化、counterpart variation、welfare 与 exploitability。 |
| G44 · 周二 | 04-06 | 最小机制:从零实现 iterated dilemma、公共资源或简化供应链环境中的一个。 |
| G45 · 周三 | 04-07 | 引导实验:加入一个学习/通信策略,并与固定策略伙伴对照。 |
| G46 · 周四 | 04-08 | 争议/案例:观察通信消融、free-rider、deceptive message 或 partner shift 中的两类现象。 |
| G47 · 周五 | 04-09 | 更新知识图谱:cross-play 不同伙伴,整理个体回报、福利、公平、exploitability 和消息成本。 |
| G48 · 周六 | 04-10 | 可选探索/补学:区分协调、合作和串谋,或阅读一个社会泛化失败案例。 |
| G49 · 周日 | 04-11 | 休息。 |
最小实现与实验
可构建一个社会困境环境、多个固定/学习策略和独立通信通道;把训练伙伴与额外观察伙伴分开,比较无通信、有通信、中心化和去中心化策略。评价不只依赖 LLM judge,优先结合环境状态和可计算指标。
W7 一页小结
- 在陌生伙伴上完成 cross-play。
- 同时报告 individual utility 与 collective welfare。
- 至少分析一个局部最优但整体有害的结果,若未出现则报告未出现范围。
- 能说明多 Agent 在串行依赖任务上为何可能更差。
Capstone 增量
加入 Social Generalization Arena,支持 partner population、communication ablation 和 cross-play。
原始/官方来源
- Melting Pot: An Evaluation Suite for Multi-Agent Reinforcement Learning
- SOTOPIA
- Concordia
- No Agent Is an Island
12. W8 · Continual、Meta 与 Transfer Learning
范围:G50~G56,2027-04-12 ~ 2027-04-18
研究问题:系统怎样在持续变化中学习新任务,同时保留旧能力并迁移到未见任务?
建议带着这些问题阅读
- Catastrophic forgetting 和 stability–plasticity dilemma 如何定义与测量?
- Forward transfer、backward transfer、few-shot adaptation 和 task interference 有何区别?
- Replay、regularization、parameter isolation 和 meta-learning 各自牺牲什么?
- In-context adaptation、参数更新和外部 memory update 是三种什么机制?
- 任务顺序和任务相似性为何会改变结论?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G50 · 周一 | 04-12 | 概念/论文:理解 forgetting、BWT、FWT、adaptation efficiency 与任务顺序效应。 |
| G51 · 周二 | 04-13 | 最小机制:从零实现两个 sequential tasks、naive fine-tuning 和简单 replay。 |
| G52 · 周三 | 04-14 | 引导实验:加入 EWC;有兴趣再尝试一阶 MAML/Reptile。 |
| G53 · 周四 | 04-15 | 争议/案例:改变任务顺序、相似性或 replay 大小,检查平均分掩盖的单任务遗忘。 |
| G54 · 周五 | 04-16 | 阶段复盘二:观察 few-shot adaptation 与旧任务遗忘,只整理理解、疑问和最想继续探索的方法。 |
| G55 · 周六 | 04-17 | 可选探索/补学:解释 stability–plasticity 的取舍,或回看 replay、EWC、meta-learning 中最模糊的一项。 |
| G56 · 周日 | 04-18 | 休息。 |
最小实现与实验
可以使用三个小型顺序任务比较 naive fine-tuning、replay 和 EWC,并按兴趣加入 meta-learning。若运行多组任务顺序或 seed,观察 forgetting、BWT、FWT、每任务性能和适应曲线;精力有限时,完成一个清楚的对照即可。
W8 低压力阶段复盘
- 我能否解释 forgetting、BWT、FWT 分别在问什么?
- 哪种现象最能体现 stability–plasticity 的取舍?
- In-context、parameter learning 和 external memory 的边界还有哪里模糊?
- 我更想继续研究 replay、EWC、meta-learning,还是转向自改进与数据问题?
这次复盘不打分,也不要求完成所有算法;保留实验失败和未完成项即可。
Capstone 增量
加入 Lifelong Adaptation Protocol:任务流、回看旧任务、顺序变化和额外迁移任务。
原始/官方来源
- Overcoming Catastrophic Forgetting in Neural Networks
- Model-Agnostic Meta-Learning
- Learning to Learn by Gradient Descent by Gradient Descent
- A Generalist Agent — Gato
13. W9 · 自改进、合成数据与递归风险
范围:G57~G63,2027-04-19 ~ 2027-04-25
研究问题:Generate–evaluate–train 循环什么时候产生真实改进,什么时候只是自我模仿、judge bias 或长尾坍缩?
建议带着这些问题阅读
- 自训练、自蒸馏、自奖励和可验证 self-improvement 的外部信号分别是什么?
- 为什么“模型给自己更高分”不等于能力提高?
- 合成数据如何改变支持集、长尾、多样性和校准?
- Verifier false positive 如何在迭代中被放大?
- 真实数据锚点、过滤和 provenance 能降低哪些风险,不能保证什么?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G57 · 周一 | 04-19 | 概念/论文:理解递归训练、真实数据锚点、tail metrics、verifier error 和停止条件。 |
| G58 · 周二 | 04-20 | 最小机制:从零实现带稀有子群的数据分布和一轮 generate–filter–retrain。 |
| G59 · 周三 | 04-21 | 引导实验:从纯合成、真实混合、规则过滤、diversity filtering 中选 2~3 种比较。 |
| G60 · 周四 | 04-22 | 争议/案例:注入 judge bias、false positive、重复数据或低覆盖,观察错误是否累积。 |
| G61 · 周五 | 04-23 | 更新知识图谱:比较迭代后的平均指标、tail recall、校准、多样性与分布距离。 |
| G62 · 周六 | 04-24 | 可选探索/补学:解释自改进依赖的外部选择信号,或回看 lineage 与长尾测量。 |
| G63 · 周日 | 04-25 | 休息。 |
最小实现与实验
在含稀有子群的可控分布上尝试多轮训练循环,对比 100% synthetic、synthetic+真实锚点、规则 verifier 和 diversity filter。记录每轮数据 lineage、平均性能、尾部召回、校准、多样性和分布距离。不要预设一定出现 model collapse;没有退化也是值得记录的观察。
W9 一页小结
- 能指出每种“自改进”依赖的外部真值或选择压力。
- 不用模型自身 judge 作为唯一评估。
- 同时报告平均与尾部指标。
- 提交 synthetic-data provenance 与停止策略。
Capstone 增量
加入 Evaluator-Bounded Controlled Improvement Loop,默认保留 clean anchor、独立 verifier 和最大迭代数。
原始/官方来源
- Self-Instruct
- STaR
- Self-Rewarding Language Models
- AI Models Collapse When Trained on Recursively Generated Data
- Large Language Models Can Self-Improve
14. W10 · Mechanistic Interpretability
范围:G64~G70,2027-04-26 ~ 2027-05-02
研究问题:怎样从相关性观察推进到关于模型内部机制的可证伪、因果性解释?
建议带着这些问题阅读
- Probe 能解码信息是否代表模型使用了该信息?
- Attention pattern、neuron、feature、circuit 和 algorithm 有什么层级差异?
- Necessity、sufficiency、causal mediation 与 causal abstraction 如何操作化?
- Activation patching、ablation 和 sparse autoencoder 分别回答什么问题?
- 为什么解释一个 toy circuit 不能外推为“理解整个大模型”?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G64 · 周一 | 04-26 | 概念/论文:选择一个已知机制的 synthetic task,理解 circuit hypothesis、必要性和充分性。 |
| G65 · 周二 | 04-27 | 最小机制:从零实现或复用一个两层 toy Transformer,先完成 attention inspection 与 activation cache。 |
| G66 · 周三 | 04-28 | 引导实验:选择 linear probe、activation patching 或 ablation 中的两种比较;SAE 为可选。 |
| G67 · 周四 | 04-29 | 争议/案例:用 clean/corrupt patch 或随机层对照寻找 probe–causality 分离,阅读事后故事化案例。 |
| G68 · 周五 | 04-30 | 更新知识图谱:用额外输入观察 circuit hypothesis,整理支持证据、反例和仍不确定之处。 |
| G69 · 周六 | 05-01 | 可选探索/补学:解释 attention-is-not-explanation 与 causal intervention,或补看 activation patching。 |
| G70 · 周日 | 05-02 | 休息。 |
最小实现与实验
训练一个可控 toy Transformer,保存 attention、residual activation 和 logits;比较 linear probe 与 causal patching。先写机制假设,再做 clean/corrupt intervention;有余力再加随机对照和跨 seed 观察,避免只在看完结果后编故事。
W10 一页小结
- 不能只凭 attention heatmap 或 probe accuracy 宣称机制。
- 至少测试一次 necessity 和一次 sufficiency。
- 报告跨 seed 是否出现相同 circuit;不稳定也是有效结果。
- 明确结果是局部行为机制,不是全模型心智解释。
Capstone 增量
加入 Causal Inspection Panel,将行为失败与内部干预证据关联,但不把解释模块当作安全证明。
原始/官方来源
- A Mathematical Framework for Transformer Circuits
- Towards Monosemanticity
- Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability
- Scaling Monosemanticity — Anthropic Research
15. W11 · Alignment、Control 与 Evaluation Science
范围:G71~G77,2027-05-03 ~ 2027-05-09
研究问题:怎样在目标不完美、分布变化、监控有限甚至系统可能规避评估时建立有边界的安全证据?
建议带着这些问题阅读
- Outer alignment、goal misgeneralization、reward hacking、deception、control 和 governance 有何区别?
- Capability evaluation 与 safety evaluation 为什么必须分开?
- Hidden objective、backdoor、sandbagging 和 evaluator gaming 如何构造无害 proxy 测试?
- Trusted monitor、untrusted monitor、random audit、fallback 和 permission boundary 各提供什么保护?
- 为什么“未观察到失败”不等于“已证明安全”?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G71 · 周一 | 05-03 | 概念/论文:理解 threat model、权限边界、能力评估、安全评估与安全—效用取舍。 |
| G72 · 周二 | 05-04 | 最小机制:从零实现带 proxy shortcut 的无害 toy agent 和简单 audit log。 |
| G73 · 周三 | 05-05 | 引导实验:从 monitor、random audit、trusted fallback、permission limit 中选两种比较。 |
| G74 · 周四 | 05-06 | 争议/案例:阅读或模拟 monitor-agent 相关失效、隐藏 trigger、OOD goal 与 false assurance。 |
| G75 · 周五 | 05-07 | 更新知识图谱:用一个额外 shift 观察 safety–usefulness 取舍,并整理 control protocol 的边界。 |
| G76 · 周六 | 05-08 | 可选探索/补学:区分 alignment training 与 deployment control,或回看 threat model 与评估泄漏。 |
| G77 · 周日 | 05-09 | 休息。 |
最小实现与实验
使用完全本地、无真实危害的 toy environment 构造 proxy reward 和隐藏 trigger;比较无控制、普通 monitor、random audit、trusted fallback 与权限限制。报告 capability、robustness、calibration、efficiency、safety 和严重子群,而不是只给 aggregate score。
W11 一页小结
- 提交明确、有限的 threat model。
- 保留未调参的隐藏 shift 和 trigger。
- 报告 audit rate、false positive/negative、safety 与 usefulness。
- 不将 control protocol、probe 或安全训练写成形式化保证。
Capstone 增量
加入 Alignment Evaluation & Control Plane:权限、预算、monitor、随机审计、fallback、事件记录和 stop condition。
原始/官方来源
- Concrete Problems in AI Safety
- Goal Misgeneralization in Deep Reinforcement Learning
- AI Control: Improving Safety Despite Intentional Subversion
- Sleeper Agents
- HELM
- Beyond the Imitation Game — BIG-bench
16. W12 · AI Scientist 与 General Learning Agent Lab
范围:G78~G84,2027-05-10 ~ 2027-05-16
研究问题:AI 可以辅助哪些科研环节;如何让假设、执行、验证、审阅和人类责任彼此独立且可追溯?
建议带着这些问题阅读
- Literature synthesis、hypothesis generation、experiment execution、analysis 和 peer review 哪些可自动化?
- 自动 evaluator 与生成模型共享偏差时,怎样避免自我确认?
- 为什么数学、代码和可执行算法更容易形成 verifier-bounded discovery loop?
- Novelty、correctness、reproducibility 和 usefulness 为什么必须分开?
- Human checkpoint、sandbox、provenance 和 negative-result archive 如何成为系统组成部分?
每日执行
| 日 | 日期 | 任务 |
|---|---|---|
| G78 · 周一 | 05-10 | 概念/论文:回顾 W1~W11,串联 AI Scientist 研究链;按兴趣决定是否做综合项目。 |
| G79 · 周二 | 05-11 | 最小机制:从 research registry、sandbox executor、artifact lineage、deterministic verifier 中选一个。 |
| G80 · 周三 | 05-12 | 引导实验:再选一个组件,例如 hypothesis dedup、baseline selector、multi-seed runner 或 human checkpoint。 |
| G81 · 周四 | 05-13 | 争议/案例:阅读 invalid hypothesis、p-hacking、judge bias、重复发现和 reviewer-generator 共偏差;只做一个小失败测试即可。 |
| G82 · 周五 | 05-14 | 阶段复盘三:串联 AI Scientist、verifier、自动实验与人类判断;整理理解、疑问和兴趣。 |
| G83 · 周六 | 05-15 | 可选探索/补学:若做综合项目,整理代码、环境、数据来源和学习记录;也可只完成论文对照表。 |
| G84 · 周日 | 05-16 | 休息。 |
最小实现与实验
General Learning Agent Lab 是可选综合学习项目,不要求做成完整平台。可以从以下模块中选择 2~3 个组合:
- research question registry;
- hypothesis 与 falsification criteria;
- task-family generator 与简单数据切分;
- reactive、search、RL、world-model、memory 和 adaptation baselines;
- experiment specification 与 sandbox executor;
- deterministic verifier、multi-seed runner 与原始 artifact store;
- skeptic reviewer 与 human accept/reject checkpoint;
- capability profile、risk profile 和 unknowns ledger。
若选择做项目,建议只选一个研究问题,避免把 12 周模块全部堆成不可解释系统。候选问题包括:
- Exact-match 是否在微型模型中制造表观涌现?
- Adaptive test-time compute 是否比固定预算更有效,反转条件是什么?
- World-model rollout error 如何随 horizon 传导到 action failure?
- Clean data anchor 是否减缓多代 synthetic recursion 的 tail degradation?
- Replay 与 EWC 的优劣如何随 task similarity 反转?
可以先跟随一个公开研究中的小规模机制,再按兴趣改变一个变量。Novelty 不由同一生成系统单独判断;无显著增益、复现失败或假设被否定同样具有学习价值。
W12 低压力阶段复盘
- 哪几篇论文真正改变了我对 AI Scientist 的理解?
- 自动生成、自动执行、自动评价和人类判断之间应如何分工?
- 如果只做 2~3 个组件,我最想组合哪些,为什么?
- 哪些负结果、失败案例或证据边界最值得保留?
- 接下来是继续 AGI 理论、深入一个技术分支,还是为 Phase 4 做准备?
这次复盘不打分,也不要求完成 General Learning Agent Lab。如果做了可选项目,只需留下简洁的环境、数据来源、关键观察、失败和能力边界;标题和结论不声称“实现 AGI”。
原始/官方来源
- FunSearch
- AlphaEvolve
- Accelerating Scientific Breakthroughs with an AI Co-Scientist
- The AI Scientist
17. G85~G90 · AGI 知识整合与兴趣路线
这六天不是考试或延迟复测。可以打开全部笔记和论文,目标是把 12 周内容连接成自己的知识结构,并决定哪些问题值得未来继续追踪。
| 编号 | 日期 | 学习主题 | 轻量产出 |
|---|---|---|---|
| G85 | 05-17 · 周一 | AGI 能力地图:串联 generality、learning efficiency、planning、memory、adaptation、autonomy 与 risk。 | 一张概念图;标出最清楚和最模糊的节点 |
| G86 | 05-18 · 周二 | 论文链路一:从 scaling → emergence → reasoning → test-time compute,比较连续改进与任务阈值。 | 论文关系表或一页叙事 |
| G87 | 05-19 · 周三 | 论文链路二:从 RL → world model → memory/tool → continual learning,理解 Agent 怎样跨时间行动。 | 机制连接图与三个开放疑问 |
| G88 | 05-20 · 周四 | 开放问题地图:整理 self-improvement、multi-agent、interpretability、alignment 和 AI scientist 中的已知、争议与未知。 | E/C/H/S 开放问题清单 |
| G89 | 05-21 · 周五 | 兴趣选题:选 1~2 个想持续学习的方向,列出三篇起始论文、一个最小实验和暂不做的内容。 | 个人后续学习卡,不设截止考核 |
| G90 | 05-22 · 周六 | Phase 4 准备:把 world model、belief、planning、control、权限和人类接管问题转译到具身场景。 | P4 问题树与仿真安全边界 |
G90 只做轻量阶段小结:
- 哪些概念已经形成稳定连接?
- 哪些争议仍无法判断,原因是什么?
- 哪些实验或失败最有助于理解?
- 最想继续追踪的 1~2 个问题是什么?
- 是否愿意进入 Phase 4;如果暂时不想,可以停留、休息或回到感兴趣的专题。
不打分、不要求口头答辩,也不要求完成全部可选项目。所有 C/H/S 主张继续保留不确定性标签,并明确说明本阶段没有预测 AGI 时间线,也没有把 capstone、benchmark 或任何当前系统判为 AGI。
18. 可选综合学习项目与能力边界
可选成果菜单
以下是选择菜单,不是交付清单。真实学习时可只完成知识图谱和 2~3 个最感兴趣的组件:
- capability ontology 与 claim–evidence ledger;
- 程序化任务生成器和简单切分;
- scaling/emergence 测量台;
- search/verifier 与 adaptive compute 控制器;
- reactive、model-free、model-based/world-model baselines;
- memory/tool runtime 与 deterministic replay;
- social generalization arena;
- continual/meta adaptation protocol;
- synthetic recursion 实验;
- causal intervention notebook;
- alignment threat model、eval harness 与 control plane;
- 一份学习报告、negative-results appendix 或 unknowns ledger。
学习边界
- 页面、笔记或代码文件数量不代表理解深度。
- 单次最高分不能代表稳定结论;有条件时再做重复运行和区间观察。
- 自动 reviewer 高分不等于独立验证。
- 模型会规划、会调用工具或会适应一个新任务,不能升级为“通用智能已实现”。
- 仿真中的安全不能外推到真实具身系统;相关问题留给 Phase 4 的动力学、控制与安全约束主题。
19. 与 Phase 4 的交接
Phase 3 研究的是离散、可回放、可自动验证环境中的泛化、规划和适应。Phase 4 才把这些方法放入感知噪声、连续时间、动力学、接触、延迟和不可逆后果中。因此可以带着以下问题继续,而不是追求“AGI 完成度”:
- World model 的 rollout error 在连续控制中如何传播?
- Memory 与 belief state 在传感器遮挡和漂移中是否仍可靠?
- Tool/action permission 如何转化为 actuator、workspace 和 emergency-stop 约束?
- Continual adaptation 何时会破坏已验证的安全控制器?
- 多智能体社会泛化如何转化为 Human–Robot Interaction,而不牺牲人类接管权?
过渡日用于休息、回看 G90 的兴趣地图,并确定仿真范围与硬件禁区;不必提前启动具身实验。
20. 最终声明
本计划把 AGI 当作需要持续澄清和测量的研究对象,而不是预设会在某个日期发生的产品里程碑。课程中的 scaling、reasoning、RL、world model、memory、multi-agent、self-improvement、interpretability、alignment 和 AI scientist 都只是候选组件或研究方法;任何单项成功都不能推出 AGI。
这一阶段的价值不是“相信 AGI 更近了”,而是逐渐能用更严格的定义、更小而有效的实验、更诚实的不确定性和更清楚的控制边界理解一项智能系统主张。
21. SOTA检查(2026-08-23 更新)
Levels of AGI(2023-11)仍用于拆分 performance、generality 与 autonomy,不被当作 AGI 时间表或单一行业标准。- AlphaEvolve(2025-05)和 AI co-scientist 路线表明“生成—自动 evaluator—选择—迭代”仍是重要研究方向,但只有 evaluator 可验证、独立复现且保留失败时,才构成本课程中的自我改进证据。
- World model、test-time search、continual learning、mechanistic interpretability 和 AI control 均处于快速演进期;G01 及每周周一可查看最近 12 个月的原始论文和官方研究更新,并标注
R/E/C/H/S。 - 新模型或新 benchmark 只改变学习对象,不改变基本证据边界:关注数据切分、预算、负结果、权限边界,并且不宣称“实现 AGI”。