返回 Papers
学习计划 Roadmap

AI Deep Mastery P3:AGI Foundations 90

本文件描述未来学什么、怎样学。按用户要求提前生成的 G01~G90 文件只提供学习输入,不包含已经发生的阅读、实验结果、模型成绩或完成状态;P3 启动前仍不创建独立进度台账。

843ai-deep-mastery/PHASE3_AGI_FOUNDATIONS_90.md

Phase 3 · AGI Foundations & Research Systems 90

中文名:通用智能基础与研究系统 90 天
状态:未来阶段;G01~G90 预习教材已备,但尚未启动学习
名义日期:2027-02-22 ~ 2027-05-22
编号:G01 ~ G90
前置条件:Phase 2 阶段复盘完成,并在 2027-02-21 过渡日确认愿意继续
定位:研究 AGI 相关能力的定义、机制、实验方法和控制边界;不预测 AGI 到达时间,不把任何单项 benchmark、语言流畅度、Agent demo 或仿真成功称为 AGI
学习原则:学习优先;不含求职、投递、面试冲刺或作品集包装

教材入口docs/ai-deep-mastery/phase-3-agi/notes/
专业课程地图docs/ai-deep-mastery/phase-3-agi/PROFESSIONAL_COURSE_REFERENCE_MAP.md

本文件描述未来学什么、怎样学。按用户要求提前生成的 G01~G90 文件只提供学习输入,不包含已经发生的阅读、实验结果、模型成绩或完成状态;P3 启动前仍不创建独立进度台账。


1. 阶段目标与边界

本阶段不是“90 天造出 AGI”,而是把容易被宏大叙事混在一起的能力拆成可以定义、实现、测量和证伪的研究问题:

能力广度 / generality
        ×
任务性能 / performance
        ×
学习与适应效率 / learning efficiency
        ×
记忆、规划与工具 / memory, planning, tool use
        ×
持续与社会学习 / continual and social learning
        ×
自主程度与风险 / autonomy and risk

完成后应能:

  1. 区分 skill、intelligence、generality、autonomy 和 deployment risk。
  2. 理解 scaling、涌现、推理、world model、自改进等主张的证据、争议与可验证方式。
  3. 从零实现小型 search、RL、model-based planning、memory、continual learning 和 causal intervention。
  4. 学会使用 baseline、合理切分、随机种子、effect size、置信区间、负结果和外推边界阅读实验。
  5. 可选构建一个小型 General Learning Agent Lab,也可以只深入其中 2~3 个感兴趣的组件;无论做到哪一步,都不把它宣传为 AGI。
  6. 解释哪些研究问题会在 Phase 4 进入具身环境后发生根本变化,例如部分可观测、连续动力学、接触、安全停机和 sim-to-real。

明确不做

  • 不预测 AGI、ASI 或“奇点”的日期。
  • 不依据厂商宣传、单次 demo 或 leaderboard 排名判断 AGI。
  • 不为复现 frontier-scale 数字购买云 GPU,也不伪造大规模实验。
  • 不让实验 Agent 获得无界网络、文件、凭证、资金或外部执行权限。
  • 不把模型生成的自评、思维链或自动 reviewer 分数当作独立真值。
  • 不预先填写模型成绩、实验结论或“预期成功”结果。

2. 研究认识论与轻量记录

2.1 五类证据标签

建议在重要笔记和实验中使用以下标签。它们是帮助思考的工具,不是评分表:

标签含义可否写成已掌握结论
R本阶段按固定配置复现,并保存原始证据只能在复现范围内陈述
E原始论文或研究机构官方材料提供实证,本人未复现注明“外部证据”
C原始研究之间存在冲突、指标依赖或开放争议保留双方论据与未知点
H可证伪假设,尚未完成实验只能写预测与判定条件
S推测性方向或长期研究问题与已证实能力分开记录

2.2 轻量学习记录

未来真正启动后,只记录真实读过、做过和仍然不理解的内容;预制教材不预造结果:

docs/ai-deep-mastery/phase-3-agi/
├── PROFESSIONAL_COURSE_REFERENCE_MAP.md
├── notes/gNN-topic.md
└── experiments/week-NN-experiment.md

一次引导实验可以只用一页记录以下内容:

  • 想理解的问题和实验前的直觉;
  • 使用的任务、baseline、主要变量和环境;
  • 关键配置、seed、现象、失败或反常结果;
  • 结果可能支持什么、不支持什么、能否跨任务外推;
  • 来源与本人工作之间的明确分界。

不是每周都要完成代码实验。若数学推导、交互式演示或论文图表复现已经回答问题,可以停在相应深度,并把尚未解决的疑问留给后续。

2.3 小规模复现原则

本阶段默认使用程序化任务、toy environment、小网络和本地 CPU/MPS。小规模实验的目标是帮助理解机制、测量方法和失败模式,不是复现大模型绝对性能。涉及大规模模型的结论保留 EC 标签,除非确实完成了对应范围的复现。


3. 固定周节奏:轻量但深入

每周围绕一个问题逐步加深,不打分,也不要求所有可选实验都完成:

星期固定职责建议产出
周一概念地图、原始论文与研究问题三个关键概念、一个仍不懂的问题
周二最小机制:推导、伪代码或从零小实现能运行的小例子或手推过程
周三引导实验或标准 baseline一张图、一个对照或一段观察
周四争议、失败案例、反方论文与现实边界“支持 / 反对 / 尚未知”三栏记录
周五更新知识图谱与一页小结本周理解、疑问、兴趣和下周连接
周六可选探索或补学;精力不足时直接休息可选,不要求产出
周日休息

轻量复盘问题

周五只需回答:

  1. 我现在能用自己的话解释什么?
  2. 哪个最小机制帮助我真正理解了它?
  3. 哪个实验、论文或案例与我的直觉冲突?
  4. 证据能支持到哪里,不能支持到哪里?
  5. 哪个方向让我想继续深挖?

负结果、没跑通的代码和仍然模糊的概念都可以保留。它们用于调整学习路线,不构成失败或扣分。


4. 12 周总览

编号与日期核心主题Capstone 增量
W1G01~G07 · 02-22~02-28AGI 定义、能力分解与测量有效性Capability Ontology
W2G08~G14 · 03-01~03-07Scaling law 与涌现争议Scaling & Emergence Harness
W3G15~G21 · 03-08~03-14推理、搜索、verifier 与 test-time computeAdaptive Inference Controller
W4G22~G28 · 03-15~03-21RL、奖励与 model-based RL;阶段复盘一RL Baselines
W5G29~G35 · 03-22~03-28World model、反事实与长程规划Learned Dynamics Planner
W6G36~G42 · 03-29~04-04Memory、planning 与 tool useAuditable Agent Runtime
W7G43~G49 · 04-05~04-11多智能体、合作与社会泛化Social Generalization Arena
W8G50~G56 · 04-12~04-18Continual、meta 与 transfer learning;阶段复盘二Lifelong Adaptation Protocol
W9G57~G63 · 04-19~04-25自改进、合成数据与递归风险Controlled Improvement Loop
W10G64~G70 · 04-26~05-02Mechanistic interpretabilityCausal Inspection Panel
W11G71~G77 · 05-03~05-09Alignment、control 与 evaluation scienceAlignment & Control Plane
W12G78~G84 · 05-10~05-16AI Scientist;阶段复盘三可选 General Learning Agent Lab
知识整合G85~G90 · 05-17~05-22论文串联、开放问题、兴趣选题与 P4 准备个人后续学习地图

5. W1 · AGI 定义、能力分解与测量有效性

范围:G01~G07,2027-02-22 ~ 2027-02-28
研究问题:什么算 generality,什么只是训练分布内 skill?性能、学习效率和自主性如何分开测量?

建议带着这些问题阅读

  • skill、intelligence、generality、autonomy、agency 和 deployment risk 有什么区别?
  • 固定任务得分、学习新任务的样本效率和跨分布适应为何不能混成一个分数?
  • 训练先验、测试污染、提示工程和人类脚手架会怎样改变“智能”判断?
  • Benchmark 的 construct validity、ecological validity 和 saturation 应如何审计?
  • 为什么一个流畅回答、单项高分或长程 demo 不能单独证明 AGI?

每日执行

日期任务
G01 · 周一02-22概念/论文:先写下自己目前对 AGI 的理解,再研读定义与测量框架;建立 generality × performance × learning efficiency × autonomy 概念图。
G02 · 周二02-23最小机制:从零编写一个程序化规则任务生成器;先完成一种规则,再按兴趣扩展组合 OOD 和规则 OOD。
G03 · 周三02-24引导实验:建立 memorization、固定规则和 search/adaptation baseline,观察准确率、适应样本数、compute 和校准。
G04 · 周四02-25争议/案例:改变先验、示例数、指标阈值或污染比例,寻找“训练高分但陌生适应差”的反例。
G05 · 周五02-26更新知识图谱:比较三类 baseline,并用一页小结审视三条“某系统已达到 AGI”式主张。
G06 · 周六02-27可选探索/补学:不用术语堆砌解释为什么 intelligence 不能只看 skill;也可以只整理尚未理解的测量问题。
G07 · 周日02-28休息;最多轻回忆五个核心定义。

最小实现与实验

最小实现是 capability_eval:程序化任务生成器、三个 baseline、合理切分和多指标报告。引导实验可改变 demonstrations、priors 和 task composition,比较 IID、compositional OOD 与 rule OOD。重点是观察准确率与适应效率是否一致;没有出现预想现象也如实记录。

W1 一页小结

  • 尝试给出可计算的能力定义,而非“像人一样聪明”。
  • 能指出 benchmark contamination、metric saturation 和 scaffolding 三类混杂。
  • 对三条前沿主张分别标 E/C/H/S,写出缺失控制实验。
  • 明确列出本周 toy benchmark 不能证明什么。

Capstone 增量

建立 Capability OntologyClaim–Evidence Ledger 和统一任务接口。此时只定义 schema 与待测假设,不填写未来成绩。

原始/官方来源


6. W2 · Scaling Laws 与涌现争议

范围:G08~G14,2027-03-01 ~ 2027-03-07
研究问题:哪些性能随模型、数据和计算平滑变化?所谓涌现何时是机制现象,何时是指标和统计现象?

建议带着这些问题阅读

  • 参数、数据、compute 和训练 loss 的经验关系是什么,适用区间在哪里?
  • Compute-optimal training 为什么不同于只增加参数?
  • 连续 loss 改进为何会在 exact-match 指标上看似突然跃迁?
  • 模型尺度、pre-training loss、任务结构和测量函数分别可能造成什么现象?
  • 为什么小规模拟合不能直接外推 frontier model 或 AGI 时间线?

每日执行

日期任务
G08 · 周一03-01概念/论文:阅读 power-law 拟合和 compute/data/model 预算关系;记下直觉、拟合区间和可能失效的条件。
G09 · 周二03-02最小机制:从零实现一个微型序列学习模型和训练循环,记录 token loss、partial credit、exact match 与 compute。
G10 · 周三03-03引导实验:使用标准训练框架建立 baseline;先跑 2~3 个预算组合,有兴趣再扩展。
G11 · 周四03-04争议/案例:比较连续与离散指标、改变阈值或注入 under-training,观察“涌现”是否随 metric 消失或移动。
G12 · 周五03-05更新知识图谱:用额外预算点观察拟合误差和残差,整理哪些结论只适用于观测区间。
G13 · 周六03-06可选探索/补学:并列讲述 Emergent Abilities 与 Mirage 两方论证,或补看不熟悉的统计概念。
G14 · 周日03-07休息。

最小实现与实验

训练多个微型模型,在固定计算预算下改变模型与数据分配;拟合 loss 曲线,同时报告连续 loss、partial credit 和 threshold/exact-match。使用多个 seed、误差区间和残差分析。实验目标是判断观察到的跃迁对指标、任务和训练充分性的敏感度,不预设一定存在或一定不存在涌现。

W2 一页小结

  • 能解释 Kaplan scaling 与 Chinchilla compute-optimal 结论的研究对象和差异。
  • 至少完成一次 metric sensitivity test。
  • 报告拟合区间、残差和外推禁区。
  • 不把 downstream threshold 直接解释为模型内部出现新机制。

Capstone 增量

加入 Scaling & Emergence Measurement Harness:预算、模型、数据、连续指标、阈值指标和置信区间使用同一运行协议。

原始/官方来源


7. W3 · 推理、搜索、Verifier 与 Test-Time Compute

范围:G15~G21,2027-03-08 ~ 2027-03-14
研究问题:模型的直接生成、外部搜索、过程验证和增加推理计算分别贡献了什么?

建议带着这些问题阅读

  • Greedy、sampling、self-consistency、tree search 和 adaptive compute 有何区别?
  • Outcome verifier 与 process verifier 各会遗漏或放大什么错误?
  • 为什么“输出更多 token”不等于获得更多有效计算?
  • Task difficulty、base success rate 和 verifier quality 如何决定 test-time compute 收益?
  • 可见推理文本、隐式计算和可验证解题轨迹为何不能混为一谈?

每日执行

日期任务
G15 · 周一03-08概念/论文:理解推理预算、搜索空间、difficulty、verifier precision/recall 和停止条件。
G16 · 周二03-09最小机制:从零实现 Game of 24、算术或程序化逻辑题中的一种搜索与确定性 verifier。
G17 · 周三03-10引导实验:从 greedy、best-of-N、self-consistency、tree search 中选 2~3 种,使用相近预算比较。
G18 · 周四03-11争议/案例:消融 verifier 或回溯,并观察 false-positive verifier 与预算过量带来的失败。
G19 · 周五03-12更新知识图谱:按难度画 accuracy–compute–latency 曲线,整理不同策略的适用条件。
G20 · 周六03-13可选探索/补学:解释何时搜索可能胜过直接生成、何时 verifier 会让搜索更坏。
G21 · 周日03-14休息。

最小实现与实验

实现一个带确定性验证器的可搜索任务,比较直接生成、best-of-N、self-consistency、树搜索和按难度动态预算。建议按 difficulty 分层,观察候选数、展开节点、token、时延、成功率以及 verifier 的 precision/recall;若时间允许,再测试错误 verifier 是否会随搜索扩大而放大错误。

W3 一页小结

  • 区分 sampling、search、verification、online learning 和参数更新。
  • 用证据说明 test-time compute 是否单调、在哪些 difficulty bin 有收益。
  • 不能只以最终准确率隐藏计算和延迟成本。
  • 不把模型生成的解释文字当作正确过程的充分证据。

Capstone 增量

加入 Adaptive Inference Controller,按任务难度和 verifier confidence 分配有上限的搜索预算。

原始/官方来源


8. W4 · Reinforcement Learning 与 Model-Based RL

范围:G22~G28,2027-03-15 ~ 2027-03-21
研究问题:Agent 如何通过交互学习;奖励、value、策略和环境模型怎样共同决定行为与失效?

建议带着这些问题阅读

  • MDP 中 state、action、transition、reward、return、policy 和 value 分别是什么?
  • Model-free 与 model-based 方法在样本效率、计算和 model bias 上如何取舍?
  • Reward misspecification、shortcut 和 goal misgeneralization 有何差异?
  • Planning、policy learning 和 online adaptation 如何分界?
  • 为什么高训练回报不能证明目标被正确学习?

每日执行

日期任务
G22 · 周一03-15概念/论文:从图示理解 Bellman expectation/optimality update,并认识几类 OOD shift。
G23 · 周二03-16最小机制:从零实现 tabular Q-learning 和一个很小的 Gridworld。
G24 · 周三03-17引导实验:实现 Dyna-Q 或简化 learned transition + planning,并与 Q-learning 对照。
G25 · 周四03-18争议/案例:改变奖励位置、障碍、转移概率或 proxy feature,观察 model error 与目标错配。
G26 · 周五03-19阶段复盘一:比较 model-free、learned-model 和 oracle-model;只整理目前的理解、疑问与最感兴趣的方向。
G27 · 周六03-20可选探索/补学:解释 model bias 如何经过 planning 影响决策,或回看最不熟悉的 RL 概念。
G28 · 周日03-21休息。

最小实现与实验

在同一 Gridworld 中公平比较 Q-learning、带学习模型的 planning 和 oracle model。训练后分别改变 reward、transition 和 observation proxy,报告 learning curve、sample efficiency、OOD return、模型误差和错误路径。目标是寻找能力失效与目标失效之间的差异,而非追求最高 reward。

W4 低压力阶段复盘

  • 我能否用自己的话解释 Bellman update 和 model-based / model-free 的差异?
  • 哪个实现或案例最能帮助我理解 model bias?
  • Capability generalization 与 goal generalization 还有哪些没想清楚?
  • 接下来更想深入 RL、world model,还是只保留概念理解?

这次复盘不打分、不要求重做;只整理理解、疑问和兴趣。Reward 最大化仍不应直接写成“理解了目标”。

Capstone 增量

加入统一的 Reactive / Model-Free / Model-Based agent 接口、轨迹记录和环境 shift 机制。

原始/官方来源


9. W5 · World Models、反事实与长程规划

范围:G29~G35,2027-03-22 ~ 2027-03-28
研究问题:预测世界、压缩状态和为行动规划之间是什么关系?

建议带着这些问题阅读

  • 能预测下一观察是否等于学到可用于控制的世界模型?
  • Observation model、latent dynamics、reward/value model 和 policy 分别承担什么职责?
  • 部分可观测环境为何需要 belief、memory 或 recurrent state?
  • Rollout error 如何随 horizon 累积并改变 action ranking?
  • 逼真生成、动力学一致性和 task relevance 为什么是不同目标?

每日执行

日期任务
G29 · 周一03-22概念/论文:画出 observation→latent→transition→prediction/planning 关系图,记录 counterfactual 问题。
G30 · 周二03-23最小机制:从零实现 toy POMDP 与一步 transition predictor;状态编码可保持简单。
G31 · 周三03-24引导实验:建立短 horizon world-model planner,并与 reactive 或 oracle-state 对照。
G32 · 周四03-25争议/案例:扰动 horizon、随机动力学或 observation aliasing,观察 rollout error 如何累积。
G33 · 周五03-26更新知识图谱:比较预测准确率、action ranking 与实际 return,整理三者可能不一致的原因。
G34 · 周六03-27可选探索/补学:解释“看起来像真实”为什么不等于可规划,或回看状态表示与 POMDP。
G35 · 周日03-28休息。

最小实现与实验

训练一个小型 observation encoder、latent transition 与 reward/value predictor,并在 latent space 做有限 horizon planning。比较一步误差、多步误差、counterfactual action prediction、计划 action 与真实 return。若观察到“预测指标高但控制失败”,重点分析原因;若未发生,也记录实验范围。

W5 一页小结

  • 区分 simulator、generative model、predictive model 和 task-relevant world model。
  • 能画出模型误差传导到错误决策的证据链。
  • 完成至少一个未见 action sequence 的反事实测试。
  • 不以帧质量或重建质量单独评价规划能力。

Capstone 增量

加入 Learned Dynamics & Counterfactual Planner,保留 oracle 与真实环境回放作为校验。

原始/官方来源


10. W6 · Memory、Planning 与 Tool Use

范围:G36~G42,2027-03-29 ~ 2027-04-04
研究问题:受限上下文中的 Agent 如何积累状态、调用外部能力并在失败后恢复?

建议带着这些问题阅读

  • Working、episodic、semantic 和 procedural memory 如何区分?
  • 长上下文、检索、摘要和持久状态分别解决什么问题?
  • 何时调用工具、如何验证返回、如何处理超时和重复执行?
  • Planner–executor、state machine 与自由循环 Agent 有何取舍?
  • Memory poisoning、stale state 和 tool error 如何传播?

每日执行

日期任务
G36 · 周一03-29概念/论文:理解 memory schema、tool contract、权限、状态转移和 replay。
G37 · 周二03-30最小机制:从零实现一个 planner–executor 状态机、working memory 和单一工具 stub。
G38 · 周三03-31引导实验:加入一种检索/分层记忆,与 no-memory 或 full-transcript 对照。
G39 · 周四04-01争议/案例:从过期记忆、矛盾记忆、timeout、重复调用和权限拒绝中选 2~3 类观察。
G40 · 周五04-02更新知识图谱:观察跨 session 任务中的 task success、retrieval、恢复和权限边界。
G41 · 周六04-03可选探索/补学:用结构化 state/action/result 回看一个失败,或补学检索、幂等与权限概念。
G42 · 周日04-04休息。

最小实现与实验

实现显式状态机、短期状态、事件记忆、语义索引和三个确定性工具;不要求记录或暴露隐藏思维链。比较无记忆、完整 transcript、检索记忆和分层记忆,在长任务、干扰事件和多 session 上测成功、检索质量、时延、状态漂移和恢复能力。

W6 一页小结

  • 不只看最终成功率,也关注 retrieval 和 tool reliability。
  • 任一失败可由保存的结构化状态确定性重放。
  • 明确 memory retention、write policy、tool permission 和 side-effect boundary。
  • 能说明模型内部 context 与系统持久记忆的差异。

Capstone 增量

加入 Hierarchical Memory + Auditable Tool Runtime,所有有副作用动作默认关闭,仅用本地 stub。

原始/官方来源


11. W7 · 多智能体、合作与社会泛化

范围:G43~G49,2027-04-05 ~ 2027-04-11
研究问题:多智能体交互什么时候产生合作与泛化,什么时候只增加协调成本、串谋或不稳定?

建议带着这些问题阅读

  • Coordination、cooperation、competition、negotiation、deception 和 collusion 如何区分?
  • 与固定伙伴配合良好是否代表能与陌生伙伴合作?
  • 通信是否总有价值;何时造成操纵、过拟合或协调开销?
  • 个体回报、社会福利、公平性、exploitability 和稳定性如何共同报告?
  • 为什么“更多 Agent”不是“更多智能”的充分条件?

每日执行

日期任务
G43 · 周一04-05概念/论文:理解社会泛化、counterpart variation、welfare 与 exploitability。
G44 · 周二04-06最小机制:从零实现 iterated dilemma、公共资源或简化供应链环境中的一个。
G45 · 周三04-07引导实验:加入一个学习/通信策略,并与固定策略伙伴对照。
G46 · 周四04-08争议/案例:观察通信消融、free-rider、deceptive message 或 partner shift 中的两类现象。
G47 · 周五04-09更新知识图谱:cross-play 不同伙伴,整理个体回报、福利、公平、exploitability 和消息成本。
G48 · 周六04-10可选探索/补学:区分协调、合作和串谋,或阅读一个社会泛化失败案例。
G49 · 周日04-11休息。

最小实现与实验

可构建一个社会困境环境、多个固定/学习策略和独立通信通道;把训练伙伴与额外观察伙伴分开,比较无通信、有通信、中心化和去中心化策略。评价不只依赖 LLM judge,优先结合环境状态和可计算指标。

W7 一页小结

  • 在陌生伙伴上完成 cross-play。
  • 同时报告 individual utility 与 collective welfare。
  • 至少分析一个局部最优但整体有害的结果,若未出现则报告未出现范围。
  • 能说明多 Agent 在串行依赖任务上为何可能更差。

Capstone 增量

加入 Social Generalization Arena,支持 partner population、communication ablation 和 cross-play。

原始/官方来源


12. W8 · Continual、Meta 与 Transfer Learning

范围:G50~G56,2027-04-12 ~ 2027-04-18
研究问题:系统怎样在持续变化中学习新任务,同时保留旧能力并迁移到未见任务?

建议带着这些问题阅读

  • Catastrophic forgetting 和 stability–plasticity dilemma 如何定义与测量?
  • Forward transfer、backward transfer、few-shot adaptation 和 task interference 有何区别?
  • Replay、regularization、parameter isolation 和 meta-learning 各自牺牲什么?
  • In-context adaptation、参数更新和外部 memory update 是三种什么机制?
  • 任务顺序和任务相似性为何会改变结论?

每日执行

日期任务
G50 · 周一04-12概念/论文:理解 forgetting、BWT、FWT、adaptation efficiency 与任务顺序效应。
G51 · 周二04-13最小机制:从零实现两个 sequential tasks、naive fine-tuning 和简单 replay。
G52 · 周三04-14引导实验:加入 EWC;有兴趣再尝试一阶 MAML/Reptile。
G53 · 周四04-15争议/案例:改变任务顺序、相似性或 replay 大小,检查平均分掩盖的单任务遗忘。
G54 · 周五04-16阶段复盘二:观察 few-shot adaptation 与旧任务遗忘,只整理理解、疑问和最想继续探索的方法。
G55 · 周六04-17可选探索/补学:解释 stability–plasticity 的取舍,或回看 replay、EWC、meta-learning 中最模糊的一项。
G56 · 周日04-18休息。

最小实现与实验

可以使用三个小型顺序任务比较 naive fine-tuning、replay 和 EWC,并按兴趣加入 meta-learning。若运行多组任务顺序或 seed,观察 forgetting、BWT、FWT、每任务性能和适应曲线;精力有限时,完成一个清楚的对照即可。

W8 低压力阶段复盘

  • 我能否解释 forgetting、BWT、FWT 分别在问什么?
  • 哪种现象最能体现 stability–plasticity 的取舍?
  • In-context、parameter learning 和 external memory 的边界还有哪里模糊?
  • 我更想继续研究 replay、EWC、meta-learning,还是转向自改进与数据问题?

这次复盘不打分,也不要求完成所有算法;保留实验失败和未完成项即可。

Capstone 增量

加入 Lifelong Adaptation Protocol:任务流、回看旧任务、顺序变化和额外迁移任务。

原始/官方来源


13. W9 · 自改进、合成数据与递归风险

范围:G57~G63,2027-04-19 ~ 2027-04-25
研究问题:Generate–evaluate–train 循环什么时候产生真实改进,什么时候只是自我模仿、judge bias 或长尾坍缩?

建议带着这些问题阅读

  • 自训练、自蒸馏、自奖励和可验证 self-improvement 的外部信号分别是什么?
  • 为什么“模型给自己更高分”不等于能力提高?
  • 合成数据如何改变支持集、长尾、多样性和校准?
  • Verifier false positive 如何在迭代中被放大?
  • 真实数据锚点、过滤和 provenance 能降低哪些风险,不能保证什么?

每日执行

日期任务
G57 · 周一04-19概念/论文:理解递归训练、真实数据锚点、tail metrics、verifier error 和停止条件。
G58 · 周二04-20最小机制:从零实现带稀有子群的数据分布和一轮 generate–filter–retrain。
G59 · 周三04-21引导实验:从纯合成、真实混合、规则过滤、diversity filtering 中选 2~3 种比较。
G60 · 周四04-22争议/案例:注入 judge bias、false positive、重复数据或低覆盖,观察错误是否累积。
G61 · 周五04-23更新知识图谱:比较迭代后的平均指标、tail recall、校准、多样性与分布距离。
G62 · 周六04-24可选探索/补学:解释自改进依赖的外部选择信号,或回看 lineage 与长尾测量。
G63 · 周日04-25休息。

最小实现与实验

在含稀有子群的可控分布上尝试多轮训练循环,对比 100% synthetic、synthetic+真实锚点、规则 verifier 和 diversity filter。记录每轮数据 lineage、平均性能、尾部召回、校准、多样性和分布距离。不要预设一定出现 model collapse;没有退化也是值得记录的观察。

W9 一页小结

  • 能指出每种“自改进”依赖的外部真值或选择压力。
  • 不用模型自身 judge 作为唯一评估。
  • 同时报告平均与尾部指标。
  • 提交 synthetic-data provenance 与停止策略。

Capstone 增量

加入 Evaluator-Bounded Controlled Improvement Loop,默认保留 clean anchor、独立 verifier 和最大迭代数。

原始/官方来源


14. W10 · Mechanistic Interpretability

范围:G64~G70,2027-04-26 ~ 2027-05-02
研究问题:怎样从相关性观察推进到关于模型内部机制的可证伪、因果性解释?

建议带着这些问题阅读

  • Probe 能解码信息是否代表模型使用了该信息?
  • Attention pattern、neuron、feature、circuit 和 algorithm 有什么层级差异?
  • Necessity、sufficiency、causal mediation 与 causal abstraction 如何操作化?
  • Activation patching、ablation 和 sparse autoencoder 分别回答什么问题?
  • 为什么解释一个 toy circuit 不能外推为“理解整个大模型”?

每日执行

日期任务
G64 · 周一04-26概念/论文:选择一个已知机制的 synthetic task,理解 circuit hypothesis、必要性和充分性。
G65 · 周二04-27最小机制:从零实现或复用一个两层 toy Transformer,先完成 attention inspection 与 activation cache。
G66 · 周三04-28引导实验:选择 linear probe、activation patching 或 ablation 中的两种比较;SAE 为可选。
G67 · 周四04-29争议/案例:用 clean/corrupt patch 或随机层对照寻找 probe–causality 分离,阅读事后故事化案例。
G68 · 周五04-30更新知识图谱:用额外输入观察 circuit hypothesis,整理支持证据、反例和仍不确定之处。
G69 · 周六05-01可选探索/补学:解释 attention-is-not-explanation 与 causal intervention,或补看 activation patching。
G70 · 周日05-02休息。

最小实现与实验

训练一个可控 toy Transformer,保存 attention、residual activation 和 logits;比较 linear probe 与 causal patching。先写机制假设,再做 clean/corrupt intervention;有余力再加随机对照和跨 seed 观察,避免只在看完结果后编故事。

W10 一页小结

  • 不能只凭 attention heatmap 或 probe accuracy 宣称机制。
  • 至少测试一次 necessity 和一次 sufficiency。
  • 报告跨 seed 是否出现相同 circuit;不稳定也是有效结果。
  • 明确结果是局部行为机制,不是全模型心智解释。

Capstone 增量

加入 Causal Inspection Panel,将行为失败与内部干预证据关联,但不把解释模块当作安全证明。

原始/官方来源


15. W11 · Alignment、Control 与 Evaluation Science

范围:G71~G77,2027-05-03 ~ 2027-05-09
研究问题:怎样在目标不完美、分布变化、监控有限甚至系统可能规避评估时建立有边界的安全证据?

建议带着这些问题阅读

  • Outer alignment、goal misgeneralization、reward hacking、deception、control 和 governance 有何区别?
  • Capability evaluation 与 safety evaluation 为什么必须分开?
  • Hidden objective、backdoor、sandbagging 和 evaluator gaming 如何构造无害 proxy 测试?
  • Trusted monitor、untrusted monitor、random audit、fallback 和 permission boundary 各提供什么保护?
  • 为什么“未观察到失败”不等于“已证明安全”?

每日执行

日期任务
G71 · 周一05-03概念/论文:理解 threat model、权限边界、能力评估、安全评估与安全—效用取舍。
G72 · 周二05-04最小机制:从零实现带 proxy shortcut 的无害 toy agent 和简单 audit log。
G73 · 周三05-05引导实验:从 monitor、random audit、trusted fallback、permission limit 中选两种比较。
G74 · 周四05-06争议/案例:阅读或模拟 monitor-agent 相关失效、隐藏 trigger、OOD goal 与 false assurance。
G75 · 周五05-07更新知识图谱:用一个额外 shift 观察 safety–usefulness 取舍,并整理 control protocol 的边界。
G76 · 周六05-08可选探索/补学:区分 alignment training 与 deployment control,或回看 threat model 与评估泄漏。
G77 · 周日05-09休息。

最小实现与实验

使用完全本地、无真实危害的 toy environment 构造 proxy reward 和隐藏 trigger;比较无控制、普通 monitor、random audit、trusted fallback 与权限限制。报告 capability、robustness、calibration、efficiency、safety 和严重子群,而不是只给 aggregate score。

W11 一页小结

  • 提交明确、有限的 threat model。
  • 保留未调参的隐藏 shift 和 trigger。
  • 报告 audit rate、false positive/negative、safety 与 usefulness。
  • 不将 control protocol、probe 或安全训练写成形式化保证。

Capstone 增量

加入 Alignment Evaluation & Control Plane:权限、预算、monitor、随机审计、fallback、事件记录和 stop condition。

原始/官方来源


16. W12 · AI Scientist 与 General Learning Agent Lab

范围:G78~G84,2027-05-10 ~ 2027-05-16
研究问题:AI 可以辅助哪些科研环节;如何让假设、执行、验证、审阅和人类责任彼此独立且可追溯?

建议带着这些问题阅读

  • Literature synthesis、hypothesis generation、experiment execution、analysis 和 peer review 哪些可自动化?
  • 自动 evaluator 与生成模型共享偏差时,怎样避免自我确认?
  • 为什么数学、代码和可执行算法更容易形成 verifier-bounded discovery loop?
  • Novelty、correctness、reproducibility 和 usefulness 为什么必须分开?
  • Human checkpoint、sandbox、provenance 和 negative-result archive 如何成为系统组成部分?

每日执行

日期任务
G78 · 周一05-10概念/论文:回顾 W1~W11,串联 AI Scientist 研究链;按兴趣决定是否做综合项目。
G79 · 周二05-11最小机制:从 research registry、sandbox executor、artifact lineage、deterministic verifier 中选一个。
G80 · 周三05-12引导实验:再选一个组件,例如 hypothesis dedup、baseline selector、multi-seed runner 或 human checkpoint。
G81 · 周四05-13争议/案例:阅读 invalid hypothesis、p-hacking、judge bias、重复发现和 reviewer-generator 共偏差;只做一个小失败测试即可。
G82 · 周五05-14阶段复盘三:串联 AI Scientist、verifier、自动实验与人类判断;整理理解、疑问和兴趣。
G83 · 周六05-15可选探索/补学:若做综合项目,整理代码、环境、数据来源和学习记录;也可只完成论文对照表。
G84 · 周日05-16休息。

最小实现与实验

General Learning Agent Lab 是可选综合学习项目,不要求做成完整平台。可以从以下模块中选择 2~3 个组合:

  1. research question registry;
  2. hypothesis 与 falsification criteria;
  3. task-family generator 与简单数据切分;
  4. reactive、search、RL、world-model、memory 和 adaptation baselines;
  5. experiment specification 与 sandbox executor;
  6. deterministic verifier、multi-seed runner 与原始 artifact store;
  7. skeptic reviewer 与 human accept/reject checkpoint;
  8. capability profile、risk profile 和 unknowns ledger。

若选择做项目,建议只选一个研究问题,避免把 12 周模块全部堆成不可解释系统。候选问题包括:

  • Exact-match 是否在微型模型中制造表观涌现?
  • Adaptive test-time compute 是否比固定预算更有效,反转条件是什么?
  • World-model rollout error 如何随 horizon 传导到 action failure?
  • Clean data anchor 是否减缓多代 synthetic recursion 的 tail degradation?
  • Replay 与 EWC 的优劣如何随 task similarity 反转?

可以先跟随一个公开研究中的小规模机制,再按兴趣改变一个变量。Novelty 不由同一生成系统单独判断;无显著增益、复现失败或假设被否定同样具有学习价值。

W12 低压力阶段复盘

  • 哪几篇论文真正改变了我对 AI Scientist 的理解?
  • 自动生成、自动执行、自动评价和人类判断之间应如何分工?
  • 如果只做 2~3 个组件,我最想组合哪些,为什么?
  • 哪些负结果、失败案例或证据边界最值得保留?
  • 接下来是继续 AGI 理论、深入一个技术分支,还是为 Phase 4 做准备?

这次复盘不打分,也不要求完成 General Learning Agent Lab。如果做了可选项目,只需留下简洁的环境、数据来源、关键观察、失败和能力边界;标题和结论不声称“实现 AGI”。

原始/官方来源


17. G85~G90 · AGI 知识整合与兴趣路线

这六天不是考试或延迟复测。可以打开全部笔记和论文,目标是把 12 周内容连接成自己的知识结构,并决定哪些问题值得未来继续追踪。

编号日期学习主题轻量产出
G8505-17 · 周一AGI 能力地图:串联 generality、learning efficiency、planning、memory、adaptation、autonomy 与 risk。一张概念图;标出最清楚和最模糊的节点
G8605-18 · 周二论文链路一:从 scaling → emergence → reasoning → test-time compute,比较连续改进与任务阈值。论文关系表或一页叙事
G8705-19 · 周三论文链路二:从 RL → world model → memory/tool → continual learning,理解 Agent 怎样跨时间行动。机制连接图与三个开放疑问
G8805-20 · 周四开放问题地图:整理 self-improvement、multi-agent、interpretability、alignment 和 AI scientist 中的已知、争议与未知。E/C/H/S 开放问题清单
G8905-21 · 周五兴趣选题:选 1~2 个想持续学习的方向,列出三篇起始论文、一个最小实验和暂不做的内容。个人后续学习卡,不设截止考核
G9005-22 · 周六Phase 4 准备:把 world model、belief、planning、control、权限和人类接管问题转译到具身场景。P4 问题树与仿真安全边界

G90 只做轻量阶段小结:

  • 哪些概念已经形成稳定连接?
  • 哪些争议仍无法判断,原因是什么?
  • 哪些实验或失败最有助于理解?
  • 最想继续追踪的 1~2 个问题是什么?
  • 是否愿意进入 Phase 4;如果暂时不想,可以停留、休息或回到感兴趣的专题。

不打分、不要求口头答辩,也不要求完成全部可选项目。所有 C/H/S 主张继续保留不确定性标签,并明确说明本阶段没有预测 AGI 时间线,也没有把 capstone、benchmark 或任何当前系统判为 AGI。


18. 可选综合学习项目与能力边界

可选成果菜单

以下是选择菜单,不是交付清单。真实学习时可只完成知识图谱和 2~3 个最感兴趣的组件:

  • capability ontology 与 claim–evidence ledger;
  • 程序化任务生成器和简单切分;
  • scaling/emergence 测量台;
  • search/verifier 与 adaptive compute 控制器;
  • reactive、model-free、model-based/world-model baselines;
  • memory/tool runtime 与 deterministic replay;
  • social generalization arena;
  • continual/meta adaptation protocol;
  • synthetic recursion 实验;
  • causal intervention notebook;
  • alignment threat model、eval harness 与 control plane;
  • 一份学习报告、negative-results appendix 或 unknowns ledger。

学习边界

  • 页面、笔记或代码文件数量不代表理解深度。
  • 单次最高分不能代表稳定结论;有条件时再做重复运行和区间观察。
  • 自动 reviewer 高分不等于独立验证。
  • 模型会规划、会调用工具或会适应一个新任务,不能升级为“通用智能已实现”。
  • 仿真中的安全不能外推到真实具身系统;相关问题留给 Phase 4 的动力学、控制与安全约束主题。

19. 与 Phase 4 的交接

Phase 3 研究的是离散、可回放、可自动验证环境中的泛化、规划和适应。Phase 4 才把这些方法放入感知噪声、连续时间、动力学、接触、延迟和不可逆后果中。因此可以带着以下问题继续,而不是追求“AGI 完成度”:

  1. World model 的 rollout error 在连续控制中如何传播?
  2. Memory 与 belief state 在传感器遮挡和漂移中是否仍可靠?
  3. Tool/action permission 如何转化为 actuator、workspace 和 emergency-stop 约束?
  4. Continual adaptation 何时会破坏已验证的安全控制器?
  5. 多智能体社会泛化如何转化为 Human–Robot Interaction,而不牺牲人类接管权?

过渡日用于休息、回看 G90 的兴趣地图,并确定仿真范围与硬件禁区;不必提前启动具身实验。


20. 最终声明

本计划把 AGI 当作需要持续澄清和测量的研究对象,而不是预设会在某个日期发生的产品里程碑。课程中的 scaling、reasoning、RL、world model、memory、multi-agent、self-improvement、interpretability、alignment 和 AI scientist 都只是候选组件或研究方法;任何单项成功都不能推出 AGI。

这一阶段的价值不是“相信 AGI 更近了”,而是逐渐能用更严格的定义、更小而有效的实验、更诚实的不确定性和更清楚的控制边界理解一项智能系统主张。


21. SOTA检查(2026-08-23 更新)

  • Levels of AGI(2023-11)仍用于拆分 performance、generality 与 autonomy,不被当作 AGI 时间表或单一行业标准。
  • AlphaEvolve(2025-05)和 AI co-scientist 路线表明“生成—自动 evaluator—选择—迭代”仍是重要研究方向,但只有 evaluator 可验证、独立复现且保留失败时,才构成本课程中的自我改进证据。
  • World model、test-time search、continual learning、mechanistic interpretability 和 AI control 均处于快速演进期;G01 及每周周一可查看最近 12 个月的原始论文和官方研究更新,并标注 R/E/C/H/S
  • 新模型或新 benchmark 只改变学习对象,不改变基本证据边界:关注数据切分、预算、负结果、权限边界,并且不宣称“实现 AGI”。