G01~G90 教材库
AI Deep Mastery 总路线 Day 181~270
正式学习日包含概念、数学或算法机制、最小实验、反例、证据边界、研究场景、自检与专业课程对齐。周日只提供轻量恢复;教材可以提前阅读,但 P3 尚未启动。
W1
第 1 周
AGI 定义与能力本体
AGI 不是某个模型在若干题目上取得高分的同义词,而是一组必须分开描述的能力主张:系统覆盖哪些任务、达到什么性能、用多少新经验完成适应、以多大自主性行动,以及这种自主性带来什么部署风险。
程序化规则任务生成器
程序化任务生成器用显式规则生产可无限采样、可控制难度且答案可验证的任务族,使“泛化到哪里”从题目印象变成训练规则、组合结构与测试规则之间的可审计关系。
基线、适应曲线与多维指标
基线不是“故意做差的参照”,而是把可能贡献性能的记忆、固定算法、搜索、示例适应与计算预算逐项显式化,从而判断一个系统的成绩究竟来自哪种机制。
测量有效性、污染与脚手架反例
测量有效性不是“分数计算正确”这么简单,而是检查任务、数据、指标和脚手架是否真的测到了所声称的能力,以及替代解释能否产生同样的高分。
能力知识图谱与主张—证据账本
主张—证据账本把“系统很通用”拆成能力节点、条件、支持证据、反证与未知项,使知识图谱能够随新研究修订,而不是积累无法核验的结论句。
不用术语堆砌解释 Intelligence 与 Skill
Skill 回答“在已界定任务上能做得多好”,intelligence 更关心“面对尚未熟练的任务,能否利用有限经验与资源获得有效技能”;两者相关,却不能用一个固定题库成绩互相替代。
W1 休息与概念沉淀
G07:W1 休息与概念沉淀
W2
第 2 周
Scaling Law 与预算几何
Scaling law 是在给定模型族、数据分布、优化方式与计算区间内,损失随参数量、数据量或计算预算呈现近似规律变化的经验模型;它描述观测区间,不是智能必然增长或 AGI 日期预测公式。
微型序列模型与可测训练循环
微型 scaling 实验不是缩小版 frontier 竞赛,而是在完全可控的序列任务上,把数据生成、模型容量、训练预算、连续损失和离散任务指标连接成可观察因果链。
Compute-Optimal 预算网格与公平基线
Compute-optimal 实验在相近训练预算下改变模型容量与数据量的分配,寻找哪个组合更有效,同时把“容量不足”和“数据或训练不足”两类失败分开。
涌现主张的指标敏感性
“涌现”只有在明确模型尺度、训练充分性、任务结构和测量函数后才是可研究主张;若跃迁随评分阈值任意移动或在连续指标中消失,它首先是测量现象,而非已证明的内部新机制。
Scaling 残差、区间与外推禁区
残差分析用预测与实际观测之间的结构化偏差检查 scaling 模型是否遗漏机制,而外推纪律要求任何拟合都只在明确区间内陈述,并把远距离预测标为假设而非事实。
Emergent Abilities 与 Mirage 论证对读
涌现争议的学习重点不是选择阵营,而是对齐双方所说的“能力”“突然”和“尺度”,找出它们产生不同预测的实验条件,以及仍无法由现有曲线判断的内部机制问题。
W2 休息与曲线放下
G14:W2 休息与曲线放下
W3
第 3 周
Test-Time Compute、搜索空间与停止条件
Test-time compute 是在参数冻结后,为当前任务分配的候选生成、搜索展开、验证、回溯与聚合预算;它只有在候选具有多样性、验证信号足够可靠且停止策略受控时,才可能转化为更高成功率。
Game of 24 的搜索与确定性 Verifier
Game of 24 是一个小而完整的可搜索任务:从四个数字出发,通过有限算术动作构造 24,适合从零观察状态表示、组合爆炸、路径去重和确定性验证怎样共同决定搜索质量。
同预算推理策略比较
同预算策略比较是在相近候选生成、节点展开或模型调用成本下,比较直接生成、重复采样、答案聚合和显式搜索,避免把更多计算带来的收益误归因于某个算法名称。
Verifier 错误、消融与搜索放大
Verifier 决定搜索把计算投向哪里;当它存在系统性假阳性时,更多候选和更深搜索可能不是稀释错误,而是更有效地找到并放大能骗过评分器的错误路径。
难度分层与 Adaptive Inference Controller
Adaptive Inference Controller 根据任务难度、当前证据和 verifier 置信度,在明确上限内决定直接回答、继续采样、展开搜索、拒答或转人工,使计算预算服务于边际收益而非统一堆叠。
何时搜索胜过直接生成,何时更坏
搜索胜过直接生成的关键不在于“想得更久”,而在于任务能被分解、正确路径能被 proposal 覆盖、中间或最终状态可可靠验证,并且额外计算的收益高于延迟和错误放大成本。
W3 休息与推理预算归零
G21:W3 休息与推理预算归零
W4
第 4 周
MDP、Bellman 方程与 OOD Shift
MDP 用状态、动作、转移与奖励刻画序贯决策,Bellman 方程把长期价值递归分解为当前奖励与下一状态价值;它能表达“如何优化给定目标”,却不能保证奖励正确代表真正意图。
从零实现 Tabular Q-Learning
Tabular Q-learning 用实际交互样本反复修正状态—动作价值,在不知道转移模型的情况下逼近最优策略,是观察探索、时间差分误差与训练回报局限的最小 model-free 实验。
Dyna-Q 与学习模型上的 Planning
Dyna-Q 将真实环境中的 Q-learning 更新与学习模型生成的模拟更新交替进行,用计算换取样本效率,同时暴露模型错误会怎样通过 planning 被重复传播。
奖励、转移与 Proxy Shift 诊断
环境 shift 诊断通过分别改变奖励、转移和观察 proxy,观察策略是失去完成目标的能力、被错误模型误导,还是继续有能力却追逐了训练中的替代目标。
阶段复盘一——Reactive、Model-Free 与 Model-Based
阶段复盘一把前四周的测量、scaling、search 与 RL 放进统一 Agent 接口,比较 reactive、model-free、learned-model 和 oracle-model 各自依赖什么信息、在哪类 shift 失败,而不是进行排名考试。
Model Bias 如何经过 Planning 影响决策
Model bias 影响决策的关键不只是预测平均误差,而是误差沿 rollout 累积、偏向规划访问的分布,并最终改变候选动作的价值排序。
W4 休息与阶段缓冲
G28:W4 休息与阶段缓冲
W5
第 5 周
World Model、Latent Dynamics 与反事实地图
World model 是为预测行动后果与支持决策而学习的状态表示和动力学;它不因能生成逼真观察就自动适合规划,也不因无法重建全部像素就一定缺少任务相关结构。
Toy POMDP 与一步 Transition Predictor
POMDP 在 MDP 上加入隐藏状态与观察生成过程,Agent 必须用历史形成 belief;一步 transition predictor 若只看当前观察,会在 observation aliasing 下把不同真实状态错误地平均。
短视野 World Model Planner 与对照实验
短视野 world-model planner 是先用学习到的状态转移模型模拟有限步行动后果,再按预测回报选择当前动作的决策器;它检验的是“模型能否支持行动排序”,而不只是下一帧是否像真。
Rollout Error、随机动力学与 Observation Aliasing
Rollout error 是模型在反复消费自身预测时产生的多步偏差,而随机动力学与 observation aliasing 会让“单条预测不准”同时包含不可约随机性、状态信息缺失和可修复模型偏差三种不同原因。
预测准确率、Action Ranking 与真实 Return 的错位
预测—控制错位是指 world model 在平均观测或转移指标上更准确,却没有更好地保存决策所需的价值差异,因而 action ranking 和真实 return 可能不升反降。
Task-Relevant World Model 的边界与反事实检验
Task-relevant world model 只承诺为明确任务、奖励、动作与环境范围保存足够的动力学信息;它能否回答未执行动作的反事实,必须由干预式测试而不是逼真生成来判断。
休息与恢复:让世界模型停在边界内
今天无必修、不引入新知识,也不需要补齐 planner、证明 world model 有效或完成任何测验与 Gate。
W6
第 6 周
Agent Memory Schema、Tool Contract 与状态边界
Agent memory 是带来源、时效和写入规则的外部状态系统,tool contract 则明确动作参数、返回、错误与副作用;二者共同限制 Agent 能记住什么、相信什么和改变什么。
从零构造 Planner–Executor 状态机
Planner–executor 状态机把“提出下一步”和“执行受控动作”拆成显式转移,使每次工具调用都有前置条件、结果类型、恢复路径和可重放证据。
分层检索记忆与 No-Memory 对照
分层检索记忆将当前工作状态、事件记录与经验证事实分别保存,再按任务和权限检索;它是否优于无记忆或完整 transcript,必须在相同信息与预算下做对照。
Memory Poisoning、Tool Timeout 与权限拒绝注入
失败注入是在完全本地和受控环境中主动制造过期、矛盾、污染、超时、重复和拒绝事件,以观察 Agent 的显式状态是否阻止错误继续传播。
跨 Session Agent 的检索、恢复与审计
跨 session Agent 的可靠性来自可重建的显式状态、带来源的检索和受控恢复,而不是模型声称自己“记得上次发生了什么”。
结构化 Replay、幂等与 Agent 自主边界
结构化 replay 用保存的 state/action/result/event 重建已发生的系统转移,而自主边界决定哪些候选动作只能模拟、哪些可只读执行、哪些必须等待独立授权。
休息与恢复:不让 Agent 占满记忆
今天无必修、不引入新知识,没有测验、Gate、工具链补作业或必须整理的 Agent 记忆。
W7
第 7 周
社会泛化、Counterpart Variation 与评价坐标
社会泛化是一个 Agent 在伙伴策略、偏好、通信习惯和群体结构变化后仍能协调或合作的能力,不能由与固定训练伙伴的高回报单独证明。
从零实现 Iterated Social Dilemma
Iterated social dilemma 用重复的局部行动揭示短期个体激励与长期共同收益的冲突,是观察合作、报复、宽恕和策略识别的最小环境。
学习策略、通信通道与固定伙伴对照
可学习通信让 Agent 发送影响伙伴决策的信号,但只有在无通信、随机通信和陌生伙伴对照下,才能判断消息是否携带可泛化信息而非私有编码或答案泄漏。
通信消融、Free-Rider 与 Partner Shift
Partner shift 暴露策略对训练伙伴的过拟合,而通信消融、free-rider 和 deceptive message 则帮助区分合作、依赖、剥削与错误信任。
Cross-Play、Welfare、Fairness 与 Exploitability 联合分析
联合社会评价把陌生伙伴上的行为矩阵与个体收益、集体福利、不平等、可利用性和消息成本并列,从而避免单一“合作分数”掩盖机制冲突。
协调、合作、串谋与“更多 Agent”边界
相互协调的 Agent 可能在共同目标上合作,也可能共同放大错误或损害第三方;增加 Agent 数量只有在任务可分、信息互补且协调成本受控时才可能带来净收益。
休息与恢复:退出多 Agent 社交场
今天无必修、不引入新知识,不需要组织 Agent 辩论、补 cross-play、做合作测验或设置任何 Gate。
W8
第 8 周
Continual、Meta 与 Transfer Learning 的指标地图
Continual learning 研究任务流中学习新能力与保留旧能力的取舍,meta learning 研究跨任务获得更快适应机制,transfer 则描述一个任务的学习如何影响另一个任务;三者不能用最终平均分混为一谈。
Sequential Fine-Tuning、Replay 与数据预算
Replay 通过在学习新任务时重放有限旧样本来降低参数覆盖,但收益取决于缓冲区选择、任务顺序和数据预算,并以存储、隐私与旧分布固化为代价。
EWC、MAML 与两种“快速适应”机制
EWC 用参数重要性约束后续更新以保护旧任务,MAML 则学习一个能经少量梯度步适应新任务的初始化;两者都涉及跨任务信息,却优化不同问题并依赖不同数据访问条件。
任务顺序、相似性与 Replay Size 的干扰实验
任务顺序与相似性改变梯度干扰和可迁移结构,因此同一 continual 方法在不同 curriculum 上可能从正迁移变成遗忘,单一顺序的平均结果不足以支持普遍结论。
阶段复盘二:适应效率与旧任务遗忘
本次复盘把“学得快”“记得住”“迁移得好”拆成独立证据,只整理目前理解、疑问与兴趣,不要求算法齐全、达标或重做失败实验。
Stability–Plasticity 的边界与三种适应层
Stability–plasticity 不是单一算法问题,而是系统在 context、external memory 和 parameters 三层选择“哪些变化立即吸收、哪些保留、哪些拒绝”的状态治理问题。
休息与恢复:允许暂时遗忘缩写
今天无必修、不引入新知识,也没有 ACC、BWT、FWT 测验、算法补齐或阶段 Gate。
W9
第 9 周
受控自改进循环、外部选择信号与停止条件
受控自改进循环是有限轮次的 generate→select→train→independent-evaluate 流程,其改进必须依赖可说明的外部选择信号、真实数据锚点和停止条件,而不是模型给自己更高分。
稀有子群上的一轮 Generate–Filter–Retrain
稀有子群 toy loop 用可控真实分布观察生成器覆盖、过滤器偏差与再训练如何重新分配数据质量,从而把平均改善和尾部退化同时暴露出来。
真实锚点、规则过滤与 Diversity Filtering 对照
真实锚点、规则过滤和多样性过滤分别约束递归训练的参考分布、标签错误与支持集收缩,它们可能互补,也可能因筛选偏差牺牲难例和尾部。
Judge Bias、False Positive 与递归错误放大
递归错误放大指生成器反复学习被偏置 judge 接受的错误、重复或低覆盖模式,使内部评分改善而独立真值、尾部与校准退化。
受控自改进证据图:平均提升不等于分布变好
受控自改进不是模型反复生成并训练自己,而是一条由外部真值、数据谱系、独立评估和停止条件约束的 `generate → select → train → evaluate` 研究循环。
合成数据谱系与长尾回看:让每一轮变化可追溯
合成数据谱系是把候选的生成条件、过滤理由、父数据、迭代轮次与训练去向连成证据链,使长尾退化能够定位而不只是被最终分数发现。
休息与回顾指南:暂停自改进循环
今天无必修、不引入新知识、无测验或 Gate,也不运行新一轮 generate–filter–train;恢复注意力本身就是研究节奏的一部分。
W10
第 10 周
机制可解释性的因果假设:从可视化走向可证伪机制
机制可解释性试图提出并干预模型内部计算的因果假设,说明哪些组件在什么输入分布上对某一行为既有必要性或充分性,而不只是展示相关图案。
Toy Transformer 与 Activation Cache:建立可干预的最小实验台
最小可解释性实验台是一个任务机制已知、前向计算可缓存、内部状态可替换且运行可重放的 Toy Transformer,而不是一套只会画 attention 的仪表盘。
Probe、Patching 与 Ablation:三种证据不能互相替代
Probe 测量信息能否从 activation 解码,patching 测量替换内部状态能否改变行为,ablation 测量移除组件造成的损失;三者回答不同问题,组合后才可能支持局部机制。
Clean/Corrupt 因果对照:防止事后故事化
Clean/corrupt 对照通过最小改变一个算法变量并在内部重建它,检验候选 circuit 是否真正中介行为差异,同时用随机与等价输入阻止事后叙事。
Circuit 泛化与稳定性:机制是否跨输入和随机种子存在
Circuit 稳定性研究同一行为机制是否在新输入、长度、符号和训练随机种子上保持因果作用,并允许不同参数实现同一算法或同一模型切换机制。
Attention 与因果干预:可选回看中的解释边界
Attention 是模型计算中的路由权重而不是天然解释;只有结合 value 内容、下游读取、行为干预和竞争对照,才能判断某条注意路径是否具有局部因果作用。
休息与回顾指南:暂停解释模型
今天无必修、不引入新知识、无测验或 Gate;不看新 heatmap、不找新 circuit,也不要求解释任何模型。
W11
第 11 周
Alignment Threat Model:先限定风险主体、能力与边界
Alignment threat model 是对系统可能追求的错误目标、可利用的观察与权限、可能受害资产和可接受剩余风险作有限声明,而不是用“模型可能失控”概括一切。
Proxy Shortcut Agent 与审计日志:构造无害的目标错位
Proxy shortcut toy agent 在训练环境中让代理目标与真实目标相关、在隐藏 shift 中将二者分离,用最小且无害的方式观察目标泛化与审计可见性。
Monitor、Random Audit、Fallback 与 Permission 的组合实验
Control protocol 通过监测、随机审计、可信回退和权限限制组合降低不可信 agent 的实际影响,并以 safety–usefulness–cost 三方权衡而非单一拦截率评价。
隐藏触发、OOD 目标与 False Assurance:寻找控制协议的盲点
False assurance 是控制协议在已知测试上表现良好,却因隐藏触发、共同分布偏差、评估泄漏或权限旁路而被误写成一般安全证据。
Shift 下的 Safety–Usefulness 曲线:控制不是越严越好
Safety–usefulness 分析在额外分布变化下同时测量严重失败、正常任务效用、人工负载与延迟,用 Pareto 边界揭示控制阈值的真实代价。
Alignment Training 与 Deployment Control:两条不同防线
Alignment training 改变模型倾向与行为分布,deployment control 限制一个仍可能失效的模型能观察、决定和执行什么;前者不能替代后者,后者也不证明前者成功。
休息与回顾指南:暂停安全评估
今天无必修、不引入新知识、无测验或 Gate;不设计 trigger、不调 monitor、不证明系统安全,让风险注意力真正暂停。
W12
第 12 周
AI Scientist 研究链:生成、执行、验证与责任不能合并
AI Scientist 是把文献检索、假设生成、实验设计、沙箱执行、确定性验证、统计分析、批判审阅与人类决定串成可追溯研究链,而不是让一个 Agent 同时生成并宣布发现。
Research Registry 与 Deterministic Verifier:让实验能够被重放
Research registry 将问题、假设、实验规格、代码、数据、运行、artifact、验证与决定建模成不可混写的版本对象,使每个研究结论能回到原始证据。
Baseline、Multi-seed 与 Human Checkpoint:给自动研究加独立约束
Baseline selector、multi-seed runner 与 human checkpoint 分别约束比较对象、随机不确定性和最终责任,使自动实验不能靠弱基线、最佳 seed 或自我审阅制造进步。
自动研究失败测试:P-hacking、Judge Bias 与重复发现
自动研究失败测试故意构造无效假设、可被利用的 evaluator 和重复候选,检查系统是否会把搜索噪声、judge 偏好或文献重述包装成发现。
阶段复盘三:从能力主张到受控研究系统
阶段复盘三把能力定义、学习机制、内部因果、持续适应、自改进、对齐控制与 AI Scientist 串成一条 claim→hypothesis→experiment→evidence→boundary 的研究链。
可选 General Learning Agent Lab:只组合能回答一个问题的组件
General Learning Agent Lab 是可选的小型研究架,用 2~3 个必要组件回答一个可证伪问题,而不是把搜索、RL、记忆、自改进和多 Agent 全部拼成 AGI demo。
休息与回顾指南:暂停自动科研
今天无必修、不引入新知识、无测验或 Gate;不生成假设、不执行实验、不让自动 reviewer 评价任何东西。
INTEGRATION
知识整合与 P4 桥接
AGI 能力—证据地图:把“通用”拆回可测问题
AGI 能力—证据地图把 generality、performance、learning efficiency、planning、memory、adaptation、autonomy 与 risk 画成独立但相互依赖的轴,并为每个节点标注可支持证据和外推禁区。
论文链路一:Scaling → Emergence → Reasoning → Test-time Compute
这条论文链把训练规模带来的连续 loss 变化、任务指标上的表观跃迁、推理策略与测试时搜索预算分开,避免把四种效应都解释成模型内部突然获得新能力。
论文链路二:RL → World Model → Memory/Tool → Continual Learning
这条链描述 Agent 如何从奖励下的序列决策,经学习动力学与规划、跨时间记忆和工具执行,再到任务流中的持续适应,同时暴露误差如何沿时间累积。
开放问题地图:用 E/C/H/S 保存已知、争议与未知
开放问题地图把 self-improvement、multi-agent、interpretability、alignment 与 AI Scientist 中的主张分成外部证据 E、冲突 C、待验假设 H 和推测 S,让未知保持可追踪而不被宏大叙事填满。
个人兴趣选题卡:从广泛前沿收敛到一两个问题
兴趣选题卡用一个问题、三篇起始材料、一个最小实验、一个停止边界和一份“不做清单”,把长期好奇心转成可持续学习路线,而不是新的考核承诺。
Phase 4 问题树:把离散 Agent 转译为具身闭环
P4 问题树把 P3 的 state、world model、memory、planning、action permission 与 human fallback 转译成感知—状态估计—规划—控制—反馈闭环,并把连续动力学、延迟、接触和不可逆后果加入证据边界。