返回 P3 学习主页
90 份预习教材已就绪

G01~G90 教材库

AI Deep Mastery 总路线 Day 181~270

正式学习日包含概念、数学或算法机制、最小实验、反例、证据边界、研究场景、自检与专业课程对齐。周日只提供轻量恢复;教材可以提前阅读,但 P3 尚未启动。

P3 状态:未启动当前仍在 P1 · M01 · 0/90专业课程地图 →
P3 启动后的建议顺序:问题预判 → 当天教材 → 一个最小机制或反例 → 用自己的话回答自检 → 记录真实观察。现在不需要提前完成外部课程、实验或进度记录。

W1

第 1 周

G01~G07 · Day 181~187 · 7
G01 · Day 181

AGI 定义与能力本体

AGI 不是某个模型在若干题目上取得高分的同义词,而是一组必须分开描述的能力主张:系统覆盖哪些任务、达到什么性能、用多少新经验完成适应、以多大自主性行动,以及这种自主性带来什么部署风险。

2027-02-22预习教材
G02 · Day 182

程序化规则任务生成器

程序化任务生成器用显式规则生产可无限采样、可控制难度且答案可验证的任务族,使“泛化到哪里”从题目印象变成训练规则、组合结构与测试规则之间的可审计关系。

2027-02-23预习教材
G03 · Day 183

基线、适应曲线与多维指标

基线不是“故意做差的参照”,而是把可能贡献性能的记忆、固定算法、搜索、示例适应与计算预算逐项显式化,从而判断一个系统的成绩究竟来自哪种机制。

2027-02-24预习教材
G04 · Day 184

测量有效性、污染与脚手架反例

测量有效性不是“分数计算正确”这么简单,而是检查任务、数据、指标和脚手架是否真的测到了所声称的能力,以及替代解释能否产生同样的高分。

2027-02-25预习教材
G05 · Day 185

能力知识图谱与主张—证据账本

主张—证据账本把“系统很通用”拆成能力节点、条件、支持证据、反证与未知项,使知识图谱能够随新研究修订,而不是积累无法核验的结论句。

2027-02-26预习教材
G06 · Day 186

不用术语堆砌解释 Intelligence 与 Skill

Skill 回答“在已界定任务上能做得多好”,intelligence 更关心“面对尚未熟练的任务,能否利用有限经验与资源获得有效技能”;两者相关,却不能用一个固定题库成绩互相替代。

2027-02-27预习教材
G07 · Day 187

W1 休息与概念沉淀

G07:W1 休息与概念沉淀

2027-02-28预习教材

W2

第 2 周

G08~G14 · Day 188~194 · 7
G08 · Day 188

Scaling Law 与预算几何

Scaling law 是在给定模型族、数据分布、优化方式与计算区间内,损失随参数量、数据量或计算预算呈现近似规律变化的经验模型;它描述观测区间,不是智能必然增长或 AGI 日期预测公式。

2027-03-01预习教材
G09 · Day 189

微型序列模型与可测训练循环

微型 scaling 实验不是缩小版 frontier 竞赛,而是在完全可控的序列任务上,把数据生成、模型容量、训练预算、连续损失和离散任务指标连接成可观察因果链。

2027-03-02预习教材
G10 · Day 190

Compute-Optimal 预算网格与公平基线

Compute-optimal 实验在相近训练预算下改变模型容量与数据量的分配,寻找哪个组合更有效,同时把“容量不足”和“数据或训练不足”两类失败分开。

2027-03-03预习教材
G11 · Day 191

涌现主张的指标敏感性

“涌现”只有在明确模型尺度、训练充分性、任务结构和测量函数后才是可研究主张;若跃迁随评分阈值任意移动或在连续指标中消失,它首先是测量现象,而非已证明的内部新机制。

2027-03-04预习教材
G12 · Day 192

Scaling 残差、区间与外推禁区

残差分析用预测与实际观测之间的结构化偏差检查 scaling 模型是否遗漏机制,而外推纪律要求任何拟合都只在明确区间内陈述,并把远距离预测标为假设而非事实。

2027-03-05预习教材
G13 · Day 193

Emergent Abilities 与 Mirage 论证对读

涌现争议的学习重点不是选择阵营,而是对齐双方所说的“能力”“突然”和“尺度”,找出它们产生不同预测的实验条件,以及仍无法由现有曲线判断的内部机制问题。

2027-03-06预习教材
G14 · Day 194

W2 休息与曲线放下

G14:W2 休息与曲线放下

2027-03-07预习教材

W3

第 3 周

G15~G21 · Day 195~201 · 7
G15 · Day 195

Test-Time Compute、搜索空间与停止条件

Test-time compute 是在参数冻结后,为当前任务分配的候选生成、搜索展开、验证、回溯与聚合预算;它只有在候选具有多样性、验证信号足够可靠且停止策略受控时,才可能转化为更高成功率。

2027-03-08预习教材
G16 · Day 196

Game of 24 的搜索与确定性 Verifier

Game of 24 是一个小而完整的可搜索任务:从四个数字出发,通过有限算术动作构造 24,适合从零观察状态表示、组合爆炸、路径去重和确定性验证怎样共同决定搜索质量。

2027-03-09预习教材
G17 · Day 197

同预算推理策略比较

同预算策略比较是在相近候选生成、节点展开或模型调用成本下,比较直接生成、重复采样、答案聚合和显式搜索,避免把更多计算带来的收益误归因于某个算法名称。

2027-03-10预习教材
G18 · Day 198

Verifier 错误、消融与搜索放大

Verifier 决定搜索把计算投向哪里;当它存在系统性假阳性时,更多候选和更深搜索可能不是稀释错误,而是更有效地找到并放大能骗过评分器的错误路径。

2027-03-11预习教材
G19 · Day 199

难度分层与 Adaptive Inference Controller

Adaptive Inference Controller 根据任务难度、当前证据和 verifier 置信度,在明确上限内决定直接回答、继续采样、展开搜索、拒答或转人工,使计算预算服务于边际收益而非统一堆叠。

2027-03-12预习教材
G20 · Day 200

何时搜索胜过直接生成,何时更坏

搜索胜过直接生成的关键不在于“想得更久”,而在于任务能被分解、正确路径能被 proposal 覆盖、中间或最终状态可可靠验证,并且额外计算的收益高于延迟和错误放大成本。

2027-03-13预习教材
G21 · Day 201

W3 休息与推理预算归零

G21:W3 休息与推理预算归零

2027-03-14预习教材

W4

第 4 周

G22~G28 · Day 202~208 · 7
G22 · Day 202

MDP、Bellman 方程与 OOD Shift

MDP 用状态、动作、转移与奖励刻画序贯决策,Bellman 方程把长期价值递归分解为当前奖励与下一状态价值;它能表达“如何优化给定目标”,却不能保证奖励正确代表真正意图。

2027-03-15预习教材
G23 · Day 203

从零实现 Tabular Q-Learning

Tabular Q-learning 用实际交互样本反复修正状态—动作价值,在不知道转移模型的情况下逼近最优策略,是观察探索、时间差分误差与训练回报局限的最小 model-free 实验。

2027-03-16预习教材
G24 · Day 204

Dyna-Q 与学习模型上的 Planning

Dyna-Q 将真实环境中的 Q-learning 更新与学习模型生成的模拟更新交替进行,用计算换取样本效率,同时暴露模型错误会怎样通过 planning 被重复传播。

2027-03-17预习教材
G25 · Day 205

奖励、转移与 Proxy Shift 诊断

环境 shift 诊断通过分别改变奖励、转移和观察 proxy,观察策略是失去完成目标的能力、被错误模型误导,还是继续有能力却追逐了训练中的替代目标。

2027-03-18预习教材
G26 · Day 206

阶段复盘一——Reactive、Model-Free 与 Model-Based

阶段复盘一把前四周的测量、scaling、search 与 RL 放进统一 Agent 接口,比较 reactive、model-free、learned-model 和 oracle-model 各自依赖什么信息、在哪类 shift 失败,而不是进行排名考试。

2027-03-19预习教材
G27 · Day 207

Model Bias 如何经过 Planning 影响决策

Model bias 影响决策的关键不只是预测平均误差,而是误差沿 rollout 累积、偏向规划访问的分布,并最终改变候选动作的价值排序。

2027-03-20预习教材
G28 · Day 208

W4 休息与阶段缓冲

G28:W4 休息与阶段缓冲

2027-03-21预习教材

W5

第 5 周

G29~G35 · Day 209~215 · 7
G29 · Day 209

World Model、Latent Dynamics 与反事实地图

World model 是为预测行动后果与支持决策而学习的状态表示和动力学;它不因能生成逼真观察就自动适合规划,也不因无法重建全部像素就一定缺少任务相关结构。

2027-03-22预习教材
G30 · Day 210

Toy POMDP 与一步 Transition Predictor

POMDP 在 MDP 上加入隐藏状态与观察生成过程,Agent 必须用历史形成 belief;一步 transition predictor 若只看当前观察,会在 observation aliasing 下把不同真实状态错误地平均。

2027-03-23预习教材
G31 · Day 211

短视野 World Model Planner 与对照实验

短视野 world-model planner 是先用学习到的状态转移模型模拟有限步行动后果,再按预测回报选择当前动作的决策器;它检验的是“模型能否支持行动排序”,而不只是下一帧是否像真。

2027-03-24预习教材
G32 · Day 212

Rollout Error、随机动力学与 Observation Aliasing

Rollout error 是模型在反复消费自身预测时产生的多步偏差,而随机动力学与 observation aliasing 会让“单条预测不准”同时包含不可约随机性、状态信息缺失和可修复模型偏差三种不同原因。

2027-03-25预习教材
G33 · Day 213

预测准确率、Action Ranking 与真实 Return 的错位

预测—控制错位是指 world model 在平均观测或转移指标上更准确,却没有更好地保存决策所需的价值差异,因而 action ranking 和真实 return 可能不升反降。

2027-03-26预习教材
G34 · Day 214

Task-Relevant World Model 的边界与反事实检验

Task-relevant world model 只承诺为明确任务、奖励、动作与环境范围保存足够的动力学信息;它能否回答未执行动作的反事实,必须由干预式测试而不是逼真生成来判断。

2027-03-27预习教材
G35 · Day 215

休息与恢复:让世界模型停在边界内

今天无必修、不引入新知识,也不需要补齐 planner、证明 world model 有效或完成任何测验与 Gate。

2027-03-28预习教材

W6

第 6 周

G36~G42 · Day 216~222 · 7
G36 · Day 216

Agent Memory Schema、Tool Contract 与状态边界

Agent memory 是带来源、时效和写入规则的外部状态系统,tool contract 则明确动作参数、返回、错误与副作用;二者共同限制 Agent 能记住什么、相信什么和改变什么。

2027-03-29预习教材
G37 · Day 217

从零构造 Planner–Executor 状态机

Planner–executor 状态机把“提出下一步”和“执行受控动作”拆成显式转移,使每次工具调用都有前置条件、结果类型、恢复路径和可重放证据。

2027-03-30预习教材
G38 · Day 218

分层检索记忆与 No-Memory 对照

分层检索记忆将当前工作状态、事件记录与经验证事实分别保存,再按任务和权限检索;它是否优于无记忆或完整 transcript,必须在相同信息与预算下做对照。

2027-03-31预习教材
G39 · Day 219

Memory Poisoning、Tool Timeout 与权限拒绝注入

失败注入是在完全本地和受控环境中主动制造过期、矛盾、污染、超时、重复和拒绝事件,以观察 Agent 的显式状态是否阻止错误继续传播。

2027-04-01预习教材
G40 · Day 220

跨 Session Agent 的检索、恢复与审计

跨 session Agent 的可靠性来自可重建的显式状态、带来源的检索和受控恢复,而不是模型声称自己“记得上次发生了什么”。

2027-04-02预习教材
G41 · Day 221

结构化 Replay、幂等与 Agent 自主边界

结构化 replay 用保存的 state/action/result/event 重建已发生的系统转移,而自主边界决定哪些候选动作只能模拟、哪些可只读执行、哪些必须等待独立授权。

2027-04-03预习教材
G42 · Day 222

休息与恢复:不让 Agent 占满记忆

今天无必修、不引入新知识,没有测验、Gate、工具链补作业或必须整理的 Agent 记忆。

2027-04-04预习教材

W7

第 7 周

G43~G49 · Day 223~229 · 7
G43 · Day 223

社会泛化、Counterpart Variation 与评价坐标

社会泛化是一个 Agent 在伙伴策略、偏好、通信习惯和群体结构变化后仍能协调或合作的能力,不能由与固定训练伙伴的高回报单独证明。

2027-04-05预习教材
G44 · Day 224

从零实现 Iterated Social Dilemma

Iterated social dilemma 用重复的局部行动揭示短期个体激励与长期共同收益的冲突,是观察合作、报复、宽恕和策略识别的最小环境。

2027-04-06预习教材
G45 · Day 225

学习策略、通信通道与固定伙伴对照

可学习通信让 Agent 发送影响伙伴决策的信号,但只有在无通信、随机通信和陌生伙伴对照下,才能判断消息是否携带可泛化信息而非私有编码或答案泄漏。

2027-04-07预习教材
G46 · Day 226

通信消融、Free-Rider 与 Partner Shift

Partner shift 暴露策略对训练伙伴的过拟合,而通信消融、free-rider 和 deceptive message 则帮助区分合作、依赖、剥削与错误信任。

2027-04-08预习教材
G47 · Day 227

Cross-Play、Welfare、Fairness 与 Exploitability 联合分析

联合社会评价把陌生伙伴上的行为矩阵与个体收益、集体福利、不平等、可利用性和消息成本并列,从而避免单一“合作分数”掩盖机制冲突。

2027-04-09预习教材
G48 · Day 228

协调、合作、串谋与“更多 Agent”边界

相互协调的 Agent 可能在共同目标上合作,也可能共同放大错误或损害第三方;增加 Agent 数量只有在任务可分、信息互补且协调成本受控时才可能带来净收益。

2027-04-10预习教材
G49 · Day 229

休息与恢复:退出多 Agent 社交场

今天无必修、不引入新知识,不需要组织 Agent 辩论、补 cross-play、做合作测验或设置任何 Gate。

2027-04-11预习教材

W8

第 8 周

G50~G56 · Day 230~236 · 7
G50 · Day 230

Continual、Meta 与 Transfer Learning 的指标地图

Continual learning 研究任务流中学习新能力与保留旧能力的取舍,meta learning 研究跨任务获得更快适应机制,transfer 则描述一个任务的学习如何影响另一个任务;三者不能用最终平均分混为一谈。

2027-04-12预习教材
G51 · Day 231

Sequential Fine-Tuning、Replay 与数据预算

Replay 通过在学习新任务时重放有限旧样本来降低参数覆盖,但收益取决于缓冲区选择、任务顺序和数据预算,并以存储、隐私与旧分布固化为代价。

2027-04-13预习教材
G52 · Day 232

EWC、MAML 与两种“快速适应”机制

EWC 用参数重要性约束后续更新以保护旧任务,MAML 则学习一个能经少量梯度步适应新任务的初始化;两者都涉及跨任务信息,却优化不同问题并依赖不同数据访问条件。

2027-04-14预习教材
G53 · Day 233

任务顺序、相似性与 Replay Size 的干扰实验

任务顺序与相似性改变梯度干扰和可迁移结构,因此同一 continual 方法在不同 curriculum 上可能从正迁移变成遗忘,单一顺序的平均结果不足以支持普遍结论。

2027-04-15预习教材
G54 · Day 234

阶段复盘二:适应效率与旧任务遗忘

本次复盘把“学得快”“记得住”“迁移得好”拆成独立证据,只整理目前理解、疑问与兴趣,不要求算法齐全、达标或重做失败实验。

2027-04-16预习教材
G55 · Day 235

Stability–Plasticity 的边界与三种适应层

Stability–plasticity 不是单一算法问题,而是系统在 context、external memory 和 parameters 三层选择“哪些变化立即吸收、哪些保留、哪些拒绝”的状态治理问题。

2027-04-17预习教材
G56 · Day 236

休息与恢复:允许暂时遗忘缩写

今天无必修、不引入新知识,也没有 ACC、BWT、FWT 测验、算法补齐或阶段 Gate。

2027-04-18预习教材

W9

第 9 周

G57~G63 · Day 237~243 · 7
G57 · Day 237

受控自改进循环、外部选择信号与停止条件

受控自改进循环是有限轮次的 generate→select→train→independent-evaluate 流程,其改进必须依赖可说明的外部选择信号、真实数据锚点和停止条件,而不是模型给自己更高分。

2027-04-19预习教材
G58 · Day 238

稀有子群上的一轮 Generate–Filter–Retrain

稀有子群 toy loop 用可控真实分布观察生成器覆盖、过滤器偏差与再训练如何重新分配数据质量,从而把平均改善和尾部退化同时暴露出来。

2027-04-20预习教材
G59 · Day 239

真实锚点、规则过滤与 Diversity Filtering 对照

真实锚点、规则过滤和多样性过滤分别约束递归训练的参考分布、标签错误与支持集收缩,它们可能互补,也可能因筛选偏差牺牲难例和尾部。

2027-04-21预习教材
G60 · Day 240

Judge Bias、False Positive 与递归错误放大

递归错误放大指生成器反复学习被偏置 judge 接受的错误、重复或低覆盖模式,使内部评分改善而独立真值、尾部与校准退化。

2027-04-22预习教材
G61 · Day 241

受控自改进证据图:平均提升不等于分布变好

受控自改进不是模型反复生成并训练自己,而是一条由外部真值、数据谱系、独立评估和停止条件约束的 `generate → select → train → evaluate` 研究循环。

2027-04-23预习教材
G62 · Day 242

合成数据谱系与长尾回看:让每一轮变化可追溯

合成数据谱系是把候选的生成条件、过滤理由、父数据、迭代轮次与训练去向连成证据链,使长尾退化能够定位而不只是被最终分数发现。

2027-04-24预习教材
G63 · Day 243

休息与回顾指南:暂停自改进循环

今天无必修、不引入新知识、无测验或 Gate,也不运行新一轮 generate–filter–train;恢复注意力本身就是研究节奏的一部分。

2027-04-25预习教材

W10

第 10 周

G64~G70 · Day 244~250 · 7
G64 · Day 244

机制可解释性的因果假设:从可视化走向可证伪机制

机制可解释性试图提出并干预模型内部计算的因果假设,说明哪些组件在什么输入分布上对某一行为既有必要性或充分性,而不只是展示相关图案。

2027-04-26预习教材
G65 · Day 245

Toy Transformer 与 Activation Cache:建立可干预的最小实验台

最小可解释性实验台是一个任务机制已知、前向计算可缓存、内部状态可替换且运行可重放的 Toy Transformer,而不是一套只会画 attention 的仪表盘。

2027-04-27预习教材
G66 · Day 246

Probe、Patching 与 Ablation:三种证据不能互相替代

Probe 测量信息能否从 activation 解码,patching 测量替换内部状态能否改变行为,ablation 测量移除组件造成的损失;三者回答不同问题,组合后才可能支持局部机制。

2027-04-28预习教材
G67 · Day 247

Clean/Corrupt 因果对照:防止事后故事化

Clean/corrupt 对照通过最小改变一个算法变量并在内部重建它,检验候选 circuit 是否真正中介行为差异,同时用随机与等价输入阻止事后叙事。

2027-04-29预习教材
G68 · Day 248

Circuit 泛化与稳定性:机制是否跨输入和随机种子存在

Circuit 稳定性研究同一行为机制是否在新输入、长度、符号和训练随机种子上保持因果作用,并允许不同参数实现同一算法或同一模型切换机制。

2027-04-30预习教材
G69 · Day 249

Attention 与因果干预:可选回看中的解释边界

Attention 是模型计算中的路由权重而不是天然解释;只有结合 value 内容、下游读取、行为干预和竞争对照,才能判断某条注意路径是否具有局部因果作用。

2027-05-01预习教材
G70 · Day 250

休息与回顾指南:暂停解释模型

今天无必修、不引入新知识、无测验或 Gate;不看新 heatmap、不找新 circuit,也不要求解释任何模型。

2027-05-02预习教材

W11

第 11 周

G71~G77 · Day 251~257 · 7
G71 · Day 251

Alignment Threat Model:先限定风险主体、能力与边界

Alignment threat model 是对系统可能追求的错误目标、可利用的观察与权限、可能受害资产和可接受剩余风险作有限声明,而不是用“模型可能失控”概括一切。

2027-05-03预习教材
G72 · Day 252

Proxy Shortcut Agent 与审计日志:构造无害的目标错位

Proxy shortcut toy agent 在训练环境中让代理目标与真实目标相关、在隐藏 shift 中将二者分离,用最小且无害的方式观察目标泛化与审计可见性。

2027-05-04预习教材
G73 · Day 253

Monitor、Random Audit、Fallback 与 Permission 的组合实验

Control protocol 通过监测、随机审计、可信回退和权限限制组合降低不可信 agent 的实际影响,并以 safety–usefulness–cost 三方权衡而非单一拦截率评价。

2027-05-05预习教材
G74 · Day 254

隐藏触发、OOD 目标与 False Assurance:寻找控制协议的盲点

False assurance 是控制协议在已知测试上表现良好,却因隐藏触发、共同分布偏差、评估泄漏或权限旁路而被误写成一般安全证据。

2027-05-06预习教材
G75 · Day 255

Shift 下的 Safety–Usefulness 曲线:控制不是越严越好

Safety–usefulness 分析在额外分布变化下同时测量严重失败、正常任务效用、人工负载与延迟,用 Pareto 边界揭示控制阈值的真实代价。

2027-05-07预习教材
G76 · Day 256

Alignment Training 与 Deployment Control:两条不同防线

Alignment training 改变模型倾向与行为分布,deployment control 限制一个仍可能失效的模型能观察、决定和执行什么;前者不能替代后者,后者也不证明前者成功。

2027-05-08预习教材
G77 · Day 257

休息与回顾指南:暂停安全评估

今天无必修、不引入新知识、无测验或 Gate;不设计 trigger、不调 monitor、不证明系统安全,让风险注意力真正暂停。

2027-05-09预习教材

W12

第 12 周

G78~G84 · Day 258~264 · 7
G78 · Day 258

AI Scientist 研究链:生成、执行、验证与责任不能合并

AI Scientist 是把文献检索、假设生成、实验设计、沙箱执行、确定性验证、统计分析、批判审阅与人类决定串成可追溯研究链,而不是让一个 Agent 同时生成并宣布发现。

2027-05-10预习教材
G79 · Day 259

Research Registry 与 Deterministic Verifier:让实验能够被重放

Research registry 将问题、假设、实验规格、代码、数据、运行、artifact、验证与决定建模成不可混写的版本对象,使每个研究结论能回到原始证据。

2027-05-11预习教材
G80 · Day 260

Baseline、Multi-seed 与 Human Checkpoint:给自动研究加独立约束

Baseline selector、multi-seed runner 与 human checkpoint 分别约束比较对象、随机不确定性和最终责任,使自动实验不能靠弱基线、最佳 seed 或自我审阅制造进步。

2027-05-12预习教材
G81 · Day 261

自动研究失败测试:P-hacking、Judge Bias 与重复发现

自动研究失败测试故意构造无效假设、可被利用的 evaluator 和重复候选,检查系统是否会把搜索噪声、judge 偏好或文献重述包装成发现。

2027-05-13预习教材
G82 · Day 262

阶段复盘三:从能力主张到受控研究系统

阶段复盘三把能力定义、学习机制、内部因果、持续适应、自改进、对齐控制与 AI Scientist 串成一条 claim→hypothesis→experiment→evidence→boundary 的研究链。

2027-05-14预习教材
G83 · Day 263

可选 General Learning Agent Lab:只组合能回答一个问题的组件

General Learning Agent Lab 是可选的小型研究架,用 2~3 个必要组件回答一个可证伪问题,而不是把搜索、RL、记忆、自改进和多 Agent 全部拼成 AGI demo。

2027-05-15预习教材
G84 · Day 264

休息与回顾指南:暂停自动科研

今天无必修、不引入新知识、无测验或 Gate;不生成假设、不执行实验、不让自动 reviewer 评价任何东西。

2027-05-16预习教材

INTEGRATION

知识整合与 P4 桥接

G85~G90 · Day 265~270 · 6
G85 · Day 265

AGI 能力—证据地图:把“通用”拆回可测问题

AGI 能力—证据地图把 generality、performance、learning efficiency、planning、memory、adaptation、autonomy 与 risk 画成独立但相互依赖的轴,并为每个节点标注可支持证据和外推禁区。

2027-05-17预习教材
G86 · Day 266

论文链路一:Scaling → Emergence → Reasoning → Test-time Compute

这条论文链把训练规模带来的连续 loss 变化、任务指标上的表观跃迁、推理策略与测试时搜索预算分开,避免把四种效应都解释成模型内部突然获得新能力。

2027-05-18预习教材
G87 · Day 267

论文链路二:RL → World Model → Memory/Tool → Continual Learning

这条链描述 Agent 如何从奖励下的序列决策,经学习动力学与规划、跨时间记忆和工具执行,再到任务流中的持续适应,同时暴露误差如何沿时间累积。

2027-05-19预习教材
G88 · Day 268

开放问题地图:用 E/C/H/S 保存已知、争议与未知

开放问题地图把 self-improvement、multi-agent、interpretability、alignment 与 AI Scientist 中的主张分成外部证据 E、冲突 C、待验假设 H 和推测 S,让未知保持可追踪而不被宏大叙事填满。

2027-05-20预习教材
G89 · Day 269

个人兴趣选题卡:从广泛前沿收敛到一两个问题

兴趣选题卡用一个问题、三篇起始材料、一个最小实验、一个停止边界和一份“不做清单”,把长期好奇心转成可持续学习路线,而不是新的考核承诺。

2027-05-21预习教材
G90 · Day 270

Phase 4 问题树:把离散 Agent 转译为具身闭环

P4 问题树把 P3 的 state、world model、memory、planning、action permission 与 human fallback 转译成感知—状态估计—规划—控制—反馈闭环,并把连续动力学、延迟、接触和不可逆后果加入证据边界。

2027-05-22预习教材