返回 P1 学习主页
90 份教材内容已就绪

M01~M90 教材库

每个课程日都有一份可直接阅读的教材,包含核心机制、推导或观察路径、最小练习、常见误区、自检问题,并对齐 MIT、Stanford、PyTorch、Hugging Face、ARENA 与 FSDL 等专业课程。 教材是学习输入,不是完成证明;只有真实学习后才更新进度账本。

当前任务 M01真实进度 0/90打开进度账本 →专业课程地图 →
推荐顺序:先读当天教材 → 做最小练习 → 用自己的话回答自检问题 → 把真实理解和结果写入“学后填写区” → 最后更新进度。无需一次读完后续课程。

W1

第 1 周

M01~M07 · 7

W2

第 2 周

M08~M14 · 7

W3

第 3 周

M15~M21 · 7

W4

第 4 周

M22~M28 · 7

W5

第 5 周

M29~M35 · 7
M29

语言模型目标、数据预算与 Scaling

语言模型预训练用历史 token 预测下一个 token,通过交叉熵在给定模型、数据和计算预算下学习语料分布的可压缩规律。

2026-09-21预习教材
M30

组装 Tiny Language Model 训练循环

Tiny LM 训练循环把 tokenizer、因果 decoder、错位标签、交叉熵和参数更新连成一条可检查的最小闭环。

2026-09-22预习教材
M31

小数据训练 Baseline:读懂曲线、吞吐与内存

训练 baseline 是一组可重复的最小训练配置,用来建立“数据—模型—优化器—资源—结果”的参照点,而不是追求一次跑出漂亮指标。

2026-09-23预习教材
M32

单变量训练实验:让曲线差异具有因果含义

单变量训练实验是在同一参照配置上只改变一个因素,用最小成本判断该因素是否可能导致可重复的训练行为变化。

2026-09-24预习教材
M33

W5 一页小结:从数据与目标到曲线和行为

预训练诊断是一条因果链:数据决定可见经验,目标定义学习信号,优化器改变参数,曲线记录过程,最终行为则需要独立任务证据来判断。

2026-09-25预习教材
M34

可选探索:重复数据、顺序与小 Checkpoint

本日用一个极小对照观察训练过程对数据重复、样本顺序或 checkpoint 的敏感性;目标是产生一个可信问题,不是完成更多训练。

2026-09-26预习教材
M35

休息与回顾指南:让 W5 在这里收束

今天没有必修、不打卡、不引入新知识;恢复精力本身就是课程安排。

2026-09-27预习教材

W6

第 6 周

M36~M42 · 7
M36

模型适配方法地图:Prompt、检索、探针、全参微调与 LoRA

模型适配是在“改变输入、外部知识、任务头或模型参数”之间选择最小而足够的干预,使基础模型适合特定任务。

2026-09-28预习教材
M37

LoRA 最小机制:冻结权重上的低秩更新

LoRA 冻结原始线性层权重 `W₀`,用两个较小矩阵的乘积 `BA` 表示可训练更新,从而以较少参数改变该层行为。

2026-09-29预习教材
M38

PEFT 引导练习:公平比较 Prompt、冻结模型与 Adapter

PEFT 练习的重点不是成功训练一个“大模型”,而是在同一小任务上明确 prompt-only、冻结表示和 adapter 各自增加了什么能力与成本。

2026-09-30预习教材
M39

领域适配诊断:为何 Loss 下降,任务却没有改善

适配 loss 只衡量模型对训练目标 token 的拟合;若目标格式、mask、数据分布或评估问题不对,loss 下降完全可能与真实任务改善无关。

2026-10-01预习教材
M40

W6 一页小结:低秩假设、领域质量与遗忘

LoRA 改变的是选定线性层中的低秩增量,而适配是否有用取决于基座能力、数据目标、训练过程和独立任务证据的共同作用。

2026-10-02预习教材
M41

可选探索:Rank、Target Module 与低秩线性代数

今天只任选一个 rank 或 target module 对照,用来理解表达容量与注入位置;也可以完全不运行,回补低秩矩阵的基本概念。

2026-10-03预习教材
M42

休息与回顾指南:暂停 Adapter 调参

今天没有必修、不打卡、不引入新知识,也不需要为了“找到最佳 rank”继续实验。

2026-10-04预习教材

W7

第 7 周

M43~M49 · 7
M43

后训练方法地图:SFT、奖励模型、DPO、PPO/GRPO 与 RLVR

后训练把示范、偏好或可验证反馈转成学习信号,使预训练模型的输出分布更符合目标行为,但反馈定义本身决定了模型会追逐什么。

2026-10-05预习教材
M44

最小奖励机制:Pairwise Loss、Group-relative Advantage 与奖励组合

偏好与强化学习把“哪个回答更好”或“这个回答得多少分”转换成可微损失或相对优势,但数值转换方式会塑造最终行为。

2026-10-06预习教材
M45

偏好数据小实验:Chosen / Rejected 如何改变学习信号

一条偏好样本不是“好答案与坏答案”的标签,而是在给定 prompt 和评判标准下,声明 chosen 相对 rejected 更可取。

2026-10-07预习教材
M46

奖励设计案例:正确性、格式、长度与 Judge 的捷径

奖励投机是策略提高可测代理分数,却没有改善甚至损害真实目标;它通常暴露的是奖励定义和评估边界,而不只是“模型不听话”。

2026-10-08预习教材
M47

W7 一页小结:从偏好与奖励到行为和 Verifier

后训练的完整链条不是“奖励上升”,而是 SFT 建立行为起点、偏好或 verifier 定义更新方向、独立评估判断行为是否更接近真实目标。

2026-10-09预习教材
M48

可选探索:TRL 小例或 DPO / GRPO 数学回看

今天可以跟随一个极小工具示例,也可以只回看一条公式;目标是确认数据到损失的映射,不是完成真实 RL 训练。

2026-10-10预习教材
M49

休息与回顾指南:退出奖励优化循环

今天无必修、不打卡、不引入新知识;不需要把所有后训练算法在一天内统一起来。

2026-10-11预习教材

W8

第 8 周

M50~M56 · 7
M50

自回归推理数据流:Prefill、Decode、KV Cache 与服务指标

大模型推理分为并行处理输入的 prefill 与逐 token 生成的 decode;KV cache 用内存保存历史注意力状态,避免每一步重复计算全部前缀。

2026-10-12预习教材
M51

最小 Cached Decode:复用历史 K/V 而不改变输出语义

Cached decode 在每个生成步只计算新 token 的 K/V,并把它们追加到历史 cache;在相同模型和数值条件下,它应与无 cache 自回归计算保持语义等价。

2026-10-13预习教材
M52

小型推理 Benchmark:同时记录时间、内存与质量

有效的推理 benchmark 在固定模型和输入上只改变 context/output 或 precision,并把延迟、内存与输出质量作为彼此独立的观测量。

2026-10-14预习教材
M53

设备约束下的 Serving:质量—内存—速度三角

设备约束下的推理设计是在模型质量、权重与 KV 内存、首 token/生成速度及并发之间选择工作点,而不是寻找所有维度同时最优的配置。

2026-10-15预习教材
M54

第二阶段复盘:训练、适配、奖励与推理是一条系统链

模型工程第二阶段是一条连续链:预训练形成基础分布,领域适配改变部分行为,偏好/奖励重排输出倾向,推理系统决定这些行为以何种成本被提供。

2026-10-16预习教材
M55

可选探索:量化、Batch、Context 或本地后端

今天任选一个推理旋钮做最小观察,或完全用于补课与恢复;目标是把一个资源假设变成可检查问题,不是搭建服务平台。

2026-10-17预习教材
M56

休息与回顾指南:结束第二阶段,不做性能冲刺

今天没有必修、不打卡、不引入新知识;第二阶段的结束标准不是 benchmark 数字,而是允许大脑停止比较。

2026-10-18预习教材

W9

第 9 周

M57~M63 · 7
M57

行为、相关、机制与因果证据阶梯

证据强度阶梯区分“模型做了什么”“内部量与行为相关”“干预能否改变行为”和“这些证据能否支持业务解释”,防止把漂亮可视化越级称为因果机制。

2026-10-19预习教材
M58

最小 Activation 干预:从观察到 Replacement / Ablation

Activation 干预是在模型前向计算中捕获某个内部张量,再将其置零、替换或修补,比较干预前后的输出以测试一个局部因果假设。

2026-10-20预习教材
M59

推理路线对比:Single Pass、Self-consistency 与 Verifier Cascade

Test-time compute 用更多采样、搜索或验证换取回答质量;single pass、self-consistency 与 verifier cascade 是计算量、延迟和可靠性不同的三种路线。

2026-10-21预习教材
M60

证据边界案例:可视化合理,不等于干预成立

解释边界要求每个结论只达到证据允许的层级:可视化产生假设,受控干预测试机制,业务理由则必须回到可验证的输入事实与规则。

2026-10-22预习教材
M61

机制可解释性、推理与 Verifier:一页小结

机制可解释性试图用可干预、可复现的内部证据解释模型行为,而 verifier 与 test-time compute 则从输出侧增加检查和搜索;三者共同回答“模型为什么这样答,以及怎样更可靠地得到答案”。

2026-10-23预习教材
M62

可选探索:Activation 位置或 Verifier 阈值

本日用一次单变量探索体会:改变 activation 的观测/干预位置是在追问内部因果,改变 verifier 阈值是在调整外部决策边界,两者解决的是不同层次的问题。

2026-10-24预习教材
M63

休息与 W9 轻回顾指南

今天的任务是恢复注意力,不引入新知识;只有在轻松且自愿的前提下,才回顾 W9 的证据阶梯与 verifier 边界。

2026-10-25预习教材

W10

第 10 周

M64~M70 · 7
M64

多模态与文档智能处理链

文档智能把像素、版面、文字与视觉关系逐层转换为字段、证据和决策;OCR、layout parser、vision encoder、projector 与语言模型只是链上的不同组件。

2026-10-26预习教材
M65

合成文档、OCR 与字段规则的最小实现

合成文档 fixture 是带有已知字段值与位置真值的无敏感样本,用它可以把 OCR、字段规则和验证逻辑拆开学习,而不依赖真实客户数据。

2026-10-27预习教材
M66

OCR+规则、Layout-aware 与小 VLM 路线比较

文档 AI 的路线选择不是“模型越新越好”,而是在字段准确性、关系理解、证据可追溯、资源与变化速度之间选择最合适的结构。

2026-10-28预习教材
M67

文档扰动与错误传播边界

文档扰动分析通过受控改变旋转、模糊、遮挡、手写、语言或字段冲突,追踪错误怎样从像素层传播到字段、证据与业务决定。

2026-10-29预习教材
M68

多模态与文档智能:一页小结

文档智能的完整因果链是 `pixels/layout → fields/relations → evidence → decision`,系统质量取决于每层的可观测性、验证与失败处理,而非单次回答是否流畅。

2026-10-30预习教材
M69

可选探索:文档扰动或小 VLM 体验

今天只做一个小探索:增加一种受控文档扰动,或体验一次小 VLM 的结构化抽取;目标是形成一条真实观察,不是完成系统。

2026-10-31预习教材
M70

休息与 W10 轻回顾指南

今天不引入 OCR、VLM 或文档模型新知识,只通过休息巩固“像素与布局—字段与关系—证据—决定”这条主链。

2026-11-01预习教材

W11

第 11 周

M71~M77 · 7
M71

非 LLM 决策 AI:任务结构与正确切分

非 LLM 决策 AI 首先由数据结构和预测时点定义:图任务看实体关系,时间序列看时间依赖,排序看候选间相对顺序;正确切分比模型复杂度更先决定结果是否可信。

2026-11-02预习教材
M72

非 LLM 决策任务的规则与统计 Baseline

Baseline 是与部署任务和正确切分对齐的最简单可运行参照,它揭示数据本身、规则和统计信号能做到什么,也为复杂模型提供最低比较标准。

2026-11-03预习教材
M73

小神经、图或序列模型的公平比较

小模型比较的核心不是换一个更复杂的名字,而是在相同数据、切分和指标下检验结构归纳偏置是否提供了 baseline 没有的有效信号。

2026-11-04预习教材
M74

切分泄漏、分布变化与 LLM 的受限角色

正确切分测试模型面对“真正未见未来或主体”的能力,而错误随机切分常让身份、邻居与未来信息泄漏;LLM 可以辅助解释和操作,但不应无条件取代结构化决策模型。

2026-11-05预习教材
M75

规则、统计、小模型与 LLM 的选择逻辑

模型选择是一条从任务结构、数据量与切分、错误成本、可验证性和运行约束推导出的决策链,而不是按技术新旧排序。

2026-11-06预习教材
M76

可选探索:改变一个特征或切分

今天通过一次单变量特征消融或切分敏感性检查,判断结果依赖的是有效结构还是容易信息;也可以不做实验而完整休息。

2026-11-07预习教材
M77

休息与 W11 轻回顾指南

今天停止模型比较并恢复精力;可选回顾只围绕“任务结构—正确切分—baseline—模型角色”,不学习第二个非 LLM 主题。

2026-11-08预习教材

W12

第 12 周

M78~M84 · 7
M78

Financial Model Lab:场景与范围说明

Financial Model Lab 是一个受控的小型知识整合练习:只选一个场景与 A/B/C 范围,把任务、数据、错误成本、baseline 和候选方法写清,而不是扩建新产品。

2026-11-09预习教材
M79

Financial Model Lab:跑通最小核心路径

最小核心路径是从一个输入样本经过预处理、规则/模型、验证到结构化输出的完整纵切面,宁可小而闭环,也不堆积尚未连接的组件。

2026-11-10预习教材
M80

Financial Model Lab:只比较一个真正关心的问题

聚焦比较只在 M79 最小路径上增加一种方法或一个维度,用预先定义的指标回答一个问题,而不是证明某技术全面优越。

2026-11-11预习教材
M81

Financial Model Lab:误差切片与场景限制

误差切片把总体分数拆到类别、长度、语言、噪声、OOD 与成本子群,检验模型在哪些条件下可靠、何时拒答,以及结果能否支持场景动作。

2026-11-12预习教材
M82

W9~W12 阶段复盘:证据、文档、决策与 Lab

第三阶段把内部机制证据、文档感知链、非 LLM 决策结构和小型场景实验连接起来,训练的核心是“结论强度必须匹配证据强度”。

2026-11-13预习教材
M83

可选探索:补一张图、一个对照或项目小结

今天最多补一个能降低理解歧义的资产:一张图、一个小对照或一页总结;不是把 Lab 包装成完整项目。

2026-11-14预习教材
M84

休息与 W12 轻回顾指南

今天让 Financial Model Lab 停止扩张并恢复精力;不新增实验、不包装成果,只可轻看范围与证据边界。

2026-11-15预习教材

INTEGRATION

知识整合

M85~M90 · 6
M85

模型工程全景图:从数据到决定

模型工程全景图把 `data→representation→objective→optimization→behavior→inference→decision` 视为一条因果链,用来定位能力、错误和工程取舍来自哪一层。

2026-11-16预习教材
M86

W1~W4 阅读回访与最小实现重访

阅读回访不是重新通读 W1~W4,而是选择一个仍有兴趣或仍模糊的主题,用旧问题、当前理解和一个最小例子检验知识是否已经形成连接。

2026-11-17预习教材
M87

训练、适配、奖励与推理关系图

预训练建立通用预测分布,领域适配改变特定任务行为,偏好/奖励塑造输出倾向,推理策略在运行时分配资源;四者作用点不同,却共同决定最终行为。

2026-11-18预习教材
M88

新场景迁移与模型选择分析

场景迁移是把同一套任务定义、数据边界、baseline、错误成本和证据原则应用到新问题,再比较规则、传统 ML、小模型与 LLM 的合适角色。

2026-11-19预习教材
M89

从模型问题到 AI 系统工程问题树

模型工程研究数据、表示、目标、训练与推理怎样形成模型行为;AI 系统工程研究模型与检索、工具、状态、服务、监控、安全和人如何共同提供持续可靠的能力。

2026-11-20预习教材
M90

P1 轻量总结与下一阶段节奏建议

P1 轻量总结不是考试或完成证明,而是浏览 90 天资产,写下最重要的 10 个联系、3 个愿意深入的方向和适合自己的下一阶段节奏。

2026-11-21预习教材