W1
第 1 周
从运行环境到梯度更新
模型训练就是把数据变成张量,在计算图上得到损失,再用链式法则求每个参数对损失的影响,最后由优化器更新参数。
不用 autograd 手写反向传播
手写反向传播就是为计算图中每个基本运算写出局部导数,再按反向拓扑顺序传播并累加梯度。
用 PyTorch autograd 重建并检查梯度
autograd 根据张量运算动态建立计算图并执行向量—雅可比积,梯度检查则用数值扰动验证其结果是否符合预期。
从 loss 与 gradient 症状定位训练故障
训练诊断不是看到 loss 异常就猜原因,而是联合观察损失、梯度、参数更新、输入数据和实现状态,逐步排除故障。
把计算图、梯度与优化串成一张图
模型训练是一条由目标、计算图、梯度估计、优化规则与数值条件共同决定的反馈回路,任何一环失真都会改变最终行为。
可选探索——改变一个变量观察梯度
今天只选择一个小变量,观察它怎样改变前向值、梯度或更新;也可以不实验,只补清链式法则。
休息与 W1 轻回顾指南
今天没有必修、不打卡、不引入新知识,恢复本身就是课程安排。
W2
第 2 周
从概率分数到可承担的决策
模型分数只有结合真实基准率、校准程度、行动阈值与错误成本,才能转化为有意义的决策。
从零实现 Logistic Regression
Logistic Regression 用线性特征组合预测对数优势,再经 sigmoid 映射为 0 到 1 的分数,并以交叉熵学习参数。
规则、Logistic Regression 与小 MLP 的公平比较
基线比较是在相同数据切分、特征可见性和指标下,检验复杂模型是否带来值得其成本的增量价值。
基准率、阈值与错误成本的联动
同一模型在不同基准率和成本结构下可能需要完全不同的阈值,因为预测质量与行动价值不是同一个函数。
判别、校准、阈值与业务决策的一页链路
一个完整的决策链应明确区分“谁风险更高”“分数代表多少风险”“在哪里采取行动”以及“行动后果是否可接受”。
可选探索——成本、拒答或校准
今天最多选择成本矩阵、拒答覆盖率或校准方法之一,观察决策链中一个旋钮的作用。
休息与 W2 轻回顾指南
今天无必修、不打卡、不引入新知识,让概率与决策链在休息中沉淀。
W3
第 3 周
Tokenization、Embedding 与表示学习
文本模型先用 tokenizer 把字符串变成离散 token,再把 token 映射为可学习向量,使任务能在连续表示空间中计算相似与组合关系。
训练一个最小 Byte-level BPE
Byte-level BPE 从可覆盖任意文本的字节符号出发,反复合并语料中最常见的相邻对,形成更长且更高效的 token。
比较 Lexical、Frozen Embedding 与小 Encoder
不同表示路线保存的信息不同:词法方法强调表面重合,预训练 embedding 强调既有语义几何,小 encoder 则可针对任务学习可变表示。
领域文本的 Token 与表示边界
领域表示边界是通用 tokenizer 与 embedding 遇到缩写、精确标识、混合语言和分布外表达时,压缩效率与语义可靠性同时下降的区域。
Text → Token → Vector → Task 因果链
从文本到任务结果的每一步都只保留并重组部分信息,因此相似向量不能越级证明事实相同、实体相同或权限相同。
可选探索——词表、规范化或相似度
今天最多改变词表大小、文本规范化或相似度度量之一,观察表示链的一处局部取舍。
休息与 W3 轻回顾指南
今天没有必修、不打卡、不引入 Transformer 新知识,给表示学习留出沉淀时间。
W4
第 4 周
Transformer 第一性原理
Transformer 块让每个位置用注意力选择并聚合其他位置的信息,再通过残差、归一化和逐位置前馈网络持续变换表示。
从零实现 Scaled Causal Attention
Scaled causal attention 用下三角可见性约束对 QKᵀ/√d_k 做 softmax,再以所得权重聚合 V。
把 TypeScript Attention 映射到 PyTorch 张量操作
实现映射是把两种语言中不同的数据结构和循环写法还原为同一组数学张量变换,并逐层确认输入、轴与不变量。
移除 Transformer 组件会发生什么
组件消融通过移除或替换一个结构,观察模型不变量、数值尺度和学习行为怎样改变,从而建立机制而非背组件清单。
第一阶段全景——从梯度到 Transformer
第一阶段把四条基础链合并为一条:数据被表示为张量和 token,模型产生分数或表示,损失定义学习方向,梯度与优化更新参数,Transformer 则提供可扩展的序列计算结构。
可选探索——Head、位置或 Context
今天最多探索 head 数、位置表示或 context 长度之一,也可只补 W1~W4 中最模糊的一处。
休息与第一阶段轻收束
今天无必修、不打卡、不引入预训练新知识,只让第一阶段自然收束。
W5
第 5 周
语言模型目标、数据预算与 Scaling
语言模型预训练用历史 token 预测下一个 token,通过交叉熵在给定模型、数据和计算预算下学习语料分布的可压缩规律。
组装 Tiny Language Model 训练循环
Tiny LM 训练循环把 tokenizer、因果 decoder、错位标签、交叉熵和参数更新连成一条可检查的最小闭环。
小数据训练 Baseline:读懂曲线、吞吐与内存
训练 baseline 是一组可重复的最小训练配置,用来建立“数据—模型—优化器—资源—结果”的参照点,而不是追求一次跑出漂亮指标。
单变量训练实验:让曲线差异具有因果含义
单变量训练实验是在同一参照配置上只改变一个因素,用最小成本判断该因素是否可能导致可重复的训练行为变化。
W5 一页小结:从数据与目标到曲线和行为
预训练诊断是一条因果链:数据决定可见经验,目标定义学习信号,优化器改变参数,曲线记录过程,最终行为则需要独立任务证据来判断。
可选探索:重复数据、顺序与小 Checkpoint
本日用一个极小对照观察训练过程对数据重复、样本顺序或 checkpoint 的敏感性;目标是产生一个可信问题,不是完成更多训练。
休息与回顾指南:让 W5 在这里收束
今天没有必修、不打卡、不引入新知识;恢复精力本身就是课程安排。
W6
第 6 周
模型适配方法地图:Prompt、检索、探针、全参微调与 LoRA
模型适配是在“改变输入、外部知识、任务头或模型参数”之间选择最小而足够的干预,使基础模型适合特定任务。
LoRA 最小机制:冻结权重上的低秩更新
LoRA 冻结原始线性层权重 `W₀`,用两个较小矩阵的乘积 `BA` 表示可训练更新,从而以较少参数改变该层行为。
PEFT 引导练习:公平比较 Prompt、冻结模型与 Adapter
PEFT 练习的重点不是成功训练一个“大模型”,而是在同一小任务上明确 prompt-only、冻结表示和 adapter 各自增加了什么能力与成本。
领域适配诊断:为何 Loss 下降,任务却没有改善
适配 loss 只衡量模型对训练目标 token 的拟合;若目标格式、mask、数据分布或评估问题不对,loss 下降完全可能与真实任务改善无关。
W6 一页小结:低秩假设、领域质量与遗忘
LoRA 改变的是选定线性层中的低秩增量,而适配是否有用取决于基座能力、数据目标、训练过程和独立任务证据的共同作用。
可选探索:Rank、Target Module 与低秩线性代数
今天只任选一个 rank 或 target module 对照,用来理解表达容量与注入位置;也可以完全不运行,回补低秩矩阵的基本概念。
休息与回顾指南:暂停 Adapter 调参
今天没有必修、不打卡、不引入新知识,也不需要为了“找到最佳 rank”继续实验。
W7
第 7 周
后训练方法地图:SFT、奖励模型、DPO、PPO/GRPO 与 RLVR
后训练把示范、偏好或可验证反馈转成学习信号,使预训练模型的输出分布更符合目标行为,但反馈定义本身决定了模型会追逐什么。
最小奖励机制:Pairwise Loss、Group-relative Advantage 与奖励组合
偏好与强化学习把“哪个回答更好”或“这个回答得多少分”转换成可微损失或相对优势,但数值转换方式会塑造最终行为。
偏好数据小实验:Chosen / Rejected 如何改变学习信号
一条偏好样本不是“好答案与坏答案”的标签,而是在给定 prompt 和评判标准下,声明 chosen 相对 rejected 更可取。
奖励设计案例:正确性、格式、长度与 Judge 的捷径
奖励投机是策略提高可测代理分数,却没有改善甚至损害真实目标;它通常暴露的是奖励定义和评估边界,而不只是“模型不听话”。
W7 一页小结:从偏好与奖励到行为和 Verifier
后训练的完整链条不是“奖励上升”,而是 SFT 建立行为起点、偏好或 verifier 定义更新方向、独立评估判断行为是否更接近真实目标。
可选探索:TRL 小例或 DPO / GRPO 数学回看
今天可以跟随一个极小工具示例,也可以只回看一条公式;目标是确认数据到损失的映射,不是完成真实 RL 训练。
休息与回顾指南:退出奖励优化循环
今天无必修、不打卡、不引入新知识;不需要把所有后训练算法在一天内统一起来。
W8
第 8 周
自回归推理数据流:Prefill、Decode、KV Cache 与服务指标
大模型推理分为并行处理输入的 prefill 与逐 token 生成的 decode;KV cache 用内存保存历史注意力状态,避免每一步重复计算全部前缀。
最小 Cached Decode:复用历史 K/V 而不改变输出语义
Cached decode 在每个生成步只计算新 token 的 K/V,并把它们追加到历史 cache;在相同模型和数值条件下,它应与无 cache 自回归计算保持语义等价。
小型推理 Benchmark:同时记录时间、内存与质量
有效的推理 benchmark 在固定模型和输入上只改变 context/output 或 precision,并把延迟、内存与输出质量作为彼此独立的观测量。
设备约束下的 Serving:质量—内存—速度三角
设备约束下的推理设计是在模型质量、权重与 KV 内存、首 token/生成速度及并发之间选择工作点,而不是寻找所有维度同时最优的配置。
第二阶段复盘:训练、适配、奖励与推理是一条系统链
模型工程第二阶段是一条连续链:预训练形成基础分布,领域适配改变部分行为,偏好/奖励重排输出倾向,推理系统决定这些行为以何种成本被提供。
可选探索:量化、Batch、Context 或本地后端
今天任选一个推理旋钮做最小观察,或完全用于补课与恢复;目标是把一个资源假设变成可检查问题,不是搭建服务平台。
休息与回顾指南:结束第二阶段,不做性能冲刺
今天没有必修、不打卡、不引入新知识;第二阶段的结束标准不是 benchmark 数字,而是允许大脑停止比较。
W9
第 9 周
行为、相关、机制与因果证据阶梯
证据强度阶梯区分“模型做了什么”“内部量与行为相关”“干预能否改变行为”和“这些证据能否支持业务解释”,防止把漂亮可视化越级称为因果机制。
最小 Activation 干预:从观察到 Replacement / Ablation
Activation 干预是在模型前向计算中捕获某个内部张量,再将其置零、替换或修补,比较干预前后的输出以测试一个局部因果假设。
推理路线对比:Single Pass、Self-consistency 与 Verifier Cascade
Test-time compute 用更多采样、搜索或验证换取回答质量;single pass、self-consistency 与 verifier cascade 是计算量、延迟和可靠性不同的三种路线。
证据边界案例:可视化合理,不等于干预成立
解释边界要求每个结论只达到证据允许的层级:可视化产生假设,受控干预测试机制,业务理由则必须回到可验证的输入事实与规则。
机制可解释性、推理与 Verifier:一页小结
机制可解释性试图用可干预、可复现的内部证据解释模型行为,而 verifier 与 test-time compute 则从输出侧增加检查和搜索;三者共同回答“模型为什么这样答,以及怎样更可靠地得到答案”。
可选探索:Activation 位置或 Verifier 阈值
本日用一次单变量探索体会:改变 activation 的观测/干预位置是在追问内部因果,改变 verifier 阈值是在调整外部决策边界,两者解决的是不同层次的问题。
休息与 W9 轻回顾指南
今天的任务是恢复注意力,不引入新知识;只有在轻松且自愿的前提下,才回顾 W9 的证据阶梯与 verifier 边界。
W10
第 10 周
多模态与文档智能处理链
文档智能把像素、版面、文字与视觉关系逐层转换为字段、证据和决策;OCR、layout parser、vision encoder、projector 与语言模型只是链上的不同组件。
合成文档、OCR 与字段规则的最小实现
合成文档 fixture 是带有已知字段值与位置真值的无敏感样本,用它可以把 OCR、字段规则和验证逻辑拆开学习,而不依赖真实客户数据。
OCR+规则、Layout-aware 与小 VLM 路线比较
文档 AI 的路线选择不是“模型越新越好”,而是在字段准确性、关系理解、证据可追溯、资源与变化速度之间选择最合适的结构。
文档扰动与错误传播边界
文档扰动分析通过受控改变旋转、模糊、遮挡、手写、语言或字段冲突,追踪错误怎样从像素层传播到字段、证据与业务决定。
多模态与文档智能:一页小结
文档智能的完整因果链是 `pixels/layout → fields/relations → evidence → decision`,系统质量取决于每层的可观测性、验证与失败处理,而非单次回答是否流畅。
可选探索:文档扰动或小 VLM 体验
今天只做一个小探索:增加一种受控文档扰动,或体验一次小 VLM 的结构化抽取;目标是形成一条真实观察,不是完成系统。
休息与 W10 轻回顾指南
今天不引入 OCR、VLM 或文档模型新知识,只通过休息巩固“像素与布局—字段与关系—证据—决定”这条主链。
W11
第 11 周
非 LLM 决策 AI:任务结构与正确切分
非 LLM 决策 AI 首先由数据结构和预测时点定义:图任务看实体关系,时间序列看时间依赖,排序看候选间相对顺序;正确切分比模型复杂度更先决定结果是否可信。
非 LLM 决策任务的规则与统计 Baseline
Baseline 是与部署任务和正确切分对齐的最简单可运行参照,它揭示数据本身、规则和统计信号能做到什么,也为复杂模型提供最低比较标准。
小神经、图或序列模型的公平比较
小模型比较的核心不是换一个更复杂的名字,而是在相同数据、切分和指标下检验结构归纳偏置是否提供了 baseline 没有的有效信号。
切分泄漏、分布变化与 LLM 的受限角色
正确切分测试模型面对“真正未见未来或主体”的能力,而错误随机切分常让身份、邻居与未来信息泄漏;LLM 可以辅助解释和操作,但不应无条件取代结构化决策模型。
规则、统计、小模型与 LLM 的选择逻辑
模型选择是一条从任务结构、数据量与切分、错误成本、可验证性和运行约束推导出的决策链,而不是按技术新旧排序。
可选探索:改变一个特征或切分
今天通过一次单变量特征消融或切分敏感性检查,判断结果依赖的是有效结构还是容易信息;也可以不做实验而完整休息。
休息与 W11 轻回顾指南
今天停止模型比较并恢复精力;可选回顾只围绕“任务结构—正确切分—baseline—模型角色”,不学习第二个非 LLM 主题。
W12
第 12 周
Financial Model Lab:场景与范围说明
Financial Model Lab 是一个受控的小型知识整合练习:只选一个场景与 A/B/C 范围,把任务、数据、错误成本、baseline 和候选方法写清,而不是扩建新产品。
Financial Model Lab:跑通最小核心路径
最小核心路径是从一个输入样本经过预处理、规则/模型、验证到结构化输出的完整纵切面,宁可小而闭环,也不堆积尚未连接的组件。
Financial Model Lab:只比较一个真正关心的问题
聚焦比较只在 M79 最小路径上增加一种方法或一个维度,用预先定义的指标回答一个问题,而不是证明某技术全面优越。
Financial Model Lab:误差切片与场景限制
误差切片把总体分数拆到类别、长度、语言、噪声、OOD 与成本子群,检验模型在哪些条件下可靠、何时拒答,以及结果能否支持场景动作。
W9~W12 阶段复盘:证据、文档、决策与 Lab
第三阶段把内部机制证据、文档感知链、非 LLM 决策结构和小型场景实验连接起来,训练的核心是“结论强度必须匹配证据强度”。
可选探索:补一张图、一个对照或项目小结
今天最多补一个能降低理解歧义的资产:一张图、一个小对照或一页总结;不是把 Lab 包装成完整项目。
休息与 W12 轻回顾指南
今天让 Financial Model Lab 停止扩张并恢复精力;不新增实验、不包装成果,只可轻看范围与证据边界。
INTEGRATION
知识整合
模型工程全景图:从数据到决定
模型工程全景图把 `data→representation→objective→optimization→behavior→inference→decision` 视为一条因果链,用来定位能力、错误和工程取舍来自哪一层。
W1~W4 阅读回访与最小实现重访
阅读回访不是重新通读 W1~W4,而是选择一个仍有兴趣或仍模糊的主题,用旧问题、当前理解和一个最小例子检验知识是否已经形成连接。
训练、适配、奖励与推理关系图
预训练建立通用预测分布,领域适配改变特定任务行为,偏好/奖励塑造输出倾向,推理策略在运行时分配资源;四者作用点不同,却共同决定最终行为。
新场景迁移与模型选择分析
场景迁移是把同一套任务定义、数据边界、baseline、错误成本和证据原则应用到新问题,再比较规则、传统 ML、小模型与 LLM 的合适角色。
从模型问题到 AI 系统工程问题树
模型工程研究数据、表示、目标、训练与推理怎样形成模型行为;AI 系统工程研究模型与检索、工具、状态、服务、监控、安全和人如何共同提供持续可靠的能力。
P1 轻量总结与下一阶段节奏建议
P1 轻量总结不是考试或完成证明,而是浏览 90 天资产,写下最重要的 10 个联系、3 个愿意深入的方向和适合自己的下一阶段节奏。