S01~S90 教材库
AI Deep Mastery 总路线 Day 091~180
每个正式学习日都包含系统机制、状态或容量推导、最小实现、失败边界、场景连接、自检与专业课程对齐。周日只提供轻量恢复;教材可以提前阅读,但 P2 尚未启动。
W1
第 1 周
本地环境确认与 AI 数据流全景
AI 数据平面是数据从业务来源进入系统,经过原始留存、验证、变换、特征或评测构造,最终支持模型训练与线上决策的可追踪流动路径。
JSONL 数据管线、Schema 验证与可重复变换
Schema 验证是在数据进入下一状态前,用显式契约检查其结构与语义前提;可重复变换则保证同一输入版本和同一规则产生可解释的一致输出。
合成事件、来源标识与字段级 Lineage
数据 lineage 是一条记录或数据集从何而来、经过哪些版本化变换、生成了什么输出的可追踪关系;合成事件提供了不触碰真实敏感数据的学习载体。
迟到、乱序、重复、缺失与 Schema Drift
数据时序与结构异常不是单纯的“脏数据”,而是会改变窗口聚合、标签、特征与决策含义的系统状态,需要显式定义处理语义。
Event Time、Point-in-Time、Lineage、Freshness 与 Skew
数据平面正确性来自时间语义、来源追踪、数据新鲜度与训练/服务一致性的共同约束,任何单一指标都不能独立保证决策可靠。
Batch Rebuild 与 Event Replay 的边界
Batch rebuild 从一组版本化快照重新计算目标数据,event replay 则按事件日志重演状态变化;两者都能重建,但依赖、顺序和副作用语义不同。
W1 休息与轻量恢复
S07:W1 休息与轻量恢复
W2
第 2 周
Experiment、Artifact、Registry、Bundle 与 Promotion
实验记录一次探索过程,artifact 是过程产生的可寻址产物,registry 管理产物身份与生命周期,release bundle 则把一次 AI 系统发布所需的多个版本组合成不可含糊的候选版本。
Artifact Hash 与最小 Bundle Manifest
Artifact hash 为具体字节内容提供稳定指纹,bundle manifest 则用显式字段把多个产物及其关系组成一个可校验、可追踪的系统候选版本。
Registry 与 Audit Trail 的版本生命周期
Registry 保存当前可解析的版本与状态,audit trail 保存状态为何、由谁、在何时改变;二者结合才能同时回答“现在是什么”和“怎样走到这里”。
模型未变,AI 系统版本为什么仍会改变
AI 系统行为由模型与上下文、检索、工具、策略、路由及运行配置共同决定,因此任何高影响组件变化都应形成新的组合版本和可比较发布证据。
Reproducibility、Lineage、AI BOM、Promotion 与 Rollback
可复现性保证过程有足够上下文可重建,lineage 连接输入与输出,AI BOM 列明组成与来源,promotion/rollback 则管理某个明确 bundle 在运行生命周期中的采用状态。
Artifact 缺失、Hash 不一致与恢复思路
Artifact 完整性处理是在 bundle 被采用前识别缺失、内容不符、依赖不可达或元数据不一致,并选择阻止、降级或恢复,而不是运行到中途才产生含糊结果。
W2 休息与版本概念沉淀
S14:W2 休息与版本概念沉淀
W3
第 3 周
训练内存、Collective 与并行轴全景
分布式训练通过在设备间切分样本、参数、层、张量、专家或上下文来突破单设备容量与时间限制,同时引入通信、同步、负载不均和恢复成本。
训练 Memory Calculator:从参数到账本
训练内存计算器是一份显式假设驱动的容量账本,用于估算不同精度、优化器、并行分片和 batch/context 配置的内存构成,而不是承诺真实峰值。
双进程 CPU/Gloo 与 Collective 观察
Collective 是一组 rank 必须以兼容顺序共同参与的数据交换操作;两进程 CPU/Gloo 能观察其同步与故障语义,但不代表 GPU 集群性能。
DP、FSDP、TP、PP 的场景选择矩阵
并行策略选择是在模型能否放下、计算强度、通信拓扑、batch/context、故障恢复和实现复杂度之间寻找可接受组合,而非寻找普遍最优算法。
Memory、Communication、Throughput、Checkpoint 与恢复
训练系统效率与可恢复性由内存放置、通信等待、有效吞吐和 checkpoint 策略共同决定,单独优化某一项可能把瓶颈移到另一层。
Batch 与 Checkpoint 配置的可选观察
Batch 与 checkpoint 配置共同决定设备峰值、通信频率、重算量和有效吞吐;可选探索的目标是解释一个变化,而不是寻找全局最优参数。
W3 休息与训练系统恢复
S21:W3 休息与训练系统恢复
W4
第 4 周
Serving 请求生命周期与核心指标
LLM serving 把持续到达、长度不同的请求经过准入、排队、prefill、逐 token decode 与输出传输转化为响应,其用户体验由各阶段时延与共享资源调度共同决定。
FIFO 离散事件 Queue Simulator
FIFO 离散事件模拟器用请求到达时间与服务时间推进虚拟时钟,显式计算开始、完成和等待,从最小模型观察排队如何放大延迟。
FIFO、Priority 与 Fair-Share 的策略比较
调度策略决定有限 serving 容量先服务谁、等待多久以及谁可能被饿死;低平均延迟、公平、优先级与吞吐通常不能同时最大化。
Burst、长上下文、Cache、Batch 与 Worker Loss
Serving 容量不是一个固定 QPS,而是模型、请求长度分布、cache、batch、worker 数与延迟目标共同定义的可持续服务区域;超出后必须排队、降级或拒绝。
W1~W4 第一阶段系统全景连接
第一阶段全景图把数据事实、版本化 artifact、训练资源与在线请求连接成一条可追溯系统链,用于发现层间假设,而不是对四周内容评分。
Backpressure 的可选最小扩展
Backpressure 是下游在容量不足时把“减速、等待或停止接收”的信号传回上游,防止无界队列把暂时过载扩大为内存、超时与重试级联。
W4 休息与第一次阶段减压
S28:W4 休息与第一次阶段减压
W5
第 5 周
AI Platform 分层、Service Catalog 与 Golden Path
AI 平台把反复出现的数据、模型、运行、安全、评测和观测能力产品化为可发现、可组合的共享服务,并通过 golden path 降低团队认知负担而不隐藏关键边界。
最小 AI Use-Case Manifest
Use-case manifest 是应用团队向 AI 平台提交的最小声明,明确用例身份、所有者、数据用途、模型和工具依赖、运行边界及 SLO 意图,使平台能够解析而不是猜测。
从 Registry、Policy 与 TCO 看 AI 平台组件关系
AI 平台不是一组彼此孤立的工具,而是用 registry 描述“有什么”、用 policy 决定“允许怎样使用”、再用成本模型解释“使用代价”的控制关系网络。
Golden Path:标准化、灵活性与平台锁定
Golden path 是平台为常见用例提供的受支持默认路径:它减少重复选择与隐性风险,但必须保留明确的适用边界和可治理的逃生通道。
平台边界如何影响 DevEx、质量与安全
平台边界决定哪些复杂度由平台吸收、哪些决策仍由用例团队承担;好的边界同时降低认知负担并保留业务责任,而不是把责任藏进自动化。
为 Use-case Manifest 增加轻量 Validator
Manifest validator 用机器可读的轻量规则检查声明是否完整且内部一致,让平台尽早给出可解释反馈,但它不能证明用例安全、有效或适合上线。
休息与恢复:暂时离开平台抽象
今天无必修、不引入新知识,也不需要用一份“完整平台蓝图”证明本周学习有效。
W6
第 6 周
Agent、Workflow 与业务事务的状态边界
耐久 Agent runtime 把不确定的模型推理嵌入显式状态机,使长时间任务能够暂停、恢复、审批和对账,而不会把一次模型循环误当成完整业务事务。
Checkpoint 与 Idempotency Key 的最小实现
Checkpoint 保存“任务已确定到哪里”,idempotency key 标识“这次业务意图是否已执行过”;两者配合才能在崩溃和重复投递后安全恢复。
Pause / Resume:Checkpoint、Session 与 HITL 的连接
Pause / resume 不是暂停一个进程,而是把可恢复状态、待决策事项和恢复条件持久化,使人工或外部事件稍后能够安全推动同一业务流程。
重复消息、Partial Success、Timeout 与人工审批
分布式业务流程最危险的不是显式失败,而是“部分已发生、部分未知”;runtime 必须把重复、超时和人工决定建模为可追踪状态。
重放、幂等、对账、补偿与审计的恢复路径
可靠恢复不是一个 retry 开关,而是用重放重建进度、用幂等控制重复、用对账确认外部事实、用补偿处理已知副作用,并用审计串起原因与责任。
Crash / Resume 与 Exactly-once 的边界
所谓 exactly-once 往往只在特定日志或事务边界内成立;跨外部系统的业务效果通常依靠至少一次投递、幂等、去重和对账实现“有效一次”。
休息与恢复:让状态机停止运行
今天无必修、不引入新知识;真正的暂停不需要为下一次恢复提前完成更多任务。
W7
第 7 周
Agent、Tool、Core System、Event 与 Human Queue 的边界
企业 Agent 集成的核心不是连接更多协议,而是为发现、调用、业务事实、异步协作和人工决策划清边界,并保留跨边界的身份与因果证据。
设计 v1 / v2 Tool Contract 与 Event Envelope
版本化契约把输入、输出、错误、副作用与演进规则写成双方可检查的约定,使 Agent 和企业系统可以独立升级而不靠提示词猜测。
MCP Discovery、Call、Scope 与 Audience
MCP 让客户端发现并调用服务器暴露的能力,但发现可见、令牌有效、scope 匹配和业务动作获准是四个不同判断。
同步 API、异步 Event、Schema 变化与 DLQ
同步与异步不是快慢二选一,而是不同的时间耦合和责任模型;schema、重复投递与 DLQ 决定异步系统能否被长期运维。
连接 Protocol、Business Semantics、Identity、Version 与 Recovery
可维护的企业集成必须让“怎样传、传什么、代表谁、按哪个版本、失败后怎么办”同时可见;只完成协议握手并不等于完成系统设计。
做一次兼容协议变更
兼容变更不是“schema 工具没有报错”,而是在生产者、消费者和积压消息并存时,通过 expand-and-contract 让语义有序迁移。
休息与恢复:不再增加协议层
今天无必修、不引入新知识,也不增加新协议;不需要同时记住 MCP、A2A、OpenAPI、AsyncAPI 与 CloudEvents 的全部细节。
W8
第 8 周
AI Telemetry、Correlation、SLO 与 Unit Cost
AI 可观测性用关联的 trace、metric、log、eval、audit 与业务结果解释一次任务为何慢、贵、错误或需要人工介入;SLO 则把用户可感知目标变成有边界的运行承诺。
用 JSONL 建立最小 Correlated Telemetry
最小 telemetry 不需要先部署观测平台:一组结构稳定、可关联、可脱敏的 JSONL 事件已经足以学习事件模型、因果链和聚合边界。
OTel-like 属性、p50/p95 与 Cost per Success
标准化属性让跨组件信号可以比较,分位数暴露延迟分布,cost per success 则把资源消耗与有效业务结果对齐,而不是只统计 token 单价。
慢、贵、答错、工具错误与人工 Backlog 的信号差异
AI incident 诊断要先区分用户症状与系统原因:慢、贵、错误答案、工具失败和人工积压可能互为因果,却需要不同信号与处理动作。
W5~W8 阶段复盘:从平台到运行证据
第二次阶段复盘把平台声明、耐久状态、协议交互和运行证据连成一条可解释链,目标是看见联系与薄弱处,而不是给学习打分。
为 Dashboard 增加一个真正有问题意识的指标
好指标从一个可行动问题出发,明确事件、分子、分母、窗口、slice 与 owner;把更多数字放到 dashboard 并不会自动增加理解。
休息与恢复:让指标停止刷新
今天无必修、不引入新知识,也不增加新指标;可观测性服务于理解,不应让学习者变成全天候监控对象。
W9
第 9 周
Trust Boundary、Least Privilege、Purpose 与 Retention
AI 系统安全从识别资产与信任边界开始,再用最小权限、目的限制和保留策略约束主体在特定时间内对特定数据与工具能做什么。
Artifact Provenance 与 Egress / Purpose Policy
Provenance 解释 artifact 从哪里来、怎样构建和由谁批准,egress/purpose policy 则约束运行时哪些数据为了什么原因可以流向哪个外部目的地。
Auth、Policy Engine 与 Audit Trail 的决策流
安全决策流把凭证验证、策略求值、业务审批和审计记录分成独立步骤,使 allow、deny 与 escalate 都能追溯到主体、资源、目的、上下文和策略版本。
Prompt Injection、Confused Deputy、Artifact Tamper、PII Egress 与 Retention
AI 威胁分析要把攻击路径映射到跨层控制与残余风险:模型输入净化不能替代工具权限,artifact hash 不能替代来源信任,访问控制也不能替代数据最小化和删除。
安全分层图:连接 Identity、Data Lifecycle、AI BOM、Tool Security 与 Privacy
AI 系统安全不是在模型外面加一个过滤器,而是让身份、数据生命周期、软件与模型供应链、工具调用和隐私技术在同一组 trust boundary 上形成可追溯的分层控制。
安全可选探索:无真实数据的攻击模拟与 PET 边界
今日只选“合成攻击案例”或“一种隐私增强技术的适用边界”之一,目标是把一个安全假设变成可观察问题,而不是攻击真实系统或宣称技术已解决隐私。
休息与回顾指南:让 W9 安全与隐私知识沉淀
今天没有必修、不引入新知识、不运行攻防实验;恢复精力本身就是 P2 的正式安排。
W10
第 10 周
EvalOps 发布生命周期:Offline→Shadow→Canary→Release / Rollback
AI release lifecycle 是将 model、prompt、retrieval、tool、policy 和 runtime 的组合变更,通过逐步扩大真实度与暴露面的证据链,从离线候选变成可控发布或可恢复回滚。
最小 Release Record:记录 Candidate、Baseline、Metrics 与 Decision
Release record 是一份不可混淆“发布了什么、与什么比、看到什么、谁在什么假设下做了什么决定”的小型可追溯记录。
读懂 Eval / A-B 比较:从脚本输出回到版本证据
Eval / A-B 比较的核心不是得到一个胜者标签,而是确认 baseline 与 candidate 在同一可解释协议下经历了什么数据、scorer、运行环境与决策规则。
多指标发布取舍:质量提升、延迟成本、Judge Drift 与 Rollback
多指标发布决策是在质量、安全、延迟、成本、覆盖率、人工容量与证据可靠性之间找可解释工作点,而不是将所有量压成一个可被优化的分数。
W10 发布决策小结:Eval、Risk Tier、Evidence、Shadow、Canary 与 Rollback
W10 的主线是将“一个版本分数更高”改写为“一个风险分层的系统变更,在逐步暴露中累积了哪些证据,由谁依何种取舍决定扩大、暂停或回滚”。
可选 Champion / Challenger 探索:小范围比较与发布科学
Champion/challenger 是让当前可用基线与一个变更明确的挑战者,在同一协议下累积可比较证据,而不是为新版本寻找一个必胜分数。
休息与回顾指南:暂停发布比较
今天没有必修、不引入新的 release framework、不运行评估或调阈值;让比较与决策思维暂停。
W11
第 11 周
人机职责图:Decision Rights、Review Tier、Queue、Override、Appeal 与 Automation Bias
Human-AI operations 是将“人在环中”具体化为谁建议、谁决定、何时必须复核、工单如何排队、决定如何被 override/appeal,以及人类容量与认知偏差怎样成为系统约束。
最小 Reviewer Queue:状态、租约、Override 与 Appeal
Reviewer queue 是将人工复核从一个界面按钮变成可排队、可领取、可超时、可追溯、可升级和可申诉的状态机。
Evidence-first 与 Recommendation-first Review:交互顺序如何改变风险
Evidence-first 与 recommendation-first 的差异不是界面排版偏好,而是用户在形成初始判断前先看到证据还是 AI 结论,从而影响 anchoring、automation bias、复核时间与错误发现。
人机运营案例:Backlog、Fatigue、冲突证据、Active Learning 与 Code-agent Review
人机运营失效往往不是某一个模型答错,而是工单流入超过人类容量、证据编排放大偏差、反馈被错误采样,最终让系统在 backlog 和 fatigue 中逐步退化。
W11 小结:Human Capacity、Trust Calibration、Feedback Provenance、DORA 与 DevEx
W11 的结论是:人不是 AI 流程末端的无限 fallback,而是有决定权、信息需求、认知偏差、容量与反馈质量的系统组件,DevEx 与风险控制必须共同优化。
可选 AI-assisted SDLC 探索:调整 Queue Capacity 或研究一条代码 Agent 路径
今日只选一项:对 toy reviewer queue 改一个容量参数,或将 AI-assisted SDLC 从 issue→plan→change→review→verify→deploy 画成证据链,不要测量真实员工或搭建全套平台。
休息与回顾指南:让人机运营暂时离开队列
今天没有必修、不引入新的人因或生产力研究、不调整 queue;学习人类容量的课程本身也要尊重学习者容量。
W12
第 12 周
综合学习项目范围:用户、数据、模型、工具、人工与风险边界
综合学习项目的范围说明用一页内容回答“为谁解决什么问题、使用什么数据和能力、人与系统各自决定什么、什么明确不做”,以防止学习项目膨胀为平台建设。
最小跨层连接:Data→Runtime、Runtime→Trace 或 Eval→Release Record
最小跨层路径不是让两个模块“能调用”,而是用一个明确 contract、correlation id、失败语义和可观测证据,说明数据或状态如何穿过 2~3 层。
组件复用图:Generator、Registry、Runtime、MCP、Trace 与 HITL
复用不是把旧文件引入新项目,而是确认旧组件的 contract、state、failure、security 和 evidence 语义与新案例一致,并显式记录哪些部分可原样使用、需 adapter 或不应复用。
系统失败场景:Timeout、重复消息、数据过期、权限与人工 Backlog
系统工程的失败分析不是为每个异常加 retry,而是分清“状态未知、副作用重复、输入已失效、行动未授权、人工容量不足”的不同处理与证据。
W9~W12 阶段复盘:Security、Release、Human 与最小系统连接
W9~W12 复盘要将安全边界、发布证据、人机决定与跨层失败放回同一张系统图,找出前三张阶段图新增的连接和仍模糊的责任,而不是做闭卷考核。
可选综合项目收束:示意图、小功能或一页案例
今日只在示意图、一个小功能、一页案例总结或直接休息中选一项,目标是使已学连接更容易解释,不封存、不压力演练、不追求项目完整度。
休息与回顾指南:结束 W12,不做封存或压力演练
今天没有必修、不引入新组件、不补综合项目;W12 的结束不需封存、演示、压力测试或“生产就绪”标签。
INTEGRATION
知识整合
Phase 2 全景知识图:从 Data 到 Human 的十层系统关系
Phase 2 全景知识图将 data、artifact、training、serving、runtime、integration、observability、security、release 和 human 表达为相互约束的状态、证据与责任网络,而不是技术栈列表。
两张解释性架构图:Context / Container 与 Data / State / Sequence
解释性架构图用一个明确问题决定视角、粒度和省略内容:一张图解释 actor/boundary 或 responsibility,另一张解释 data/state 如何在时间中流动,而不是用一张大图包含所有细节。
系统方法迁移:Voice Agent、Web3 Wallet、AI 客服或 Embodied Operations
系统方法迁移是保留 boundary、state、version、evidence、owner、failure、recovery 等通用思考,同时重新定义新场景的时间尺度、物理/金融副作用、人类控制和可恢复性,而不是复制同一套架构。
系统兴趣选修:只浅探一个主题
今日只从 feature store、distributed compute、MLflow、container orchestration、OpenTelemetry、A2A、PET 或 human factors 中选一个主题,用一张短读书卡或一个小练习理解它在全景图的位置,不安装完整平台。
Phase 3 问题树:区分系统工程问题与 AGI / 认知 / 智能本质问题
Phase 3 问题树把当前的困惑分成可通过架构、数据、实验、运行与治理回答的系统工程问题,以及需理论、认知科学、机制、学习与智能观研究的 AGI 基础问题,防止用工程术语伪回答本质问题。
Phase 2 轻量总结:10 个连接、3 个方向与下一阶段节奏
S90 只用一页内容记下自己真正能解释的 10 个系统连接、3 个仍想深入的方向和 Phase 3 的轻量节奏,不做量化考核、不闭卷、不伪造 90 天已掌握的结论。