S88:系统兴趣选修:只浅探一个主题
今日只从 feature store、distributed compute、MLflow、container orchestration、OpenTelemetry、A2A、PET 或 human factors 中选一个主题,用一张短读书卡或一个小练习理解它在全景图的位置,不安装完整平台。
内容类型:预习教材(不代表已完成)
日期:2027-02-18
阶段:P2 · AI Systems Engineering 90
总路线:Day 178
周次节奏:知识整合 · 周四兴趣选修
状态:教材已备;学习未完成
一句话定义
今日只从 feature store、distributed compute、MLflow、container orchestration、OpenTelemetry、A2A、PET 或 human factors 中选一个主题,用一张短读书卡或一个小练习理解它在全景图的位置,不安装完整平台。
学习目标
- 用“它解决什么责任、拥有什么状态、提供什么 contract”而非产品功能清单理解主题。
- 识别两个适用条件、两个非目标、一个 failure 与一个跨层接口。
- 在 60 分钟内结束,只写文档理解或真实执行过的观察,不填伪造结果。
核心知识
Feature store 主要解决 feature definition、lineage、offline/online consistency、freshness 与 serving,不是通用数据湖。Distributed compute/Ray 类主题管 task/actor、resource scheduling、fault tolerance 与 data movement,不自动解决业务幂等、版本和模型评估。Container orchestration 管 deployment、scheduling、service discovery、health/restart、config/secret 和弹性,不理解 agent task 的业务恢复。
MLflow 类工具管 experiment run、params/metrics/artifacts、model registry 与 lineage,适合连接训练/评估与发布身份;它不自动定义好 metric 或负责发布决策。OpenTelemetry 提供 traces、metrics、logs、baggage/context 与语义约定,适合跨服务 correlation;它不决定哪些 AI 内容可安全记录。
A2A 主要处理多 agent 之间的 discovery、task/message/artifact 与长任务交互,不自动提供组织权限、信任评估、工作流一致性或业务补偿。PET 选修要从 threat model 出发,区分 DP、TEE、FHE、tokenization 的保护对象、信任假设与资源成本。Human factors 关心 mental model、automation bias、cognitive load、control、feedback 和 team capacity,不能用小样本个人体验外推。
选修的价值在于定位,而非入门证书。学完应能把主题放进 S85 图的一层,画出一条输入与一条输出 contract,并说明它不能替代哪个相邻层。
机制与推导
短读书卡用八格:problem, owned state, contract, lifecycle, failure, observability, non-goals, adjacent layer。小练习则只验证一个机制,例如 OTel 的 context propagation、MLflow 的 run/artifact link、A2A 的 task/artifact 结构;未安装或运行可用 schema/sequence 设计替代,但必须标为 planned。
最小练习或观察
- 选一个主题,写选择原因与 60 分钟停止点;不选多个比较。
- 填八格读书卡,每格 1~3 句,引用官方材料中的章节位置。
- 在 S85 图标注它的层、owner 与两条 contract,不画所有内部子系统。
- 若做小练习,只用合成输入、无副作用路径,记录真实执行的事实。
- 产出一张卡或一个小练习即停,不延伸到平台安装、证书或性能调优。
常见误区与边界
- 同时选多个工具并做功能对比,失去主题机制。
- 把官方 quickstart 跑通当成已理解生产架构。
- 将 Kubernetes/Ray/MLflow/OTel/A2A 当作可相互替代的“AI 平台”。
- 选 PET 却不写 threat model,选 human factors 却把个人体验当普遍因果结论。
- 本日只是兴趣浅探,不代表掌握所选技术或具备运维能力。
系统 / 金融 / Web3 连接
金融零售可以选 MLflow 理解发布追溯,选 OTel 理解 case→agent→tool→review correlation,选 PET 理解敏感数据处理边界。Web3 可以选 A2A 思考 wallet/risk/simulation agent 间的 task/artifact,但必须另行保留签名授权和不可逆副作用。
自检问题
- 所选主题拥有的核心 state 是什么?
- 它与相邻层的两条 contract 是什么?
- 它明确不解决什么?
- 你的结论是文档理解、planned exercise 还是实际观察?
专业课程对齐
- MLflow Documentation:选 MLflow/feature lifecycle 方向时精读 tracking、artifacts、registry 与 evaluation,其他方向只作跨层参照。
- OpenTelemetry Documentation:选 observability 时精读 traces、context、metrics/logs 和 semantic conventions,其他方向只检查证据接口。
- A2A Protocol:选 multi-agent 时精读 agent card/discovery、tasks、messages、artifacts 与长任务,其他方向不必阅读。
深入学习提示
三个链接是候选路由,不是三项作业。主读与所选主题直接对应的一份,从八格读书卡中找两个尚缺答案的格子定向查找,而不从文档首页通读。
学后填写区
- 选择的主题:
- 八格读书卡:
- 在 S85 图的位置与 contract:
- 实际观察(未运行留空):
- 非目标与后续好奇: