S85:Phase 2 全景知识图:从 Data 到 Human 的十层系统关系
Phase 2 全景知识图将 data、artifact、training、serving、runtime、integration、observability、security、release 和 human 表达为相互约束的状态、证据与责任网络,而不是技术栈列表。
内容类型:预习教材(不代表已完成)
日期:2027-02-15
阶段:P2 · AI Systems Engineering 90
总路线:Day 175
周次节奏:知识整合 · 周一全景图
状态:教材已备;学习未完成
一句话定义
Phase 2 全景知识图将 data、artifact、training、serving、runtime、integration、observability、security、release 和 human 表达为相互约束的状态、证据与责任网络,而不是技术栈列表。
学习目标
- 合并 W4、W8、W12 三张阶段图,每层只保留责任、核心状态和 1~2 个跨层 contract。
- 在图上同时显示 runtime/data flow 与 evidence/decision flow,避免把决定与治理变成旁边注释。
- 区分 learned concept、repository asset、implemented path、observed result 和 production capability,不越级标注。
核心知识
Data plane 管数据来源、schema、quality、lineage、classification、purpose、freshness 与 retention。Artifact plane 将 model、dataset、prompt、index、adapter、container、policy、tool schema 变成可版本、hash、注册和回滚的对象。两者的跨层语义是 lineage:哪些 data/artifact 产生了当前运行与决定。
Training plane 管分布式计算、checkpoint、数值一致与可复现;Serving plane 管 prefill/decode、batching、cache、routing、capacity 与 latency/cost。两者不只通过 model artifact 连接,还通过 precision、tokenizer、context、runtime compatibility 与资源假设连接。
Runtime plane 管 agent/workflow state、tool calls、timeout、retry、idempotency、cancellation 与 human wait;Integration plane 管 API/event/protocol、schema evolution、identity propagation 与 enterprise boundary。MCP/A2A 等协议提供互操作原语,不自动提供业务授权、工作流恢复和数据治理。
Observability plane 用 trace/metric/log/event 连接 correlation、release、artifact、cost、quality 与 human queue;Security plane 定义 principal、delegation、purpose、policy、data boundary、tool capability 和 supply chain。可观测不应以记录敏感原文换取 debug 便利,安全也不应使故障完全不可诊断。
Release plane 将 candidate/baseline、eval、shadow、canary、decision 和 rollback 组织成证据生命周期;Human plane 管 decision rights、review tier、queue、override、appeal、trust calibration、feedback provenance 和 capacity。两者相互依赖:发布增加的 human load 必须在决定中可见,人工反馈也必须可追溯到 release 与证据。
全景图应有两种箭头:“数据/控制路径”和“证据/决定路径”。如果只有前者,系统看起来会自动流动却无人负责;如果只有后者,就无法知道决定实际作用到哪个运行状态。
机制与推导
对每层用八个问题压缩:purpose, owned state, input/output contract, version, evidence, failure, recovery, owner。跨层连接可写成 producer contract→boundary/control→consumer assumption→evidence。如果 consumer assumption 不能被 evidence 观察,就标为系统风险,例如 runtime 假定 index 新鲜却从不记 index version/expiry。
最小练习或观察
- 把三张旧图中的组件放到十层,合并重复责任,不为每个名词单独画箱。
- 每层填八问中最关键的 3~4 项,保持图可读。
- 画一条业务路径与一条证据路径,必须经过 human/release/security 中至少两层。
- 用实线/虚线标 implemented/planned,用注释标 observed/not observed。
- 写三个当前图无法回答的问题,不通过增加组件强行解决。
常见误区与边界
- 十层变成十个孤立框,没有 contract、state 和 evidence。
- 将通用 platform/security 组件画在四处,不定义单一 owner 与服务边界。
- 把仓库中存在的代码当成已部署、已观测或已掌握。
- 为了图完整而加入尚未学习的 Kubernetes/Ray 等细节。
- 全景知识图是当前理解,不是 reference architecture 或生产认证。
系统 / 金融 / Web3 连接
金融案例可追踪 document/case data→evidence artifact→runtime/tool→recommendation→review/decision→release/outcome,并标 PII purpose 和 retention。Web3 可追踪 request→chain/provider data→simulation artifact→policy/tool→preview→signature→broadcast/reconciliation,把 human signature 与不可逆状态置于中心。
自检问题
- 十层中每层唯一拥有的 state 是什么?
- runtime/data flow 与 evidence/decision flow 在哪里交汇?
- 图中哪条 consumer assumption 目前没有 evidence?
- 你是否明确区分了 code exists、implemented、observed 和 production?
专业课程对齐
- Stanford CS329S:精读 ML systems design、data、training、deployment 与 monitoring 主题,校准前八层的系统责任。
- Full Stack Deep Learning:精读 project lifecycle、infrastructure、testing、deployment 与 continual learning,用来连接组件而非继续加组件。
- NIST AIRC / AI RMF:选读 Govern/Map/Measure/Manage,检查全景图中的 owner、human、risk 与 evidence。
深入学习提示
以已有三张图为主材料,外部课程只用来修正责任边界。如果阅读产生新工具名称,先问它是否替代现有箱子、细化 contract,还是只是实现选项;只有前两者值得修图。
学后填写区
- Phase 2 全景知识图:
- 业务流 / 证据流:
- implemented / planned / observed:
- 三个无法回答的问题:
- 当前最重要的系统连接: