返回 M01~M90 教材库
M89 · 预习教材教材已备 ≠ 学习已完成

M89:从模型问题到 AI 系统工程问题树

模型工程研究数据、表示、目标、训练与推理怎样形成模型行为;AI 系统工程研究模型与检索、工具、状态、服务、监控、安全和人如何共同提供持续可靠的能力。

2026-11-20phase2ai-systems-engineeringproblem-treeboundaryreview-list

内容类型:预习教材(不代表已完成)
日期:2026-11-20
阶段:P1 · AI Model Engineering 90 · 知识整合
周次:整合周(M85~M90)
节奏:周五下一阶段问题树
状态:教材已备;学习未完成
标签phase2 ai-systems-engineering problem-tree boundary review-list

一句话定义

模型工程研究数据、表示、目标、训练与推理怎样形成模型行为;AI 系统工程研究模型与检索、工具、状态、服务、监控、安全和人如何共同提供持续可靠的能力。

学习目标

  1. 区分“模型本身应改进”与“系统应约束、补充或监控”的问题。
  2. 构建 Phase 2 问题树,而不是提前学习完整系统课程。
  3. 将 P1 的未解问题分为复习、系统承接和暂缓三类。
  4. 保持阶段切换轻量,不制造 gate 或考试。

核心知识

1. 模型问题

模型问题包括 tokenizer/表示缺陷、训练数据覆盖不足、objective 错配、优化不稳定、领域适配与遗忘、校准和推理质量。解决手段通常改变数据、参数、训练信号或模型级推理策略。例如领域术语持续理解错误,可能需要数据/适配;量化后特定能力退化,属于模型与推理后端交界问题。

2. 系统问题

系统问题包括知识时效、权限、检索、工具执行、工作流状态、多 agent 协作、服务扩缩、缓存、可观测性、成本、SLO、安全、审计、人工升级和反馈闭环。它们无法靠“更强模型”完全解决。例如实时账户余额必须查授权系统;模型不能凭训练记忆提供当前值。

3. 交界问题

很多问题横跨两层:上下文窗口与检索切块、模型 calibration 与系统阈值、verifier 与工作流重试、KV cache 与多租户隔离、模型拒答与产品回退。问题树应标出所有者和证据,而不是硬切成互斥分类。

4. Phase 2 的六条主枝

  1. Context/Retrieval:知识如何选择、引用、更新与授权。
  2. Tools/Workflow/State:模型怎样调用确定性能力并管理长任务。
  3. Serving/Reliability:延迟、吞吐、容量、降级、幂等和故障恢复。
  4. Observability/EvalOps:trace、指标、离线/在线评估和反馈质量。
  5. Security/Governance:提示注入、数据泄漏、权限、审计与责任。
  6. Human/Cost:人工复核、升级路径、预算和价值衡量。

机制与推导

判断问题归属可问:错误在相同输入下是否稳定复现?补充正确上下文/工具能否解决?是否涉及实时状态或权限?是否只在负载、重试、多用户下出现?是否需要跨组件 trace 才能定位?前两项更偏模型/上下文,后三项更偏系统,但最终可能需要联合修复。

问题树的根是“在约束下持续提供可信 AI 能力”。每条主枝下面只写问题,不急着写产品或技术答案。例如不是“上向量数据库”,而是“怎样在权限和时效约束下检索足够证据,并知道何时证据不足”。

最小练习或观察步骤

  1. 从 P1 笔记提取最多 12 个未解问题。
  2. 标为 M(模型)、S(系统)或 B(边界)。
  3. 按六条主枝组织 S/B 问题。
  4. 为每条写可观察信号与最小失败例,不设计完整方案。
  5. 将纯模型基础问题放 P1 复习清单;兴趣远期问题放暂缓。
  6. 选出 Phase 2 第一周最自然的三个问题,但不提前执行。

常见误区

  • 把系统问题全部归结为 prompt engineering。
  • 把实时知识缺失当成模型参数不足。
  • 问题树直接堆产品名和组件名。
  • 在 P1 结束前扩建 P2 系统。
  • 将所有未掌握内容都列为阻塞。
  • 用 gate、评分或复杂验收制造阶段压力。

金融、Web3 与文档场景连接

金融系统必须处理权限、数据驻留、审计与人工责任;Web3 工具需要链状态时效、签名安全和恶意输入隔离;文档系统需要证据回链、敏感字段最小化与版本管理。这些主要是系统问题,但底层模型的校准、抽取和表示能力仍提供输入,两层需要共同契约。

自检问题

  1. 模型问题与系统问题的分界依据是什么?
  2. 哪些问题属于交界,为什么?
  3. Phase 2 六条主枝各回答什么?
  4. 为什么问题树不应直接写组件答案?
  5. 哪些 P1 问题应复习,哪些交给 P2,哪些暂缓?

专业课程对齐

  • Stanford CS329S:回看生产 ML 的数据、部署、监控、持续更新与组织接口,用于识别哪些问题已经超出单模型边界。
  • Full Stack Deep Learning:回看端到端 AI 系统架构、数据管线和服务生命周期,用于把 Phase 2 主枝连接成问题树而非工具清单。
  • Stanford CS336:回看训练与推理的模型侧实现约束,为系统层的吞吐、显存、批处理、缓存和模型版本问题提供底层锚点。

深入学习提示

先浏览 CS329S 与 FSDL 的课程目录,把 P1 中“模型本身可解决”的问题和“需要系统协同”的问题分栏;遇到训练/推理资源问题时,再回查 CS336 对应模块。问题树至少包含数据与知识、服务与编排、评估与观测、可靠性与安全、成本性能、反馈更新六枝;每枝用“症状 → 可能层级 → 可观测信号 → 候选干预”展开。例如答案过时可能来自知识源、索引、缓存或模型知识,不能默认归因于参数;延迟过高可能来自序列长度、batching、检索、工具调用或队列。再标出 P1 能提供的接口:模型版本、输入输出契约、离线指标、切片和资源画像。该页只是 Phase 2 的学习导航和课程回看桥梁,不预学完整系统,也不把候选干预写成已验证方案。

学后填写区

  • Phase 2 问题树位置:
  • M / S / B 分类:
  • 六条主枝中的核心问题:
  • P1 复习与暂缓清单:
  • Phase 2 第一周候选问题(不提前执行):
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。