返回 S01~S90 教材库
S78 · 总 Day 168教材已备 ≠ 学习已完成

S78:综合学习项目范围:用户、数据、模型、工具、人工与风险边界

综合学习项目的范围说明用一页内容回答“为谁解决什么问题、使用什么数据和能力、人与系统各自决定什么、什么明确不做”,以防止学习项目膨胀为平台建设。

2027-02-08

内容类型:预习教材(不代表已完成)
日期:2027-02-08
阶段:P2 · AI Systems Engineering 90
总路线:Day 168
周次节奏:W12 · 周一概念与阅读
状态:教材已备;学习未完成

一句话定义

综合学习项目的范围说明用一页内容回答“为谁解决什么问题、使用什么数据和能力、人与系统各自决定什么、什么明确不做”,以防止学习项目膨胀为平台建设。

学习目标

  1. 从 AML Investigation Copilot、Payment Dispute、KYC、客服助手或 Web3 Wallet 风险中选一个熟悉案例。
  2. 在 A 架构理解、B 最小连接、C 兴趣扩展中选一档,并设置 time/compute/data 上限。
  3. 为 user、data、model、tool、human、risk 写 in-scope/out-of-scope、接口与成功的学习证据。

核心知识

首先写问题而非解决方案。“搭建 RAG agent”是技术方法,“调查员需在 10 份文档中定位相互矛盾的金额与日期”才是可分析的问题。用户、任务、当前流程、痛点、错误代价和不可自动的决定应先于技术选型。

范围 A 产出 problem statement、context/data-flow diagram、关键责任和 2~3 个取舍,不要求代码。范围 B 只从 data、runtime、observability、release、human 中连接 2~3 层,例如 fake document→generator→trace。范围 C 只在 B 上加一个兴趣层或第二个小案例;不可把九个 plane 全部实现当成完整性。

数据边界要写来源、许可、敏感度、用途、保留和是否可进入外部 provider。默认用合成数据或已存示例,不引入真实客户、凭据、钱包私钥或业务日志。模型/工具边界要标注 provider、网络、副作用、超时、幂等与权限。人工边界要说明 AI 只提供什么 evidence/recommendation,谁保留最终决定权。

学习成功不是 accuracy、上线或端到端自动化。可以是:能解释一条数据/状态流;能展示一个 failure 如何被发现;能说明两个取舍;能列出尚未实现的层。

机制与推导

范围可写成约束集:

scope = objective + actors + data + selected_planes + interfaces + risks + explicit_non_goals

时间预算 T 中应保留理解和记录,而不全用于实现:T = reading + design + minimal_build + observation + reflection。当新想法不直接支持核心学习问题,就进 parking lot。每添加一层,都问是否带来新的可观察连接;如果只是为了技术栈完整,就不加。

最小练习或观察

  1. 选案例和 A/B/C,定义最多一页范围、一个时间预算和一个停止日期。
  2. 写 user/job/current pain、学习问题、输入/输出、不可自动决定。
  3. 列六类边界:data、model、tool、human、external systems、risk,对每类写 in/out。
  4. 选仅 2~3 个层作最小连接,其余只在图上标责任与未来问题。
  5. 使用合成数据,不写“已运行”、“已验证”或“已安全”的虚假状态。

常见误区与边界

  • 从框架、向量库或 agent protocol 出发,找不到具体用户问题。
  • 将 A/B/C 解释为低/中/高分,被迫选 C 并扩大范围。
  • 画出九个 plane 就认为需全部实现。
  • 用真实客户文档、凭据、钱包或未经授权的日志让案例“更真实”。
  • 这是综合学习,不是产品承诺、生产 readiness 或求职作品包。

系统 / 金融 / Web3 连接

AML 案例可选“从合成文档生成带 source id 的证据摘要,并产生 trace”,不执行案件决策。Web3 Wallet 可选“从合成 transaction request 生成预览与 policy result”,不持有私钥、不请求签名、不广播。这些边界本身就是系统工程学习内容。

自检问题

  1. 你的问题说明是用户问题还是技术方案?
  2. A/B/C 范围各自的完成边界是什么?
  3. 为什么未实现 plane 只需标责任和未来问题?
  4. 你的 explicit non-goals 是否真正阻止了外部副作用和范围膨胀?

专业课程对齐

  • Stanford CS329S:精读 ML systems design、data management、deployment 与 monitoring 主题,用于识别系统边界与非模型瓶颈。
  • Full Stack Deep Learning:精读 project lifecycle、infrastructure、testing 与 deployment,映射 A/B/C 范围及学习产出。
  • NIST AIRC / AI RMF:选读 Map/Govern,检查用户、上下文、风险、roles 和 out-of-scope 是否明确。

深入学习提示

顺序为 NIST 先定上下文,CS329S 划系统边界,FSDL 选最小交付。阅读时每看到一个新组件,不是立即加入 scope,而是写它对当前学习问题提供的唯一新证据;写不出就留在 parking lot。

学后填写区

  • 案例与 A/B/C 范围:
  • 用户问题与学习问题:
  • 选定的 2~3 层:
  • 六类边界与 non-goals:
  • 时间预算与停止条件:
重点主线 · H04 · AI 开发完整工作流本周配套机制实验 · W12 · 综合连接:一条可解释的本地学习链路 →详细讲义、离线示例与源码;按需要选读,不新增必交任务。
本页是未来 P2 的预习教材。等 P1 完成并正式进入 P2 后,再填写真实理解、练习结果和不确定项;现在阅读不会改变P1 唯一进度账本