AISA 深度学习实验室:8 周学习总纲
AML Copilot 是贯穿八周的实验标本,现有代码是实验仪器。只有在验证学习假设时才修改代码;不要求公开部署,也不以展示效果判断是否掌握。
AISA 深度学习实验室:金融零售 × Web3(8 周)
周期:2026-08-24 ~ 2026-10-18
状态:当前学习主线
实验标本:AML 调查 Copilot
目标:理解原理、建立模型、亲手实验、分析失败、形成长期记忆
非目标:求职、投递、简历、职位匹配、个人品牌、作品集包装或 offer 转化
1. 核心学习问题
如何在高风险金融与链上场景中,设计一个可理解、可验证、可控制、可演进的 AI 系统?
AML Copilot 是贯穿八周的实验标本,现有代码是实验仪器。只有在验证学习假设时才修改代码;不要求公开部署,也不以展示效果判断是否掌握。
学习循环统一为:
问题 → 闭卷前测 → 原理学习 → 建模/实验 → 反例与失败 → 纠错 → 间隔复习 → 跨域迁移
当前项目已有大量笔记,下一阶段不再追求覆盖更多主题,而是缩短“写过、看过”和“能解释、能实现、能证伪”之间的距离。
2. 周度验收模型
每周五个维度各评 0~2 分:
| 维度 | 0 分 | 1 分 | 2 分 |
|---|---|---|---|
| 理解 | 只能复述术语 | 能说明基本机制 | 能推导边界、反例和取舍 |
| 建模 | 无结构化模型 | 有图或表 | 角色、数据、状态与约束一致 |
| 实验 | 没有动手 | 完成最小实验 | 有基线、变量控制和失败分析 |
| 回忆 | 依赖原文 | 能回答基本问题 | 延迟回忆后仍能解释和重建 |
| 迁移 | 只会原案例 | 能做近似类比 | 能处理陌生金融/Web3 场景 |
每周总分达到 8/10 且任何维度不为 0,才进入下一周。未过关时延长学习,不为赶日期跳过。
3. 八周学习主线
Week 1(08-24 ~ 08-30):AI 系统认知与边界
核心问题
- 模型、工作流、数据和控制分别解决什么问题?
- rule engine、workflow、RAG、copilot、agent 的边界是什么?
- 当前三个 AI 页面真实实现了什么,哪些是教学模拟?
理论学习
- deterministic / statistical / generative 系统。
- LLM、structured output、tool calling、agent loop 与 human decision。
- C4、数据流、决策流、状态机和质量属性。
- runtime、依赖、lockfile、数据版本与随机性对实验的影响。
实验 / 建模
- 从代码反向重建 AML Copilot、Agent Arch Lab、Agent Platform 的系统边界。
- 把 12 个代表性任务分类为规则、检索、模型、LLM 或人工决策。
- 建一张 rule/workflow/RAG/copilot/agent 对比表,并为每类写一个反例。
- 固定本地 test/typecheck/build 基线,记录环境失败及其原因。
笔记产出
- 《AI 系统不是模型:当前项目系统边界图》。
- 10 张概念卡与一份初始误区清单。
Gate U1
- 闭卷重画 AML Copilot 系统图。
- 正确分类至少 10/12 个任务,并说明 3 个 no-AI 场景。
- 10 道自测题正确率达到 80%。
Week 2(08-31 ~ 09-06):AML 领域与决策建模
核心问题
- AML 判断依据来自哪里?
- observation、inference、recommendation、decision 如何分离?
- 链上地址、钱包与真实客户身份是什么关系?
理论学习
- KYC → transaction monitoring → alert → case → SAR → review/audit。
- structuring、layering、money mule 与正常业务边界。
- BPMN、DMN、DDD bounded context、event storming 和统一语言。
- EVM account、跨链路径、地址聚类与链上证据局限。
实验 / 建模
- 画 AML AS-IS/TO-BE BPMN 和异常路径矩阵。
- 建 DMN 决策表,明确事实、推断、建议和最终决策的 owner。
- 划分 KYC、监控、调查、报告、链上分析五个 bounded context。
- 用一个链上资金流案例完成 alert → case → evidence → review 映射。
笔记产出
- 《AML × 链上资金流领域模型》。
- 术语表、决策表和证据分类表。
Gate U2
- 对陌生案例区分 observation/inference/decision。
- 能指出所需证据、人工权限和审计字段。
- BPMN、DMN 与领域模型的命名一致。
Week 3(09-07 ~ 09-13):AI 方案模式与复杂度边界
核心问题
- 什么时候用 workflow、RAG、copilot 或 tool agent?
- 更复杂的方案何时只会增加失败面?
- 自治等级和 HITL 应如何设计?
理论学习
- source-bound generation、tool use、memory、context 和 fallback。
- autonomy level、approval、abstention、stop rule。
- DDD application service、state machine 与 agent loop 的关系。
实验 / 建模
- 用同一调查任务比较规则模板、检索模板、RAG Copilot、受限 Agent。
- 为四种模式记录质量、可解释性、延迟、控制成本和失效方式。
- 设计三种 no-AI / workflow-only 场景。
- 写 ADR:选择最小充分方案,而不是默认使用 agent。
笔记产出
- 《四种 AI 模式比较实验》。
- 一份 autonomy/HITL 状态图和 ADR。
Gate U3
- 为三个新场景选择最小充分方案。
- 能解释为什么拒绝更复杂的方案。
- 能说明 memory、context、state 和 audit log 的区别。
Week 4(09-14 ~ 09-20):数据、RAG 与知识边界
核心问题
- 检索结果为何会相关但不可信,或者根本不该被当前用户看见?
- BM25、embedding、hybrid、rerank 分别解决什么问题?
- 权限与 freshness 为什么必须进入检索链路?
理论学习
- data contract、lineage、label provenance、PII 与 freshness。
- sparse/dense retrieval、cosine similarity、RRF、reranking。
- chunking、metadata、Recall@K、MRR、nDCG、citation validity。
- ACL pre-filter 与 post-filter 的风险差异。
实验 / 建模
- 用现有 RAG 模块做 BM25、dense、hybrid、rerank 小规模对照。
- 设计 relevance、permission、freshness 三组 query。
- 加入 AML 类型学、链上地址风险和跨链异常语料。
- 从 ingestion/query/auth/generation 四层记录失败原因。
笔记产出
- 《RAG 失效地图》。
- Data Readiness 学习版与检索实验日志。
Gate U4
- 能从零解释 RRF 和至少两个检索指标。
- 能诊断五类检索失败,并说明何时不需要向量检索。
- 能解释为什么授权应在检索前生效。
Week 5(09-21 ~ 09-27):Eval 科学与不确定性
核心问题
- 怎样知道系统真的更好,而不是只得到好看的平均分?
- 人工标签、规则 grader 与 LLM judge 各有什么偏差?
- 高风险错误为什么不能被总体 accuracy 掩盖?
理论学习
- base rate、confusion matrix、precision、recall、FPR/FNR、PPV。
- calibration、abstention、Cohen's κ、bootstrap CI、slice analysis。
- 数据泄漏、标签分歧、rubric 先验和 judge bias。
实验 / 建模
- 手算 confusion matrix 与 κ,再和代码结果对照。
- 人工标注 20~30 个现有案例,补正常业务、证据冲突和 Web3 hard cases。
- 改变阈值,观察漏报、误报、人工复核量的变化。
- 比较规则、人工与自动 grader 的分歧。
笔记产出
- 《AML Eval Protocol》。
- Error Atlas 与指标选择说明。
Gate U5
- 能手算关键指标与 κ。
- 能解释高 accuracy 为何可能没有意义。
- 能为陌生需求设计 grader、threshold 和 slice。
Week 6(09-28 ~ 10-04):运行时、可靠性与可观测性
核心问题
- AI 系统如何失败,失败怎样传播到业务结果?
- retry、timeout、fallback、circuit breaker 与 stop 应如何配合?
- 失败、慢、贵和答错分别如何观测?
理论学习
- idempotency、checkpoint、retry budget、circuit breaker、fail-open/closed。
- SLI/SLO、error budget、p50/p95/p99。
- trace/span/event/metric/log 与 cost-per-task。
实验 / 建模
- 注入 tool failure、timeout、invalid citation、context pollution。
- 画 failure propagation tree 和 trace map。
- 比较 retry、fallback、stop 对质量、延迟和成本的影响。
- 做一次本地 game day,保留意外结果。
笔记产出
- 《从模型错误到业务影响》。
- 三个可靠性 ADR 与 game-day 学习记录。
Gate U6
- 对陌生故障选择 retry/fallback/stop 并解释取舍。
- 闭卷追踪依赖故障到用户、审计和业务影响。
- 能说明 tail latency 与平均延迟的差别。
Week 7(10-05 ~ 10-11):安全、MCP 与治理
核心问题
- 谁能让 agent 做什么,出了问题谁负责?
- prompt injection 为什么不能只靠提示词解决?
- identity、authentication、authorization、policy 和 approval 如何分层?
理论学习
- threat modeling、trust boundary、least privilege、confused deputy。
- prompt/tool/data supply-chain attack 与 data exfiltration。
- MCP 的 discover/list/call、schema、transport 与授权边界。
- PII minimization、retention、HITL、RACI 和 auditability。
实验 / 建模
- 建威胁模型和 20 个 red-team case。
- 比较 scope、deny-by-default、approval、output validation 的单独与组合效果。
- 运行本地 MCP 最小 server/client,测试非法 schema、无权限和重放。
- 对比 AML reviewer 权限与 Web3 wallet/tool approval。
笔记产出
- Threat-Control-Residual Risk 矩阵。
- MCP 序列图与桌面事故复盘。
Gate U7
- 对未知攻击给出资产、边界、路径、控制、恢复和 owner。
- 能解释 confused deputy 的完整链路。
- 能说明每项缓解措施没有解决什么。
Week 8(10-12 ~ 10-18):综合迁移与长期记忆
核心问题
- 这套理解能否迁移到 AML 以外?
- 哪些实验改变了最初判断?
- 哪些知识已经掌握,哪些仍只是熟悉?
理论学习
- ATAM、架构 trade-off、演进式设计与跨域类比。
- retrieval practice、interleaving、elaboration、Feynman technique。
- 事实、推断、假设、模拟结果和真实结果的认识论边界。
综合实验
- 闭卷处理一个陌生场景:支付争议、APP scam 或链上钱包风险。
- 在 90 分钟内完成流程、决策、C4、数据、eval、安全和 SLO。
- 与 AML 方案对照,找出可迁移模式和不可迁移约束。
- 选择三个最难主题做 15 分钟 teach-back。
- 建知识图谱,把概念连接到实验、失败、ADR、代码和旧笔记。
笔记产出
- 《受监管 AI 系统架构总论》。
- 知识图谱、误区清单和下一阶段问题树。
Gate U8
- 90 分钟陌生案例综合题达到 8/10。
- 三次 teach-back 能回答反例与边界问题。
- 72 小时后延迟回忆达到 80%。
- 能明确列出仍不会、仍不确定和下一步要验证的内容。
4. 56 天执行系统
本文件定义为什么学、八周学什么和如何验收;逐日执行以以下文件为准:
| 用途 | 文件 |
|---|---|
| D01~D56 核心问题、输入、实验、退出条件和复习 | docs/aisa-learning/AISA_56_DAY_CURRICULUM.md |
| 唯一完成状态与五维评分 | docs/daily/AISA_LEARNING_PROGRESS.md |
| 日学习、实验和周 Gate 模板 | docs/aisa-learning/README.md |
| 错题与误区 | docs/aisa-learning/ERROR_CARDS.md |
| R1/R2/R3 到期队列 | docs/aisa-learning/REVIEW_QUEUE.md |
Day 按自然日连续编号,避免把“40 个核心学习日”和“56 个自然日”混为一谈:
W1 D01-D07 W2 D08-D14 W3 D15-D21 W4 D22-D28
W5 D29-D35 W6 D36-D42 W7 D43-D49 W8 D50-D56
周五 Gate 初测、周六 teach-back/补救、周日休息或 20 分钟轻回忆也有独立 Day。Gate 未通过时允许顺延,不为了保持 56 天形式跳过补学。
5. 每周与每日节奏
每周
- 周一:核心理论与闭卷前测。
- 周二:领域或架构建模。
- 周三:带假设的实验。
- 周四:反例、失败模式和替代方案。
- 周五:综合笔记与闭卷 Gate。
- 周六:teach-back、错题整理和 R1 复习。
- 周日:休息或 20 分钟轻量回忆。
每天 3~4 小时
| 时间 | 活动 | 要求 |
|---|---|---|
| 20 分钟 | 闭卷回忆 | 先写已知和疑问,再看资料 |
| 60~75 分钟 | 原理学习 | 优先原始论文、规范、源码和既有深度笔记 |
| 90~120 分钟 | 实验或建模 | 改变一个变量,保留失败或画出约束 |
| 40 分钟 | 综合笔记 | 写推理、结果、反例和不确定性 |
| 15 分钟 | 自测排期 | 生成 3~5 道题,登记 R1/R2/R3 |
每周只新增三类内容:一篇综合笔记、一份实验记录、一组错题/概念卡。避免重新追求每日大量产出。
6. 学习笔记模板
# Week X:[核心问题]
## 1. 学习前的判断
- 我原来如何理解?
- 哪些是事实,哪些是假设?
## 2. 闭卷概念图
- 先凭记忆画,再查资料修正
## 3. 三个核心原理
- 原理
- 适用条件
- 失效条件与反例
## 4. 实验 / 建模
- 假设
- 自变量 / 控制变量
- 方法与实现
- 结果
- 意外、失败与局限
## 5. 架构取舍
- 方案 A / B / C
- 为什么选或不选
## 6. 与金融零售 / Web3 的连接
## 7. 纠正的误解与仍不确定的问题
## 8. 十道闭卷题
## 9. 复习记录
- R1:+1 天
- R2:+7 天
- R3:+30 天
7. 现有资产复用
| 资产 | 本阶段用途 | 使用规则 |
|---|---|---|
| AML 代码与文档 | src/aml/*、AML PRD、治理图 | 作为实验标本,不把已有文档当作已经掌握 |
| Web3 90 / 实战 | 钱包、交易、跨链、DeFi、预言机和地址风险 | 只作为第二数据域和迁移案例,不重跑 90 天 |
| Architecture 120+ | DDD、BPMN、C4、ADR、ATAM、可观测性、安全 | 每张图和 ADR 必须对应当前问题 |
| AIPA-120 | 三个 AI 实验页面和历史笔记 | 作为待验证假设和源码阅读材料 |
| ABPA-180 | 问题定义、流程、Requirements-to-Eval、RACI | 跳过面试、Executive Story 和作品集部分 |
| AIPROD-90 | 数据/RAG、EvalOps、可靠性、安全 | 按周定向检索,不恢复逐日打卡 |
| LLM / DSDB / Expert | 原理和深度参考 | 先闭卷回忆,再定向阅读 |
| Solidity + Rust/Move | 未来专项 | 本周期暂停,除非实验明确需要合约 |
8. 明确不做什么
- 不做求职投递、岗位能力矩阵、简历、个人品牌或 offer 计划。
- 不以首页包装、公开宣传或笔记数量判断学习是否完成。
- 不同时启动第二个 capstone。
- 不为了追日期跳过闭卷自测、失败记录和间隔复习。
- 不把生成文档、模拟结果、通过测试和真实理解混为一谈。
- 不重写或删除旧计划;只在索引中标明当前是否执行。
- 不追逐所有新框架;新资料必须回答当前核心问题。
9. 八周完成标准
- 8 次周度闭卷自测与纠错复盘。
- 8 个可复现的小实验或架构建模练习。
- 1 个从流程、决策、数据、AI 模式、eval、可靠性到安全的综合迁移实验。
- 1 张可从概念追到代码、实验、失败和 ADR 的知识图谱。
- 至少 3 次 teach-back,以及对应的反例和追问记录。
- R1/R2 复习完成率不低于 80%。
- 清楚列出仍不会、仍不确定和需要下一周期验证的内容。
完成的标准不是“看完”,而是“能解释、能建模、能实验、能证伪、能迁移,并在一段时间后仍能回忆”。
10. 下一阶段预告(不并行执行)
U8 与延迟复测通过后,进入 AI Model Engineering 90。该阶段不再重复 RAG、Agent 和治理主线,而是用 90 天补齐模型原理、训练、后训练、推理、多模态与非 LLM 决策实验。若 U8 未通过,先补学,本计划与下一阶段日期整体顺延。