返回 Papers
学习计划 Roadmap

AISA 深度学习实验室:8 周学习总纲

AML Copilot 是贯穿八周的实验标本,现有代码是实验仪器。只有在验证学习假设时才修改代码;不要求公开部署,也不以展示效果判断是否掌握。

444AISA_DEEP_LEARNING_8_WEEK_PLAN_2026.md

AISA 深度学习实验室:金融零售 × Web3(8 周)

周期:2026-08-24 ~ 2026-10-18
状态:当前学习主线
实验标本:AML 调查 Copilot
目标:理解原理、建立模型、亲手实验、分析失败、形成长期记忆
非目标:求职、投递、简历、职位匹配、个人品牌、作品集包装或 offer 转化


1. 核心学习问题

如何在高风险金融与链上场景中,设计一个可理解、可验证、可控制、可演进的 AI 系统?

AML Copilot 是贯穿八周的实验标本,现有代码是实验仪器。只有在验证学习假设时才修改代码;不要求公开部署,也不以展示效果判断是否掌握。

学习循环统一为:

问题 → 闭卷前测 → 原理学习 → 建模/实验 → 反例与失败 → 纠错 → 间隔复习 → 跨域迁移

当前项目已有大量笔记,下一阶段不再追求覆盖更多主题,而是缩短“写过、看过”和“能解释、能实现、能证伪”之间的距离。


2. 周度验收模型

每周五个维度各评 0~2 分:

维度0 分1 分2 分
理解只能复述术语能说明基本机制能推导边界、反例和取舍
建模无结构化模型有图或表角色、数据、状态与约束一致
实验没有动手完成最小实验有基线、变量控制和失败分析
回忆依赖原文能回答基本问题延迟回忆后仍能解释和重建
迁移只会原案例能做近似类比能处理陌生金融/Web3 场景

每周总分达到 8/10 且任何维度不为 0,才进入下一周。未过关时延长学习,不为赶日期跳过。


3. 八周学习主线

Week 1(08-24 ~ 08-30):AI 系统认知与边界

核心问题

  • 模型、工作流、数据和控制分别解决什么问题?
  • rule engine、workflow、RAG、copilot、agent 的边界是什么?
  • 当前三个 AI 页面真实实现了什么,哪些是教学模拟?

理论学习

  • deterministic / statistical / generative 系统。
  • LLM、structured output、tool calling、agent loop 与 human decision。
  • C4、数据流、决策流、状态机和质量属性。
  • runtime、依赖、lockfile、数据版本与随机性对实验的影响。

实验 / 建模

  • 从代码反向重建 AML Copilot、Agent Arch Lab、Agent Platform 的系统边界。
  • 把 12 个代表性任务分类为规则、检索、模型、LLM 或人工决策。
  • 建一张 rule/workflow/RAG/copilot/agent 对比表,并为每类写一个反例。
  • 固定本地 test/typecheck/build 基线,记录环境失败及其原因。

笔记产出

  • 《AI 系统不是模型:当前项目系统边界图》。
  • 10 张概念卡与一份初始误区清单。

Gate U1

  • 闭卷重画 AML Copilot 系统图。
  • 正确分类至少 10/12 个任务,并说明 3 个 no-AI 场景。
  • 10 道自测题正确率达到 80%。

Week 2(08-31 ~ 09-06):AML 领域与决策建模

核心问题

  • AML 判断依据来自哪里?
  • observation、inference、recommendation、decision 如何分离?
  • 链上地址、钱包与真实客户身份是什么关系?

理论学习

  • KYC → transaction monitoring → alert → case → SAR → review/audit。
  • structuring、layering、money mule 与正常业务边界。
  • BPMN、DMN、DDD bounded context、event storming 和统一语言。
  • EVM account、跨链路径、地址聚类与链上证据局限。

实验 / 建模

  • 画 AML AS-IS/TO-BE BPMN 和异常路径矩阵。
  • 建 DMN 决策表,明确事实、推断、建议和最终决策的 owner。
  • 划分 KYC、监控、调查、报告、链上分析五个 bounded context。
  • 用一个链上资金流案例完成 alert → case → evidence → review 映射。

笔记产出

  • 《AML × 链上资金流领域模型》。
  • 术语表、决策表和证据分类表。

Gate U2

  • 对陌生案例区分 observation/inference/decision。
  • 能指出所需证据、人工权限和审计字段。
  • BPMN、DMN 与领域模型的命名一致。

Week 3(09-07 ~ 09-13):AI 方案模式与复杂度边界

核心问题

  • 什么时候用 workflow、RAG、copilot 或 tool agent?
  • 更复杂的方案何时只会增加失败面?
  • 自治等级和 HITL 应如何设计?

理论学习

  • source-bound generation、tool use、memory、context 和 fallback。
  • autonomy level、approval、abstention、stop rule。
  • DDD application service、state machine 与 agent loop 的关系。

实验 / 建模

  • 用同一调查任务比较规则模板、检索模板、RAG Copilot、受限 Agent。
  • 为四种模式记录质量、可解释性、延迟、控制成本和失效方式。
  • 设计三种 no-AI / workflow-only 场景。
  • 写 ADR:选择最小充分方案,而不是默认使用 agent。

笔记产出

  • 《四种 AI 模式比较实验》。
  • 一份 autonomy/HITL 状态图和 ADR。

Gate U3

  • 为三个新场景选择最小充分方案。
  • 能解释为什么拒绝更复杂的方案。
  • 能说明 memory、context、state 和 audit log 的区别。

Week 4(09-14 ~ 09-20):数据、RAG 与知识边界

核心问题

  • 检索结果为何会相关但不可信,或者根本不该被当前用户看见?
  • BM25、embedding、hybrid、rerank 分别解决什么问题?
  • 权限与 freshness 为什么必须进入检索链路?

理论学习

  • data contract、lineage、label provenance、PII 与 freshness。
  • sparse/dense retrieval、cosine similarity、RRF、reranking。
  • chunking、metadata、Recall@K、MRR、nDCG、citation validity。
  • ACL pre-filter 与 post-filter 的风险差异。

实验 / 建模

  • 用现有 RAG 模块做 BM25、dense、hybrid、rerank 小规模对照。
  • 设计 relevance、permission、freshness 三组 query。
  • 加入 AML 类型学、链上地址风险和跨链异常语料。
  • 从 ingestion/query/auth/generation 四层记录失败原因。

笔记产出

  • 《RAG 失效地图》。
  • Data Readiness 学习版与检索实验日志。

Gate U4

  • 能从零解释 RRF 和至少两个检索指标。
  • 能诊断五类检索失败,并说明何时不需要向量检索。
  • 能解释为什么授权应在检索前生效。

Week 5(09-21 ~ 09-27):Eval 科学与不确定性

核心问题

  • 怎样知道系统真的更好,而不是只得到好看的平均分?
  • 人工标签、规则 grader 与 LLM judge 各有什么偏差?
  • 高风险错误为什么不能被总体 accuracy 掩盖?

理论学习

  • base rate、confusion matrix、precision、recall、FPR/FNR、PPV。
  • calibration、abstention、Cohen's κ、bootstrap CI、slice analysis。
  • 数据泄漏、标签分歧、rubric 先验和 judge bias。

实验 / 建模

  • 手算 confusion matrix 与 κ,再和代码结果对照。
  • 人工标注 20~30 个现有案例,补正常业务、证据冲突和 Web3 hard cases。
  • 改变阈值,观察漏报、误报、人工复核量的变化。
  • 比较规则、人工与自动 grader 的分歧。

笔记产出

  • 《AML Eval Protocol》。
  • Error Atlas 与指标选择说明。

Gate U5

  • 能手算关键指标与 κ。
  • 能解释高 accuracy 为何可能没有意义。
  • 能为陌生需求设计 grader、threshold 和 slice。

Week 6(09-28 ~ 10-04):运行时、可靠性与可观测性

核心问题

  • AI 系统如何失败,失败怎样传播到业务结果?
  • retry、timeout、fallback、circuit breaker 与 stop 应如何配合?
  • 失败、慢、贵和答错分别如何观测?

理论学习

  • idempotency、checkpoint、retry budget、circuit breaker、fail-open/closed。
  • SLI/SLO、error budget、p50/p95/p99。
  • trace/span/event/metric/log 与 cost-per-task。

实验 / 建模

  • 注入 tool failure、timeout、invalid citation、context pollution。
  • 画 failure propagation tree 和 trace map。
  • 比较 retry、fallback、stop 对质量、延迟和成本的影响。
  • 做一次本地 game day,保留意外结果。

笔记产出

  • 《从模型错误到业务影响》。
  • 三个可靠性 ADR 与 game-day 学习记录。

Gate U6

  • 对陌生故障选择 retry/fallback/stop 并解释取舍。
  • 闭卷追踪依赖故障到用户、审计和业务影响。
  • 能说明 tail latency 与平均延迟的差别。

Week 7(10-05 ~ 10-11):安全、MCP 与治理

核心问题

  • 谁能让 agent 做什么,出了问题谁负责?
  • prompt injection 为什么不能只靠提示词解决?
  • identity、authentication、authorization、policy 和 approval 如何分层?

理论学习

  • threat modeling、trust boundary、least privilege、confused deputy。
  • prompt/tool/data supply-chain attack 与 data exfiltration。
  • MCP 的 discover/list/call、schema、transport 与授权边界。
  • PII minimization、retention、HITL、RACI 和 auditability。

实验 / 建模

  • 建威胁模型和 20 个 red-team case。
  • 比较 scope、deny-by-default、approval、output validation 的单独与组合效果。
  • 运行本地 MCP 最小 server/client,测试非法 schema、无权限和重放。
  • 对比 AML reviewer 权限与 Web3 wallet/tool approval。

笔记产出

  • Threat-Control-Residual Risk 矩阵。
  • MCP 序列图与桌面事故复盘。

Gate U7

  • 对未知攻击给出资产、边界、路径、控制、恢复和 owner。
  • 能解释 confused deputy 的完整链路。
  • 能说明每项缓解措施没有解决什么。

Week 8(10-12 ~ 10-18):综合迁移与长期记忆

核心问题

  • 这套理解能否迁移到 AML 以外?
  • 哪些实验改变了最初判断?
  • 哪些知识已经掌握,哪些仍只是熟悉?

理论学习

  • ATAM、架构 trade-off、演进式设计与跨域类比。
  • retrieval practice、interleaving、elaboration、Feynman technique。
  • 事实、推断、假设、模拟结果和真实结果的认识论边界。

综合实验

  • 闭卷处理一个陌生场景:支付争议、APP scam 或链上钱包风险。
  • 在 90 分钟内完成流程、决策、C4、数据、eval、安全和 SLO。
  • 与 AML 方案对照,找出可迁移模式和不可迁移约束。
  • 选择三个最难主题做 15 分钟 teach-back。
  • 建知识图谱,把概念连接到实验、失败、ADR、代码和旧笔记。

笔记产出

  • 《受监管 AI 系统架构总论》。
  • 知识图谱、误区清单和下一阶段问题树。

Gate U8

  • 90 分钟陌生案例综合题达到 8/10。
  • 三次 teach-back 能回答反例与边界问题。
  • 72 小时后延迟回忆达到 80%。
  • 能明确列出仍不会、仍不确定和下一步要验证的内容。

4. 56 天执行系统

本文件定义为什么学、八周学什么和如何验收;逐日执行以以下文件为准:

用途文件
D01~D56 核心问题、输入、实验、退出条件和复习docs/aisa-learning/AISA_56_DAY_CURRICULUM.md
唯一完成状态与五维评分docs/daily/AISA_LEARNING_PROGRESS.md
日学习、实验和周 Gate 模板docs/aisa-learning/README.md
错题与误区docs/aisa-learning/ERROR_CARDS.md
R1/R2/R3 到期队列docs/aisa-learning/REVIEW_QUEUE.md

Day 按自然日连续编号,避免把“40 个核心学习日”和“56 个自然日”混为一谈:

W1 D01-D07   W2 D08-D14   W3 D15-D21   W4 D22-D28
W5 D29-D35   W6 D36-D42   W7 D43-D49   W8 D50-D56

周五 Gate 初测、周六 teach-back/补救、周日休息或 20 分钟轻回忆也有独立 Day。Gate 未通过时允许顺延,不为了保持 56 天形式跳过补学。


5. 每周与每日节奏

每周

  • 周一:核心理论与闭卷前测。
  • 周二:领域或架构建模。
  • 周三:带假设的实验。
  • 周四:反例、失败模式和替代方案。
  • 周五:综合笔记与闭卷 Gate。
  • 周六:teach-back、错题整理和 R1 复习。
  • 周日:休息或 20 分钟轻量回忆。

每天 3~4 小时

时间活动要求
20 分钟闭卷回忆先写已知和疑问,再看资料
60~75 分钟原理学习优先原始论文、规范、源码和既有深度笔记
90~120 分钟实验或建模改变一个变量,保留失败或画出约束
40 分钟综合笔记写推理、结果、反例和不确定性
15 分钟自测排期生成 3~5 道题,登记 R1/R2/R3

每周只新增三类内容:一篇综合笔记、一份实验记录、一组错题/概念卡。避免重新追求每日大量产出。


6. 学习笔记模板

# Week X:[核心问题]

## 1. 学习前的判断
- 我原来如何理解?
- 哪些是事实,哪些是假设?

## 2. 闭卷概念图
- 先凭记忆画,再查资料修正

## 3. 三个核心原理
- 原理
- 适用条件
- 失效条件与反例

## 4. 实验 / 建模
- 假设
- 自变量 / 控制变量
- 方法与实现
- 结果
- 意外、失败与局限

## 5. 架构取舍
- 方案 A / B / C
- 为什么选或不选

## 6. 与金融零售 / Web3 的连接

## 7. 纠正的误解与仍不确定的问题

## 8. 十道闭卷题

## 9. 复习记录
- R1:+1 天
- R2:+7 天
- R3:+30 天

7. 现有资产复用

资产本阶段用途使用规则
AML 代码与文档src/aml/*、AML PRD、治理图作为实验标本,不把已有文档当作已经掌握
Web3 90 / 实战钱包、交易、跨链、DeFi、预言机和地址风险只作为第二数据域和迁移案例,不重跑 90 天
Architecture 120+DDD、BPMN、C4、ADR、ATAM、可观测性、安全每张图和 ADR 必须对应当前问题
AIPA-120三个 AI 实验页面和历史笔记作为待验证假设和源码阅读材料
ABPA-180问题定义、流程、Requirements-to-Eval、RACI跳过面试、Executive Story 和作品集部分
AIPROD-90数据/RAG、EvalOps、可靠性、安全按周定向检索,不恢复逐日打卡
LLM / DSDB / Expert原理和深度参考先闭卷回忆,再定向阅读
Solidity + Rust/Move未来专项本周期暂停,除非实验明确需要合约

8. 明确不做什么

  • 不做求职投递、岗位能力矩阵、简历、个人品牌或 offer 计划。
  • 不以首页包装、公开宣传或笔记数量判断学习是否完成。
  • 不同时启动第二个 capstone。
  • 不为了追日期跳过闭卷自测、失败记录和间隔复习。
  • 不把生成文档、模拟结果、通过测试和真实理解混为一谈。
  • 不重写或删除旧计划;只在索引中标明当前是否执行。
  • 不追逐所有新框架;新资料必须回答当前核心问题。

9. 八周完成标准

  • 8 次周度闭卷自测与纠错复盘。
  • 8 个可复现的小实验或架构建模练习。
  • 1 个从流程、决策、数据、AI 模式、eval、可靠性到安全的综合迁移实验。
  • 1 张可从概念追到代码、实验、失败和 ADR 的知识图谱。
  • 至少 3 次 teach-back,以及对应的反例和追问记录。
  • R1/R2 复习完成率不低于 80%。
  • 清楚列出仍不会、仍不确定和需要下一周期验证的内容。

完成的标准不是“看完”,而是“能解释、能建模、能实验、能证伪、能迁移,并在一段时间后仍能回忆”。


10. 下一阶段预告(不并行执行)

U8 与延迟复测通过后,进入 AI Model Engineering 90。该阶段不再重复 RAG、Agent 和治理主线,而是用 90 天补齐模型原理、训练、后训练、推理、多模态与非 LLM 决策实验。若 U8 未通过,先补学,本计划与下一阶段日期整体顺延。