AIPA Notes

AI产品×架构 120天融合计划 — AI Solutions Architect 主轴:evals/可观测/AML Copilot/自建 Agent 平台

P1 → P2 → P3 → P4 顺序由浅入深;每篇开头有「今日导引(学习定位)」、结尾有「衔接 昨天→今天→明天」,可顺着学习路径连续阅读。

120天 AIPA 融合计划

120/120

120 篇 AIPA 学习笔记

P1 产品定义×评测×可观测底座
28篇 · Day 1-28
P2 AI-native 参考架构
35篇 · Day 29-63
P3 AML 调查 Copilot
35篇 · Day 64-98
P4 自建 Agent 平台×求职冲刺
22篇 · Day 99-120

P1 产品定义×评测×可观测底座

Day 1-28 · 28
AIPA Day 1

AML Copilot 产品发现与 JTBD

作品②的每项架构决策都得回答「哪个用户 job、哪个 eval 指标需要它」——所以第一天不写代码,先用数字和 JTBD 把问题钉死。

2026-06-15
amljtbdproduct-discovery+1
AIPA Day 2

AML×AI 竞品格局 2026

复刻 FIS-Anthropic 的稀缺性只存在于 GA 前的时间窗——没人公开过带 eval 数字与 $/案件 的端到端架构解剖,这正是 AISA 作品集的空位。

2026-06-16
amlcompetitive-landscapeagentic-ai+1
AIPA Day 3

一页纸 PRD 与 evals 即成功指标

AI 产品里「质量」的定义就是产品定义——evals 不是先选指标后测量,而是从真实失败归纳出来、低于门槛就阻断 merge。

2026-06-17
evalsprdllm-as-judge+1
AIPA Day 4

洗钱类型学与合成数据生成器设计

真实 AML 数据被保密与隐私锁死,eval 的地基只能自己造——一个带金标 ground truth、噪声注入、seed 可重放的案件级合成生成器。

2026-06-18
amltypologysynthetic-data+1
AIPA Day 5

SAR 叙述结构与 HITL 复核设计

SAR 是法律文书、幻觉即合规事故——AI 出草稿、人改人签,HITL 既是质量手段也是 Article 50 的合规手段。

2026-06-19
sarhitlagent-ux+1
AIPA Day 6

W1 原型实现复盘 — 契约先行与诚实标注

把诚实从「上线前补丁」前移成编译期类型与测试不变量,让规则基线成为 LLM 必须打败的对手。

2026-06-20
contract-firstsynthetic-dataevals+1
AIPA Day 7

W1 周总结 — 尺子先于引擎

在写任何 LLM 代码前,PRD、金标、规则基线、诚实标注就能先就位——这就是「尺子先于引擎」。

2026-06-21
weekly-summaryevalsaml+1
AIPA Day 8

agent-v2 真实 traces 导出与采样

随机抽 100 条会漏长尾失败,分层采样故意过采样高失败层来「发现」,再加权回插估「真实率」——两者口径绝不能混用。

2026-06-22
tracessamplingerror-analysis+1
AIPA Day 9

开放编码 open coding

先立指标=污染数据源——开放编码必须悬置预设、自由文本先于标签、只记 first failure,且不可外包给 LLM。

2026-06-23
open-codinggrounded-theoryerror-analysis+1
AIPA Day 10

轴向编码 axial coding

频次最高≠最该修——监管场景下严重度主导优先级,类数应由「每类能否挂一个可执行 eval」倒推。

2026-06-24
axial-codingclusteringseverity-matrix+1
AIPA Day 11

failure taxonomy 定稿

失败分类法的可用性不在「定义写得好」,而在每对易混类都有边界判例 + 一棵短路返回的决策树,让归类可复现、并反向锚定每类该用代码还是 judge。

2026-06-25
failure-taxonomyeval-designdecision-tree+1
AIPA Day 12

金标定向补难例 —— 用信息增益指导数据集扩充

eval 的判别力来自决策边界附近的难例而非数量——盲目扩易例只压缩动态范围,20-30 个定向难例抵 300+ 易例,且标签必须取真实意图、绝不能用规则判定结果。

2026-06-26
hard-casesactive-learninggolden-dataset+1
AIPA Day 13

taxonomy → eval 映射 —— 每条失败该交给哪种评测

taxonomy 说清了系统会在哪犯错,但每类错该用什么抓需要一张路由表——先穷尽近零成本的代码型断言,judge 只留给会反复迭代的主观质量且必须先用人工标注校准 TPR/TNR。

2026-06-27
eval-typesllm-as-judgetaxonomy+1
AIPA Day 14

W2 周总结 —— 错误分析方法论的因果闭环与偏差登记

周总结不是流水账,而是验证因果链是否闭合、偏差是否登记量化、基准能否冻结——合成数据的漂亮 recall/FPR 必须带「synthetic, not production-validated」口径,单编码者 κ 未验证须诚实暴露。

2026-06-28
error-analysisbiassaturation+1
AIPA Day 15

代码型检查 evals — 评测金字塔的确定性底座

代码型检查是评测金字塔的确定性底座——零方差、近零成本、能在 judge 触发前拦掉 30%-60% 失败;把 judge 放底座是反模式,但全绿只证明结构对而非内容对。

2026-06-29
evalscode-based-checksci-gate+1
AIPA Day 16

LLM-as-judge 四段式 rubric — judge prompt 结构与刻度选择

代码断言不了的语义质量归 judge,而 judge 要稳,靠的是「角色+rubric+锚定示例+结构化输出」四段,加上「能二元就二元」的刻度纪律

2026-06-30
llm-as-judgerubricbinary-vs-likert+1
AIPA Day 17

judge 校准与一致率 — Cohen's kappa 与校准闭环

90% 的裸一致率可能对应 κ=0 的零鉴别力 judge,必须用 κ 扣掉随机一致,judge 准入门设在 κ≥0.6(substantial)

2026-07-01
judge-calibrationcohens-kappainter-rater+1
AIPA Day 18

人工抽检协议 — 抽检率、漏检概率与升级路径

自动化只能做规模化粗筛,SAR 可提交性等合规红线必须人工兜底;抽检是逮系统性缺陷的统计哨兵,而非全量复核

2026-07-02
human-in-the-loopsamplingllm-simulated-users+1
AIPA Day 19

阻断式 CI eval gate — 让"尺子"挡住 merge

eval gate 的目标不是最严,而是「零假阳前提下尽量敏感」——靠统计显著性 + 滚动 7 天基线,把假阳率压到团队愿意一直开着它的水平

2026-07-03
eval-gateci-cdeval-driven-development+1
AIPA Day 20

agent-lab evals 面板 — 把"尺子"做成可演示装置

无后端不是缺陷而是诚信护栏——确定性纯函数让面板展示的就是 CI 里挡 merge 的同一个数字,消灭「demo 用好数据、CI 用真数据」的双口径造假

2026-07-04
evals-panelinteractive-demodeterministic+1
AIPA Day 21

W3 周总结 — 三类 eval 齐备,尺子刻度成形

三类 eval 不是三选一,而是按成本递增串联的三道滤网——deterministic 在 CI fail-fast、rubric 只查语义、composite 压成生产健康分。

2026-07-05
weekly-summaryevalsci-gate+1
AIPA Day 22

OTel GenAI semconv 精读

一套标准属性名(gen_ai.*)让换厂商不重写仪表盘,但 semconv 仍是 experimental——改名爆炸半径远大于埋点本身,必须靠映射层隔离。

2026-07-06
opentelemetrygenai-semconvobservability+1
AIPA Day 23

独立属性映射层

防腐层的价值只在变更那一刻兑现——业务/eval/告警全用自有字段说话,semconv 改名时把爆炸半径从 N 处收敛到 1 处。

2026-07-07
anti-corruption-layerdddtelemetry+1
AIPA Day 24

埋点接入全链路

一条调查链全链路 span 化 + 共享 execution_id,把「指标退化」和「现场证据」焊死,一眼定位卡在检索还是生成、花了多少钱。

2026-07-08
instrumentationtrace-treetrace-eval-correlation+1
AIPA Day 25

Langfuse 自托管

trace 是分析负载不是日志——高吞吐写+聚合读要列存;金融 PII 的数据驻留是硬约束,用「多担运维」换「数据不出门」。

2026-07-09
langfuseself-hostingclickhouse+1
AIPA Day 26

失败归因面板 — 工具失败 / 模型幻觉 / 上下文污染三分

被标为「幻觉」的失败多半是上下文污染或检索 miss——归因桶要按修复路径(工具/模型/上下文)分,而非按症状分。

2026-07-10
failure-attributionobservabilityagentic-control-plane
AIPA Day 27

缓冲 + 长文#1 定稿 + P1 主线 SOTA 复查

满分 = 口径一致性而非性能;复查的产出不是「资料还在」,而是「设计要不要改」。

2026-07-11
longformsota-recheckevals+1
AIPA Day 28

P1 阶段总结 — 尺子先于引擎,证据先于声明

在写任何 LLM 代码之前,尺子(PRD/金标/规则基线/三类 evals/CI 门/tracing/归因)可以先就位——这是 2026 的工程事实标准。

2026-07-12
phase-summaryevals-firstsota-check+1

P2 AI-native 参考架构

Day 29-63 · 35
AIPA Day 29

Anthropic orchestrator-worker 精读 — +90.2% 背后的 15× token 与超线性

多 agent 是「token 投递机制」而非「智能放大器」——质量与 token 在「单窗口装不下」的任务上是台阶跃迁,不是线性。

2026-07-13
orchestrator-workermulti-agenttoken-economics
AIPA Day 30

handoff vs orchestrator-worker — 控制权转移的两种语义

「该谁来接这个对话」用 handoff,「怎么把活拆开并行再合起来」用 orchestrator——handoff 省的那点 token 是用「无法做综合型任务」换来的。

2026-07-14
handofforchestratormulti-agent-pattern
AIPA Day 31

单 agent vs 多 agent 的证据核查 — pass^k、HAL 与 64% 的出处

多 agent 的优势高度条件化——只有「广度可分解且超单窗/上下文退化」才赢,等 token 预算下单 agent 在多跳推理上不输甚至更优。

2026-07-15
single-vs-multi-agentpass-kreliability
AIPA Day 32

token economics 决策框架 — 15× 成本何时换得回 +90.2%

决定要不要多 agent 的不是「能涨几个点准确率」,而是任务「做错的代价」(V+L)——AML 因漏报损失 L 极大,门槛低到约 0.29%,而模型分级+缓存把真实溢价从 3.75× 压到 1.43×。

2026-07-16
token-economicscost-quality-tradeoffbudget
AIPA Day 33

ADR#1 — 本项目为什么(暂)不上多 agent

AML 单案调查落在「shared context、无超窗、强一致」象限,三条证据共指不该上多 agent——主路径定为单 agent,多 agent 代码降级为 /agent-lab 教学装置,沉没成本不是论据。

2026-07-17
adrmulti-agentorchestrator-worker+1
AIPA Day 34

LangGraph 1.0 checkpointing 接入 — 节点级恢复与静态站现实

resume 重跑的是整个节点而非 interrupt 的下一行——副作用必须幂等否则重复扣费/写库;而静态站无后端的约束反而逼你手写 checkpointer,从「会用框架」变成「懂框架机制」。

2026-07-18
langgraphcheckpointingdurable-execution+1
AIPA Day 35

W5 周总结 — 编排半周方法论、checkpoint 验收与 token 经济学框架

架构决策的质量取决于「区分对了什么」而非「选了什么」——划对「广度并行 vs 单一深推」「super-step 存档 vs 行级存档」的区分轴,单/多 agent 和幂等纪律都是推论;成本框架的价值在「设对硬上限」防尾部失控,不在压低均值。

2026-07-19
week-summaryorchestrationtoken-economics+1
AIPA Day 36

checkpoint 断点续跑 — 难点不在保存,在幂等重放

断点续跑真正的难点不在保存状态,而在重放时不重复产生副作用——引擎只保证「至少跑到」,「不重复扣款/不重复上报 SAR」是你用幂等键还的债。

2026-07-20
durable-executionidempotencycrash-recovery
AIPA Day 37

HITL 审批点持久化 — interrupt 节点与跨会话恢复

审批等待是小时/天级、进程存活是分钟级——靠 interrupt 抛异常序列化状态、释放进程,再用 thread_id 持久游标跨会话恢复;而 resume 会重跑节点开头,所以前置副作用必须复用 Day 36 的幂等纪律。

2026-07-21
human-in-the-loopinterruptapproval-queue
AIPA Day 38

time-travel 调试 — 「重放」不等于「重现」

「重放」不等于「重现」——LangGraph 式 state-replay 会重新执行非确定性 LLM 调用,故障当场消失;要 debug「那一次为什么错」必须用 record/replay 回灌录制响应,连系统时钟都要拦。

2026-07-22
time-travelrecord-replaynon-determinism
AIPA Day 39

durable execution 三方案取舍 — 宏观工作流 / 微观推理 / 事件溯源

三方案是分层不是三选一——把非确定 LLM 推理关进 LangGraph、让 Temporal 在外层只看「成/败」;在浏览器 demo 阶段引 Temporal 是负 ROI,自建轻量事件溯源层但接口对齐二者语义以备迁移。

2026-07-23
durable-executiontemporallayered-architecture
AIPA Day 40

context engineering — JIT 检索与 context rot

上下文不是越多越好而是越精越好——effective context 远小于 advertised window,塞进的语义近似干扰项是负资产;用 JIT 检索只载相关片段、只在「高频×稳定×小」时才预载。

2026-07-24
context-engineeringjit-retrievalcontext-rot
AIPA Day 41

agentic 自适应检索 — 查询改写、多跳与防重复

检索从「单次 top-k」进化为「改写→多跳→充分性判定」的有界循环,防重复的治本不是 id 去重而是用已确认证据把每跳推向未覆盖的信息空间。

2026-07-25
agentic-ragadaptive-retrievalmulti-hop
AIPA Day 42

W6 周总结 — durable execution × context engineering 收口

从「demo 能跑」到「生产能信」缺的是持久化执行与上下文工程两块地基,而两者的 SOTA 共识都是「按代价分级,不按能力铺满」。

2026-07-26
week-summarydurable-executioncontext-engineering
AIPA Day 43

自托管 AI gateway — LiteLLM/Bifrost/Portkey 与统一接入层

AI gateway 是 LLM 调用的控制平面,价值不在省 SDK 而在把预算/韧性/密钥/可观测这些横切关注点从 N 个 agent 里抽出来收敛到一处。

2026-07-27
ai-gatewaylitellmcost-control
AIPA Day 44

MCP 2026-07-28 最终规范精读 — 无状态核心如何重写会话语义

stateless core 不只是删掉一个 session header,而是抽空了「会话」这个抽象本身——可扩展性的代价永远是把隐式状态外置、显式编码进每个请求。

2026-07-28
mcpstatelessprotocol-spec
AIPA Day 45

语义缓存实测 — 双层判定、命中率真相与假阳的代价

语义缓存的真问题不是省钱而是正确性——错命中带满分置信与 200 OK 静默退化,合规路径只能缓存只读科普、绝不缓存触发动作或判定结论。

2026-07-29
semantic-cachecost-controlfalse-positive
AIPA Day 46

gateway 治理 — 路由策略、fallback 链、预算闸与意图感知路由

路由决定请求发给谁、fallback 决定挂了怎么办、预算闸决定超支怎么拦——三者是 agent 生产里「成本可持续 + 不间断服务」的底座。

2026-07-30
llm-routingfallbackbudget-governance
AIPA Day 47

成本×延迟×质量 Pareto 面板 — 没有最优模型,只有前沿上的取舍

没有最优模型,只有前沿上的取舍——成本、延迟、质量三轴互相打架,1000× 价差只换 8 分质量、同质同价延迟可差 8 倍。

2026-07-31
pareto-frontiermulti-objectivemodel-selection+1
AIPA Day 48

gateway 实测报告 — 把 Day 47 的前沿填上真数字

缓存降本不是免费的——一条「相似但不对」的缓存 SAR 比慢一秒严重一万倍,所以 SAR 叙述步必须禁缓存,缓存只用在无事实负载的段落。

2026-08-01
ai-gatewaysemantic-cachebenchmark+1
AIPA Day 49

EU AI Act Article 50 生效 — SAR 标注、Omnibus 推迟与 HITL 豁免同构

HITL 不只是产品 UX,它是 Article 50(4) 编辑责任豁免的法律触发器——人工复核加自然人担责是合规架构的承重墙,改全自动就捅破豁免。

2026-08-02
eu-ai-actarticle-50transparency+1
AIPA Day 50

MCP server 构建 I — 把 agent-v2 检索封装成无状态 MCP server

把检索封装成 MCP server 最难的不是写工具,是彻底戒掉服务端状态——上下文全进 arguments 与 _meta,server 纯函数化,预算/重试留给调用方。

2026-08-03
mcpstateless-servertool-registration+1
AIPA Day 51

MCP server 构建 II — Tasks 异步长任务 + OAuth 鉴权

stateless 世界里 task handle 就是状态载体也是敏感凭证,而 MCP 鉴权最危险的洞不是「没鉴权」而是「鉴权了却没校验 audience」。

2026-08-04
mcptasksoauth+2
AIPA Day 52

MCPTox 式红队 I — 工具描述即注入面

工具的 description 字段会被直接拼进模型上下文当「说明书」读,纯文本即可投毒,且越听话的强模型 ASR 反而越高——安全不能指望模型自己不上当。

2026-08-05
mcptoxtool-poisoningprompt-injection+2
AIPA Day 53

agent 风控网关 v1 — 把支付风控三段式搬到 MCP 调用链

写在 prompt 或工具描述里的安全约束都只是「建议」,真正的强制必须放在模型推理之外、不可绕过的确定性网关上——而最该拦的是「合法工具的非常规组合」。

2026-08-06
risk-gatewayzero-trustleast-privilege+2
AIPA Day 54

红队 II — 拦截后对比与绕过归因

只重跑原 payload 会把「表面拦截」误报成「根因修复」,而拦得越严反而把攻击者逼向合法路径——正解是 defense-in-depth + 风险分级,绕过归因要打到缺陷层不打到关键词。

2026-08-07
red-teamasrdefense-in-depth+1
AIPA Day 55

A2A 协议精读 — Agent Card、任务委托与长任务生命周期

跨组织协作真正难的不是接口描述而是信任的传递性——签名 Agent Card 把信任从预配白名单变成可验证凭证链;长任务的难点也不是「等」而是「可中断+可恢复」,client 不能把上下文揣在内存里。

2026-08-08
a2aagent-cardtask-lifecycle+1
AIPA Day 56

长文#2 定稿《红队一个 MCP server》+ W8 周总结

红队报告的说服力与 ASR 数字漂亮程度负相关、与残余风险披露完整度正相关;安全是 AI-native 产品 PM 的一等判断力,不是合规清单。

2026-08-09
longformred-teamaisa+1
AIPA Day 57

框架对比基准 — 三固定原则与「对账异常调查」任务规范

框架对比最大的谎言是「我们测了框架」,其实测的是默认配置与作者调优时间;只有 prompt/模型/工具逐字符固定、用确定性可判分的合成 golden,跨框架数字才有因果解释力。

2026-08-10
agent-frameworkbenchmark-methodologyvercel-ai-sdk-6+1
AIPA Day 58

Vercel AI SDK 6 实现 — usage vs totalUsage 的成本陷阱与数据点#1

多步 agent 的成本不是「最后一次调用」而是「每步 input 的累加」(随步数近似二次增长),成本维度必须取 totalUsage;数据点#1 单独不下任何框架结论,它的价值是校准基准本身。

2026-08-11
vercel-ai-sdk-6tool-loop-agenttoken-accounting+1
AIPA Day 59

Claude Agent SDK 对比实现 — 谁拥有 loop,谁拥有 context

Claude Agent SDK 的「贴心默认」(preset 提示、自动 compaction、缓存折扣)在框架横评里全是污染源,必须主动「关掉聪明」;成本要分裸 token 与实付双口径报,混报就是 trade-off 矩阵的第一个雷。

2026-08-12
claude-agent-sdkharnesscompaction+1
AIPA Day 60

四框架 trade-off 矩阵 + memory 厂商 benchmark 批判(ATAM 式 I)

四框架是工具箱不是竞品——选型是任务-框架匹配;memory benchmark 的可怕不在数字假,而在「同产品换个配置就从 49 跳到 94」,所以选型要靠 ATAM 比架构契合,不靠排名。

2026-08-13
framework-tradeoffatammemory-benchmark+1
AIPA Day 61

memory 厂商批判评审定稿 — 用 ATAM 砸碎 benchmark 排名

选 agent 记忆要看架构与任务的契合度(AML 强时间维 + 审计回放),而非 benchmark 排名——排名量的是平均任务,你的任务不是平均任务。

2026-08-14
agent-memoryatammem0-letta-zep+1
AIPA Day 62

长文#3 定稿 — 四框架 trade-off:同一桩 AML 调查,谁来编排?

最强的框架不等于最该选的框架——语言生态先砍掉一半选项,再用 Temporal(macro durable)+ Vercel AI SDK 6(micro 推理)分层组合,而非一个框架硬扛。

2026-08-15
longformagent-frameworkslanggraph-temporal+1
AIPA Day 63

P2 阶段总结 — 参考架构落地,部件齐而引擎待接

agent 架构的难不在调一次 LLM,而在 durability/成本/安全/可审计这些横切关注点——它们是确定性工程,可在零 LLM 推理下先把护栏前置成设计物证。

2026-08-16
phase-summaryreference-architecturesota-check+1

P3 AML 调查 Copilot

Day 64-98 · 35
AIPA Day 64

证据汇集 pipeline 架构设计 — 五段流程的接口契约与失败隔离

AML 流水线是固定五段、顺序由合规写死,复用 P2 dispatch 的 Budget 断言机制但不要它的 LLM 自由编排——否则审计时答不出「为何跳过某段」。

2026-08-17
evidence-pipelineinterface-contractfault-isolation
AIPA Day 65

证据汇集 — RRF 多源检索与召回优先

金融调查里「漏证据」比「多证据」代价大几个数量级——①段刻意 over-retrieve 把召回拉满,精排推到下游确定性规则引擎,因为检索漏召回是静默不可观测的。

2026-08-18
rrfmulti-source-retrievalrecall-first
AIPA Day 66

dispatch + Budget 单案成本控制 — 子任务调度与超限降级

成本闸的价值不在均值在截断长尾——闸必须在 agent 代码之外、在花下一笔钱之前,超限时退回 P1 零成本规则路径而非抛异常。

2026-08-19
budget-enforcementcost-capgraceful-degradation
AIPA Day 67

类型学比对引擎升级 I — structuring/layering 的阈值、可解释与证据对齐

检测阈值必须严于且低于监管申报阈值(洗钱者知阈值并贴线),layering 的可疑度在资金流图的边上而非单点上——这是确定性规则相对 LLM 不可替代的可审计优势。

2026-08-20
structuringlayeringexplainable-rules
AIPA Day 68

类型学升级 II — mule network 图比对与叠加命中仲裁

钱骡网络的信号在账户间的图拓扑里而非任何单账户属性里;叠加命中时类型学是一条资金链的多阶段而非概率竞争,定性该按资金最终去向而非分最高。

2026-08-21
mule-networkgraph-topologytypology-arbitration
AIPA Day 69

金标扩集 ≥100 — 难例不是堆数量,是造区分度

金标的价值不在案件总数,在「能让候选系统分出高下的高方差难例」占比——满分金标是 bug 不是 feature,扩集的目的是造区分度而非堆样本量。

2026-08-22
golden-datasethard-casesdiscriminability
AIPA Day 70

W10 周总结 — 金标扩集后,基线第一次掉分

W10 要的不是基线没掉分,是基线在该掉的地方(mule HARD 档)精确掉分、在不该掉的地方(structuring EASY 档)稳住——掉对位置才是金标有判别力的硬证据。

2026-08-23
weekly-summarydiscriminabilityopen-coding
AIPA Day 71

SAR 规则模板基线 — 先建「愚蠢但确定」的对照系

规则模板的价值恰恰在于它笨——笨得确定、可复现、永不幻觉,它是 LLM 必须打败的对照组,没有它 LLM 的「好」就没有参照系。

2026-08-24
sar-narrativedeterministic-baselineeval-floor+1
AIPA Day 72

SAR 叙述 LLM 化 I — 引用锚点与闭世界幻觉防护

模型负责流畅,确定性闸门负责真实——把残余幻觉降到合规可接受不能靠「换更强的模型」,只能靠确定性验证加拒绝出文。

2026-08-25
sar-llmcitation-anchorclosed-world+1
AIPA Day 73

SAR LLM vs 模板对照评测 — LLM 必须打败基线才配上线

可读性赢了不等于该上线——SAR 是法律文书,可读性高分不能赎买事实忠实的缺陷,必须分维度设硬门而非加权总分。

2026-08-26
sar-evalfaithfulness-fluency-tradeoffpaired-comparison+1
AIPA Day 74

审计轨迹 I — 全链路 OTel 与"案件 ID 贯穿"四段 span

审计 trace 是给数年后的监管者写的,不是给现在的工程师调试用的——业务语义属性比性能属性重要,且必须长期持久、不可篡改。

2026-08-27
audit-trailopentelemetrygenai-spans+1
AIPA Day 75

审计轨迹 II — 不可篡改:哈希链、监管要件与落盘

审计轨迹是和鉴权、加密同级的合规架构组件,不是日志——它的举证方向相反,必须在「对家假设我们会作弊」的前提下仍能用密码学自证清白。

2026-08-28
immutable-audithash-chaintamper-evident+1
AIPA Day 76

每日 evals 防退化固化 — daily runner、退化告警与 CI gate

eval 不是「写出来」就落地,要「定时自动跑 + 退化即阻断」才算数——三角不可能逼你把廉价/快/统计显著拆到不同层。

2026-08-29
daily-evalsregression-gateci+1
AIPA Day 77

W11 周总结 — SAR LLM 对照定稿、failure taxonomy v2、审计 trail 完成

本周最有价值的不是「LLM 把 SAR 写得更流畅」,而是「用对照实验量出了 LLM 在合规文本上的代价边界」——起草变易、复核变难,最危险的是语气越权。

2026-08-30
weekly-summarysar-llmfailure-taxonomy+2
AIPA Day 78

Agent UX 模式选型 — 七模式与金融 HITL 的适配,以及"信任决定模式"的反直觉

UX 模式集是用户信任度的函数、不是功能集的函数——同一个 Agent,给资深和新手调查员该呈现的模式不同,所以按信任曲线分阶段开放而非上满 12 模式。

2026-08-31
agent-uxhuman-in-the-loopprogressive-authorization
AIPA Day 79

plan-and-execute 预览实装 — 冻结计划、执行前授权与成本预估

plan-and-execute 的最大价值不在省钱而在「锁控制流」——冻结的工具调用序列让 prompt 注入改不了调用哪些工具;且 SAR 是输出密集型,预估漏算输出 token 比漏算输入危险得多。

2026-09-01
plan-and-executehitl-approvalcost-budget
AIPA Day 80

置信度信号实装 — 类型学命中与 SAR 字段级置信度,judge 分到三档信号的映射

显示校准过的不确定性(含「我不确定」)比隐藏它更能建立信任;但未校准的置信度会主动误导用户、比不显示更糟——所以信号合法性建立在 Day 17 的 κ 校准之上。

2026-09-02
confidence-signalingtrust-calibrationhitl
AIPA Day 81

渐进式授权实装 — 分级授权决策树、复用 P2 风控网关、授权决策写审计轨迹

渐进式授权的「渐进」是 deny-by-default 的收紧再松绑,而非先宽后收——信任度只松得动中风险,永远封不了高风险的同步人审顶。

2026-09-03
progressive-authorizationleast-privilegeaudit-trail
AIPA Day 82

结构化错误恢复实装 — 让用户保持控制,而非自动重试

好的错误恢复不是悄悄自动重试到成功,而是让用户始终知道发生了什么、能随时夺回控制权——在 AML 里无声自动重试比会报错停下危险得多。

2026-09-04
error-recoverygraceful-degradationagent-ux
AIPA Day 83

HITL × durable execution 打通 — 审批等待是一种「对时钟的中断」

审批等待与定时等待在 durable execution 里是同一个 interrupt——超时不是要额外造的机制,难的是决定超时默认值朝「拒」那边倒,且把它钉成不可配置的代码硬约束。

2026-09-05
human-in-the-loopdurable-executionapproval-timeout
AIPA Day 84

W12 周总结 — Agent UX 模式库定稿,以及「金融特化」如何重写每一个通用模式

通用 Agent UX 模式是「词汇表」、金融合规是「语法」——本周真正的产出不是 6 个模式清单(借来的),而是能把任意模式翻译成受监管版本的 G1/G2/G3 三条改写规则和模式依赖偏序。

2026-09-06
agent-uxpattern-libraryfinancial-specialization
AIPA Day 85

SAR 质量 rubric — 四维 LLM-judge 评分锚定 taxonomy,与 Fiserv/FIS GA 对照

SAR 质量 rubric 不该照搬 FinCEN 5W1H——那是「内容清单」不是「评分维度」,照搬会让 judge 在强相关维度上重复打分、抬方差压 κ;四维根因正交才打得稳、可独立修。

2026-09-07
sar-qualityllm-as-judgerubric+1
AIPA Day 86

SAR eval suite — judge×人工抽检的分层校准,与「LLM 模拟用户不可靠」的红线

judge 给的分必须经 κ 校准才可信,且人工抽检要分层投向信息量最大的样本,而非随机抽 10%——监管语言维更要由人工最终拍板,绝不用 LLM 模拟标注者。

2026-09-08
eval-suitejudge-human-agreementcohens-kappa+1
AIPA Day 87

AML 对抗红队 — 证据文本里的注入面,与 SAR 诱导遗漏

AML 最危险的注入不在外部网页,而在被调查者自己填的交易备注里——你越忠实引用证据越忠实执行攻击,防线只能是剥夺 LLM 对证据集的决定权,而非指望它更聪明。

2026-09-09
red-teamindirect-prompt-injectionevidence-poisoning+1
AIPA Day 88

v1.0 发布工程 — Article 50 透明标注落地点、脱敏演示集与发布检查清单

透明标注不是「打个 AI 水印」就完事,而是分款、分时机(首屏首次曝光)、分可达性(无障碍 aria/对比度)的多点义务;合规的可信度来自可被独立验证,不来自声明。

2026-09-10
release-engineeringarticle-50transparency-labeling+1
AIPA Day 89

Copilot v1.0 发布 + 每案件单位成本 — $/案件如何成为定价基础而非事后核算

最便宜的 token 不等于最便宜的案件——单位成本的分母(成功率)比分子(token 单价)更值得优化,而 $/案件 是 agent 产品的定价基础,不是事后核算的财务指标。

2026-09-11
unit-economicscost-per-casebudget-instrumentation
AIPA Day 90

长文#4 旗舰初稿 —《复刻 FIS-Anthropic:我从零做了一个 AML 调查 agent》

复刻一个还没 GA 的巨头方向是优势不是冒昧——价值峰值落在「方向已被验证、方案尚未 GA」的窗口内,而 failure war stories 比 success metrics 更难造假、更有说服力。

2026-09-12
longformportfoliofis-anthropic+1
AIPA Day 91

W13 周总结 + 长文#4 发布 — v1.0 交付复盘与「认证的价值边界」

作品是主资产、认证是边界明确的保底过滤器——三态混淆和主辅倒置是简历上最隐蔽的两个自杀动作。

2026-09-13
weekly-summaryv1-releaseaws-certification+1
AIPA Day 92

AI Act 映射 I — Articles 9-12 落到 audit log / model registry / 数据血缘

风险管理不是一份年审文档,而是「识别→测→缓解→回流」的持续闭环——合规要求和好工程同构,evals 闭环天然满足 Article 9。

2026-09-14
eu-ai-acthigh-riskrisk-management+1
AIPA Day 93

AI Act 映射 II — Articles 13-15 落到 HITL gateway / eval suite / 红队

分析师 100% 同意 AI 不是质量证明,而是 Article 14 意义上的监督失败信号——override 率是监督「meaningful」与否的审计指标。

2026-09-15
eu-ai-acthuman-oversightautomation-bias+1
AIPA Day 94

DORA/CRD 叠加 — 模型供应商是关键 ICT 第三方,韧性接 durable execution

换个模型 API 不是一行配置改动,而是一次合规事件——模型/云供应商在 DORA 眼里是受监管的关键 ICT 第三方,断点续跑是法定的运营韧性承重组件。

2026-09-16
doraict-third-partyoperational-resilience+1
AIPA Day 95

美国线 + 治理底座 — SR 11-7 三道防线 / NIST AI RMF / ISO 42001 落到自家组件

一份 2011 年的 SR 11-7 早已涵盖 LLM、examiner 现在就在用它查 AI——黑盒不可解释不是免责借口,而是必须用独立 evals + 证据链补的验证缺口。

2026-09-17
sr11-7model-risknist-ai-rmf+1
AIPA Day 96

C4 合规架构图 — 把法条画成着色组件,长文#5 初稿开骨架

合规不是附在架构旁的 checklist,它本身就是 C4 Component 图的一个着色视图——红色缺口组件比全绿更能证明架构判断力

2026-09-18
c4-modelcompliance-as-architecturegap-analysis
AIPA Day 97

AML Copilot AI PRD 定稿 — 组装而非新写,附定价模型与长文#5 发布

AI PRD 与传统 PRD 的根本差异不是多几节,而是验收范式从二元判定翻转成概率分布断言——且 HITL 既是合规豁免触发器,也是该按 per-case 收费的分界线

2026-09-19
ai-prdevals-as-specoutcome-pricing
AIPA Day 98

P3 阶段总结 — 旗舰交付清单、SOTA 重审与 P4 开工预查

阶段末「主线没过时」本身需要当日检索的证据而非默认;v1.0 的可信度不在全绿,而在两个 🔴 缺口红得清楚、能解释为什么

2026-09-20
phase-summarysota-recheckp4-prep

P4 自建 Agent 平台×求职冲刺

Day 99-120 · 22
AIPA Day 99

平台化开工 — Agent 平台五件套的组件边界设计

自建 Agent 平台的价值不在替代 AgentCore,而在逼自己讲清每个托管组件为什么必须存在——边界讲清远胜功能写全

2026-09-21
agent-platformagentcorecomponent-boundaries
AIPA Day 100

工具网关 I — 工具注册表

把函数变 agent 工具最该补的不是入参 schema,而是 outputSchema——合规场景下输出比输入更需校验,否则 SAR 草稿会接地到坏数据;且 list 给治理看、search 才给 LLM 用

2026-09-22
tool-gatewaymcptool-registry
AIPA Day 101

工具网关 II — 鉴权层

agent 鉴权的首要价值是收窄 prompt injection 的爆炸半径——沿主体/客体/时间三维同时切窄权限,让单点失陷损失可控。

2026-09-23
gateway-authagent-identityleast-privilege
AIPA Day 102

工具网关 III — 调用审计 + 网关合龙

审计字段由「能否重建行为链」倒推而非「记多少算多」决定,且审计系统对被审计的 agent 自身也是零信任——只能 append,不能读删。

2026-09-24
call-auditobservabilityappend-only
AIPA Day 103

策略引擎 I — 声明式规则 (principal/action/resource/condition 四元组)

策略必须在 LLM 推理之外做确定性数据驱动评估——被监管对象不能自我执行约束,forbid-wins 给监管红线不被宽 permit 误开的结构性保证。

2026-09-25
policy-enginecedardeclarative-authz+1
AIPA Day 104

策略引擎 II — 事中拦截 (每次工具调用过判定 · allow/deny/escalate→HITL)

escalate 是与 deny 正交的第三态——冻结 agent、移交人类,绝非「deny+重试」;拦截的可信度上限取决于审计的不可篡改性,而非判定的正确性。

2026-09-26
policy-enforcementinterceptionhitl-escalation+1
AIPA Day 105

Agent 注册表 + AgentCore 计费拆解 + W15 周总结

Agent 热更新的安全前提是「不可变版本 + 原子指针切换」而非就地改配置;纯消耗计费的真成本藏在 idle 内存与无上限可观测性,对长 HITL 合规场景反而可能更贵。

2026-09-27
agent-registryversioningagentcore-pricing+1
AIPA Day 106

多会话运行时 I — 会话隔离与上下文不泄漏

会话隔离是三层递进——逻辑命名空间、内存别名、执行环境,功能测试全绿照样可能在 KV-cache 侧信道漏,所以「功能正确 ≠ 安全隔离」。

2026-09-28
session-isolationmulti-tenantcontext-leakage
AIPA Day 107

多会话运行时 II — durable 会话与跨会话恢复

durable 会话要把「短期对话历史(Sessions/checkpoint)」与「长期提炼记忆(Memory Bank/facts)」分两层存,全量回灌 transcript 会触发 context rot;且「可恢复」放大并发面,必须配版本号乐观锁。

2026-09-29
durable-sessioncheckpointcross-session-resume
AIPA Day 108

计量计费与预算强制 — 三家定价与 TCO 输入

硬拒绝会让已花掉的钱全打水漂,所以超限要分级降级(opus→haiku 省约 19×、保收尾);token 占总成本 10-100×,三家 vCPU 单价差只是 0.06% 噪声,省钱在模型路由而非换平台。

2026-09-30
meteringbudget-enforcementtco-pricing
AIPA Day 109

平台管理面板 + 8 维选型矩阵

选型没有全维最优的平台,第一性原理是「身份和数据已经在哪朵云」而非「谁最强」——硬约束(身份/数据/合规)先剪枝、软偏好(M365/定价/eval)再 tie-breaker,定价排最后。

2026-10-01
selection-matrixplatform-comparisonagent-lab
AIPA Day 110

自建平台 v1 合龙 + build-vs-buy TCO — 自建省的 API 费常被运维人力吃掉,但合规场景仍值

平台正确性不是各组件正确性的并集而是契约的交集(合龙的 bug 全在接缝);自建省的 API 费常被运维人力(占 TCO 25-30%)整条吃掉,所以默认 buy,唯有数据驻留/HIPAA/air-gapped 才让合规压倒成本。

2026-10-02
build-vs-buytcoself-hosted-agent-platform
AIPA Day 111

长文#6 初稿 — build-vs-buy 解剖:我自建的每个零件,托管平台收你哪一层的钱

自建的真正回报不是省钱,而是获得「逐层拆解托管平台在卖什么、哪层该买哪层该建」的判断力。

2026-10-03
longform6component-mappingdefense-in-depth
AIPA Day 112

长文#6 定稿 + W16 周总结 — build/buy 的线,不在你和厂商之间,在你自己技术栈的每一层

build/buy 的线不在你和厂商之间,而是穿过你自己的技术栈——每一层各跑一遍决策树,而非对整个平台投一票。

2026-10-04
longform6-finaldecision-treeweek16-summary
AIPA Day 113

金融私有化部署方案 — 数据敏感度→断网要求→GPU 资源的三问决策树

「数据驻留」不等于「数据断网」——把前者当后者做,方案成本直接翻 3–5 倍,先确认在哪一档再报价。

2026-10-05
private-deploymentair-gappedfoundry-local+1
AIPA Day 114

售前方案书 — KYC 审核 AI 改造的 TCO/ROI 与 POC 门禁

售前方案的杀手是 ROI 数字而非架构图——80% 打磨精力该投在回收期那两页,POC 合同里写可量化 gate 而非功能清单。

2026-10-06
presaleskyc-automationroi-tco+1
AIPA Day 115

长文#7 — spec-driven 下的多 coding agent 工作方式

spec 是被 agent 执行而非被人参考的可执行制品,所以不会 rot;多 agent 的瓶颈不是模型能力,而是依赖图与验收闸的设计质量。

2026-10-07
spec-drivenmulti-agent-codingadr-as-contract+1
AIPA Day 116

长文#8 — TOGAF ADM × agentic AI 的治理悖论

治理 agent 不是治理模型,治理接口与边界不是治理实现——把架构治理从「周期性审议」改成「漂移分超阈即触发」。

2026-10-08
togaf-admagentic-governancegovernance-paradox+1
AIPA Day 117

面试三件套 I — agentic 系统设计八域白板与 customer roleplay

staff 级面试的打分重心在 trade-off 段与真实 failure,不在画框图——讲踩过的坑比讲完美系统加分,roleplay 是协作设计不是辩论赛。

2026-10-09
agentic-system-designinterviewcustomer-roleplay
AIPA Day 118

面试三件套 II — 作品集三件套改写与 45min POC 演练

招聘经理 5 分钟看 demo 和数字不看笔记数——能跑的系统加三个数字胜过三百页文档,POC 留 10 分钟写 golden 跑数字是最高 ROI。

2026-10-10
portfoliothree-piece-narrativepoc-demo
AIPA Day 119

主动出击 + 三层投递 + JD-能力映射 + 阶段末 SOTA 复查

投「我已解决你一个真问题+可跑 demo+数字」而非「我想申请」,转化率高一个量级;eval 框架设计是 LangChain SA 的显式职责,也是 L1 的隐藏护城河。

2026-10-11
three-tier-applicationjd-mappingproactive-outreach
AIPA Day 120

收官日 — 知识图谱、能力验证对照与 Q4 移交清单

120 天的价值不在笔记数,在依赖图的连通性——能从 Phase 1 的 judge κ 一路讲到 L1 JD 命中点;收官不是终点,是把活变量交接给未来自己的检查点。

2026-10-12
capstoneknowledge-graphhandover