AIPA Notes
AI产品×架构 120天融合计划 — AI Solutions Architect 主轴:evals/可观测/AML Copilot/自建 Agent 平台
按 P1 → P2 → P3 → P4 顺序由浅入深;每篇开头有「今日导引(学习定位)」、结尾有「衔接 昨天→今天→明天」,可顺着学习路径连续阅读。
120天 AIPA 融合计划
120 篇 AIPA 学习笔记
P1 产品定义×评测×可观测底座
Day 1-28 · 28 篇AML Copilot 产品发现与 JTBD
作品②的每项架构决策都得回答「哪个用户 job、哪个 eval 指标需要它」——所以第一天不写代码,先用数字和 JTBD 把问题钉死。
AML×AI 竞品格局 2026
复刻 FIS-Anthropic 的稀缺性只存在于 GA 前的时间窗——没人公开过带 eval 数字与 $/案件 的端到端架构解剖,这正是 AISA 作品集的空位。
一页纸 PRD 与 evals 即成功指标
AI 产品里「质量」的定义就是产品定义——evals 不是先选指标后测量,而是从真实失败归纳出来、低于门槛就阻断 merge。
洗钱类型学与合成数据生成器设计
真实 AML 数据被保密与隐私锁死,eval 的地基只能自己造——一个带金标 ground truth、噪声注入、seed 可重放的案件级合成生成器。
SAR 叙述结构与 HITL 复核设计
SAR 是法律文书、幻觉即合规事故——AI 出草稿、人改人签,HITL 既是质量手段也是 Article 50 的合规手段。
W1 原型实现复盘 — 契约先行与诚实标注
把诚实从「上线前补丁」前移成编译期类型与测试不变量,让规则基线成为 LLM 必须打败的对手。
W1 周总结 — 尺子先于引擎
在写任何 LLM 代码前,PRD、金标、规则基线、诚实标注就能先就位——这就是「尺子先于引擎」。
agent-v2 真实 traces 导出与采样
随机抽 100 条会漏长尾失败,分层采样故意过采样高失败层来「发现」,再加权回插估「真实率」——两者口径绝不能混用。
开放编码 open coding
先立指标=污染数据源——开放编码必须悬置预设、自由文本先于标签、只记 first failure,且不可外包给 LLM。
轴向编码 axial coding
频次最高≠最该修——监管场景下严重度主导优先级,类数应由「每类能否挂一个可执行 eval」倒推。
failure taxonomy 定稿
失败分类法的可用性不在「定义写得好」,而在每对易混类都有边界判例 + 一棵短路返回的决策树,让归类可复现、并反向锚定每类该用代码还是 judge。
金标定向补难例 —— 用信息增益指导数据集扩充
eval 的判别力来自决策边界附近的难例而非数量——盲目扩易例只压缩动态范围,20-30 个定向难例抵 300+ 易例,且标签必须取真实意图、绝不能用规则判定结果。
taxonomy → eval 映射 —— 每条失败该交给哪种评测
taxonomy 说清了系统会在哪犯错,但每类错该用什么抓需要一张路由表——先穷尽近零成本的代码型断言,judge 只留给会反复迭代的主观质量且必须先用人工标注校准 TPR/TNR。
W2 周总结 —— 错误分析方法论的因果闭环与偏差登记
周总结不是流水账,而是验证因果链是否闭合、偏差是否登记量化、基准能否冻结——合成数据的漂亮 recall/FPR 必须带「synthetic, not production-validated」口径,单编码者 κ 未验证须诚实暴露。
代码型检查 evals — 评测金字塔的确定性底座
代码型检查是评测金字塔的确定性底座——零方差、近零成本、能在 judge 触发前拦掉 30%-60% 失败;把 judge 放底座是反模式,但全绿只证明结构对而非内容对。
LLM-as-judge 四段式 rubric — judge prompt 结构与刻度选择
代码断言不了的语义质量归 judge,而 judge 要稳,靠的是「角色+rubric+锚定示例+结构化输出」四段,加上「能二元就二元」的刻度纪律
judge 校准与一致率 — Cohen's kappa 与校准闭环
90% 的裸一致率可能对应 κ=0 的零鉴别力 judge,必须用 κ 扣掉随机一致,judge 准入门设在 κ≥0.6(substantial)
人工抽检协议 — 抽检率、漏检概率与升级路径
自动化只能做规模化粗筛,SAR 可提交性等合规红线必须人工兜底;抽检是逮系统性缺陷的统计哨兵,而非全量复核
阻断式 CI eval gate — 让"尺子"挡住 merge
eval gate 的目标不是最严,而是「零假阳前提下尽量敏感」——靠统计显著性 + 滚动 7 天基线,把假阳率压到团队愿意一直开着它的水平
agent-lab evals 面板 — 把"尺子"做成可演示装置
无后端不是缺陷而是诚信护栏——确定性纯函数让面板展示的就是 CI 里挡 merge 的同一个数字,消灭「demo 用好数据、CI 用真数据」的双口径造假
W3 周总结 — 三类 eval 齐备,尺子刻度成形
三类 eval 不是三选一,而是按成本递增串联的三道滤网——deterministic 在 CI fail-fast、rubric 只查语义、composite 压成生产健康分。
OTel GenAI semconv 精读
一套标准属性名(gen_ai.*)让换厂商不重写仪表盘,但 semconv 仍是 experimental——改名爆炸半径远大于埋点本身,必须靠映射层隔离。
独立属性映射层
防腐层的价值只在变更那一刻兑现——业务/eval/告警全用自有字段说话,semconv 改名时把爆炸半径从 N 处收敛到 1 处。
埋点接入全链路
一条调查链全链路 span 化 + 共享 execution_id,把「指标退化」和「现场证据」焊死,一眼定位卡在检索还是生成、花了多少钱。
Langfuse 自托管
trace 是分析负载不是日志——高吞吐写+聚合读要列存;金融 PII 的数据驻留是硬约束,用「多担运维」换「数据不出门」。
失败归因面板 — 工具失败 / 模型幻觉 / 上下文污染三分
被标为「幻觉」的失败多半是上下文污染或检索 miss——归因桶要按修复路径(工具/模型/上下文)分,而非按症状分。
缓冲 + 长文#1 定稿 + P1 主线 SOTA 复查
满分 = 口径一致性而非性能;复查的产出不是「资料还在」,而是「设计要不要改」。
P1 阶段总结 — 尺子先于引擎,证据先于声明
在写任何 LLM 代码之前,尺子(PRD/金标/规则基线/三类 evals/CI 门/tracing/归因)可以先就位——这是 2026 的工程事实标准。
P2 AI-native 参考架构
Day 29-63 · 35 篇Anthropic orchestrator-worker 精读 — +90.2% 背后的 15× token 与超线性
多 agent 是「token 投递机制」而非「智能放大器」——质量与 token 在「单窗口装不下」的任务上是台阶跃迁,不是线性。
handoff vs orchestrator-worker — 控制权转移的两种语义
「该谁来接这个对话」用 handoff,「怎么把活拆开并行再合起来」用 orchestrator——handoff 省的那点 token 是用「无法做综合型任务」换来的。
单 agent vs 多 agent 的证据核查 — pass^k、HAL 与 64% 的出处
多 agent 的优势高度条件化——只有「广度可分解且超单窗/上下文退化」才赢,等 token 预算下单 agent 在多跳推理上不输甚至更优。
token economics 决策框架 — 15× 成本何时换得回 +90.2%
决定要不要多 agent 的不是「能涨几个点准确率」,而是任务「做错的代价」(V+L)——AML 因漏报损失 L 极大,门槛低到约 0.29%,而模型分级+缓存把真实溢价从 3.75× 压到 1.43×。
ADR#1 — 本项目为什么(暂)不上多 agent
AML 单案调查落在「shared context、无超窗、强一致」象限,三条证据共指不该上多 agent——主路径定为单 agent,多 agent 代码降级为 /agent-lab 教学装置,沉没成本不是论据。
LangGraph 1.0 checkpointing 接入 — 节点级恢复与静态站现实
resume 重跑的是整个节点而非 interrupt 的下一行——副作用必须幂等否则重复扣费/写库;而静态站无后端的约束反而逼你手写 checkpointer,从「会用框架」变成「懂框架机制」。
W5 周总结 — 编排半周方法论、checkpoint 验收与 token 经济学框架
架构决策的质量取决于「区分对了什么」而非「选了什么」——划对「广度并行 vs 单一深推」「super-step 存档 vs 行级存档」的区分轴,单/多 agent 和幂等纪律都是推论;成本框架的价值在「设对硬上限」防尾部失控,不在压低均值。
checkpoint 断点续跑 — 难点不在保存,在幂等重放
断点续跑真正的难点不在保存状态,而在重放时不重复产生副作用——引擎只保证「至少跑到」,「不重复扣款/不重复上报 SAR」是你用幂等键还的债。
HITL 审批点持久化 — interrupt 节点与跨会话恢复
审批等待是小时/天级、进程存活是分钟级——靠 interrupt 抛异常序列化状态、释放进程,再用 thread_id 持久游标跨会话恢复;而 resume 会重跑节点开头,所以前置副作用必须复用 Day 36 的幂等纪律。
time-travel 调试 — 「重放」不等于「重现」
「重放」不等于「重现」——LangGraph 式 state-replay 会重新执行非确定性 LLM 调用,故障当场消失;要 debug「那一次为什么错」必须用 record/replay 回灌录制响应,连系统时钟都要拦。
durable execution 三方案取舍 — 宏观工作流 / 微观推理 / 事件溯源
三方案是分层不是三选一——把非确定 LLM 推理关进 LangGraph、让 Temporal 在外层只看「成/败」;在浏览器 demo 阶段引 Temporal 是负 ROI,自建轻量事件溯源层但接口对齐二者语义以备迁移。
context engineering — JIT 检索与 context rot
上下文不是越多越好而是越精越好——effective context 远小于 advertised window,塞进的语义近似干扰项是负资产;用 JIT 检索只载相关片段、只在「高频×稳定×小」时才预载。
agentic 自适应检索 — 查询改写、多跳与防重复
检索从「单次 top-k」进化为「改写→多跳→充分性判定」的有界循环,防重复的治本不是 id 去重而是用已确认证据把每跳推向未覆盖的信息空间。
W6 周总结 — durable execution × context engineering 收口
从「demo 能跑」到「生产能信」缺的是持久化执行与上下文工程两块地基,而两者的 SOTA 共识都是「按代价分级,不按能力铺满」。
自托管 AI gateway — LiteLLM/Bifrost/Portkey 与统一接入层
AI gateway 是 LLM 调用的控制平面,价值不在省 SDK 而在把预算/韧性/密钥/可观测这些横切关注点从 N 个 agent 里抽出来收敛到一处。
MCP 2026-07-28 最终规范精读 — 无状态核心如何重写会话语义
stateless core 不只是删掉一个 session header,而是抽空了「会话」这个抽象本身——可扩展性的代价永远是把隐式状态外置、显式编码进每个请求。
语义缓存实测 — 双层判定、命中率真相与假阳的代价
语义缓存的真问题不是省钱而是正确性——错命中带满分置信与 200 OK 静默退化,合规路径只能缓存只读科普、绝不缓存触发动作或判定结论。
gateway 治理 — 路由策略、fallback 链、预算闸与意图感知路由
路由决定请求发给谁、fallback 决定挂了怎么办、预算闸决定超支怎么拦——三者是 agent 生产里「成本可持续 + 不间断服务」的底座。
成本×延迟×质量 Pareto 面板 — 没有最优模型,只有前沿上的取舍
没有最优模型,只有前沿上的取舍——成本、延迟、质量三轴互相打架,1000× 价差只换 8 分质量、同质同价延迟可差 8 倍。
gateway 实测报告 — 把 Day 47 的前沿填上真数字
缓存降本不是免费的——一条「相似但不对」的缓存 SAR 比慢一秒严重一万倍,所以 SAR 叙述步必须禁缓存,缓存只用在无事实负载的段落。
EU AI Act Article 50 生效 — SAR 标注、Omnibus 推迟与 HITL 豁免同构
HITL 不只是产品 UX,它是 Article 50(4) 编辑责任豁免的法律触发器——人工复核加自然人担责是合规架构的承重墙,改全自动就捅破豁免。
MCP server 构建 I — 把 agent-v2 检索封装成无状态 MCP server
把检索封装成 MCP server 最难的不是写工具,是彻底戒掉服务端状态——上下文全进 arguments 与 _meta,server 纯函数化,预算/重试留给调用方。
MCP server 构建 II — Tasks 异步长任务 + OAuth 鉴权
stateless 世界里 task handle 就是状态载体也是敏感凭证,而 MCP 鉴权最危险的洞不是「没鉴权」而是「鉴权了却没校验 audience」。
MCPTox 式红队 I — 工具描述即注入面
工具的 description 字段会被直接拼进模型上下文当「说明书」读,纯文本即可投毒,且越听话的强模型 ASR 反而越高——安全不能指望模型自己不上当。
agent 风控网关 v1 — 把支付风控三段式搬到 MCP 调用链
写在 prompt 或工具描述里的安全约束都只是「建议」,真正的强制必须放在模型推理之外、不可绕过的确定性网关上——而最该拦的是「合法工具的非常规组合」。
红队 II — 拦截后对比与绕过归因
只重跑原 payload 会把「表面拦截」误报成「根因修复」,而拦得越严反而把攻击者逼向合法路径——正解是 defense-in-depth + 风险分级,绕过归因要打到缺陷层不打到关键词。
A2A 协议精读 — Agent Card、任务委托与长任务生命周期
跨组织协作真正难的不是接口描述而是信任的传递性——签名 Agent Card 把信任从预配白名单变成可验证凭证链;长任务的难点也不是「等」而是「可中断+可恢复」,client 不能把上下文揣在内存里。
长文#2 定稿《红队一个 MCP server》+ W8 周总结
红队报告的说服力与 ASR 数字漂亮程度负相关、与残余风险披露完整度正相关;安全是 AI-native 产品 PM 的一等判断力,不是合规清单。
框架对比基准 — 三固定原则与「对账异常调查」任务规范
框架对比最大的谎言是「我们测了框架」,其实测的是默认配置与作者调优时间;只有 prompt/模型/工具逐字符固定、用确定性可判分的合成 golden,跨框架数字才有因果解释力。
Vercel AI SDK 6 实现 — usage vs totalUsage 的成本陷阱与数据点#1
多步 agent 的成本不是「最后一次调用」而是「每步 input 的累加」(随步数近似二次增长),成本维度必须取 totalUsage;数据点#1 单独不下任何框架结论,它的价值是校准基准本身。
Claude Agent SDK 对比实现 — 谁拥有 loop,谁拥有 context
Claude Agent SDK 的「贴心默认」(preset 提示、自动 compaction、缓存折扣)在框架横评里全是污染源,必须主动「关掉聪明」;成本要分裸 token 与实付双口径报,混报就是 trade-off 矩阵的第一个雷。
四框架 trade-off 矩阵 + memory 厂商 benchmark 批判(ATAM 式 I)
四框架是工具箱不是竞品——选型是任务-框架匹配;memory benchmark 的可怕不在数字假,而在「同产品换个配置就从 49 跳到 94」,所以选型要靠 ATAM 比架构契合,不靠排名。
memory 厂商批判评审定稿 — 用 ATAM 砸碎 benchmark 排名
选 agent 记忆要看架构与任务的契合度(AML 强时间维 + 审计回放),而非 benchmark 排名——排名量的是平均任务,你的任务不是平均任务。
长文#3 定稿 — 四框架 trade-off:同一桩 AML 调查,谁来编排?
最强的框架不等于最该选的框架——语言生态先砍掉一半选项,再用 Temporal(macro durable)+ Vercel AI SDK 6(micro 推理)分层组合,而非一个框架硬扛。
P2 阶段总结 — 参考架构落地,部件齐而引擎待接
agent 架构的难不在调一次 LLM,而在 durability/成本/安全/可审计这些横切关注点——它们是确定性工程,可在零 LLM 推理下先把护栏前置成设计物证。
P3 AML 调查 Copilot
Day 64-98 · 35 篇证据汇集 pipeline 架构设计 — 五段流程的接口契约与失败隔离
AML 流水线是固定五段、顺序由合规写死,复用 P2 dispatch 的 Budget 断言机制但不要它的 LLM 自由编排——否则审计时答不出「为何跳过某段」。
证据汇集 — RRF 多源检索与召回优先
金融调查里「漏证据」比「多证据」代价大几个数量级——①段刻意 over-retrieve 把召回拉满,精排推到下游确定性规则引擎,因为检索漏召回是静默不可观测的。
dispatch + Budget 单案成本控制 — 子任务调度与超限降级
成本闸的价值不在均值在截断长尾——闸必须在 agent 代码之外、在花下一笔钱之前,超限时退回 P1 零成本规则路径而非抛异常。
类型学比对引擎升级 I — structuring/layering 的阈值、可解释与证据对齐
检测阈值必须严于且低于监管申报阈值(洗钱者知阈值并贴线),layering 的可疑度在资金流图的边上而非单点上——这是确定性规则相对 LLM 不可替代的可审计优势。
类型学升级 II — mule network 图比对与叠加命中仲裁
钱骡网络的信号在账户间的图拓扑里而非任何单账户属性里;叠加命中时类型学是一条资金链的多阶段而非概率竞争,定性该按资金最终去向而非分最高。
金标扩集 ≥100 — 难例不是堆数量,是造区分度
金标的价值不在案件总数,在「能让候选系统分出高下的高方差难例」占比——满分金标是 bug 不是 feature,扩集的目的是造区分度而非堆样本量。
W10 周总结 — 金标扩集后,基线第一次掉分
W10 要的不是基线没掉分,是基线在该掉的地方(mule HARD 档)精确掉分、在不该掉的地方(structuring EASY 档)稳住——掉对位置才是金标有判别力的硬证据。
SAR 规则模板基线 — 先建「愚蠢但确定」的对照系
规则模板的价值恰恰在于它笨——笨得确定、可复现、永不幻觉,它是 LLM 必须打败的对照组,没有它 LLM 的「好」就没有参照系。
SAR 叙述 LLM 化 I — 引用锚点与闭世界幻觉防护
模型负责流畅,确定性闸门负责真实——把残余幻觉降到合规可接受不能靠「换更强的模型」,只能靠确定性验证加拒绝出文。
SAR LLM vs 模板对照评测 — LLM 必须打败基线才配上线
可读性赢了不等于该上线——SAR 是法律文书,可读性高分不能赎买事实忠实的缺陷,必须分维度设硬门而非加权总分。
审计轨迹 I — 全链路 OTel 与"案件 ID 贯穿"四段 span
审计 trace 是给数年后的监管者写的,不是给现在的工程师调试用的——业务语义属性比性能属性重要,且必须长期持久、不可篡改。
审计轨迹 II — 不可篡改:哈希链、监管要件与落盘
审计轨迹是和鉴权、加密同级的合规架构组件,不是日志——它的举证方向相反,必须在「对家假设我们会作弊」的前提下仍能用密码学自证清白。
每日 evals 防退化固化 — daily runner、退化告警与 CI gate
eval 不是「写出来」就落地,要「定时自动跑 + 退化即阻断」才算数——三角不可能逼你把廉价/快/统计显著拆到不同层。
W11 周总结 — SAR LLM 对照定稿、failure taxonomy v2、审计 trail 完成
本周最有价值的不是「LLM 把 SAR 写得更流畅」,而是「用对照实验量出了 LLM 在合规文本上的代价边界」——起草变易、复核变难,最危险的是语气越权。
Agent UX 模式选型 — 七模式与金融 HITL 的适配,以及"信任决定模式"的反直觉
UX 模式集是用户信任度的函数、不是功能集的函数——同一个 Agent,给资深和新手调查员该呈现的模式不同,所以按信任曲线分阶段开放而非上满 12 模式。
plan-and-execute 预览实装 — 冻结计划、执行前授权与成本预估
plan-and-execute 的最大价值不在省钱而在「锁控制流」——冻结的工具调用序列让 prompt 注入改不了调用哪些工具;且 SAR 是输出密集型,预估漏算输出 token 比漏算输入危险得多。
置信度信号实装 — 类型学命中与 SAR 字段级置信度,judge 分到三档信号的映射
显示校准过的不确定性(含「我不确定」)比隐藏它更能建立信任;但未校准的置信度会主动误导用户、比不显示更糟——所以信号合法性建立在 Day 17 的 κ 校准之上。
渐进式授权实装 — 分级授权决策树、复用 P2 风控网关、授权决策写审计轨迹
渐进式授权的「渐进」是 deny-by-default 的收紧再松绑,而非先宽后收——信任度只松得动中风险,永远封不了高风险的同步人审顶。
结构化错误恢复实装 — 让用户保持控制,而非自动重试
好的错误恢复不是悄悄自动重试到成功,而是让用户始终知道发生了什么、能随时夺回控制权——在 AML 里无声自动重试比会报错停下危险得多。
HITL × durable execution 打通 — 审批等待是一种「对时钟的中断」
审批等待与定时等待在 durable execution 里是同一个 interrupt——超时不是要额外造的机制,难的是决定超时默认值朝「拒」那边倒,且把它钉成不可配置的代码硬约束。
W12 周总结 — Agent UX 模式库定稿,以及「金融特化」如何重写每一个通用模式
通用 Agent UX 模式是「词汇表」、金融合规是「语法」——本周真正的产出不是 6 个模式清单(借来的),而是能把任意模式翻译成受监管版本的 G1/G2/G3 三条改写规则和模式依赖偏序。
SAR 质量 rubric — 四维 LLM-judge 评分锚定 taxonomy,与 Fiserv/FIS GA 对照
SAR 质量 rubric 不该照搬 FinCEN 5W1H——那是「内容清单」不是「评分维度」,照搬会让 judge 在强相关维度上重复打分、抬方差压 κ;四维根因正交才打得稳、可独立修。
SAR eval suite — judge×人工抽检的分层校准,与「LLM 模拟用户不可靠」的红线
judge 给的分必须经 κ 校准才可信,且人工抽检要分层投向信息量最大的样本,而非随机抽 10%——监管语言维更要由人工最终拍板,绝不用 LLM 模拟标注者。
AML 对抗红队 — 证据文本里的注入面,与 SAR 诱导遗漏
AML 最危险的注入不在外部网页,而在被调查者自己填的交易备注里——你越忠实引用证据越忠实执行攻击,防线只能是剥夺 LLM 对证据集的决定权,而非指望它更聪明。
v1.0 发布工程 — Article 50 透明标注落地点、脱敏演示集与发布检查清单
透明标注不是「打个 AI 水印」就完事,而是分款、分时机(首屏首次曝光)、分可达性(无障碍 aria/对比度)的多点义务;合规的可信度来自可被独立验证,不来自声明。
Copilot v1.0 发布 + 每案件单位成本 — $/案件如何成为定价基础而非事后核算
最便宜的 token 不等于最便宜的案件——单位成本的分母(成功率)比分子(token 单价)更值得优化,而 $/案件 是 agent 产品的定价基础,不是事后核算的财务指标。
长文#4 旗舰初稿 —《复刻 FIS-Anthropic:我从零做了一个 AML 调查 agent》
复刻一个还没 GA 的巨头方向是优势不是冒昧——价值峰值落在「方向已被验证、方案尚未 GA」的窗口内,而 failure war stories 比 success metrics 更难造假、更有说服力。
W13 周总结 + 长文#4 发布 — v1.0 交付复盘与「认证的价值边界」
作品是主资产、认证是边界明确的保底过滤器——三态混淆和主辅倒置是简历上最隐蔽的两个自杀动作。
AI Act 映射 I — Articles 9-12 落到 audit log / model registry / 数据血缘
风险管理不是一份年审文档,而是「识别→测→缓解→回流」的持续闭环——合规要求和好工程同构,evals 闭环天然满足 Article 9。
AI Act 映射 II — Articles 13-15 落到 HITL gateway / eval suite / 红队
分析师 100% 同意 AI 不是质量证明,而是 Article 14 意义上的监督失败信号——override 率是监督「meaningful」与否的审计指标。
DORA/CRD 叠加 — 模型供应商是关键 ICT 第三方,韧性接 durable execution
换个模型 API 不是一行配置改动,而是一次合规事件——模型/云供应商在 DORA 眼里是受监管的关键 ICT 第三方,断点续跑是法定的运营韧性承重组件。
美国线 + 治理底座 — SR 11-7 三道防线 / NIST AI RMF / ISO 42001 落到自家组件
一份 2011 年的 SR 11-7 早已涵盖 LLM、examiner 现在就在用它查 AI——黑盒不可解释不是免责借口,而是必须用独立 evals + 证据链补的验证缺口。
C4 合规架构图 — 把法条画成着色组件,长文#5 初稿开骨架
合规不是附在架构旁的 checklist,它本身就是 C4 Component 图的一个着色视图——红色缺口组件比全绿更能证明架构判断力
AML Copilot AI PRD 定稿 — 组装而非新写,附定价模型与长文#5 发布
AI PRD 与传统 PRD 的根本差异不是多几节,而是验收范式从二元判定翻转成概率分布断言——且 HITL 既是合规豁免触发器,也是该按 per-case 收费的分界线
P3 阶段总结 — 旗舰交付清单、SOTA 重审与 P4 开工预查
阶段末「主线没过时」本身需要当日检索的证据而非默认;v1.0 的可信度不在全绿,而在两个 🔴 缺口红得清楚、能解释为什么
P4 自建 Agent 平台×求职冲刺
Day 99-120 · 22 篇平台化开工 — Agent 平台五件套的组件边界设计
自建 Agent 平台的价值不在替代 AgentCore,而在逼自己讲清每个托管组件为什么必须存在——边界讲清远胜功能写全
工具网关 I — 工具注册表
把函数变 agent 工具最该补的不是入参 schema,而是 outputSchema——合规场景下输出比输入更需校验,否则 SAR 草稿会接地到坏数据;且 list 给治理看、search 才给 LLM 用
工具网关 II — 鉴权层
agent 鉴权的首要价值是收窄 prompt injection 的爆炸半径——沿主体/客体/时间三维同时切窄权限,让单点失陷损失可控。
工具网关 III — 调用审计 + 网关合龙
审计字段由「能否重建行为链」倒推而非「记多少算多」决定,且审计系统对被审计的 agent 自身也是零信任——只能 append,不能读删。
策略引擎 I — 声明式规则 (principal/action/resource/condition 四元组)
策略必须在 LLM 推理之外做确定性数据驱动评估——被监管对象不能自我执行约束,forbid-wins 给监管红线不被宽 permit 误开的结构性保证。
策略引擎 II — 事中拦截 (每次工具调用过判定 · allow/deny/escalate→HITL)
escalate 是与 deny 正交的第三态——冻结 agent、移交人类,绝非「deny+重试」;拦截的可信度上限取决于审计的不可篡改性,而非判定的正确性。
Agent 注册表 + AgentCore 计费拆解 + W15 周总结
Agent 热更新的安全前提是「不可变版本 + 原子指针切换」而非就地改配置;纯消耗计费的真成本藏在 idle 内存与无上限可观测性,对长 HITL 合规场景反而可能更贵。
多会话运行时 I — 会话隔离与上下文不泄漏
会话隔离是三层递进——逻辑命名空间、内存别名、执行环境,功能测试全绿照样可能在 KV-cache 侧信道漏,所以「功能正确 ≠ 安全隔离」。
多会话运行时 II — durable 会话与跨会话恢复
durable 会话要把「短期对话历史(Sessions/checkpoint)」与「长期提炼记忆(Memory Bank/facts)」分两层存,全量回灌 transcript 会触发 context rot;且「可恢复」放大并发面,必须配版本号乐观锁。
计量计费与预算强制 — 三家定价与 TCO 输入
硬拒绝会让已花掉的钱全打水漂,所以超限要分级降级(opus→haiku 省约 19×、保收尾);token 占总成本 10-100×,三家 vCPU 单价差只是 0.06% 噪声,省钱在模型路由而非换平台。
平台管理面板 + 8 维选型矩阵
选型没有全维最优的平台,第一性原理是「身份和数据已经在哪朵云」而非「谁最强」——硬约束(身份/数据/合规)先剪枝、软偏好(M365/定价/eval)再 tie-breaker,定价排最后。
自建平台 v1 合龙 + build-vs-buy TCO — 自建省的 API 费常被运维人力吃掉,但合规场景仍值
平台正确性不是各组件正确性的并集而是契约的交集(合龙的 bug 全在接缝);自建省的 API 费常被运维人力(占 TCO 25-30%)整条吃掉,所以默认 buy,唯有数据驻留/HIPAA/air-gapped 才让合规压倒成本。
长文#6 初稿 — build-vs-buy 解剖:我自建的每个零件,托管平台收你哪一层的钱
自建的真正回报不是省钱,而是获得「逐层拆解托管平台在卖什么、哪层该买哪层该建」的判断力。
长文#6 定稿 + W16 周总结 — build/buy 的线,不在你和厂商之间,在你自己技术栈的每一层
build/buy 的线不在你和厂商之间,而是穿过你自己的技术栈——每一层各跑一遍决策树,而非对整个平台投一票。
金融私有化部署方案 — 数据敏感度→断网要求→GPU 资源的三问决策树
「数据驻留」不等于「数据断网」——把前者当后者做,方案成本直接翻 3–5 倍,先确认在哪一档再报价。
售前方案书 — KYC 审核 AI 改造的 TCO/ROI 与 POC 门禁
售前方案的杀手是 ROI 数字而非架构图——80% 打磨精力该投在回收期那两页,POC 合同里写可量化 gate 而非功能清单。
长文#7 — spec-driven 下的多 coding agent 工作方式
spec 是被 agent 执行而非被人参考的可执行制品,所以不会 rot;多 agent 的瓶颈不是模型能力,而是依赖图与验收闸的设计质量。
长文#8 — TOGAF ADM × agentic AI 的治理悖论
治理 agent 不是治理模型,治理接口与边界不是治理实现——把架构治理从「周期性审议」改成「漂移分超阈即触发」。
面试三件套 I — agentic 系统设计八域白板与 customer roleplay
staff 级面试的打分重心在 trade-off 段与真实 failure,不在画框图——讲踩过的坑比讲完美系统加分,roleplay 是协作设计不是辩论赛。
面试三件套 II — 作品集三件套改写与 45min POC 演练
招聘经理 5 分钟看 demo 和数字不看笔记数——能跑的系统加三个数字胜过三百页文档,POC 留 10 分钟写 golden 跑数字是最高 ROI。
主动出击 + 三层投递 + JD-能力映射 + 阶段末 SOTA 复查
投「我已解决你一个真问题+可跑 demo+数字」而非「我想申请」,转化率高一个量级;eval 框架设计是 LangChain SA 的显式职责,也是 L1 的隐藏护城河。
收官日 — 知识图谱、能力验证对照与 Q4 移交清单
120 天的价值不在笔记数,在依赖图的连通性——能从 Phase 1 的 judge κ 一路讲到 L1 JD 命中点;收官不是终点,是把活变量交接给未来自己的检查点。