返回 Papers
AI 扩展计划 / Playbooks

AI Architecture Review Gate Checklists

AI 架构评审不能只看模型、API 和一张系统图。它要证明一个概率型能力可以被插入业务流程,并且在数据、知识、权限、工具、评估、人类控制、运维、成本和价值上保持可管理。本文把 AI 架构评审拆成从 intake 到季度复审的门禁体系,适合金融零售企业中的客服、信贷、支付、反欺诈、反洗钱、财富合规和内部知识工作场景。

432AI_ARCHITECTURE_REVIEW_GATE_CHECKLISTS.md

AI Architecture Review Gate Checklists

AI 架构评审不能只看模型、API 和一张系统图。它要证明一个概率型能力可以被插入业务流程,并且在数据、知识、权限、工具、评估、人类控制、运维、成本和价值上保持可管理。本文把 AI 架构评审拆成从 intake 到季度复审的门禁体系,适合金融零售企业中的客服、信贷、支付、反欺诈、反洗钱、财富合规和内部知识工作场景。


1. Source Anchors

AnchorLink在评审中的用法
NIST AI RMFhttps://www.nist.gov/itl/ai-risk-management-framework用 Govern / Map / Measure / Manage 组织风险识别、评估、监控和治理。
NIST AI RMF Generative AI Profilehttps://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence用于 hallucination、data leakage、misuse、synthetic content、evaluation 等 GenAI 风险。
EU AI Acthttps://eur-lex.europa.eu/eli/reg/2024/1689/oj/eng用 risk-based lens 识别高风险场景、透明度、人类监督和技术文档需求。
ISO/IEC 42001https://www.iso.org/standard/81230.html用 AI management system 思路评审责任、生命周期和持续改进。
OWASP LLM Top 10https://owasp.org/www-project-top-10-for-large-language-model-applications/评审提示注入、敏感信息披露、过度代理、不安全输出处理等。
TOGAFhttps://www.opengroup.org/togaf用架构治理、能力规划、路线图和 architecture board 语言组织评审。
C4 Modelhttps://c4model.com/用 context、container、component 让系统边界可讨论。
BIANhttps://bian.org/deliverables/service-landscape/用银行服务域评审金融零售能力边界和系统集成。

2. 为什么 AI 架构评审必须分 Gate

传统架构评审关注服务边界、数据库、API、安全、部署、可用性和成本。AI 系统还要评审:

AI-specific concern评审问题
Business fit业务问题是否真的适合 AI,还是流程、规则、报表或培训更合适?
Workflow insertionAI 在 read、summarize、recommend、draft、decide、act 哪个环节介入?
Data and knowledge模型能否访问正确、合法、当前有效、按权限可见的事实?
Grounding输出是否能引用证据,引用是否真的支持结论?
Tool authority工具调用是否可能越权,是否有审批、幂等和回滚?
Evaluationeval 是否覆盖真实失败模式,而不是只看平均分?
Change controlprompt、model、index、policy、tool 变更是否触发回归?
Human oversight高风险输出是否进入清晰的人类复核和责任链?
Adoption用户是否真的改变工作方式,还是只打开过工具?
Operations上线后谁维护知识库、eval、policy、incident 和成本?

门禁把风险前移:

Idea
  -> Intake Gate
  -> Business Fit Gate
  -> Data and Knowledge Gate
  -> AI Pattern Gate
  -> Architecture Gate
  -> Eval and Risk Gate
  -> Pilot Gate
  -> Release Gate
  -> Scale Gate
  -> Quarterly Review

3. Gate 总览

Gate主要问题决策结果核心证据
G0 Intake这个 use case 是否值得进入 discoveryaccept / park / rejectopportunity brief
G1 Business Fit业务问题、用户、流程、价值是否清楚continue / refine / stopopportunity canvas、workflow、stakeholder map
G2 Data and Knowledge数据、知识、权限、质量是否足够ready / conditional / blockedsource inventory、data readiness pack
G3 AI Pattern应该用 RAG、workflow、agent、fine-tuning、rules 还是 vendorarchitecture directionADR、decision matrix
G4 Architecture系统边界、集成、控制、可观测是否合理approve / reviseC4、data flow、sequence、threat model
G5 Eval and Risk需求是否可测,风险是否可控approve pilot / reviserequirements-to-eval、control pack
G6 Pilot是否可以小范围试点launch pilot / no-gopilot plan、success criteria、rollback
G7 Release是否可以生产发布release / limited release / no-goeval report、runbook、RACI
G8 Scale是否可以扩展到更多用户或流程scale / hold / reworkadoption dashboard、ROI、risk review
G9 Quarterly Review这个 AI capability 是否仍有效continue / refresh / retirequality trend、cost、risk、feedback

4. G0 Intake Gate

Intake gate 用于阻止“领导想看 demo”直接变成项目。

必须回答:

QuestionEvidence
谁提出需求,谁拥有业务结果sponsor、business owner
当前痛点是什么baseline signal、volume、quality、risk evidence
影响哪些用户和流程workflow and user segments
为什么不用规则、报表、流程优化或培训no-AI alternative
是否涉及客户权益、信贷、隐私、合规或高风险决策initial risk tier
是否有 owner 愿意参与 discoverynamed owner

Decision:

Decision条件
Accept discovery有明确业务问题、owner、初步价值和风险边界
Park价值不清但方向可能有潜力
Reject无 owner、风险过高、明显可用非 AI 方案解决

Red flags:

Red flagWhy it matters
只说“做 AI”,不说业务问题无法定义 outcome 和评估
涉及高风险流程却先做公开 demo控制、权限和客户影响失控
没有流程 owner后续 adoption 和价值无法兑现
成功标准是“模型能回答”不是生产标准

5. G1 Business Fit Gate

Business fit gate 评审 AI 是否解决真实流程问题。

Checklist:

CheckExplanation
有 use case canvas定义问题、流程、用户、价值和风险
有 AS-IS / TO-BE workflow明确 AI 进入哪一步以及例外路径
有 pain metricscycle time、touch time、error rate、rework、backlog、cost
有 stakeholder map用户、经理、风险、合规、运营、技术、客户影响
区分 AI fit 与 no-AI boundary防止技术冲动
定义 first insertion pointread、summarize、recommend、draft、decide、act
识别高风险 decision boundary明确禁止自动化的决定
有 business owner 和 operating owner价值和运行责任明确

金融零售判断:

Use caseGood fitBad fit
AML copilotevidence aggregation、red-flag checklist、case narrative draftautomatic filing decision
Customer service RAGapproved knowledge retrieval、answer draft、citationunauthorized fee waiver commitment
Lending assistantmemo drafting、policy citation、missing document checklistmodel-owned credit decision

6. G2 Data and Knowledge Gate

AI 系统能否上线,很大程度取决于数据和知识是否可用、合法、可追溯、按权限可见。

Checklist:

CheckWhy
source of truth 列清楚防止向量库被误当权威来源
数据分类完成public、internal、confidential、PII、financial、special category
data owner 和 knowledge owner 明确支持变更、质量和审批
lineage 和 versioning 明确支持复现和审计
access control 和 entitlement filter防止越权检索
retention and logging policy控制 prompt、trace、embedding、summary 的记录风险
stale knowledge detection防止过期政策输出
prompt/log forbidden data防止敏感数据进入不可控日志

Required assets:

AssetContent
Data Readiness Packsources、quality、access、lineage、limits
Knowledge Source Inventoryowner、version、effective date、authority
Permission Modelrole、case、source、field-level rules
Data Flow Diagramdata movement、storage、vendor boundary
Freshness Planupdate cadence、re-index、regression trigger

Blocked conditions:

ConditionGate result
权限不清且可能暴露客户数据blocked
来源版本和生效日期不可追踪blocked or limited
供应商数据使用条款不清blocked until contract review
历史标签存在明显偏差但未评估conditional or blocked

7. G3 AI Pattern Gate

所有需求都用 chatbot、RAG 或 agent 是常见架构失败。Pattern gate 要先选结构,再谈模型。

NeedPreferAvoid
最新政策、引用、权限RAG + citation + metadatafine-tuning only
稳定分类、标签、路由classifier、rules、small modelfree-form generation
多步系统操作workflow orchestration + bounded agentautonomous open agent
高风险建议decision support + human reviewdirect automation
文档抽取OCR/document AI + validationpure chat prompt
风格或格式适配prompt baseline then tuning if justifiedfull training first
严格计算deterministic tool or rulesmodel arithmetic
低风险 FAQRAG/cache/fast modelexpensive reasoning model

Required decision records:

ADRMust explain
RAG vs long context vs tuning知识变化、上下文、成本和证据要求
Workflow vs agent自由度、工具、风险、可测性
Buy vs build vs hybrid供应商边界、数据、控制、成本
Model/provider choice质量、延迟、成本、区域、数据处理
Tool access boundaryallowlist、approval、rollback
Human review boundary哪些场景必须人审
Eval strategy数据集、方法、阈值和 owner

8. G4 Architecture Gate

Architecture gate 要证明系统可落地、可观测、可治理、可回滚。

Required diagrams:

DiagramMust answer
C4 Context系统和外部 actor、数据源、供应商边界
C4 Container应用、orchestrator、model gateway、retrieval、tool gateway、audit
Data Flow数据进入、处理、存储、日志、权限、跨境和保留
Sequence单次请求如何检索、调用模型、调用工具、校验、记录
Control Architecture高风险控制、人审、stop switch、fallback
Eval Architectureoffline eval、online checks、trace sampling、failed case 回流
Cost / Latency Model路由、缓存、工具、p95、预算

Architecture quality bar:

QuestionExpected answer
数据从哪里来source inventory and lineage
证据如何进入 promptretrieval filters and citation
模型如何被调用model gateway, route, version
工具如何被授权tool gateway, policy, approval
输出如何验证schema, policy, citation, safety checks
高风险如何升级risk trigger and human review
日志和审计在哪里audit writer and evidence store
线上如何监控telemetry, dashboard, alert
谁能回滚release owner and rollback path

Red flags:

Red flagWhy
UI 直接调用模型 API权限、日志和密钥控制不足
没有 tool permissionagent 越权风险
没有 audit log无法复盘、审计和处理投诉
没有 eval / monitoring质量不可控
所有错误都靠 prompt 防止控制层过薄
没有成本和延迟预算scale 后不可持续

9. G5 Eval and Risk Gate

Eval and risk gate 把需求转成可执行的上线证据。

Checklist:

CheckExplanation
有 Requirements-to-Eval Matrix关键需求都映射到评估
每条关键需求有 eval methoddeterministic、judge、expert、red-team 或 production sample
有 golden dataset包含 common、edge、missing-data、high-risk
有 severity levelscritical failure 独立阻断
有 release thresholds不只看平均分
有 red-team backlog覆盖 OWASP LLM 风险
有 human oversight designreview criteria、日志、override reason
有 incident response pathseverity、triage、stop、customer impact

Risk-tiered gate:

Risk tierExampleGate
Lowinternal product FAQautomated eval + sample review
Mediumcustomer service draftautomated eval + QA sampling + policy guardrail
HighAML, lending, wealth complianceexpert review + human oversight + audit + strict release gate
Criticalautonomous customer-impacting decisiongenerally no-go unless deterministic, authorized, governed

Minimum release thresholds:

GateSuggested threshold
Critical unsafe output0
Unauthorized action0
Unsupported factual claim in high-risk output0
Citation coverage for policy answersdefined by scenario, usually high
Expert acceptancethreshold by use case
Regression vs previous versionno critical regression
Cost / latencywithin workflow SLA

10. G6 Pilot Gate

Pilot gate 确认小范围试点可学习、可停止、可回滚。

AreaRequired decision
Scope用户、流程、数据、风险等级、流量比例
Metricsquality、safety、workflow、adoption、cost、risk
Stop rules触发暂停或回滚的质量、风险、成本、投诉条件
Supportoffice hour、L1/L2/L3、FAQ、known limitations
Trainingrole-based authorization and scenario training
Monitoringdaily/weekly review cadence
Feedbackstructured reason codes and issue routing

Pilot 不应只问“用户喜不喜欢”。它要回答:真实流程是否改变,质量是否可控,成本是否可接受,复核负担是否吞掉价值,用户是否知道何时信任和何时升级。


11. G7 Release Gate

Required evidence pack:

EvidencePurpose
Final architecture diagrams系统边界和控制清楚
ADR set关键架构选择可追溯
Data readiness sign-off数据和知识可用且受控
Eval report质量和风险可证明
Risk/control pack人审、权限、incident、residual risk
Security/privacy review技术和数据风险可接受
Operating model / RACI上线后责任清楚
Incident runbook出错后可处理
Release notes变更范围可见
User enablement用户知道边界和反馈路径
Monitoring dashboard生产行为可观察
Rollback plan能停止、降级或回滚

Release decision options:

DecisionMeaning
Full release符合质量、风险、运营和 adoption 条件
Limited release限定用户、流程、风险等级或输出类型
Shadow mode只观察,不影响真实流程
Internal-only仅内部辅助,不面向客户
No-go关键风险或证据不足

Final release questions:

  1. 如果模型今天出错,谁第一个知道?
  2. 如果供应商明天更新模型,谁跑回归?
  3. 如果知识库过期,谁负责修?
  4. 如果用户绕过流程,谁处理?
  5. 如果输出导致客户投诉,证据链在哪里?
  6. 如果成本翻倍,谁有权降级模型或关停功能?

12. G8 Scale Gate and G9 Quarterly Review

Scale gate 判断是否值得扩展到更多用户、产品线、区域或风险等级。

Scale evidenceQuestion
Business metricpilot 是否达到目标
Quality metric输出质量是否稳定
Risk trend是否无 critical incident,residual risk 是否可接受
Adoption目标用户是否持续使用并形成新工作方式
Operating modelmanager、QA、risk、support 是否承受得住
Cost forecast单位成本是否可控
Scope change新区域、产品和政策差异是否评估

Quarterly review 判断 capability 是否仍有效:

Review areaEvidence
Valuebusiness outcome, adoption, finance view
Qualityeval regression, QA, failed traces
Knowledgesource freshness, policy changes
Vendormodel/provider changes
Costrun-rate, unit cost, variance
Riskincidents, complaints, control gaps
Lifecyclecontinue, refresh, restrict, retire

13. Financial Retail Gate Profiles

Use caseGate emphasisNo-go triggers
AML copilothuman oversight、evidence citation、audit trail、typology coverage、prompt injectionunsupported claims、final filing suggestion、missing audit log、hidden evidence
KYC remediationdata quality、customer communication、jurisdiction policy、source-of-truth updateunauthorized document request、golden source update without approval、misstated legal requirement
Customer service RAGknowledge version、citation、no unauthorized promise、escalation、QA feedbackanswers without sources、outdated policy、fee waiver commitment
Payments exception agenttool permission、idempotency、approval before action、reconciliationrepair without approval、unlogged tool action、duplicate or irreversible action
Lending assistantdeterministic calculations、fair lending、reason codes、human decision ownermodel-owned credit decision、protected/proxy variables unreviewed、unsupported denial explanation

14. Review Board Pack

Before review, prepare:

SectionContent
Executive summarydecision requested, use case, risk tier
Scope and no-AI optionwhat is in scope, what is excluded
Process mapAS-IS, TO-BE, exception, control
Architecturecontext, container, data flow, sequence
Pattern ADRRAG, workflow, agent, rules, vendor choices
Requirements-to-Evalmatrix, dataset, thresholds, severity
Data readinesssources, permissions, freshness
Control packtool boundary, human oversight, incident
Threat modelsecurity and misuse risks
Cost / latency modelbudget and SLA
Operating modelowner, support, runbook
Pilot / release planscope, stop rule, rollback
Open risksrequested decisions and conditions

Review meeting should end with a decision, not a discussion summary: approve, approve with conditions, revise, park, or reject.


15. Ready and Done Definitions

StageReady means
Discoverybusiness owner exists, pain has evidence, risk tier roughly known, no-AI option considered
Architectureworkflow documented, data sources identified, AI boundaries defined, eval ideas exist
Pilotarchitecture approved, data readiness acceptable, eval and control drafted, pilot stop rules defined
Productioneval gate passed, critical risks controlled, runbook tested, dashboard live, rollback ready
Scalepilot value proven, quality stable, adoption real, cost understood, risk accepted, new scope evaluated

16. Operating Principle

AI architecture review is the discipline of proving that a probabilistic capability can enter a business workflow without losing control of quality, risk, cost, accountability and user trust.

This is the business decision.
This is the system boundary.
This is the evidence.
This is how we evaluate it.
This is how we control it.
This is who owns it.
This is how we stop it if it fails.