S61:安全分层图:连接 Identity、Data Lifecycle、AI BOM、Tool Security 与 Privacy
AI 系统安全不是在模型外面加一个过滤器,而是让身份、数据生命周期、软件与模型供应链、工具调用和隐私技术在同一组 trust boundary 上形成可追溯的分层控制。
内容类型:预习教材(不代表已完成)
日期:2027-01-22
阶段:P2 · AI Systems Engineering 90
总路线:Day 151
周次节奏:W9 · 周五知识整理
状态:教材已备;学习未完成
一句话定义
AI 系统安全不是在模型外面加一个过滤器,而是让身份、数据生命周期、软件与模型供应链、工具调用和隐私技术在同一组 trust boundary 上形成可追溯的分层控制。
学习目标
- 能把 principal、credential、delegation、purpose、artifact 和 data subject 放进一张安全图。
- 能区分 authentication、authorization、approval、data minimization 与 privacy-enhancing technology 的职责。
- 能从 threat→control→evidence→residual risk 追踪一条完整安全链,不用“已合规”代替证据。
核心知识
Identity plane 先回答“谁在代表谁行动”。用户、agent、service account、tool provider 和 human reviewer 是不同 principal;身份认证只证明 principal,授权还需 resource、action、scope、purpose、time 与 delegation chain。高风险操作的 approval 是一次业务决策,不应被永久 token 替代。
Data lifecycle plane 覆盖 collect、classify、transform、retrieve、log、share、retain 与 delete。purpose limitation 要求同一份数据不因技术上可访问就可用于任意目标;retention 要作用到 prompt、trace、cache、embedding、eval sample 和人工工单,不只作用于原始数据库。
AI BOM / supply chain plane 记录 model、dataset、tokenizer、prompt/template、adapter、container、library、tool server、policy 与 provider 的版本、来源、hash、许可与审批。BOM 不阻止攻击,但它使“哪个变更进入了哪个运行”可被回答。
Tool security plane 必须把模型输出视为不可信建议。schema validation、allowlist、最小 scope、幂等键、超时、预览、人工确认和结果核验共同构成执行边界。Prompt injection 不仅是文本问题:当不可信内容能驱动高权限工具时,它会转化为 confused deputy。
Privacy plane 不能用一个技术名称概括。tokenization/pseudonymization 降低直接识别,但可能被关联;DP 限制统计输出对个体的额外泄露,但有隐私预算与效用损失;TEE 保护使用中数据,但引入 attestation、供应商与侧信道风险;FHE 可在密文上计算,但算子支持与成本可能限制用例。
机制与推导
把一次 tool call 写成判定:
decision = policy(principal, delegation, action, resource, purpose, data_class, context, risk)
只有 decision=allow 不足够,还要生成 evidence:policy version、request hash、approval id、tool version、result digest 和 retention class。一个实用威胁模型可用四元组表达:
risk = likelihood × impact × exposure × control_gap
它不是精确概率公式,而是强迫学习者说明“什么资产、什么路径、什么影响、现有控制缺什么”。控制后仍需保留 residual risk,例如正确授权也无法保证模型的业务判断正确。
最小练习或观察
- 选一个无真实数据的文档摘要或钱包风险案例,画 user、agent、model provider、retrieval store、tool 和 reviewer。
- 在边界上标记数据分类、协议、credential、日志及所有权。
- 选一条路径,填 threat→preventive control→detective evidence→response→residual risk。
- 为一个 artifact 写 provenance 字段,为一个 tool action 写 authorization context,为一类日志写 retention 规则。
- 只保留设计与假设;未运行就不填控制有效。
常见误区与边界
- 把 API key 当成用户授权,丢失委托主体与 purpose。
- 有 AI BOM 就声称供应链安全,却不验签、不锁定版本也不处理撤销。
- 把加密与访问控制当成数据最小化;被合法解密后的数据仍可被过度使用。
- 用简单关键词过滤宣称消除 prompt injection,却没有限制工具能力与外发路径。
- 安全图是学习模型,不是安全认证、法律意见或实际穿透测试结果。
系统 / 金融 / Web3 连接
在 AML 调查中,“查看案件”、“生成叙述”和“提交报告”应是三种权限;客户 PII 不应因模型需要上下文就进入所有 trace。在 Web3 Wallet Agent 中,读取余额、构造交易、请求签名与广播是不同能力;chain id、合约、金额、slippage 和 expiry 必须进入用户可理解的预览与审批证据。
自检问题
- authentication、authorization、delegation 和 approval 分别回答什么?
- 为什么 model card 或 BOM 不能单独证明 artifact 可信?
- DP、TEE、FHE 和 tokenization 各自保护哪一段风险,又留下什么?
- 一次 tool call 的最小可审计证据应包含什么?
专业课程对齐
- OWASP GenAI Security Project:精读 LLM/agent 应用风险、prompt injection、supply-chain 与 excessive agency 主题,映射到图中的 tool 与 artifact 边界。
- NIST AI Risk Management Framework / AIRC:精读 Govern、Map、Measure、Manage 的组织逻辑,用于检查技术控制是否有 owner、evidence 与 residual risk。
- Model Context Protocol 文档:选读 security/trust 边界、client/server 和 tool 原语,把协议能力与实际授权机制分开。
深入学习提示
顺序为 OWASP 找攻击路径→MCP 找协议和执行边界→NIST 找治理与风险闭环。阅读时不要复制控制清单,而要选同一个资产,追踪它从数据进入、artifact 生成、agent 使用到日志删除的整条生命周期。如果一项控制只能降低风险,就明写剩余假设,不用“安全”二元标签。
学后填写区
- 选择的系统与资产:
- trust boundary 与 principal:
- 一条 threat→control→evidence 链:
- 数据生命周期与 retention:
- 当前 residual risk: