S60:Prompt Injection、Confused Deputy、Artifact Tamper、PII Egress 与 Retention
AI 威胁分析要把攻击路径映射到跨层控制与残余风险:模型输入净化不能替代工具权限,artifact hash 不能替代来源信任,访问控制也不能替代数据最小化和删除。
内容类型:预习教材(不代表已完成)
日期:2027-01-21
阶段:P2 · AI Systems Engineering 90
总路线:Day 150 / 360
周次:W9 · Security、Privacy、AI Supply Chain
节奏:周四案例与连接
状态:教材已备;学习未完成
标签:prompt-injection、confused-deputy、artifact-tamper、pii-egress、residual-risk
一句话定义
AI 威胁分析要把攻击路径映射到跨层控制与残余风险:模型输入净化不能替代工具权限,artifact hash 不能替代来源信任,访问控制也不能替代数据最小化和删除。
学习目标
- 解释五类威胁的资产、入口、信任边界和可能影响。
- 为每类威胁组合预防、检测、响应控制,而非寻找单一万能防线。
- 区分控制有效范围与残余风险。
- 完成一张
threat→control→evidence→residual risk表。
核心知识
- Prompt injection 让不受信内容试图改变 Agent 指令或诱导调用工具。核心控制是内容与指令分离、工具最小权限、参数校验、敏感操作审批和结果约束,而不是只添加更强系统提示。
- Confused deputy 指拥有权限的中介被低权限主体诱导去访问或操作不属于它的资源。需要 end-user delegation、audience/resource binding、purpose 和服务端授权。
- Artifact tamper 改变模型、prompt、tool package、index 或 policy。Digest、签名、provenance、准入和运行时验证组合降低风险。
- PII egress 可经 prompt、tool 参数、日志、trace、cache、导出和错误消息发生。需分类、最小化、tokenization/redaction、egress policy、DLP-like 检查与访问审计。
- Retention failure 是数据超过目的期限仍存在、删除只删主库不删派生物,或审计与删除要求冲突。必须维护数据流和派生索引。
- Residual risk 是控制后仍存在的不确定与影响,需要 owner、接受/转移/降低决定和复查,而不是写成“风险已解决”。
机制与推导
可把风险粗略表示为 (Risk\approx Likelihood\times Impact),但数值不必伪精确。更有学习价值的是攻击链:
untrusted document
-> model interprets embedded instruction
-> requests high-privilege tool
-> gateway trusts Agent identity without user/resource binding
-> data leaves approved boundary
-> verbose trace retains leaked content
对应控制分层:标记不受信内容;模型不能直接持有广泛凭证;gateway 验证 actor/delegation/resource/purpose;高风险 action 要审批;egress 过滤字段;telemetry 默认不存正文;audit 关联决定。任何一层失效,其他层仍提供阻断或证据,这就是 defense in depth。
Artifact 场景则是 source→build→registry→runtime,每步验证 digest 和身份;即使完整性无误,恶意但被签名的源码仍是残余风险,需要代码来源、评审和最小运行权限。
最小练习或观察步骤
- 使用完全合成、无真实外部写入的 Agent 案例,列出五类威胁。
- 每类写 asset、entry point、trust boundary、impact。
- 各选至少两层控制,并写控制产生的 evidence。
- 为每类补一个 residual risk 和 owner,不打风险分数。
- 选择 prompt injection,画到 tool/egress/telemetry 的完整攻击链。
- 不执行真实攻击、不输入真实 PII、不测试外部服务;只做架构分析。
常见误区与边界
- 把 prompt injection 当纯提示词问题,模型拒答即认为安全。
- Agent 有服务账号就不再传播用户委托和资源范围。
- 签名 artifact 一定可信,忽略签名者或构建链受损。
- 只对 prompt 脱敏,日志、cache、错误和工具结果仍泄露。
- 删除原始记录但保留 embedding、备份和导出。
- 威胁表完成不等于系统经过安全测试或符合监管要求。
系统 / 金融 / Web3 场景连接
金融 Agent 读取客户上传文件时,文件内容不应获得指令权;工具访问必须绑定当前案件和目的,PII 只按必要字段发送。Web3 Agent 读取恶意 token metadata 或合约文本也可能遭注入,但真正的资产保护来自钱包隔离、simulation、allowlist、限额和用户签名确认;提示词不是私钥边界。
自检问题
- Prompt injection 为什么必须在工具与身份边界控制?
- Confused deputy 与普通未认证访问有何不同?
- Artifact digest 能证明什么、不能证明什么?
- 删除请求为什么需要追踪派生数据?
- Residual risk 应包含哪些责任信息?
专业课程对齐
- 阅读 Model Context Protocol 官方文档 的 security best practices、authorization 和 tools 内容,重点观察工具调用中的用户同意、token audience 与 confused-deputy 风险。
- 阅读 Kubernetes 官方文档 的 security、RBAC、Secrets、network policies 与 supply-chain 相关导航,将身份、工作负载、网络和 artifact 控制映射为多层防御。
- 阅读 Google SRE 资源 中 incident response、postmortem 与 security/reliability 相关章节入口,思考控制失败后如何检测、遏制、恢复并保留学习证据。
深入学习提示
从一条完整攻击链学习,胜过罗列二十个攻击名。对每项控制问:阻止哪一步、失败时留下什么信号、谁响应、还有什么残余风险。深入时重点比较“合法身份被错误委托”和“恶意输入诱导高权限工具”,这两者常共同出现;不把案例扩成真实攻击实验。
学后填写区
- 五类威胁表:
- 一条完整攻击链:
- 分层控制与 evidence:
- 残余风险与 owner:
- 尚未理解的问题: