返回 S01~S90 教材库
S60 · 总 Day 150教材已备 ≠ 学习已完成

S60:Prompt Injection、Confused Deputy、Artifact Tamper、PII Egress 与 Retention

AI 威胁分析要把攻击路径映射到跨层控制与残余风险:模型输入净化不能替代工具权限,artifact hash 不能替代来源信任,访问控制也不能替代数据最小化和删除。

2027-01-21prompt-injection、confused-deputy、artifact-tamper、pii-egress、residual-risk

内容类型:预习教材(不代表已完成)
日期:2027-01-21
阶段:P2 · AI Systems Engineering 90
总路线:Day 150 / 360
周次:W9 · Security、Privacy、AI Supply Chain
节奏:周四案例与连接
状态:教材已备;学习未完成
标签:prompt-injection、confused-deputy、artifact-tamper、pii-egress、residual-risk

一句话定义

AI 威胁分析要把攻击路径映射到跨层控制与残余风险:模型输入净化不能替代工具权限,artifact hash 不能替代来源信任,访问控制也不能替代数据最小化和删除。

学习目标

  1. 解释五类威胁的资产、入口、信任边界和可能影响。
  2. 为每类威胁组合预防、检测、响应控制,而非寻找单一万能防线。
  3. 区分控制有效范围与残余风险。
  4. 完成一张 threat→control→evidence→residual risk 表。

核心知识

  • Prompt injection 让不受信内容试图改变 Agent 指令或诱导调用工具。核心控制是内容与指令分离、工具最小权限、参数校验、敏感操作审批和结果约束,而不是只添加更强系统提示。
  • Confused deputy 指拥有权限的中介被低权限主体诱导去访问或操作不属于它的资源。需要 end-user delegation、audience/resource binding、purpose 和服务端授权。
  • Artifact tamper 改变模型、prompt、tool package、index 或 policy。Digest、签名、provenance、准入和运行时验证组合降低风险。
  • PII egress 可经 prompt、tool 参数、日志、trace、cache、导出和错误消息发生。需分类、最小化、tokenization/redaction、egress policy、DLP-like 检查与访问审计。
  • Retention failure 是数据超过目的期限仍存在、删除只删主库不删派生物,或审计与删除要求冲突。必须维护数据流和派生索引。
  • Residual risk 是控制后仍存在的不确定与影响,需要 owner、接受/转移/降低决定和复查,而不是写成“风险已解决”。

机制与推导

可把风险粗略表示为 (Risk\approx Likelihood\times Impact),但数值不必伪精确。更有学习价值的是攻击链:

untrusted document
 -> model interprets embedded instruction
 -> requests high-privilege tool
 -> gateway trusts Agent identity without user/resource binding
 -> data leaves approved boundary
 -> verbose trace retains leaked content

对应控制分层:标记不受信内容;模型不能直接持有广泛凭证;gateway 验证 actor/delegation/resource/purpose;高风险 action 要审批;egress 过滤字段;telemetry 默认不存正文;audit 关联决定。任何一层失效,其他层仍提供阻断或证据,这就是 defense in depth。

Artifact 场景则是 source→build→registry→runtime,每步验证 digest 和身份;即使完整性无误,恶意但被签名的源码仍是残余风险,需要代码来源、评审和最小运行权限。

最小练习或观察步骤

  1. 使用完全合成、无真实外部写入的 Agent 案例,列出五类威胁。
  2. 每类写 asset、entry point、trust boundary、impact。
  3. 各选至少两层控制,并写控制产生的 evidence。
  4. 为每类补一个 residual risk 和 owner,不打风险分数。
  5. 选择 prompt injection,画到 tool/egress/telemetry 的完整攻击链。
  6. 不执行真实攻击、不输入真实 PII、不测试外部服务;只做架构分析。

常见误区与边界

  • 把 prompt injection 当纯提示词问题,模型拒答即认为安全。
  • Agent 有服务账号就不再传播用户委托和资源范围。
  • 签名 artifact 一定可信,忽略签名者或构建链受损。
  • 只对 prompt 脱敏,日志、cache、错误和工具结果仍泄露。
  • 删除原始记录但保留 embedding、备份和导出。
  • 威胁表完成不等于系统经过安全测试或符合监管要求。

系统 / 金融 / Web3 场景连接

金融 Agent 读取客户上传文件时,文件内容不应获得指令权;工具访问必须绑定当前案件和目的,PII 只按必要字段发送。Web3 Agent 读取恶意 token metadata 或合约文本也可能遭注入,但真正的资产保护来自钱包隔离、simulation、allowlist、限额和用户签名确认;提示词不是私钥边界。

自检问题

  1. Prompt injection 为什么必须在工具与身份边界控制?
  2. Confused deputy 与普通未认证访问有何不同?
  3. Artifact digest 能证明什么、不能证明什么?
  4. 删除请求为什么需要追踪派生数据?
  5. Residual risk 应包含哪些责任信息?

专业课程对齐

  • 阅读 Model Context Protocol 官方文档 的 security best practices、authorization 和 tools 内容,重点观察工具调用中的用户同意、token audience 与 confused-deputy 风险。
  • 阅读 Kubernetes 官方文档 的 security、RBAC、Secrets、network policies 与 supply-chain 相关导航,将身份、工作负载、网络和 artifact 控制映射为多层防御。
  • 阅读 Google SRE 资源 中 incident response、postmortem 与 security/reliability 相关章节入口,思考控制失败后如何检测、遏制、恢复并保留学习证据。

深入学习提示

从一条完整攻击链学习,胜过罗列二十个攻击名。对每项控制问:阻止哪一步、失败时留下什么信号、谁响应、还有什么残余风险。深入时重点比较“合法身份被错误委托”和“恶意输入诱导高权限工具”,这两者常共同出现;不把案例扩成真实攻击实验。

学后填写区

  • 五类威胁表:
  • 一条完整攻击链:
  • 分层控制与 evidence:
  • 残余风险与 owner:
  • 尚未理解的问题:
重点主线 · H03 · 工具接口与代码变更边界本周配套机制实验 · W9 · 安全边界:模型建议不携带权限 →详细讲义、离线示例与源码;按需要选读,不新增必交任务。
本页是未来 P2 的预习教材。等 P1 完成并正式进入 P2 后,再填写真实理解、练习结果和不确定项;现在阅读不会改变P1 唯一进度账本