返回 G01~G90 教材库
G44 · 总 Day 224教材已备 ≠ 学习已完成

G44:从零实现 Iterated Social Dilemma

Iterated social dilemma 用重复的局部行动揭示短期个体激励与长期共同收益的冲突,是观察合作、报复、宽恕和策略识别的最小环境。

2027-04-06social-dilemma、iterated-game、strategy、credit-assignment、baseline

内容类型:预习教材(不代表已完成)
日期:2027-04-06
阶段:P3 · AGI Foundations 90
总路线:Day 224 / 360
周次:W7 · 多智能体、合作与社会泛化
节奏:周二最小机制
状态:教材已备;学习未完成
标签:social-dilemma、iterated-game、strategy、credit-assignment、baseline

一句话定义

Iterated social dilemma 用重复的局部行动揭示短期个体激励与长期共同收益的冲突,是观察合作、报复、宽恕和策略识别的最小环境。

学习目标

  1. 从 payoff matrix 推导一次博弈与重复博弈的激励差别。
  2. 实现环境、固定策略、观察历史与多 seed 轨迹,不依赖复杂框架。
  3. 区分策略表现、伙伴构成、回合长度和噪声带来的影响。
  4. 认识 toy game 对真实社会行为的巨大简化。

核心知识

  • 以囚徒困境为例,收益满足 (T>R>P>S):单次博弈中背叛占优,但双方持续合作的累计回报可能高于持续背叛。
  • 重复交互让当前行动影响伙伴未来行为,产生 reputation、retaliation 与 forgiveness;这种时间耦合不是“道德”本身。
  • 固定策略包括 Always Cooperate、Always Defect、Tit-for-Tat、Generous TFT、Win-Stay-Lose-Shift 和随机策略。它们提供可解释 baseline,不应只与很弱对手比较。
  • Observation 可以是上一步联合动作、最近 (k) 步、累计得分或带噪消息。不同观察改变任务难度和可识别性,必须明确。
  • 回合终止若固定可知,策略可能在末轮背叛;几何随机终止更接近未知 horizon。环境设置会改变“合作稳定”的含义。

机制与推导

典型 payoff:

             partner C   partner D
agent C        (R,R)       (S,T)
agent D        (T,S)       (P,P)

无限重复、折扣 (\gamma) 下,持续合作价值为:

[ V_C=\frac{R}{1-\gamma} ]

若一次背叛后触发永久惩罚,其价值为:

[ V_D=T+\gamma\frac{P}{1-\gamma} ]

当 (V_C\ge V_D) 时,这类触发策略能在理想条件下支持合作。它不证明现实 Agent 必然合作,因为噪声、有限 horizon、误认伙伴和策略更新都会改变条件。

加入动作翻转概率 (\epsilon) 后,严格 TFT 可能进入报复循环。Generous TFT 以概率 (g) 宽恕,可降低误差传播但也可能更易被利用。这提供一个清晰 stability–exploitability 取舍。

实现环境的核心转移是:

actions -> optional noise -> payoff lookup
-> append public/private history -> termination draw

随机数、payoff matrix、termination 与 observation schema 都进入配置,才能比较不同运行而不伪造一致性。

最小练习或观察步骤

  1. 实现 reset(seed)step(a1,a2),动作只含 C/D,返回双方 reward、observation 和 done。
  2. 加入六个固定策略,先跑无噪声 round-robin,再选择 (\epsilon=0.05) 或 (0.1) 的动作噪声。
  3. 比较固定 50 回合与每步以概率 (q) 终止;记录个体平均回报、合作率、最长报复链和配对方差。
  4. 手推 TFT 对 Always Defect 前五步,再对含一次误差的 TFT×TFT 手推,检查代码轨迹。
  5. 把策略名称隐藏,仅给行为轨迹,尝试判断哪些统计足以区分;记录不可识别的策略对。
  6. 不把最优策略写死;排名依赖 partner population、噪声、horizon 和 payoff,应报告条件而非冠军。

常见误区与边界

  • 用 cooperation rate 单独评价,忽略合作可能是被利用或共同伤害第三方。
  • 只与 Always Cooperate 配对,任何剥削策略都显得优秀。
  • 固定 horizon 最后一轮效应被误当成普遍背叛机制。
  • 把 TFT 的规则行为称为理解他人意图;它只响应可见历史。
  • 只跑一个随机序列,忽略动作噪声造成的轨迹分叉。
  • 囚徒困境省略语言、制度、权力、文化和多方外部性,不能直接推论人类社会。

研究/系统场景连接

简化供应链可将“共享真实库存/隐瞒”写成重复互动,但真实机构还受法规、合同和客户影响。toy 环境适合观察局部激励与反馈,不应用来自动制定对合作方的风险判断。多 Agent 系统中,固定策略像可解释 stub,可帮助发现语言 Agent 只是迎合特定伙伴还是对陌生行为保持稳健。金融用例必须把客户和监管作为 stakeholder,避免只优化内部角色总回报。

自检问题

  1. 为什么重复博弈可能改变单次博弈的激励?
  2. 动作噪声如何让严格报复策略产生低福利循环?
  3. 固定 horizon 与随机终止会怎样影响策略?
  4. 策略排名依赖哪些环境条件?
  5. 哪些社会现象完全不在这个 toy game 中?

专业课程对齐

深入学习提示

可扩展到公共物品、资源枯竭或简化 market game,但每次只增加一个机制。深入重点是制度如何改变 payoff,而不是让模型写更长对话。可以比较 evolutionarily stable strategy 或 replicator dynamics,仍需注明它们依赖 population 假设。

学后填写区

  • 实际实现的 payoff 与终止:
  • 实际比较的固定策略:
  • 噪声下的观察:
  • 一个不可识别或反直觉轨迹:
  • 外推边界:
  • 尚未理解的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本