G44:从零实现 Iterated Social Dilemma
Iterated social dilemma 用重复的局部行动揭示短期个体激励与长期共同收益的冲突,是观察合作、报复、宽恕和策略识别的最小环境。
内容类型:预习教材(不代表已完成)
日期:2027-04-06
阶段:P3 · AGI Foundations 90
总路线:Day 224 / 360
周次:W7 · 多智能体、合作与社会泛化
节奏:周二最小机制
状态:教材已备;学习未完成
标签:social-dilemma、iterated-game、strategy、credit-assignment、baseline
一句话定义
Iterated social dilemma 用重复的局部行动揭示短期个体激励与长期共同收益的冲突,是观察合作、报复、宽恕和策略识别的最小环境。
学习目标
- 从 payoff matrix 推导一次博弈与重复博弈的激励差别。
- 实现环境、固定策略、观察历史与多 seed 轨迹,不依赖复杂框架。
- 区分策略表现、伙伴构成、回合长度和噪声带来的影响。
- 认识 toy game 对真实社会行为的巨大简化。
核心知识
- 以囚徒困境为例,收益满足 (T>R>P>S):单次博弈中背叛占优,但双方持续合作的累计回报可能高于持续背叛。
- 重复交互让当前行动影响伙伴未来行为,产生 reputation、retaliation 与 forgiveness;这种时间耦合不是“道德”本身。
- 固定策略包括 Always Cooperate、Always Defect、Tit-for-Tat、Generous TFT、Win-Stay-Lose-Shift 和随机策略。它们提供可解释 baseline,不应只与很弱对手比较。
- Observation 可以是上一步联合动作、最近 (k) 步、累计得分或带噪消息。不同观察改变任务难度和可识别性,必须明确。
- 回合终止若固定可知,策略可能在末轮背叛;几何随机终止更接近未知 horizon。环境设置会改变“合作稳定”的含义。
机制与推导
典型 payoff:
partner C partner D
agent C (R,R) (S,T)
agent D (T,S) (P,P)
无限重复、折扣 (\gamma) 下,持续合作价值为:
[ V_C=\frac{R}{1-\gamma} ]
若一次背叛后触发永久惩罚,其价值为:
[ V_D=T+\gamma\frac{P}{1-\gamma} ]
当 (V_C\ge V_D) 时,这类触发策略能在理想条件下支持合作。它不证明现实 Agent 必然合作,因为噪声、有限 horizon、误认伙伴和策略更新都会改变条件。
加入动作翻转概率 (\epsilon) 后,严格 TFT 可能进入报复循环。Generous TFT 以概率 (g) 宽恕,可降低误差传播但也可能更易被利用。这提供一个清晰 stability–exploitability 取舍。
实现环境的核心转移是:
actions -> optional noise -> payoff lookup
-> append public/private history -> termination draw
随机数、payoff matrix、termination 与 observation schema 都进入配置,才能比较不同运行而不伪造一致性。
最小练习或观察步骤
- 实现
reset(seed)与step(a1,a2),动作只含 C/D,返回双方 reward、observation 和 done。 - 加入六个固定策略,先跑无噪声 round-robin,再选择 (\epsilon=0.05) 或 (0.1) 的动作噪声。
- 比较固定 50 回合与每步以概率 (q) 终止;记录个体平均回报、合作率、最长报复链和配对方差。
- 手推 TFT 对 Always Defect 前五步,再对含一次误差的 TFT×TFT 手推,检查代码轨迹。
- 把策略名称隐藏,仅给行为轨迹,尝试判断哪些统计足以区分;记录不可识别的策略对。
- 不把最优策略写死;排名依赖 partner population、噪声、horizon 和 payoff,应报告条件而非冠军。
常见误区与边界
- 用 cooperation rate 单独评价,忽略合作可能是被利用或共同伤害第三方。
- 只与 Always Cooperate 配对,任何剥削策略都显得优秀。
- 固定 horizon 最后一轮效应被误当成普遍背叛机制。
- 把 TFT 的规则行为称为理解他人意图;它只响应可见历史。
- 只跑一个随机序列,忽略动作噪声造成的轨迹分叉。
- 囚徒困境省略语言、制度、权力、文化和多方外部性,不能直接推论人类社会。
研究/系统场景连接
简化供应链可将“共享真实库存/隐瞒”写成重复互动,但真实机构还受法规、合同和客户影响。toy 环境适合观察局部激励与反馈,不应用来自动制定对合作方的风险判断。多 Agent 系统中,固定策略像可解释 stub,可帮助发现语言 Agent 只是迎合特定伙伴还是对陌生行为保持稳健。金融用例必须把客户和监管作为 stakeholder,避免只优化内部角色总回报。
自检问题
- 为什么重复博弈可能改变单次博弈的激励?
- 动作噪声如何让严格报复策略产生低福利循环?
- 固定 horizon 与随机终止会怎样影响策略?
- 策略排名依赖哪些环境条件?
- 哪些社会现象完全不在这个 toy game 中?
专业课程对齐
- 阅读 Melting Pot 官方介绍,将本日二人矩阵博弈放到更丰富社会情境的前置位置。
- 阅读 No Agent Is an Island 官方研究页,关注训练与评价中的社会环境分布,而非只比较单局回报。
- 阅读 Concordia 原始论文,观察生成式社会模拟怎样表示场景与行动,并列出它相对显式 payoff matrix 增加的自由度和不确定性。
深入学习提示
可扩展到公共物品、资源枯竭或简化 market game,但每次只增加一个机制。深入重点是制度如何改变 payoff,而不是让模型写更长对话。可以比较 evolutionarily stable strategy 或 replicator dynamics,仍需注明它们依赖 population 假设。
学后填写区
- 实际实现的 payoff 与终止:
- 实际比较的固定策略:
- 噪声下的观察:
- 一个不可识别或反直觉轨迹:
- 外推边界:
- 尚未理解的问题: