返回 G01~G90 教材库
G43 · 总 Day 223教材已备 ≠ 学习已完成

G43:社会泛化、Counterpart Variation 与评价坐标

社会泛化是一个 Agent 在伙伴策略、偏好、通信习惯和群体结构变化后仍能协调或合作的能力,不能由与固定训练伙伴的高回报单独证明。

2027-04-05multi-agent、social-generalization、cross-play、welfare、exploitability

内容类型:预习教材(不代表已完成)
日期:2027-04-05
阶段:P3 · AGI Foundations 90
总路线:Day 223 / 360
周次:W7 · 多智能体、合作与社会泛化
节奏:周一概念与论文
状态:教材已备;学习未完成
标签:multi-agent、social-generalization、cross-play、welfare、exploitability

一句话定义

社会泛化是一个 Agent 在伙伴策略、偏好、通信习惯和群体结构变化后仍能协调或合作的能力,不能由与固定训练伙伴的高回报单独证明。

学习目标

  1. 区分 coordination、cooperation、competition、negotiation、deception 与 collusion。
  2. 理解 self-play、cross-play、zero-shot coordination 和 population evaluation 的差异。
  3. 建立个体效用、社会福利、公平性、exploitability、稳定性与通信成本的多维评价。
  4. 设计 partner split,避免训练伙伴泄漏到测试结论。

核心知识

  • Coordination 只要求行动相容,不必共享目标;cooperation 指为共同或互补收益行动;competition 的收益冲突;negotiation 通过提议分配;deception 利用错误信念;collusion 是参与者联合损害第三方或规则目标。相同行为表面可能对应不同机制。
  • Self-play 训练与自身副本互动,容易形成只对同类策略有效的 convention。Cross-play 把一个策略与不同训练运行、不同算法或未见伙伴配对,测试 convention 是否可迁移。
  • Counterpart variation 不只是换随机 seed,还可改变理性程度、风险偏好、通信协议、记忆、目标权重与学习速度。拆清变化轴才能知道泛化发生在哪里。
  • 团队总回报上升可能伴随一方被持续剥削;平均个人回报相等也可能建立在对外部参与者有害的串谋上。因此环境需要明确 stakeholder 与 welfare 定义。
  • 多 Agent 系统增加通信、排队、冲突和 credit assignment 成本。串行依赖任务中,更多角色可能降低速度与可靠性,数量不是智能指标。

机制与推导

用 Markov game 表示多智能体环境:

[ (\mathcal S,{\mathcal A_i}{i=1}^n,T,{R_i}{i=1}^n,{O_i}_{i=1}^n,\gamma) ]

每个 Agent (i) 有策略 (\pi_i(a_i\mid o_i)),联合动作决定转移。社会福利可以是 utilitarian:

[ W_{sum}=\sum_i U_i ]

也可关注最弱者:(W_{min}=\min_i U_i),或不平等程度,例如简化差距 (G=\max_iU_i-\min_iU_i)。这些定义体现价值选择,不能由数据自动决定。

Cross-play matrix 令 (M_{ij}=U(\pi_i,\pi_j))。若 self-play 对角线很高而非对角线很低,说明策略依赖私有 convention。社会泛化可报告未见伙伴上的均值、最差分位数与方差,而非压成一个“social intelligence score”。

Exploitability 粗略衡量对手采用 best response 后能多获得多少:

[ Exploit(\pi)=\max_{\pi'}U(\pi',\pi)-U(\pi,\pi) ]

在复杂环境中无法精确求 best response,可用一组 probe policies 近似,并明确这只是下界。高福利不意味着低 exploitability,低 exploitability 也不等于公平或安全。

最小练习或观察步骤

  1. 选择 iterated dilemma、公共资源或简化供应链之一,明确每个 Agent 的 observation、action、reward 和共同资源。
  2. 准备至少四类固定伙伴:总合作、总背叛、tit-for-tat、带噪声策略;把其中一部分完全留作 cross-play。
  3. 建立 self-play 与 cross-play matrix,保留每种配对的个体 (U_i)、总福利、最差个体、波动和回合长度。
  4. 若有通信,记录消息数量或长度;无通信 baseline 必须使用同样环境与行动预算。
  5. 构造一个“团队福利高但一方很差”和一个“个体高回报但公共资源崩溃”的手工反例。
  6. 写明伙伴 population 覆盖不到哪些真实社会行为,不把 toy game 外推为人类社会理解。

常见误区与边界

  • 与固定伙伴训练和测试后,把高回报称为通用合作能力。
  • 将 team reward 当作公平性,忽略个体分布、弱势方与外部成本。
  • 用 LLM judge 对社会行为打分作为唯一真值,缺少环境可计算指标。
  • 把通信内容看起来礼貌等同于行动合作。
  • 将某个 probe policy 未能利用 Agent 解释为不可利用;probe 集只提供有限证据。
  • toy 社会困境不能证明现实谈判、文化理解或道德能力,只能训练指标和反例意识。

研究/系统场景连接

多 Agent 金融流程可以模拟“销售—风控—运营”角色,但角色间高一致不等于正确:它们可能共享同一错误摘要,形成自动化共识。应保留独立信息源和 human escalation,不用内部互评代替外部真值。研究团队 Agent 也可能互相引用生成内容,表面形成共识却没有新增证据;cross-play 可换不同策略和资料来源,检查结论是否依赖私有 convention。

自检问题

  1. coordination 与 cooperation 的目标关系有什么区别?
  2. self-play 对角线高、cross-play 非对角线低说明什么?
  3. welfare、fairness 与 exploitability 为什么不能互相替代?
  4. partner variation 至少包含哪些变化轴?
  5. probe best response 为什么只给 exploitability 的有限证据?

专业课程对齐

深入学习提示

可进一步研究 population-based training、ad hoc teamwork、equilibrium selection 与 mechanism design。先用矩阵和固定策略理解 convention,再引入学习 Agent。每次看到“多 Agent 涌现合作”,都问测试伙伴是否未见、福利如何定义、谁承担外部成本、通信是否只是泄漏答案。

学后填写区

  • 实际选择的社会环境:
  • 伙伴 population 与切分:
  • 采用的多维指标:
  • 一个 convention 依赖:
  • 一个公平或外部性问题:
  • 尚未理解的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本