G47:Cross-Play、Welfare、Fairness 与 Exploitability 联合分析
联合社会评价把陌生伙伴上的行为矩阵与个体收益、集体福利、不平等、可利用性和消息成本并列,从而避免单一“合作分数”掩盖机制冲突。
内容类型:预习教材(不代表已完成)
日期:2027-04-09
阶段:P3 · AGI Foundations 90
总路线:Day 227 / 360
周次:W7 · 多智能体、合作与社会泛化
节奏:周五知识图谱更新
状态:教材已备;学习未完成
标签:cross-play、welfare、fairness、exploitability、social-evaluation
一句话定义
联合社会评价把陌生伙伴上的行为矩阵与个体收益、集体福利、不平等、可利用性和消息成本并列,从而避免单一“合作分数”掩盖机制冲突。
学习目标
- 组织 cross-play matrix,并区分 within-seed、cross-seed、cross-algorithm 与 probe partner。
- 同时报告 individual utility、collective welfare、fairness 与 exploitability proxy。
- 识别平均值、归一化和伙伴权重中的价值选择。
- 用一页知识图谱总结 W7,不把结果包装成社会智能证明。
核心知识
- Cross-play matrix 的行列选择决定结论。若大量容易合作的伙伴占权重,平均表现会很好;现实 deployment partner distribution 往往未知,因此还需分组和最差分位。
- Welfare 聚合规则具有规范性。求和偏向总量,最小效用强调最弱者,Nash welfare (\prod_i(U_i-b_i)) 兼顾增益与分配但依赖 disagreement point (b_i)。
- Fairness 不能只等于收益相同。有的 Agent 贡献更多资源,equal outcome 与 proportional outcome 会给出不同判断。教材应列选择,不替用户做伦理结论。
- Exploitability 依赖对手搜索能力。固定 probe 找到的漏洞是存在性证据,找不到不是安全证明。
- 消息成本、协调时延和失败恢复是系统维度。多 Agent 福利高但成本十倍,是否值得取决于任务而非研究分数。
机制与推导
设 cross-play matrix 中 (M_{ij}^{(k)}) 表示策略 (i) 与伙伴 (j) 的第 (k) 个指标。不要过早加权成标量。最少保留:
[ M_{ij}=(U_i,U_j,W,G,E,C_m) ]
其中 (W=U_i+U_j),(G=|U_i-U_j|),(E) 是 probe exploitability,(C_m) 是消息成本。若需要 Nash welfare:
[ NW=(U_i-b_i)(U_j-b_j) ]
当任一增益为负时通常需要特殊处理,不能为了求 log 随意裁剪而不说明。
Population-weighted expectation 为:
[ \bar U=\sum_jw_jU(\pi,p_j) ]
权重 (w_j) 是关于 deployment population 的假设。可以同时报告 uniform、stress-heavy 两种权重,展示结论敏感度。
Convention gap 可定义为 self-play 与 cross-play 差:
[ Gap=\mathbb E_iM_{ii}^{W}-\mathbb E_{i\ne j}M_{ij}^{W} ]
Gap 大提示协议过拟合,但也可能由不同策略能力差造成,需查看具体轨迹。
最小练习或观察步骤
- 将已有策略按训练 seed、算法和固定 probe 分组,生成矩阵而不是只列总排名。
- 每个 cell 保存双方 utility、sum welfare、gap、公平指标、消息成本和失败类型;至少保留轨迹引用。
- 计算 uniform partner average 与 stress-heavy weighting,比较策略排序是否改变。
- 用一个贪婪 best-response probe 对每个策略尝试利用,记录找到的增益;明确搜索空间有限。
- 找出三个 cell:高福利但不公平、低福利但不易利用、高 self-play 低 cross-play。若数据没有,构造手工反例用于理解。
- 完成 W7 知识图谱:伙伴分布→通信→行动→个体效用→福利/公平→外部性,标注证据与未知点。
常见误区与边界
- 对所有指标 min-max 后相加成综合分,掩盖价值冲突和基线选择。
- 伙伴权重没有依据,却把加权平均称为真实部署表现。
- exploitability probe 未找到漏洞就写成稳健。
- 高福利且公平就忽略对环境、客户或第三方的负外部性。
- Cross-play 低全部归因于社会泛化差,忽略底层能力不匹配。
- 小矩阵只说明有限策略 population,不能代表开放社会或人类互动。
研究/系统场景连接
内部多 Agent 流程的 stakeholder 不只包括各 Agent,还包括客户、人工审查者和监管约束。两个 Agent 通过减少升级获得高内部效率,可能把风险转嫁给客户,因此 welfare schema 必须包括外部事件指标。研究系统中,多 reviewer 达成一致也可能源于同源模型;cross-model 或 rule-based probe 能增加多样性,但仍不能替代原始数据真值。
自检问题
- partner weight 为何是结论中的隐含假设?
- sum welfare、min welfare 与 Nash welfare 的规范偏好有何不同?
- convention gap 还可能被什么因素混杂?
- exploitability proxy 为什么通常只是下界?
- 怎样把第三方外部性纳入社会评价?
专业课程对齐
- 阅读 Melting Pot 官方介绍,核对其评价为什么强调多个社会场景与 background population。
- 阅读 SOTOPIA 原始论文,查看其 social goal 与评价维度,再比较环境可计算 payoff 和模型 judge 的证据差别。
- 阅读 No Agent Is an Island 官方研究页,把 cross-play 置于共同适应与社会环境分布的研究问题中。
深入学习提示
深入可研究 Pareto frontier、social choice、mechanism robustness 与 population-based evaluation。不要急着选唯一综合分;先画二维或三维 Pareto 图,找出无法同时优化的关系。社会评价的成熟表现不是给出漂亮冠军,而是说清楚“对谁好、在什么伙伴分布、牺牲了什么”。
学后填写区
- 实际矩阵分组:
- 指标与权重选择:
- 一个排序敏感性:
- 一个可利用或 convention 依赖:
- 第三方外部性:
- 尚未理解的问题: