返回 G01~G90 教材库
G45 · 总 Day 225教材已备 ≠ 学习已完成

G45:学习策略、通信通道与固定伙伴对照

可学习通信让 Agent 发送影响伙伴决策的信号,但只有在无通信、随机通信和陌生伙伴对照下,才能判断消息是否携带可泛化信息而非私有编码或答案泄漏。

2027-04-07communication、multi-agent-learning、centralized-training、cross-play、ablation

内容类型:预习教材(不代表已完成)
日期:2027-04-07
阶段:P3 · AGI Foundations 90
总路线:Day 225 / 360
周次:W7 · 多智能体、合作与社会泛化
节奏:周三引导实验
状态:教材已备;学习未完成
标签:communication、multi-agent-learning、centralized-training、cross-play、ablation

一句话定义

可学习通信让 Agent 发送影响伙伴决策的信号,但只有在无通信、随机通信和陌生伙伴对照下,才能判断消息是否携带可泛化信息而非私有编码或答案泄漏。

学习目标

  1. 区分 cheap talk、可验证消息、共享状态与直接动作控制。
  2. 实现一个小型学习或表格策略,并给通信设置显式带宽与成本。
  3. 比较 centralized training/decentralized execution 和独立学习的边界。
  4. 用 communication ablation 与 cross-play 判断消息的真实贡献。

核心知识

  • Cheap talk 消息本身不改变环境 payoff,只通过改变伙伴 belief 起作用;没有共同激励或可信承诺时,消息可能无信息甚至欺骗。
  • 如果通信通道直接包含隐藏状态或对方答案,性能提升是信息泄漏,不是学习出社会推理。消息可见范围和生成时点必须明确。
  • Centralized training 可用联合状态或联合 critic 改善 credit assignment,执行时各 Agent 只看本地观察。若测试仍保留训练期全局信息,就没有验证 decentralized execution。
  • Emergent protocol 可能是任意符号 convention。与相同训练副本配合成功,并不保证人可解释或能和新伙伴对齐。
  • 通信价值需要扣除 token、时延、冲突和攻击面。无通信也可能通过观察行动历史协调。

机制与推导

两 Agent 在时刻 (t) 先发消息 (m_i\sim\mu_i(m\mid o_i)),再行动:

[ a_i\sim\pi_i(a\mid o_i,m_{-i}) ]

若消息有成本 (c(m_i)),训练目标可写为:

[ J_i=\mathbb E\left[\sum_t\gamma^t(r_{i,t}-\lambda c(m_{i,t}))\right] ]

比较有无通信时必须保持 action observation 一致。通信贡献可用配对差:

[ \Delta_{comm}=U(\pi,\mu)-U(\pi,\mu_{silent}) ]

但若 silent 改变模型输入长度或训练方式,差异仍有混杂。更强消融包括:正确消息、随机置换、延迟一轮、来自另一局轨迹的消息。

Cross-play 检验 convention:训练出多个独立 sender/receiver 对,形成矩阵 (M_{ij})。对角高、非对角低说明协议共同适应但不通用。可以计算 message-action mutual information 作为线索:

[ I(M;A)=\sum_{m,a}p(m,a)\log\frac{p(m,a)}{p(m)p(a)} ]

高互信息只说明相关,不证明消息因果有用;仍需置换干预。

最小练习或观察步骤

  1. 在 toy dilemma 或双人导航中加入离散消息集合 {0,1,2,3},每轮消息先于行动且不能直接改变状态。
  2. 选择表格 Q-learning、简单 policy gradient 或规则自适应之一;学习为可选,重点是清楚的对照。
  3. 比较 no-message、truthful rule message、learned message、random message;记录回报、福利、通信次数与成本。
  4. 训练至少两个独立 sender/receiver 配对,形成 cross-play matrix;精力不足时也可用手工协议模拟私有 convention。
  5. 做消息置换与延迟干预,观察行动和结果是否改变;将互信息与干预结果并列。
  6. 分离训练可见信息与执行可见信息,明确任何全局 state 是否只进入训练 critic。

常见误区与边界

  • 通信后回报上升就认为出现语言或意图理解,可能只是隐藏状态泄漏。
  • 消息和行动高相关就宣称消息被使用,没有置换或静默消融。
  • 只测试共同训练的 sender/receiver,掩盖私有协议。
  • 集中 critic 的全局信息泄漏到执行策略。
  • 不计消息成本,通信越多越显得有利。
  • toy 离散符号协议不是自然语言交流、共同心智或人类社会智能的证据。

研究/系统场景连接

多个业务 Agent 之间的消息应是 typed claim,包含来源与权限,不是互相发送自由文本后自动采信。风险 Agent 告诉服务 Agent“需要升级”可以是可验证状态;发送未引用的客户判断则可能形成自动化传言。研究系统中,生成者与 reviewer 的通信若共享答案或同一偏差,会抬高内部一致性却不增加外部真实性;需保留独立 verifier 或隐藏测试。

自检问题

  1. cheap talk 为何在利益不一致时可能不可信?
  2. 消息互信息高为什么仍不能证明因果贡献?
  3. 哪些消融可以发现答案泄漏或私有 convention?
  4. centralized training 的全局信息何时构成测试泄漏?
  5. 通信价值为何要同时报告成本与陌生伙伴表现?

专业课程对齐

  • 阅读 Melting Pot 官方介绍,观察社会情境与背景 population 如何改变通信策略的意义。
  • 阅读 SOTOPIA 原始论文,分析自然语言社会交互评价比离散消息多出的 judge 依赖与语义不确定性。
  • 阅读 Concordia 原始论文,关注 Agent 行动、叙事环境与 game master 的信息边界,用来审视“谁知道全局状态”。

深入学习提示

进一步可研究 differentiable communication、information bottleneck 与 grounding。先坚持离散、小带宽和可置换消息,这比直接引入长文本更容易归因。深入的核心问题是:消息携带的是环境新信息、伙伴策略线索、协调 convention,还是直接泄漏目标答案?

学后填写区

  • 实际采用的消息通道:
  • 无通信与有通信的公平性设置:
  • 置换/延迟干预观察:
  • cross-play 现象:
  • 不能支持的社会能力主张:
  • 尚未理解的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本