Chapter 11 Multiagent Interactions

从效用和偏好计算最佳响应、占优、纳什均衡、帕累托效率与社会福利。

学习目标

  • 能用效用与偏好计算最佳响应
  • 能区分占优、纳什均衡与帕累托效率
  • 能分析社会福利函数的选择影响

为什么必须先冻结联合模型

先预测:囚徒困境中双方合作是稳定结果吗?带着判断进入本页。

从效用和偏好计算最佳响应、占优、纳什均衡、帕累托效率与社会福利。 博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。 本页不以单个代理“看起来聪明”为通过条件,而是检查联合状态、偏离动机、失败传播和可重放证据。

直觉、对象与计算合同

贯穿场景是:手算双人两行动囚徒困境并改变一次重复博弈贴现。参与者、可观察信息、行动集、偏好或目标、环境转移、协议版本和终止条件必须在运行前固定,不能在看到结果后修改效用或阈值。

Nash(a)iffeveryi:ui(a)>=ui(ai,ai)Nash(a*) iff every_i: u_i(a*) >= u_i(a_i, a_-i*)

公式用于公开关系与前提,不替代正式证明或实证测量。均衡不保证合作或公平;没有重复和未来价值时不能凭愿望支持合作。 本页重点防范:把高社会福利结果误称为纳什均衡,未检查单方偏离

多智能体交互
多智能体交互合作、竞争与协调的光谱;点击节点查看详情1合作2零和3混合
纯合作

共享目标:团队问题,重心在协调与信用分配。

正式目录节点:解释与联合验证

下列目录节点逐项映射到解释、页面专属实验和章末答案。每个节点都必须指出它改变哪个联合状态以及什么观测会推翻结论;单纯出现术语不计覆盖。

Chapter 11 Multiagent Interactions

“Chapter 11 Multiagent Interactions”决定感知、内部状态、目标与行动怎样连接,应在相同环境轨迹上比较。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查效用偏好;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.1 Utilities and Preferences

“11.1 Utilities and Preferences”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查占优策略;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.2 Setting the Scene

“11.2 Setting the Scene”细化本单元的正式问题,需要映射到参与者、信息、行动、结果和失败边界。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查纳什均衡;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.3 Solution Concepts and Solution Properties

“11.3 Solution Concepts and Solution Properties”细化本单元的正式问题,需要映射到参与者、信息、行动、结果和失败边界。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查帕累托;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.3.1 Dominant Strategies

“11.3.1 Dominant Strategies”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查社会福利;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.3.2 Nash Equilibria

“11.3.2 Nash Equilibria”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查效用偏好;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.3.3 Pareto Efficiency

“11.3.3 Pareto Efficiency”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查占优策略;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.3.4 Maximising Social Welfare

“11.3.4 Maximising Social Welfare”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查纳什均衡;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.4 Competitive and Zero-Sum Interactions

“11.4 Competitive and Zero-Sum Interactions”细化本单元的正式问题,需要映射到参与者、信息、行动、结果和失败边界。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查帕累托;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.5 The Prisoner's Dilemma

“11.5 The Prisoner's Dilemma”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查社会福利;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.5.1 The shadow of the future

“11.5.1 The shadow of the future”细化本单元的正式问题,需要映射到参与者、信息、行动、结果和失败边界。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查效用偏好;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.5.2 Program Equilibria

“11.5.2 Program Equilibria”是需要从行动与收益表计算的博弈性质,不能由总收益或一次轨迹目测。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查占优策略;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.6 Other Symmetric 2 x2 Interactions

“11.6 Other Symmetric 2 x2 Interactions”细化本单元的正式问题,需要映射到参与者、信息、行动、结果和失败边界。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查纳什均衡;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.7 Representing Multiagent Scenarios

“11.7 Representing Multiagent Scenarios”决定感知、内部状态、目标与行动怎样连接,应在相同环境轨迹上比较。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查帕累托;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

11.8 Dependence Relations in Multiagent Systems

“11.8 Dependence Relations in Multiagent Systems”决定感知、内部状态、目标与行动怎样连接,应在相同环境轨迹上比较。 在“博弈模型枚举参与者、行动和收益;纳什均衡只排除单方有利偏离,帕累托效率排除不伤害任何人的改进,社会福利则聚合个体效用。”这条联合因果链中,本节点重点检查社会福利;只改变一个条件并保存联合轨迹,若出现“把高社会福利结果误称为纳什均衡,未检查单方偏离”,就在首个分叉停止。

常见误区

术语

小结

  • 博弈模型枚举参与者、行动和收益
  • 纳什均衡只排除单方有利偏离
  • 帕累托效率排除不伤害任何人的改进
  • 社会福利聚合个体效用
  • 均衡不保证合作或公平,需逐格检查偏离

容易踩的坑

误区 1

现象 → 误判博弈类型 原因 → 合作机制用在竞争场景 修法 → 先画收益矩阵再定机制

误区 2

现象 → 把纳什均衡当最优 原因 → 均衡可能整体低效 修法 → 对比帕累托效率评估

误区 3

现象 → 忽略交互的非平稳性 原因 → 对手学习使策略失效 修法 → 定期重评估均衡

练习与答案

前后导航

练习

练习

问题 1: 纳什均衡的含义?

问题 2: 零和与混合动机博弈的区别?

问题 3: 构造一个 2×2 收益矩阵并找出纯策略纳什均衡。(独立实现)

讨论

评论区加载中…