博弈论中的“囚徒困境”模型

博弈论及其应用

维普资讯 www.51wendang.com

新探 2 0年第 8期 ( 0B总第 1 5 ) 9期

博弈论中的 ■王家辉 日常生活中买卖会重复进行,国白。 范例,是 15它 9 0年 T c e提出的,完次审讯, uk r其

模型

“徒困境”型是博弈论中的经典会重复进行,比如犯罪团伙会被警方多白,了报复对手的背叛,囚模为以后都选择坦

全信息下的静态博弈为广大博弈论的工际间的战争此伏彼起。而且人们也发现

假定囚徒 j格执行上述冷酷战严

作者和初学者所掌握,成为解释生活现基本博弈的重复进行并非基本博弈的简略,考察囚徒 i的最优策略是否为冷酷

象的有力工具。其实“囚徒困境”模型随单累加,比如商业中的回头客问题。面战略?如果 i下在博弈的某个阶段首先选 着博弈论的深入发展,具有各种不同的继续以表 1示的“所囚徒困境”型为例择了坦白,在该阶段得到 0而不是一模他, 形式,通常分为:全信息的静态博弈,对多重博弈进行探讨。完 1但他的这次背叛会遭到囚徒 j永远,的首先观察“徒困境”囚的有限博弈,惩罚,因此 i随后每个阶段的支付都 在以 T记基本博弈的重复次数。博弈重复是一。如果下列条件满足,态博弈及不完全信息的动态博弈四种形 3给定 j没有选式。 进行所耗时间会比较长,支付的时间价择坦白,将不会选择坦白: i 完全信息静态“囚徒困境”弈值必须考虑, r折现因子。有限博 博记为在 0 r 3+2 3+≤一+ ( 1 r一 )+ ( )r一 )…一 ( 1 r ) 2 1+ _+ ( 一

完全信息的动态博弈,不完全信息的静

完全信息静态“囚徒困境”博弈部分弈的情况下,可简化在 r l=的情况下讨地奠定了非合作博弈论的理论基础。它论,并采用动态博弈的逆向归纳法进行

B . 0一

≤一

r/( 的基本模型是:警察抓住了两个合伙犯研究:危分析 tT阶段两博弈方的选择,解上述不等式得:≥13这个条件容易= 满足 )就是说,果 r 13给定 j持。如≥/,坚罪的罪犯,由于缺乏足够的证据指证他 这仍然是一个基本的囚徒困境博弈,此没有

首先坦白,不会选 i们的罪行,所以希望这两人中至少有一时前一阶段的结果已成为事实,又无后冷酷战略并且 j 人供认犯罪,能确认罪名成立。此警 续阶段,此不难得出结论,一阶段的择首先坦白。就为因这进一步假定 j先选择坦白,么 i首那 察将这两个罪犯分别关押以防止他们串结果是 (白,白 )双方得益 ( 3一 )坦坦,一,3。

供,并告诉他们警方的政策是“白从现在回到 tT 1阶段,理性的博弈方对是否有积极性坚持冷酷战略以惩罚 j的坦=一坚持冷酷战略,他随宽,拒从严”如果两人中只有一人坦于后一阶段的结局非常清楚,其结果必不合作行为?如果 i抗: 3白认罪,坦白者立即释放,另一人则然是 (白,白 )此不管现阶段的博 后每个阶段的支付是一,但如果他选择则而坦坦,因将重判 5年徒刑;如果两个同时坦白认 弈结果是什么,双方在本阶段以后的最其他战略,他在任何单一阶段的支付都 3因此,论 r多大,都有无是 i罪,则他们将各判 3年监禁。当然罪犯知终得益都是在本阶段得益的基础上各加 不会大于一,积极性坚持冷酷战略。在博弈重复无数道如果他们两人都拒不认罪,则警方只上一,时的得益矩阵是: 3此 次的情况下,只要 r> 13子博弈精炼/,能以较轻的妨碍公务罪判处他们 1徒年表 2 囚徒 2 均衡是每个阶段博弈双方都采用抵赖进刑。矩阵表示两个罪犯的得益如下 (用得坦白不坦白益向量的第一个数字是囚徒 1的得益, 第二个数字是囚徒 2的得益 ): 表 1 囚

坦白

(6一 (3一 )一,6)一, 8

行合作。 三、完全信息静态“徒困境” 不囚博弈

徒 1

不坦白 ( 8,3 ( 4— -一 ) -,4)

囚徒 2 坦白不坦白坦白 ( 3一 -,3) ( - 0,5)不坦白 (5,) (, ) - 0一1一1

徒 1

由于现实生活中许多博弈并不满足容易看出,坦白仍是两博弈方的严格优完全信息的要求,比如买卖双方都对彼超策略, (白,白 ) T 1阶段的唯即坦坦是一此的信息掌握不完全,买者不知卖

者产的纯 N s衡。 ah均 一

以此往上类推,阶段“徒困境”品的质量到底如何,卖者也不知道买者每囚 假定两个罪犯熟悉彼此,这便是一个同博弈的结果都是博弈双方采用坦白, 愿意付出多高的价格等等,因此研究不所时行动的完全信息静态博弈。容易看出,以 T次重复博弈的子博弈精炼 N s ah均完全信息下的博弈有着重要的理论和现实意义。 由于对于每个囚徒而言,无论对方选择衡是每个博弈阶段双方都采用坦白。 什么策略,白都是自己的最优策略,坦所再考虑“徒困境”博弈重复无数 囚假定囚徒 1两种类型,性的 (有理或和有以(白,白)坦坦是博弈的 N s ah均衡。 次。因为无限博弈没有最终阶段,以不称为不合作的 )非理性的 (意愿合作所的 )概率分别为 1 p和 P又假定囚徒 2, -, 二、完全信息动态“囚徒困境” 能运用逆向归纳法求解。考虑博弈双方博只有一种类型一一理性的。假定理性的弈——重复“徒困境”弈囚博都采用“冷酷战略” ( ): 1开始阶段选择抵研究重复博弈的意义在于基本博弈赖;2 ( )选择抵赖直到有一方选择了坦囚徒可以选择任意的策略,而非理性的囚徒 1只有一种策略“锋相对”即开针, 基金项目:国家自然科学基金项目(0 70 4。 722 1)

1 9 弥斗量篮

博弈论中的“囚徒困境”模型

你可能喜欢

  • 博弈论应用
  • 博弈论模型
  • 博弈论案例
  • 博弈论分析
  • 电影介绍
  • 博弈模型
  • 中日贸易
  • 博弈论初步

博弈论中的“囚徒困境”模型相关文档

最新文档

返回顶部