据Ars Technica 2026年9月11日报道,研究人员用数学模型研究了一类策略会演化、回报随机变化的博弈,考察现实中不断变动的收益和后果如何影响选择。传统博弈通常在一个静态背景下进行:每种结果对应的回报保持不变。报道称,这种设定限制了博弈论与真实行为的关联,因为在现实生活中,战略选择的回报和后果始终在变化。
在这项研究中,研究人员把演化策略和随机变化的回报同时纳入模型,分析一系列博弈。囚徒困境被用作理解这类问题的经典框架。
报道回顾称,囚徒困境涉及两名被捕后分别接受审讯的窃贼。如果两人都保持沉默,他们会因较轻的罪行受到惩罚;如果其中一人达成协议,也就是背叛,那么该囚徒获释,另一人面临更重的刑罚;如果两人都达成协议,则两人都受到介于两者之间的惩罚。
在这一框架下,运行博弈的人可以为合作和背叛设定不同回报,以探索最优策略如何随回报和风险变化。参与者则可以通过在多轮博弈中调整策略,逐步发现更有利的做法。报道称,根据保持沉默即合作的回报与背叛回报之间的平衡,博弈最终会稳定在所有人背叛所有人的状态。在这种简单情形中,每个人都输。
报道将随机回报引入经典竞赛,意在让模型更贴近现实:现实中的奖励和惩罚并非固定不变,策略也不断调整。囚徒困境的例子表明,当合作回报与背叛诱惑的对比发生变化时,个体选择会随之改变,而所有参与者都采取背叛策略时,集体结果对每个人都不利。