该研究提出了一种声誉调节的强化学习模型,将声誉视为影响个体学习与决策的信息来源,而非单纯的外部激励或收益调节因素。研究基于空间囚徒困境博弈,采用Q-learning算法,使智能体通过局部声誉指标整合个体经验与社会信息。结果显示,声誉调节的学习机制显著促进了合作行为的涌现,并观察到随诱惑参数增大,系统出现从完全合作到完全背叛的不连续相变。合作通过合作簇的成核过程扩散,而簇的瓦解则使系统陷入完全背叛的吸收态。该研究揭示了声誉促进合作的深层机制:不仅提供直接激励,更重要的是重塑了社会信息环境,为理解合作涌现提供了新的理论视角。
| Reputation-modulated reinforcement learning | 一种将声誉信息整合到强化学习框架中的方法,智能体利用声誉度量调整学习过程以促进合作。 |
| Spatial prisoner's dilemma game | 一种在空间结构上进行的囚徒困境博弈模型,个体与邻居互动,常用于研究合作涌现。 |
| Q-learning | 一种无模型的强化学习算法,通过更新Q值来学习最优策略,智能体根据状态-动作对的价值做出决策。 |
| Phase transition | 系统状态发生突变的现象,此处指从完全合作到完全背叛的不连续转变。 |
| Nucleation | 合作簇的形成过程,类似于物理中的成核现象,合作行为从局部小簇开始扩散。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅