本综述由来自北京大学(Peking University)前沿计算研究中心的孙浩然(Haoran Sun)和吴雨森(Yusen Wu)与江南大学(Jiangnan University)商学院的程郁琨(Yukun Cheng)以及北京大学高可信软件技术教育部重点实验室的楚旭(Xu Chu)共同完成,并发表于《第三十四届国际人工智能联合会议(IJCAI-25)》。本文是一篇系统性综述,旨在梳理和构建博弈论(Game Theory)与大语言模型(Large Language Models, LLMs)这两个领域交汇处的研究全景。
文章的核心背景在于,随着以GPT系列为代表的大语言模型在文本生成与理解能力上取得突破,研究者们开始双向探究这两个领域间的互动:一是利用博弈论工具评估与增强大语言模型的能力,二是探索大语言模型如何重塑并扩展经典的博弈论研究。此前存在的综述多侧重于单向视角,即仅将博弈论作为评测大语言模型的手段,而本文则首次系统性地阐述了二者之间双向的、相互促进的关系。文章围绕三个核心视角展开论述:基于博弈的标准化评估、博弈论驱动的算法创新,以及对大语言模型进行社会影响的博弈建模。
在第一个核心视角,即基于博弈论的评估层面,论文详细梳理了利用博弈模型评测大语言模型决策能力的研究。首先,在行为表现评估上,研究指出大语言模型在处理如“性别之战”等经典矩阵博弈(Matrix Games)时表现挣扎,即使如GPT-4这样的先进模型也常因上下文表述和效用矩阵的设置而表现出显著偏差,无法稳定选择最优策略。然而,在诸如“狼人杀”(Werewolf)、“抵抗组织:阿瓦隆”(Avalon)以及拍卖(Auctions)和讨价还价(Bargaining)等更复杂的、基于自然语言交流的现实博弈场景中,大语言模型却展现出了类似人类的欺骗、信任构建和领导力等策略行为,甚至在定价博弈中自主达成垄断性合谋。文章还介绍了GTBench、γ-Bench等综合性基准测试平台,它们被用于系统性地刻画大语言模型在不同策略环境中的优势与局限。其次,在提升博弈表现方面,综述总结了两种关键技术路径:一是递归思考(Recursively Thinking)框架,如递归沉思(Recon)模型,通过促使模型进行一阶和二阶视角采择来增强长期策略推理能力;二是辅助模块(Auxiliary Modules)的集成,通过引入额外计算工具来弥补大语言模型在复杂数学计算和历史数据检索上的不足。最后,大语言模型的角色也超越了单纯的玩家,其强大的语言理解能力使其能将自然语言描述转化为形式化的博弈结构,或作为人类被试的替代品参与行为经济学实验,从而反哺博弈论研究本身。
在第二个核心视角,即博弈论驱动的算法创新层面,文章阐释了博弈论如何从机理理解和算法改进两个维度推动大语言模型本身的发展。一方面,合作博弈中的Shapley值被广泛用于打开大语言模型的“黑箱”,通过评估输入标记(Tokens)和模型层对输出的贡献度来提升模型的可解释性(Interpretability),例如Tokenshap和TextGenShap等工作。同时,社会选择理论(Social Choice Theory)被用于分析和解决基于人类反馈的强化学习(RLHF)中存在的偏好冲突问题,指出了当前Bradley-Terry模型方法的内在公理化缺陷,并提出了具有代表性的社会选择框架来有效聚合大规模异构偏好。另一方面,博弈论直接激发了大语言模型训练算法的创新。针对标准RLHF仅能捕捉传递性偏好(Transitive Preferences)的局限,基于纳什学习的人类反馈(NLHF)范式被提出,它将偏好建模为一个双策略对抗的博弈,通过寻找冯·诺依曼赢家(von Neumann winner)来优化模型,其衍生算法如SPO、SPPO、DNO等进一步解决了非传递性偏好和训练效率问题。此外,面对人类偏好数据中的异质性(Heterogeneity),MaxMin-RLHF等研究利用平等主义原则(Egalitarian Principle)和博达计数(Borda Count)等社会选择规则,确保了模型对齐的公平性。文章还指出,博弈论思想在提升数据成本效率(如自我博弈微调)和设计生成器与判别器的共识博弈(Consensus Game)等其他两人博弈形式中,均显著提升了大语言模型的准确性和特定能力。
在第三个核心视角,即大语言模型相关的社会影响建模方面,文章将研究分为三个子领域进行归纳。首先是人机竞争模型的研究,如基于图洛克竞赛(Tullock Contest)的模型通过均衡分析表明,大语言模型并不会从根本上取代人类创作者,而是会挤压低效创作者的市场份额。其次,围绕大语言模型本身的产品化和平台化,产生了新的博弈场景。这包括将大语言模型微调作为市场服务的利润分配博弈,以及将广告竞价与大语言模型文本生成深度融合的机制设计,例如研究者们设计了在基于检索增强生成(RAG)框架下,于大语言模型生成内容的每个语篇段落中概率性地插入广告,并能保证激励相容(Incentive Compatibility)的拍卖机制。最后,大语言模型凭借其语义理解和生成能力扩展了经典博弈模型,例如在同伴预测(Peer Prediction)机制中利用大语言模型处理复杂的文本评价以激励高质量反馈,或在拍卖中引入语义增强的个性化估值(Semantic-Enhanced Personalized Valuation)以提升出价策略的准确性。
文章最终识别并提出了若干未来研究方向。其科学价值在于构建了一个连接博弈论与大语言模型的、具有双向互动关系的结构化框架,不仅系统化地归纳了当前分散的研究成果,更通过批判性分析指出了现有评估体系受限于人类认知框架、以及理论理解滞后于现象观察等关键瓶颈。应用价值上,该综述为开发具备通用博弈推理能力的智能体、设计更符合社会道德约束的模型对齐算法,以及构建由大语言模型驱动的、具有理论保障的新型商业机制和市场模型提供了清晰的研究路线图。文章最具启发性的亮点在于其贯穿始终的“双向”视角,它彻底摆脱了将博弈论仅视为工具的固有思维,深刻揭示了二者在方法论和模型层面的协同进化潜力。