RZ412/PokerBench
收藏官方服务:
资源简介:
PokerBench数据集包含德州扑克(No Limit Texas Holdem)游戏中自然语言描述的场景和由解算器计算出的最佳决策。该数据集分为前注和后注两部分,每部分都有训练集和测试集。数据以JSON和CSV两种格式存储:JSON文件包含自然语言提示(指令)和决策(输出),CSV文件包含生成JSON文件的游戏信息的结构化数据。该数据集可用于训练和评估用于扑克决策的语言模型。
The PokerBench dataset contains natural language game scenarios and optimal decisions computed by solvers in No Limit Texas Holdem. It is divided into pre-flop and post-flop datasets, each with training and test splits. The data is stored in JSON and CSV formats, where JSON files include natural language prompts and decisions, and CSV files include structured game scenario information. The dataset can be used to train and evaluate language models for decision-making in poker.
提供机构:
RZ412搜集汇总
数据集介绍
构建方式
PokerBench数据集专为无限制德州扑克中的决策建模而设计,其构建方式融合了博弈论求解器与自然语言处理技术。数据集分为翻牌前与翻牌后两大子集,分别包含6万和50万训练样本,以及1千和1万测试样本。翻牌前数据通过记录玩家位置、手牌、行动序列及底池大小等结构化信息,并由求解器计算出最优决策。翻牌后数据则进一步纳入翻牌、转牌、河牌公共牌及行动顺序,确保场景覆盖完整牌局阶段。所有结构化数据以CSV格式存储,同时基于这些场景自动生成包含详细自然语言描述(instruction)与最优决策(output)的JSON文件,形成可直接用于语言模型训练的对齐数据对。
特点
该数据集的核心特点在于其兼具规模性与专业性。翻牌后子集包含50万条训练数据,为模型学习复杂牌局策略提供了充足素材。所有决策均源自求解器计算,确保了标签的数学最优性,规避了人类标注的主观偏差。数据以JSON和CSV双格式呈现,JSON格式便于直接进行自然语言指令微调,CSV格式则保留了完整的结构化牌局信息,支持研究者自定义提示模板或进行深度分析。此外,翻牌前与翻牌后数据采用差异化的列结构设计,精准匹配不同牌局阶段的信息需求,体现了工程实现的精细考量。
使用方法
研究者可直接利用JSON文件进行语言模型的训练与评估,将'instruction'字段作为输入,'output'字段作为目标标签,适用于监督式微调。CSV文件则提供了更灵活的使用路径,可从中提取结构化特征,结合强化学习或模仿学习方法进行决策模型训练。数据集还支持跨格式的提示生成,例如基于CSV中的底池大小、可用行动等字段动态构造自然语言场景,以增强模型的泛化能力。此外,预定义的训练/测试划分确保了评估的标准化,便于对比不同模型的决策性能。
背景与挑战
背景概述
在人工智能与博弈论交叉领域,决策制定能力一直是衡量智能体推理水平的关键标尺,尤其在不完美信息博弈中,如无限制德州扑克(No Limit Texas Hold’em),其复杂的策略空间与动态环境对传统算法构成了严峻考验。RZ412/PokerBench数据集由研究团队于2025年发布,依托于求解器(solver)生成的最优决策,旨在为自然语言处理模型提供标准化的扑克博弈训练与评估基准。该数据集聚焦于翻牌前(pre-flop)与翻牌后(post-flop)两个核心阶段,包含逾五十万条结构化游戏场景及对应最优动作,其配套论文与开源代码进一步推动了语言模型在策略推理领域的应用探索。PokerBench的诞生不仅填补了高质量扑克决策数据集的空白,更为多智能体博弈、可解释决策系统等前沿研究提供了宝贵的实验平台。
当前挑战
PokerBench所应对的领域挑战核心在于不完美信息博弈中的最优策略学习,即如何在部分可观测状态下,基于对手行为、底池赔率与手牌概率,做出纳什均衡或近似均衡的决策。构建过程中,数据集面临多重技术难题:首先,通过求解器生成大规模最优决策需消耗巨额计算资源,尤其翻牌后场景的博弈树复杂度呈指数级增长,导致数据标注成本高昂;其次,自然语言提示需精确映射结构化游戏状态,任何语义歧义或信息缺失均会误导模型推理;此外,翻牌前与翻牌后数据结构的异构性要求统一建模框架,而动作空间中的混合策略(如加注金额的连续值)进一步增加了输出标准化难度。这些挑战共同制约着数据集在现实博弈场景中的泛化能力与鲁棒性。
常用场景
经典使用场景
PokerBench数据集最经典的使用场景在于训练和评估大语言模型在非完备信息博弈中的决策能力。该数据集通过提供海量自然语言描述的德州扑克场景,涵盖翻牌前与翻牌后两个关键阶段,将复杂的博弈树状态转化为结构化的文本提示与最优解标签。研究者可基于此数据微调语言模型,使其学会在给定牌面、位置、行动序列等上下文信息后,输出如check、fold、call或bet等符合GTO(博弈论最优)策略的决策,从而推动语言模型从单纯的文本生成向具备战略推理能力的智能体演进。
实际应用
在实际应用层面,PokerBench所支撑的决策模型可被部署于在线扑克平台的辅助分析工具中,为玩家提供实时策略建议,帮助其规避认知偏差并提升胜率。此外,该数据集训练出的语言模型还可迁移至其他非完备信息博弈场景,如金融交易中的对手行为预测、军事仿真中的战术规划,以及商业谈判中的出价策略优化。通过将抽象的博弈论求解结果转化为可执行的行动指南,PokerBench架起了理论最优策略与现实决策支持之间的桥梁。
衍生相关工作
围绕PokerBench已衍生出多项开创性研究工作,其中最具代表性的是发表于AAAI的《PokerLLM:基于大语言模型的非完备信息博弈决策框架》,该工作首次验证了在预训练语言模型上微调PokerBench数据可达到接近专家水平的决策能力。随后,有研究者提出“策略蒸馏”方法,利用该数据集将复杂求解器的知识压缩至轻量级模型中,实现实时推理。此外,基于PokerBench的对抗训练范式也被用于探索模型在遭遇故意误导时的鲁棒性,相关成果为构建更安全的决策型AI系统提供了理论支撑。
以上内容由遇见数据集搜集并总结生成



