遇见数据集

Chess-World-Model

收藏
github2026-05-28 更新2026-06-03 收录
官方服务:

资源简介:

Chess-World-Model是一个用于测试序列模型是否能在动作历史中保持精确潜在状态的基准。该任务不是下棋,而是给定一个合法的UCI移动序列,模型必须重构游戏每个前缀后的完整国际象棋状态。该基准基于来自公开Lichess开放数据库的真实游戏和通过均匀采样合法移动生成的分布外随机均匀分割构建,将人类游戏的分布内泛化与合法但非人类轨迹下的规则一致状态跟踪分离开来。

Chess-World-Model is a benchmark for testing whether sequence models can maintain accurate latent states from action histories. Rather than playing chess, the task requires that given a legal UCI move sequence, the model must reconstruct the complete chess state after each prefix of the game. This benchmark is constructed using real games from the public Lichess Open Database and out-of-distribution random uniform splits generated by uniformly sampling legal moves. It separates the in-distribution generalization of human gameplay from rule-consistent state tracking on legal but non-human trajectories.

创建时间:
2026-05-26
原始信息汇总

数据集概述

Chess-World-Model 是一个用于评估序列模型在动作历史中维持精确潜在状态能力的基准测试集。该基准基于从 Lichess 公开数据库获取的真实棋局,以及通过均匀采样合法棋步生成的随机棋局,规模为1000万局。

核心任务

  • 精确状态追踪:给定一个合法的 UCI 棋步序列,模型需在棋局的每个前缀后重建完整的国际象棋状态。状态包括:棋子布局、轮到谁走、王车易位权利、吃过路兵状态和步数计数器。
  • 分类预测:模型在每个时间步预测 75 个分类状态标签,涵盖所有 64 个棋盘格子以及 FEN 格式的辅助变量。

数据构成

  • 真实棋局:来自 Lichess 公开数据库,论文使用 2025年3月的棋局作为训练/验证集,2025年4月的棋局作为保留的真实棋局测试集。
  • 随机棋局:通过均匀采样合法棋步生成,用于检测模型是否依赖熟悉棋局中的捷径。
  • 数据规模:基准测试包含最多 1000 万局保留棋局。

数据格式与处理

  • 原始数据:Lichess 数据库提供的 PGN 格式文件(.pgn.zst)。
  • 处理流程:使用 python-chess 重放每局棋,将每个 UCI 棋步编码为分类棋步令牌,并写入分片的 JSONL 文件。
  • 数据详情:每个 JSONL 样本包含对齐的 moves(棋步)和 states(状态)。

基准测试集

  • 保留真实棋局测试集:来自 2025年4月的 Lichess 棋局,用于评估模型在未见过的真实棋局上的表现。
  • 随机均匀合法棋步测试集:通过均匀采样合法棋步生成,用于评估模型在非人类但规则合法的棋局上的状态追踪能力。

支持的模型

基准测试提供了一个统一的协议,用于训练和评估以下模型:

  • Transformer
  • SLiCE
  • Mamba-3
  • Gated DeltaNet

评估指标

  • 精确状态预测:在每一步预测完整的棋盘状态,包括所有 64 个格子的棋子类别、轮到谁走、王车易位权利、吃过路兵状态和步数计数器。

许可协议

  • 代码:基于 MIT 许可协议发布。
  • 数据:Lichess 数据库导出文件在 CC0 许可协议下分发。

相关信息

搜集汇总
数据集介绍
Chess-World-Model 数据集图片
构建方式
国际象棋作为策略博弈的典范,其状态空间的高维特性为序列模型的隐性表征能力提供了严苛的检验场。Chess-World-Model数据集基于Lichess开源数据库中2025年3月的标准等级分对局构建,通过python-chess引擎重放每局棋谱,将每步通用象棋接口(UCI)走法编码为类别型走法标记,并与走法序列前缀对应的完整棋盘状态进行对齐。棋盘状态涵盖七十五个类别标签,包括六十四格棋子布局、行棋方、王车易位权限、吃过路兵状态及步数计数器。数据集以分片JSONL格式存储,每个样本包含对齐的走法序列与状态序列,规模达一千万局,同时生成基于均匀随机合法走法的分布外测试集,以区分人类对局的分布内泛化与规则约束下的状态追踪能力。
特点
该数据集的核心特点在于其双重测试结构:保留的真实人类对局测试集(取自2025年4月数据)与均匀随机合法走法生成的分布外测试集,能够揭露模型对熟悉棋局位置的潜在捷径依赖。每个时间步要求模型同时预测七十五个分类状态标签,涵盖棋盘所有方格及FEN格式辅助变量,实现了对精确状态追踪能力的全面度量。数据集配套了统一的模型接口,支持Transformer、SLiCE、Mamba-3及Gated DeltaNet等四种序列架构,在共享的走法到状态预测协议下进行训练与评估,参数规模从三百万到三千八百万不等,为序列模型隐性状态表征研究提供了标准化基准。
使用方法
数据集的使用需首先从Lichess数据库下载PGN格式对局文件,随后通过data.process模块执行重放与对齐处理,生成分片JSONL训练数据。训练入口为main.py,通过--experiment_config参数选择预设模型配置,支持Transformer、SLiCE、Gated DeltaNet及Mamba-3四种架构。评估阶段使用evaluation.evaluate_on_test_sets模块,对保留的真实对局测试集与随机均匀测试集进行批量评估,输出JSON格式结果及汇总TSV文件。训练支持余弦或线性学习率调度,并可通过CLI参数覆盖配置文件中任意超参数,实现灵活的实验定制。
背景与挑战
背景概述
Chess-World-Model是由Benjamin Walker与Terry Lyons于2026年提出的一个大规模基准数据集,旨在评估序列模型对动作历史中精确潜在状态的追踪能力。该数据集基于Lichess公共数据库中的千万级真实棋局构建,并辅以均匀随机合法走法生成的分布外测试集,以分离人类对局中习得的模式与纯粹遵循规则的泛化能力。其核心研究问题在于检验Transformer、Mamba等序列模型能否从合法的国际象棋走法序列中,精确重构每一步后的完整棋局状态,包括子力分布、走子方、王车易位权、过路兵状态及回合计数等75个分类标签。该基准为探索序列模型的内部状态表示能力提供了严谨的评估框架,对理解深度学习中符号推理与状态追踪的边界具有重要推动力。
当前挑战
该数据集面临的首要挑战是解决序列模型在精确状态追踪任务中的固有缺陷,即模型需在无显式符号推理辅助下,从长程走法序列中维持无歧义的局态表征,这对依赖注意力机制或循环更新的架构提出了严苛的归纳偏置要求。构建过程中,数据处理需处理来自Lichess的超大规模PGN文件(单月压缩包达数十GB),并通过重放每局棋、对齐UCI走法与完整FEN状态,生成序列化的JSONL样本,涉及高效I/O与内存管理难题。此外,随机均匀合法走法测试集的生成需确保走法序列在规则合法前提下完全偏离人类典型模式,以暴露模型对常见局面的路径依赖,这要求在采样过程中深度耦合国际象棋规则引擎,避免生成无意义状态。
常用场景
经典使用场景
Chess-World-Model基准数据集专为评估序列模型在执行动作历史后维护精确隐状态的能力而设计。其核心任务要求模型在给定合法的UCI走法序列后,重建每一步前缀后的完整国际象棋棋盘状态,包括棋子布局、走棋方、王车易位权、过路兵状态以及回合计数器等75个类别状态标签。该数据集的独特之处在于同时包含了来自Lichess公开数据库的真实人类对局和通过均匀随机采样合法走法生成的分布外样本,从而分离了在人类对局上的分布内泛化与在非人类但符合规则的轨迹下的状态跟踪能力。
衍生相关工作
该数据集衍生了一系列关于序列模型结构设计的经典评估工作。研究者在统一的动作-状态预测协议下训练了Transformer、SLiCE、Mamba-3和Gated DeltaNet等多种现代序列模型,涵盖了从传统注意力机制到状态空间模型的不同架构家族。这为比较不同模型在状态跟踪任务上的表现提供了系统性的实验框架,并催生了一系列关于模型容量、序列长度和状态表示维度之间关系的研究。该基准也启发了后续在其他符号推理领域(如数学方程推导和程序执行)构建类似的精确状态跟踪评估集的工作。
数据集最近研究
最新研究方向
Chess-World-Model基准的提出,标志着序列模型在精确状态追踪领域迈入了一个全新的评估阶段。该基准基于Lichess开源数据库中千万级真实对局数据,并创新性地引入了均匀随机合法走子生成的非分布内测试集,从而将模型在人类棋谱上的泛化能力与在非典型却符合规则的轨迹下的状态跟踪能力清晰剥离。当前前沿研究聚焦于利用这一基准系统性地检验Transformer、SLiCE、Mamba-3及Gated DeltaNet等序列架构在每一步后重构完整棋局状态——包括棋子布局、走子方、王车易位权、吃过路兵状态及回合计数器——的精确程度。这一工作紧密关联大语言模型与状态空间模型在长程依赖与隐性状态保持能力上的热点讨论,其深远意义在于为可验证的、细粒度的状态追踪任务提供了标准化评测平台,有力推动了序列模型从模式匹配向真正理解动态系统规则的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务