Chess-World-Model
收藏资源简介:
Chess-World-Model是一个用于测试序列模型是否能在动作历史中保持精确潜在状态的基准。该任务不是下棋,而是给定一个合法的UCI移动序列,模型必须重构游戏每个前缀后的完整国际象棋状态。该基准基于来自公开Lichess开放数据库的真实游戏和通过均匀采样合法移动生成的分布外随机均匀分割构建,将人类游戏的分布内泛化与合法但非人类轨迹下的规则一致状态跟踪分离开来。
Chess-World-Model is a benchmark for testing whether sequence models can maintain accurate latent states from action histories. Rather than playing chess, the task requires that given a legal UCI move sequence, the model must reconstruct the complete chess state after each prefix of the game. This benchmark is constructed using real games from the public Lichess Open Database and out-of-distribution random uniform splits generated by uniformly sampling legal moves. It separates the in-distribution generalization of human gameplay from rule-consistent state tracking on legal but non-human trajectories.
数据集概述
Chess-World-Model 是一个用于评估序列模型在动作历史中维持精确潜在状态能力的基准测试集。该基准基于从 Lichess 公开数据库获取的真实棋局,以及通过均匀采样合法棋步生成的随机棋局,规模为1000万局。
核心任务
- 精确状态追踪:给定一个合法的 UCI 棋步序列,模型需在棋局的每个前缀后重建完整的国际象棋状态。状态包括:棋子布局、轮到谁走、王车易位权利、吃过路兵状态和步数计数器。
- 分类预测:模型在每个时间步预测 75 个分类状态标签,涵盖所有 64 个棋盘格子以及 FEN 格式的辅助变量。
数据构成
- 真实棋局:来自 Lichess 公开数据库,论文使用 2025年3月的棋局作为训练/验证集,2025年4月的棋局作为保留的真实棋局测试集。
- 随机棋局:通过均匀采样合法棋步生成,用于检测模型是否依赖熟悉棋局中的捷径。
- 数据规模:基准测试包含最多 1000 万局保留棋局。
数据格式与处理
- 原始数据:Lichess 数据库提供的 PGN 格式文件(.pgn.zst)。
- 处理流程:使用
python-chess重放每局棋,将每个 UCI 棋步编码为分类棋步令牌,并写入分片的 JSONL 文件。 - 数据详情:每个 JSONL 样本包含对齐的
moves(棋步)和states(状态)。
基准测试集
- 保留真实棋局测试集:来自 2025年4月的 Lichess 棋局,用于评估模型在未见过的真实棋局上的表现。
- 随机均匀合法棋步测试集:通过均匀采样合法棋步生成,用于评估模型在非人类但规则合法的棋局上的状态追踪能力。
支持的模型
基准测试提供了一个统一的协议,用于训练和评估以下模型:
- Transformer
- SLiCE
- Mamba-3
- Gated DeltaNet
评估指标
- 精确状态预测:在每一步预测完整的棋盘状态,包括所有 64 个格子的棋子类别、轮到谁走、王车易位权利、吃过路兵状态和步数计数器。
许可协议
- 代码:基于 MIT 许可协议发布。
- 数据:Lichess 数据库导出文件在 CC0 许可协议下分发。
相关信息
- 论文:Paper PDF
- 数据来源:Lichess 数据库
- 数据集图示:Dataset figure





