chess-stockfish-il-10m-d10-mpv5
收藏资源简介:
该数据集名为Chess Stockfish IL 10M D10 MPV5,是一个专门用于国际象棋模仿学习和策略蒸馏的数据集,包含1000万个由Stockfish国际象棋引擎标注的棋局局面。其核心目的是为国际象棋策略/价值神经网络的预训练提供数据支持,通常作为强化学习或自我对弈训练前的初始化步骤。数据集基于150,325局实际对局的PGN数据库导出构建,并采用Creative Commons CC0许可证发布。在技术规格上,数据生成时使用了Stockfish引擎,搜索深度为10,并采用MultiPV=5的设置以获取多个候选着法,每个局面标注了前5个最优着法(Top-K policy targets)。数据集以PyTorch张量分片的形式组织,共100个分片,每个分片包含10万个样本。原始数据大小约为12.6 GiB,压缩后为713 MiB。数据编码方面,棋盘状态使用18个执子方视角的标准平面进行编码,动作空间被编码为64×64×5,共计20,480个可能的动作。每个数据样本包含丰富的字段,如棋盘状态、当前执子方、人类棋手实际着法、Stockfish推荐的着法ID、中心兵分数、策略概率、局面价值、对局最终结果价值、合法着法索引结构,以及步数、对局ID等着法编号辅助信息。该数据集适用于国际象棋模仿学习、Stockfish策略蒸馏、策略与价值网络的预训练、离线强化学习研究,以及作为AlphaZero风格自我对弈训练前的网络初始化。
The dataset is named Chess Stockfish IL 10M D10 MPV5 and contains 10 million chess positions annotated by the Stockfish chess engine, specifically designed for imitation learning and policy distillation. Its core purpose is to provide data support for pre-training chess strategy/value neural networks, typically serving as an initialization step before reinforcement learning or self-play training. The dataset is constructed from a PGN database of 150,325 actual games and released under the Creative Commons CC0 license. Technically, data generation uses the Stockfish engine with a search depth of 10 and MultiPV=5 settings to obtain multiple candidate moves, with each position annotated with the top 5 optimal moves (Top-K policy targets). The dataset is organized as PyTorch tensor shards, with 100 shards each containing 100,000 samples. The raw data size is approximately 12.6 GiB, compressed to 713 MiB. In terms of data encoding, the board state is encoded using 18 standard planes from the side-to-move perspective, and the action space is encoded as 64×64×5, totaling 20,480 possible actions. Each data sample includes rich fields such as board state, side to move, human players actual move, Stockfish-recommended move IDs, centipawn scores, policy probabilities, position values, game result values, legal move sparse indexing structures, and auxiliary information like ply, game ID, and move number. This dataset is suitable for chess imitation learning, Stockfish policy distillation, pre-training of policy and value networks, offline reinforcement learning research, and as network initialization before AlphaZero-style self-play training.
数据集概述
该数据集专为国际象棋模仿学习与策略蒸馏设计,包含1000万个经Stockfish引擎标注的棋局局面,适用于策略/价值神经网络的预训练。
核心参数
- 样本数量:10,000,000个局面
- 引擎配置:Stockfish,搜索深度10层,MultiPV(多主变)值5
- 格式:PyTorch张量分片(每片100,000样本,共100片)
- 尺寸:原始12.6 GiB,压缩后713 MiB
数据来源
源自150,325场对局的PGN数据库导出,遵循CC0许可协议。
编码方式
- 棋盘编码:18通道标准化棋盘平面(当前走棋方视角)
- 动作编码:64×64×5 = 20,480种动作空间
- 策略目标:Top-5动作概率分布
张量字段说明
每个.pt分片包含以下字段:
| 字段名 | 维度 | 含义 |
|---|---|---|
boards |
[N, 18, 8, 8] | 棋盘状态 |
side_to_move |
[N] | 当前走棋方 |
human_action |
[N] | 人类对局动作 |
sf_action_ids |
[N, 5] | Stockfish推荐动作ID |
sf_scores_cp |
[N, 5] | 引擎评分(厘兵值) |
sf_policy |
[N, 5] | 引擎策略概率 |
value_cp |
[N] | 局面价值(厘兵值) |
value_tanh |
[N] | 双曲正规范化价值 |
result_value |
[N] | 对局结果价值 |
legal_offsets |
[N+1] | 合法动作索引偏移 |
legal_ids |
不规则数组 | 合法动作ID列表 |
ply / game_id / move_number |
- | 对局步数/ID/编号 |
预期用途
- 国际象棋模仿学习
- Stockfish策略蒸馏
- 策略/价值网络预训练
- 离线强化学习研究
- 自对弈训练的初始化




