遇见数据集

chess-stockfish-il-10m-d10-mpv5

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

该数据集名为Chess Stockfish IL 10M D10 MPV5,是一个专门用于国际象棋模仿学习和策略蒸馏的数据集,包含1000万个由Stockfish国际象棋引擎标注的棋局局面。其核心目的是为国际象棋策略/价值神经网络的预训练提供数据支持,通常作为强化学习或自我对弈训练前的初始化步骤。数据集基于150,325局实际对局的PGN数据库导出构建,并采用Creative Commons CC0许可证发布。在技术规格上,数据生成时使用了Stockfish引擎,搜索深度为10,并采用MultiPV=5的设置以获取多个候选着法,每个局面标注了前5个最优着法(Top-K policy targets)。数据集以PyTorch张量分片的形式组织,共100个分片,每个分片包含10万个样本。原始数据大小约为12.6 GiB,压缩后为713 MiB。数据编码方面,棋盘状态使用18个执子方视角的标准平面进行编码,动作空间被编码为64×64×5,共计20,480个可能的动作。每个数据样本包含丰富的字段,如棋盘状态、当前执子方、人类棋手实际着法、Stockfish推荐的着法ID、中心兵分数、策略概率、局面价值、对局最终结果价值、合法着法索引结构,以及步数、对局ID等着法编号辅助信息。该数据集适用于国际象棋模仿学习、Stockfish策略蒸馏、策略与价值网络的预训练、离线强化学习研究,以及作为AlphaZero风格自我对弈训练前的网络初始化。

The dataset is named Chess Stockfish IL 10M D10 MPV5 and contains 10 million chess positions annotated by the Stockfish chess engine, specifically designed for imitation learning and policy distillation. Its core purpose is to provide data support for pre-training chess strategy/value neural networks, typically serving as an initialization step before reinforcement learning or self-play training. The dataset is constructed from a PGN database of 150,325 actual games and released under the Creative Commons CC0 license. Technically, data generation uses the Stockfish engine with a search depth of 10 and MultiPV=5 settings to obtain multiple candidate moves, with each position annotated with the top 5 optimal moves (Top-K policy targets). The dataset is organized as PyTorch tensor shards, with 100 shards each containing 100,000 samples. The raw data size is approximately 12.6 GiB, compressed to 713 MiB. In terms of data encoding, the board state is encoded using 18 standard planes from the side-to-move perspective, and the action space is encoded as 64×64×5, totaling 20,480 possible actions. Each data sample includes rich fields such as board state, side to move, human players actual move, Stockfish-recommended move IDs, centipawn scores, policy probabilities, position values, game result values, legal move sparse indexing structures, and auxiliary information like ply, game ID, and move number. This dataset is suitable for chess imitation learning, Stockfish policy distillation, pre-training of policy and value networks, offline reinforcement learning research, and as network initialization before AlphaZero-style self-play training.

创建时间:
2026-07-14
原始信息汇总

数据集概述

该数据集专为国际象棋模仿学习与策略蒸馏设计,包含1000万个经Stockfish引擎标注的棋局局面,适用于策略/价值神经网络的预训练。

核心参数

  • 样本数量:10,000,000个局面
  • 引擎配置:Stockfish,搜索深度10层,MultiPV(多主变)值5
  • 格式:PyTorch张量分片(每片100,000样本,共100片)
  • 尺寸:原始12.6 GiB,压缩后713 MiB

数据来源

源自150,325场对局的PGN数据库导出,遵循CC0许可协议。

编码方式

  • 棋盘编码:18通道标准化棋盘平面(当前走棋方视角)
  • 动作编码:64×64×5 = 20,480种动作空间
  • 策略目标:Top-5动作概率分布

张量字段说明

每个.pt分片包含以下字段:

字段名 维度 含义
boards [N, 18, 8, 8] 棋盘状态
side_to_move [N] 当前走棋方
human_action [N] 人类对局动作
sf_action_ids [N, 5] Stockfish推荐动作ID
sf_scores_cp [N, 5] 引擎评分(厘兵值)
sf_policy [N, 5] 引擎策略概率
value_cp [N] 局面价值(厘兵值)
value_tanh [N] 双曲正规范化价值
result_value [N] 对局结果价值
legal_offsets [N+1] 合法动作索引偏移
legal_ids 不规则数组 合法动作ID列表
ply / game_id / move_number - 对局步数/ID/编号

预期用途

  • 国际象棋模仿学习
  • Stockfish策略蒸馏
  • 策略/价值网络预训练
  • 离线强化学习研究
  • 自对弈训练的初始化
搜集汇总
数据集介绍
chess-stockfish-il-10m-d10-mpv5 数据集图片
构建方式
该数据集专为象棋领域的模仿学习与策略蒸馏而设计,包含一千万个由Stockfish引擎标注的棋局位置。数据源自150,325局对弈,采用深度为10的搜索与MultiPV设置为5的多变例分析,生成Top-5策略目标。所有样本以PyTorch张量分片形式存储,每片包含十万个样本,共一百片,并采用18通道的棋盘编码与20,480维的动作编码,确保信息完整且高效。
特点
数据集特色在于其高规模的样本量与精细的标注质量。每一样本包含棋盘状态、走子方、人类动作、Stockfish推荐动作及其评分、策略概率、局面价值等多个张量字段,支持丰富的监督信号。此外,数据集经过验证所有分片均有效,压缩后仅713 MiB,便于存储与加载,同时保持原始数据12.6 GiB的精度。
使用方法
适用于象棋模仿学习、策略蒸馏、价值网络预训练及离线强化学习研究。使用时,通过加载PyTorch张量分片,可提取棋盘、动作、策略与价值信息进行模型训练。该数据集特别推荐用于自我对弈训练前的初始化,或作为无搜索引擎的基线训练基础,引用自CC0许可的PGN数据库。
背景与挑战
背景概述
该数据集由研究者于2024年创建,依托Stockfish引擎与PyTorch框架构建,旨在为国际象棋领域的模仿学习与策略蒸馏提供大规模标注数据。核心研究问题在于如何通过监督学习预训练策略/价值神经网络,以降低后续强化学习或自我对弈的样本复杂度。数据集包含1000万棋局位置,每局面经Stockfish深度10搜索及MultiPV=5分析,生成多动作概率分布与价值标签,显著提升了策略蒸馏的精度。其公开的CC0许可与压缩格式(713 MiB)极大降低了研究门槛,已成为国际象棋AI领域预训练的基础资源,尤其对无需搜索的轻量级引擎训练具有里程碑式的影响。
当前挑战
该领域面临的首要挑战在于棋局策略的复杂性:Stockfish的深度搜索评估需平衡准确性、速度与资源消耗,而策略蒸馏常因模型容量有限导致高阶战术模式丢失。数据集构建中,从150,325局棋谱提取1000万样本时,需确保局面-动作对的多样性以模拟真实的搜索树分布,同时避免局部最优解。此外,动作编码(20,480维)与不完整策略标签(仅保留Top-5)引入稀疏性问题,使得价值函数估计在高维动作空间中易受噪声干扰,离线训练的策略网络难以泛化至未经充分采样的局面。
常用场景
经典使用场景
在国际象棋人工智能研究领域,该数据集最经典的使用场景是作为模仿学习与策略蒸馏的预训练语料。通过将Stockfish引擎在搜索深度10、多主变5的条件下生成的千万级棋局位置及其对应的最优策略、价值函数转化为监督学习信号,研究者能够训练出具备强先验知识的策略网络与价值网络。这一过程为后续的强化学习或自我对弈训练提供了高质量的初始化权重,显著加速模型收敛并提升最终棋力。该数据集以PyTorch张量切分形式存储,包含标准化的棋盘编码、动作空间及合法性掩码,便于直接集成到深度学习框架中,是构建无搜索轻量级引擎(如Lichess上的Joey_ChessEngine)的基石。
衍生相关工作
该数据集衍生了多项经典工作,其中之一是将策略蒸馏与强化学习交替进行的迭代训练范式。研究者先利用该数据集预训练模型,再通过自我对弈生成新数据并混合原始数据微调,持续提升模型棋力而无需依赖外部引擎。另一方向是探索更高效的价值函数表示:基于该数据集的`value_tanh`和`result_value`字段,学者们对比了不同价值头(如双头架构、分位数回归)对终局预测准确率的影响。此外,该数据集还被用于验证新型动作空间表征(如对比学习编码)在小样本条件下的泛化能力,以及研究Transformer架构相比于传统卷积网络在规划任务中的优势。这些工作共同推动了从数据驱动的神经网络训练到自主博弈智能体构建的完整技术链条。
数据集最近研究
最新研究方向
该数据集聚焦于国际象棋领域的模仿学习与策略蒸馏前沿方向,依托Stockfish引擎在固定搜索深度与多主变量模式下生成的千万级标注局面,为无搜索引擎的预训练提供了高保真行为模板。这一研究范式与近期强化学习中“离线预训练-在线微调”的热点趋势紧密呼应,通过大规模监督式策略提取显著降低了自对弈初始阶段的试错成本,为棋类AI从规则驱动向数据驱动转型奠定了数据基础设施。其对20,480维动作空间的紧凑编码与18通道棋盘表示,亦为视觉-策略联合建模提供了可复用的基准,推动了神经架构在离散控制问题中的泛化能力评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务