遇见数据集

chess-soft-sf19

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集为 Stockfish 19 多主变(MultiPV)软标签数据集,由 avewright 发布。数据集包含 2,010,006 行,使用紧凑词汇表(1968 个词)。数据通过以下三种方式混合生成:自对弈(Stockfish 19 对弈自身,带 epsilon=0.20 探索和随机合法走法)、重新标记(对现有本地棋局使用新 Stockfish 19 标签)以及 10,000 行冻结评估样本。教师模型为 Stockfish 19 版本 sf_19(EvalFile nn-1a298aa575a0.nnue),搜索参数为 100k 节点 / MultiPV=8 / tau=120。标签包括策略软标签(STM softmax 在最后一个完整 MultiPV-8 迭代上)、软索引、软概率、软 CP 和软将杀值,以及白方绝对视角的 cp/mate/wdl。数据格式为 Parquet,分片存储,并附带 teacher.json、summary.json、audit.json 等元数据文件。该数据集适用于棋类策略学习、价值网络训练等任务,提供高质量的软标签监督信号。

This dataset is a Stockfish 19 Multi-PV soft label dataset released by avewright. It contains 2,010,006 rows with a compact vocabulary of 1,968 tokens. The data is generated via three methods: self-play (Stockfish 19 playing itself with epsilon=0.20 exploration and random legal moves), relabeling (existing local games labeled with new Stockfish 19 annotations), and 10,000 frozen evaluation samples. The teacher model is Stockfish 19 version sf_19 (EvalFile nn-1a298aa575a0.nnue) with search parameters 100k nodes / MultiPV=8 / tau=120. Labels include policy soft labels (STM softmax on the last complete MultiPV-8 iteration), soft indices, soft probabilities, soft CP, soft mate values, and cp/mate/wdl from Whites absolute perspective. Data format is Parquet, sharded, with metadata files teacher.json, summary.json, audit.json. This dataset is suitable for chess strategy learning and value network training, providing high-quality soft label supervision signals.

创建时间:
2026-09-07
原始信息汇总

数据集概述

该数据集由用户 avewright 发布,名为 Stockfish 19 soft targets(chess-soft-sf19),是一个基于 Stockfish 19 引擎生成的国际象棋训练数据集,采用软标签(soft labels)和 MultiPV 技术生成,许可协议为 MIT。

基本信息

  • 数据集名称:Stockfish 19 soft targets
  • 许可证:MIT
  • 标签:国际象棋,Stockfish-19,软标签,MultiPV
  • 数据规模:共 2,010,006 行 数据
  • 源ID4

数据构成

数据集的生成方式包括三类,具体分布如下:

来源 行数 说明
自我对弈(self-play) 0 SF19 对 SF19,ε=0.20,使用开局库+4个随机合法走法
重新标注(relabel) 0 对已有局面使用新的 SF19 标签
冻结评估(frozen eval) 10,000 存放在 data/shard_000000.parquet 中,split=1

重新标注原本计划占 80%,但实际已有局面迭代器在约 84k 个接受标签后停止,剩余约 100万训练数据由自我对弈填充。split=0 表示训练集,split=1 为评估集。

教师模型配置

  • 引擎版本:Stockfish 19 标签 sf_19(提交号 edb0d9db
  • 神经网络文件nn-1a298aa575a0.nnue
  • 评估设置:完整棋力,Threads=1Hash=32,启用 UCI_ShowWDL
  • 节点预算100k 节点 / MultiPV=8 / tau=120
  • 自我对弈搜索:每个标签阶段使用 4k 节点快速搜索,从第4步后每隔3步进行标签

目标标签说明

  • 策略标签:使用 Softmax(tau=120)对最后的完整 MultiPV-8 迭代结果进行计算
  • 未搜索的合法走法不会出现在标签中,但这并不代表它们是差棋
  • 将杀评分:使用 sign * (100000 - min(|mate|, 1000)) 表示,而非直接使用将杀步数
  • 界限外的分数会被丢弃
  • cp / mate / wdl 均为白方绝对视角
  • 软标签数组soft_indicessoft_probs 宽度为8,填充值分别为 -10
  • 辅助存储soft_cpssoft_mates 用于在不运行引擎的情况下重建 Softmax 概率

质量审计

对 2,000 个独立局面进行了 100k/8 与 1M/8 的对比审计:

  • top-1 对比 1M 搜索:无差异
  • 后悔值(regret):p50=0,p90=0,均值=0
  • 1M 参考质量的缺失:p50=0.0%,p90=0.0%

审计结果存储于 audit.json 文件中。

文件结构

数据集包含以下文件:

  • data/shard_XXXXXX.parquet — 数据分片文件
  • teacher.json — 教师模型配置及文件哈希信息
  • summary.json — 数据摘要信息
  • sampling.json — 采样配置信息
  • audit.json — 质量审计结果
  • eval_manifest.json — 评估清单信息

使用注意事项

  • 应遵循数据集中的 split 字段划分训练集和评估集
  • shard_000000 是冻结的评估集(saved_split_v1),不应将其混入训练集
  • 不应自行创造新的局面哈希留出集

特殊说明

  • 该数据集并不是 chess-soft-multipv-lichesschess-soft-100m-disagreements 的过滤版本,而是一个全新生成的独立数据集
  • 仅使用 FEN 的重新标注行会丢弃重复历史信息,且若没有合法的吃子走法,可能省略过路兵(EP)信息
搜集汇总
数据集介绍
chess-soft-sf19 数据集图片
构建方式
该数据集由官方Stockfish 19引擎生成,采用MultiPV(多候选)搜索策略,在每局对弈中设置100k节点预算,并以MultiPV=8、温度参数tau=120进行软标签(soft labels)的采样。其构建起源于自我对弈(self-play)与已有棋盘重新标注(relabel)双通道,前者采用ε=0.20的探索策略,并辅以开局库及随机合法着法;后者则对现有局面应用新版引擎重新评估。尽管设计预期relabel占80%,实际接受标签仅达84k,剩余训练数据由自我对弈补齐。所有标签均基于完整搜索的末次迭代,策略由softmax函数转化,确保概率分布平滑,且包含cp、mate、WDL等多个价值的白方绝对视角的评估指标。
特点
该数据集蕴含2,010,006行高质量数据,源自Stockfish 19特定版本(sf_19,哈希edb0d9db),并配套完整评估文件。核心特性在于其软标签策略:通过MultiPV-8搜索获取八条候选走法,并以温度tau=120的softmax函数生成概率分布,使低差异的着法获得非零概率,从而提升训练的泛化能力。标签包括cp、mate及WDL(胜平负概率),其中mate采用特定编码以减少极端值影响。数据集亦通过2,000个隔离位置进行质量审计,保证了其与更高搜索预算(1M节点)输出的一致性,遗憾值(regret)中位数与90百分位均为零,缺失参考概率质量亦近乎于零,验证了其可靠性。
使用方法
使用该数据集时,需严格遵守split划分,即split=0作为训练集,split=1作为冻结的评估集(固定为shard_000000.parquet)。应依据parquet文件中的列,如soft_indices与soft_probs,重建策略头的监督目标,或利用soft_cps与soft_mates于不需额外引擎环境下自行计算软标签。数据包含FEN字符串,可配合chess库解析局面。请注意,部分行源于重新标注,可能缺失重复历史信息;同时,未搜索的合法着法并未在标签中出现,故不可视为负例。训练时避免引入自定义的位置哈希留出集,而应信任官方分割以利复现实验。
背景与挑战
背景概述
该数据集由avewright团队于近期创建,旨在为国际象棋AI研究提供高质量的监督学习目标。数据集基于Stockfish 19引擎,采用MultiPV技术生成软标签,包含超过200万条对局局面,覆盖自对弈、重标注及冻结评估等多样来源。其核心研究问题在于如何利用强大引擎的深度搜索信息,提升神经网络在国际象棋局面评估与走子策略上的学习效果。该数据集的发布为国际象棋AI领域注入了新的数据资源,有望促进更精准的棋力模型训练,并对后续相关数据集构建标准产生影响。
当前挑战
该数据集面临的挑战涵盖领域问题与构建难题。领域层面,国际象棋局面评估需兼顾策略多样性、残局精确性及不确定性处理,而软标签需在合理计算预算下捕捉引擎深度评估的分布特征,以避免对未搜索走法的系统性偏差。构建过程中,需平衡自对弈与重标注数据比例,确保数据代表性;处理MultiPV搜索的不稳定性、哈希状态不清除带来的潜在不一致性;同时管理FEN记录的简化对重复局面及特殊规则(如吃过路兵)的影响。此外,数据质量控制、审计验证及大规模并行计算资源的高效调度亦是重要挑战。
常用场景
经典使用场景
该数据集以国际象棋对弈为核心,承载了由Stockfish 19引擎生成的MultiPV软标签,为强化学习与深度学习的交叉研究提供了高质量的监督信号。经典使用场景聚焦于训练国际象棋AI的策略网络和价值网络,通过softmax概率分布刻画每个局面下的候选走子优先级,使模型能够学习到细微的局势评估与决策倾向。研究者常利用其200万行样本进行自监督预训练,或将其作为模仿学习的基准,对比不同架构(如Transformer、残差网络)在棋类策略提取上的表现。数据集的紧凑词表(1968)设计也支持高效的内存访问与批处理,成为棋类智能体从原始棋谱迈向引擎级判断的桥梁。
衍生相关工作
该数据集已衍生出多项经典工作,尤其是在‘软目标蒸馏’领域,研究者利用其100k节点标签去训练轻量级学生网络,旨在复现全强度Stockfish 19的策略分布,从而在推理时降低算力需求而不显著损失棋力。另有工作基于该数据集的多进程搜索特性,探索了‘后见之明’式奖励塑形方法,通过对比MultiPV列表中的次级选择来增强模型的后悔最小化能力。数据集的FEN-only重标记行也被用于研究重复局面检测的鲁棒性,催生了更精细的位置哈希技术。此外,其‘无分歧审计’启示了数据质量自动筛选算法的开发,相关论文将类似的孤立位置评估策略推广至其他棋类变体。
数据集最近研究
最新研究方向
在人工智能与棋类博弈的交汇前沿,深度学习模型对棋局态势的精准评估与策略生成已成为研究焦点。此数据集以Stockfish 19引擎为‘教师’,通过自对弈与多PV搜索,生成高保真、细粒度的软标签目标(如策略概率分布与胜率评估),其质量审计表明在顶级搜索深度下具有极低的策略误差与遗憾值。此举回应了当前强化学习与蒙特卡洛树搜索中,对高质量、可复现训练信号的需求,尤其在AlphaZero范式之后,如何平衡探索效率与评估精度成为关键。该数据集的发布,为训练更强大、更具鲁棒性的国际象棋AI模型提供了坚实基座,有望推动博弈决策、表示学习及复杂环境下的泛化研究,对自主智能体的发展具有范式参考意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务