遇见数据集

zero-evaluator

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集名为“Zero Evaluator High-Variance Chess Positions”,是一个收集了3,809,201个国际象棋棋局位置的高质量数据集,这些位置来自三种不同的对弈风格:引擎锦标赛对局(CCRL,通过Leela Chess Zero标准数据集)、神经网络自对弈(Leela Chess Zero自对弈训练数据)以及高水平人类在线对局(Lichess精英数据库)。数据集旨在为棋局评估、静态评估器训练或WDL(胜负平)预测提供丰富的、高方差的位置样本。所有位置均以规范化的六字段FEN字符串记录,可直接重建棋盘,无需回放棋局。数据集按开局、中局、残局均衡覆盖,并提供了两个带标签的配置和一个不带标签的默认配置。具体配置包括: - `default`:1,509,201个来自CCRL引擎锦标赛对局的位置,无WDL标签; - `stockfish_zero_wdl`:1,509,201个位置,附带静态Stockfish NNUE深度0 WDL标签(0–1000量表),以及引擎来源信息; - `consensus_wdl`:1,000,000个位置,携带经过温度校准的Lc0和Stockfish静态WDL标签以及它们的共识目标,并附有样本权重,反映评估者之间的共识程度; - `lc0_selfplay`:2,000,000个来自Leela Chess Zero自对弈的位置,按产生棋局的网络强度分为strong、mid、low、early四个子集; - `lichess_elite`:300,000个来自Lichess高水平(2400+ vs 2200+)快棋对局的位置。 每个记录包含规范的FEN、来源对局元数据、步数、结果、行棋方、棋子统计、合法着法数量、将军状态、王车易位掩码、半步行棋时钟等字段。带标签的配置额外包含WDL概率列。数据以Parquet格式存储,按source_split和phase分区,共六个分区(train/test × opening/middlegame/endgame)。该数据集适用于训练和评估棋局静态评估器、WDL预测模型、以及研究不同来源对局位置的分布特征。

The dataset is named "Zero Evaluator High-Variance Chess Positions". It is a high-quality dataset collecting 3,809,201 chess positions from three different playing styles: engine tournament games (CCRL via Leela Chess Zero standard dataset), neural network self-play (Leela Chess Zero self-play training data), and high-level human online games (Lichess elite database). The dataset aims to provide rich, high-variance position samples for chess evaluation, static evaluator training, or WDL (win/draw/loss) prediction. All positions are recorded in normalized six-field FEN strings, allowing direct board reconstruction without replaying games. The dataset covers openings, middlegames, and endgames in a balanced manner, and provides two labeled configurations and one unlabeled default configuration. Specific configurations include: default (1,509,201 positions without labels), stockfish_zero_wdl (1,509,201 positions with static Stockfish NNUE depth 0 WDL labels), consensus_wdl (1,000,000 positions with temperature-calibrated Lc0 and Stockfish static WDL labels and consensus weights), lc0_selfplay (2,000,000 self-play positions divided into four subsets by network strength), and lichess_elite (300,000 positions from high-level blitz games). Each record contains fields such as FEN, source game metadata, ply, result, side to move, piece counts, legal move count, check status, castling mask, halfmove clock, etc. Labeled configurations additionally include WDL probability columns. The data is stored in Parquet format, partitioned by source_split and phase into six partitions.

创建时间:
2026-08-21
原始信息汇总

Zero Evaluator 高方差国际象棋局面数据集

数据集概述

该数据集收集了 3,809,201 个国际象棋局面,来源于三种不同的对弈风格——引擎锦标赛对局、神经网络自我对弈和人类高水平在线对局。所有局面以归一化的六字段 FEN 格式存储,无需重放对局即可直接重建棋盘,且每个集合都平衡了开局、中局和残局的覆盖。

配置说明

数据集提供五个配置:

带标签的配置

stockfish_zero_wdl(1,509,201 个局面)

  • 来自 CCRL 引擎锦标赛对局
  • 包含 Stockfish NNUE 静态 WDL 标签(0-1000 概率标度)
  • 包含每行的引擎来源信息

consensus_wdl(1,000,000 个局面)

  • 来自同一语料库
  • 由 Lc0 和 Stockfish 两个静态评估器独立标注后融合为共识目标
  • 包含逐行的共识一致权重(sample_weight,范围 0.4-1.0)
  • 唯一带有验证集(validation)的配置

无标签配置

default(1,509,201 个局面)

  • CCRL 引擎锦标赛对局

lc0_selfplay(2,000,000 个局面)

  • Leela Chess Zero 自我对弈数据
  • 按生成网络的强度分为 strongmidlowearly 四个子集

lichess_elite(300,000 个局面)

  • Lichess 平台上 2400+ 对 2200+ 的强手对局
  • 其中约 88% 为超快棋(3+0 或 3+2)

三个无标签集合几乎互不相交:3,784,379 个 FEN 唯一,24,822 个出现于多个集合(主要为常见开局局面)。

数据分布

defaultstockfish_zero_wdl 配置按 source_split(train/test)和 phase(opening/middlegame/endgame)分区,共六个分区:

分区 开局 中局 残局 总计
Train 182,691 723,841 295,196 1,201,728
Test 51,510 176,159 79,804 307,473
总计 234,201 900,000 375,000 1,509,201

consensus_wdl 的训练/验证/测试集按 15/60/25 的开局/中局/残局比例均匀分配。

数据列说明

基础记录包含归一化 FEN、来源对局出处、步数与结果、行棋方、棋子与物质统计、合法着法数、将军状态、王车易位掩码和半步行棋时钟等。

stockfish_zero_wdl 配置新增列:

  • wdl_win / wdl_draw / wdl_loss(uint16):静态胜/和/负概率,0-1000 标度
  • wdl_engine_name / wdl_engine_version / wdl_engine_weights:引擎标识

consensus_wdl 配置新增列:

  • 三组 WDL 三元组(共识目标、Lc0 校准标签、Stockfish 校准标签)
  • teacher_q_delta:两个评估器期望得分的有符号差
  • teacher_js_divergence:Jensen-Shannon 散度(比特)
  • sample_weight:共识一致权重

所有 WDL 三元组均从行棋方视角出发,总和为 1000。

数据格式与加载

数据以 Zstandard 压缩的 Parquet 文件存储。可通过 Hugging Face Datasets 库加载,也可通过 PyArrow 直接以 Hive 分区方式读取流式 Arrow 批次。

验证情况

  • 所有源头行均完整复现于 Parquet 文件
  • 6,000 个抽样 FEN 记录经 python-chess 成功重建
  • 所有带标签行 WDL 值总和为 1000
  • 自我对弈与人类集合内无重复 FEN
  • 每个分区的开局/中局/残局比例保持 15/60/25

数据来源

  • CCRL 标准数据集(Leela Chess Zero,250 万引擎对局)
  • Lc0 自我对弈训练数据(2018-09 至 2026-08,9 个训练运行)
  • Lichess 精英数据库(2020-06 至 2025-10,12 个月等量采样)
搜集汇总
数据集介绍
zero-evaluator 数据集图片
构建方式
该数据集名为zero-evaluator,汇集了来自引擎锦标赛、神经网络自我对弈及人类高手在线对弈三种迥异风格棋局的380万余个国际象棋局面,以标准化六字段FEN格式存储,便于直接重建棋盘。其中两个子集附带静态胜平负(WDL)标签。构建过程包含对Lc0自我对弈数据的重新评分、对Stockfish深度为零的NNUE静态评估,以及通过温度校准融合双引擎评估的共识标签,并通过严格过滤与抽样确保各阶段(开局、中局、残局)平衡。
特点
zero-evaluator数据集的核心特点在于其多源异构性与双引擎共识标签。它提供了无标签的默认配置、带Stockfish WDL标签的配置,以及带Lc0与Stockfish校准后共识WDL的配置,后者还包含评估者分歧度与样本权重。各集合内部及之间均保持阶段平衡,且注重多样性。此外,数据集严格验证了FEN合法性、标签准确性及文件完整性,确保高质量与可复现性。
使用方法
用户可通过Hugging Face Datasets库加载数据,选择不同配置,如`stockfish_zero_wdl`或`consensus_wdl`,获取带标签的WDL三元组。对于大规模高效处理,可借助PyArrow直接读取Parquet文件,利用Hive分区过滤或流式批次处理。另可依据`sample_weight`列对共识标签进行加权训练,以优化模型学习效果。数据集提供了Python示例及详尽文档,便于集成至各类国际象棋评估模型研究。
背景与挑战
背景概述
国际象棋人工智能领域长期面临评估器泛化能力不足的困境,传统引擎评估与神经网络胜率预测间的语义鸿沟亟待弥合。Zero Evaluator高方差局面数据集由研究者Pawitt等人于2026年构建,整合了CCRL引擎锦标赛、Leela Chess Zero自对弈及Lichess精英人类对局三大异质来源,共计380万局面的FEN记录。该数据集的核心创新在于提供Stockfish NNUE零深度静态评估与Lc0共识校准标签,覆盖开局、中局、残局的均衡分布,为评估器鲁棒性研究确立了新基准。其多源融合设计既解构了不同水平棋手的决策特征,又通过共识机制弥合了引擎间评估尺度差异,对国际象棋AI评估体系的发展具有里程碑意义,已吸引众多研究者将其作为模型泛化测试的标准平台。
当前挑战
该数据集面临的挑战多维且深刻。领域层面,静态零深度WDL评估与传统搜索评估在语义上不可直接兼容,共识标签虽经温度校准及JS散度过滤,仍难以完全消除引擎间系统性偏差,且高方差局面的先验分布呈现显著长尾特征,对评估器决策边界构成严峻考验。构建层面,来自CCRL、Lc0自对弈及Lichess精英赛的数据在风格、水平及规则方面存在本质差异,需经精细的相位平衡(15/60/25)与去重处理(仅0.65%的FEN重叠)方得统一;此外,超大规模数据(380万局面)的标准化存储、共识标签的算力消耗(两引擎独立评估加校准)及严格验证流程(逐行核对、Python-chess重构测试)亦构成工程与算法上的双重挑战。
常用场景
经典使用场景
该数据集汇聚了来自引擎锦标赛、神经自对弈与高水平人类对弈的三类棋局,提供了逾三百万个标准化FEN格式的棋局状态,并附有对局阶段、行棋方、棋子统计等丰富注释。其经典应用场景在于为国际象棋人工智能研究提供大规模、多样化的棋局快照,尤以那些高方差、胜负难料的局面为特色,为评估和训练棋力评估模型提供了坚实的基准数据。
实际应用
在实际应用中,该数据集可作为棋类AI训练与评估的关键资源,助力开发更精准的棋局局面评估模块。其高方差的特征使其适用于游戏AI的难度调节,例如在训练AlphaZero类模型时,提供多样化的自对弈局面以增强模型的泛化能力。此外,共识WDL标签的样本权重设计,为处理多标注者不一致问题提供了实用范例,可迁移至其他人工智能领域的多源知识融合场景。
衍生相关工作
该数据集衍生的相关工作是开发了基于零深度静态评估的共识WDL标签体系,通过温度校准与詹森-香农散度过滤,实现了多引擎评估的集成与加权。这种教师-学生架构的标签生成方式,为蒸馏学习提供了高质量的软目标。其方差审计报告及分区策略,也成为后续研究评估数据多样性、阶段平衡性的参照标准,启发了更多关于棋类AI自我对弈数据质量与利用效率的研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务