遇见数据集

chess-autocomplete-eval-datasets

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

该数据集是“国际象棋自动补全评估套件数据集”,专门用于评估一系列国际象棋自动补全模型(如91M、350M、700M参数版本)的性能。它不包含模型、评估代码或结果,仅提供评估所需的输入数据。数据集总大小为5.6 GiB,由三个核心评估组件的数据构成:1. stratified_human/:包含来自Lichess 2022-2023年的768,000盘标准对局,总计45,728,786步棋,数据经过分层处理形成768个单元格(基于Elo等级分和时间控制),以二进制令牌格式存储。2. allie_benchmark/:包含来自Lichess 2022年快棋对局的884,049个已评分棋局位置,排除了开局阶段和时钟时间少于30秒的棋步。3. maia/:包含两个子集:example_test_dataset.csv(来自Lichess 2019年12月常规棋对局的127,852行已评分位置,用于按技能水平评估)和cross_skill_2023-12.jsonl(来自Lichess 2023年12月常规棋对局的4,932,999个已评分位置,数量分布与Maia-2项目匹配)。所有数据源自Lichess数据库(CC0许可证)或基于其衍生,部分文件遵循MIT许可证。数据集排除了模型训练月份(2024-01至2025-09),确保评估公正性,覆盖的评估月份(2019-12、2022、2023-12)均早于训练窗口。

This dataset is the "Chess Autocomplete Evaluation Suite Dataset," specifically designed for evaluating the performance of a series of chess autocomplete models (e.g., 91M, 350M, 700M parameter versions). It does not include models, evaluation code, or results, only providing the input data required for evaluation. The total dataset size is 5.6 GiB, consisting of data from three core evaluation components: 1. stratified_human/: Contains 768,000 standard games from Lichess 2022-2023, totaling 45,728,786 moves. The data is stratified into 768 cells (16 white Elo rating buckets × 16 black Elo rating buckets × 3 time controls: ultra-rapid, rapid, classical), with each cell containing 1,000 games, stored in binary token format consistent with the base dataset `Alfredvc/chess-autocomplete-lichess`. 2. allie_benchmark/: Contains 884,049 rated board positions from Lichess 2022 rapid games, excluding moves from the opening phase and those made with less than 30 seconds on the clock. 3. maia/: Includes two subsets: `example_test_dataset.csv` (127,852 rows of rated positions from Lichess December 2019 classical games, used for evaluation grouped by player skill level: proficient, advanced, master) and `cross_skill_2023-12.jsonl` (4,932,999 rated positions from Lichess December 2023 classical games, with quantity distribution matching the Maia-2 projects appendix Table 8). All data originates from the Lichess database (CC0 license) or is derived from it, with files in `allie_benchmark` and `maia/example_test_dataset.csv` redistributed under the MIT license from the Allie (Zhang et al., 2024) and Maia-2 (CSSLab, 2024) projects, respectively. The dataset intentionally excludes months used for model training (2024-01 to 2025-09) to ensure fair evaluation, with evaluation months covered (2019-12, 2022, 2023-12) all predating the training window.

创建时间:
2026-07-16
原始信息汇总

数据集概述:Chess Autocomplete Eval Battery Datasets

该数据集是为国际象棋自动补全模型(chess-autocomplete)提供的完整评估套件输入数据,仅包含输入数据,不包含模型、评估代码或评估结果。数据集总大小为5.6 GiB(6.0 GB),记录数量在1M到10M之间。

数据集组成

数据集包含三个主要子目录,每个子目录对应评估套件的一个组件:

1. stratified_human/

  • 文件merged.binmerged-map.binmerged-metadata.parquet
  • 内容:768,000局Lichess标准棋局(2022-2023年),共45,728,786步棋。按16个白方Elo区间 × 16个黑方Elo区间 × 3种时限(子弹棋、快棋、闪电棋)分层为768个单元,每单元1,000局棋。不含古典棋类。
  • 编码:与 Alfredvc/chess-autocomplete-lichess 相同的二进制token格式。merged.bin 包含46,496,786个 uint16 token;merged-map.bin 包含每局棋的 uint64 字节偏移量(768,000条);merged-metadata.parquet 每行对应一局棋的元数据。
  • 许可证:CC0-1.0(源自Lichess CC0数据)

2. allie_benchmark/

  • 文件2022-test-annotated.jsonl
  • 内容:884,049个来自Lichess 2022年闪电棋局的有评分局面。排除开局着法和时限低于30秒的着法。
  • 来源:Hugging Face数据集 yimingzhang/allie-data 中的 lichess-2022-blitz-test/2022-test-annotated.jsonl 文件。
  • 许可证:MIT(Allie, Zhang et al., 2024)。底层棋局为Lichess CC0。

3. maia/

  • example_test_dataset.csv

    • 内容:127,852行来自Lichess 2019年12月快棋棋局的有评分局面,已排除30秒以内的着法。评估时取其中106,740个 move_ply > 10 的局面,分组为熟练(56,812)、高级(41,747)、大师(8,181)。
    • 许可证:MIT(Maia-2, CSSLab, 2024)。底层棋局为Lichess CC0。
  • cross_skill_2023-12.jsonl

    • 内容:4,932,999个来自Lichess 2023年12月快棋棋局的有评分局面。按活跃Elo与对手Elo单元划分,计数与Maia-2附录表8矩阵匹配。
    • 许可证:CC0-1.0(源自Lichess CC0数据)

许可证信息

路径 许可证 来源
stratified_human/* CC0-1.0 Lichess数据库,重新编码
maia/cross_skill_2023-12.jsonl CC0-1.0 Lichess数据库,重新生成
allie_benchmark/2022-test-annotated.jsonl MIT Allie(Zhang et al., 2024)
maia/example_test_dataset.csv MIT Maia-2(CSSLab, 2024)

训练排除说明

已发布的三个模型(91M、350M、700M)均未使用本数据集中覆盖的Lichess月份(2019年12月、2023年12月、2022年)进行训练。这些模型使用2024年1月至2025年9月共21个月的月度分片数据进行训练。

文件清单

文件 大小
LICENSES/allie-MIT.txt 1.0 KiB
LICENSES/maia2-MIT.txt 1.0 KiB
allie_benchmark/2022-test-annotated.jsonl 42.7 MiB
maia/cross_skill_2023-12.jsonl 5.5 GiB
maia/example_test_dataset.csv 21.5 MiB
stratified_human/merged-map.bin 5.9 MiB
stratified_human/merged-metadata.parquet 487.6 KiB
stratified_human/merged.bin 88.7 MiB
搜集汇总
数据集介绍
chess-autocomplete-eval-datasets 数据集图片
构建方式
该数据集是为国际象棋自回归语言模型评估套件精心构建的输入数据集合,涵盖三个子组件。其中stratified_human组件从Lichess平台2022与2023年的标准对局中,依据白方与黑方的Elo等级分各划分16个区间,并结合三种时间控制模式(子弹、闪电、快棋),共形成768个分层单元格,每个单元格随机选取1000局对局,总计包含76.8万局棋谱与4572.8万个着法。所有着法通过Rust工具进行二进制编码,以uint16令牌序列存储,同时生成偏移映射表与元数据Parquet文件。allie_benchmark组件则直接源自Allie数据集,筛选出2022年闪电战中排除开局着法和30秒内走棋的评分局面。maia组件包含从Maia-2项目复制的示例测试数据集,以及依据Lichess 2023年12月快棋对局按技能等级交叉分层生成的评分局面。
特点
该数据集针对国际象棋语言模型评估需求进行了精心设计,其最显著的特点在于严格的分层采样策略与训练数据隔离。stratified_human组件通过Elo等级分与时间控制的细分,确保评估数据在不同棋力等级与对弈速度上具有均衡覆盖,避免了某些棋力段的样本偏差。数据集中的每个子组件均包含评分局面,即每个位置附有对应着法的先验概率,这为计算交叉熵损失与困惑度提供了基准。尤为重要的是,该数据集明确排除了模型训练所覆盖的时间段——所有评估局面均来自2019年12月、2023年12月及2022年,而三款模型均训练于2024年1月至2025年9月的21个月分片,从而保证了评估结果的公平性与可靠性。
使用方法
使用者可通过HuggingFace的`hf download`命令一键获取完整数据集,评估套件的脚本会自动从该仓库拉取所需文件。对于Python开发环境,stratified_human组件专门提供了`chess_autocomplete.evals.components.stratified_human`模块用于读取二进制格式的棋盘状态序列及元数据。allie_benchmark与maia组件则分别提供了对应的读取模块,其中maia组件支持两种评估场景:一是复现Maia-2论文中Table 1的测试,二是生成交叉技能分析图表。评估运行时,用户需确保本地已安装Rust编译的二进制工具链以处理二进制编码文件,并配合模型推理代码计算各局面下的损失值,从而获得单元测试级别的评估结果。
背景与挑战
背景概述
在自然语言处理与棋类游戏交叉研究领域,国际象棋因其完备的规则体系与丰富的棋谱数据,成为评估语言模型序列建模能力的理想试验场。2024年,由Alfredvc等研究者构建的Chess Autocomplete Eval Battery Datasets应运而生,整合了来自Lichess平台的海量对局数据,旨在为国际象棋自回归模型的预测能力提供标准化评测基准。该数据集涵盖2022至2023年间超过45,000,000步棋局,通过精细的分层抽样策略(按双方等级分与时限类型划分768个单元格)确保评估的统计效力,并严格隔离训练与测试时间范围,对后续国际象棋AI与语言模型研究产生了重要影响。
当前挑战
该数据集面临的核心挑战在于解决国际象棋序列预测领域中评测标准碎片化的问题。此前各模型采用不同规模的私有测试集,导致性能比较缺乏统一基准。构建过程中,研究者需克服多项技术难点:从每月超过10GB的PGN压缩档案中高效解析并重组海量对局,将棋谱转换为紧凑的二进制token格式以存储46,496,786个uint16令牌;同时需处理跨数据源的许可兼容性问题,将来自Allie(MIT许可)与Maia-2(MIT许可)的标注数据与Lichess的CC0数据进行整合。此外,为确保评估的公平性,必须严格排除训练集覆盖时间范围内的对局,并控制开局阶段与超时步数带来的噪声,这些挑战极大地增加了数据集的构建复杂度。
常用场景
经典使用场景
在国际象棋人工智能的研究领域中,模型性能的可靠评估是推动技术进步的关键环节。chess-autocomplete-eval-datasets作为一套为棋谱补全模型量身打造的综合评测数据集,其经典使用场景在于为不同规模的语言模型(如91M、350M、700M参数版本)提供标准化的测试基准。该数据集涵盖来自lichess平台的数百万盘对局记录,以二进制token格式存储棋步序列,并按照棋手等级分、时间控制等维度进行精细分层,从而确保评测结果的代表性和公平性。研究者可利用其中的stratified_human子集,在控制变量条件下对比模型预测与人类棋手实际落子的偏差,系统评估模型在不同水平对局中的棋步预测能力。
实际应用
在实际应用层面,chess-autocomplete-eval-datasets服务于棋类AI技术从实验室走向现实产品的关键验证环节。开发者可借助该数据集对棋谱补全模型进行上线前全面测评,确保模型在快棋、闪电战和常规赛等不同时限场景下的预测质量稳定可靠。基于评测结果,棋类教学平台能够筛选出在特定等级分段表现优异的模型,用以生成针对不同水平棋手的个性化训练棋谱推荐。此外,游戏分析工具和直播解说系统可利用经过该数据集验证的模型,实时提供高准确度的后续招法预测,从而丰富观赛体验和战术分析深度,推动棋类娱乐与教育产业的智能化升级。
衍生相关工作
围绕chess-autocomplete-eval-datasets已衍生出一系列具有深远影响的经典工作。Allie基准测试(Zhang et al., 2024)所贡献的2022年快棋标注位置集构成了对比评测的重要参考,其MIT开源协议促进了后续研究的广泛应用。Maia-2项目(CSSLab, 2024)提供的示例测试集与跨技能水平对局记录,则直接支撑了关于模型在不同棋力层次表现差异的深入探讨。此外,stratified_human子集基于lichess官方数据重建的二进制编码格式,已被多个后续研究采纳为统一的棋谱表示标准。这些相关工作共同催生了关于训练数据时段选择、评测集构建规范与模型泛化性边界的系统性方法论,深刻影响了棋类NLP与序列预测领域的实验设计范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务