遇见数据集

chess-san-base

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

OMLCheT Chess SAN Base数据集是一个专为训练轻量级语言模型和强化学习代理而设计的国际象棋对局序列数据集,采用纯标准代数记谱法格式。数据来源于Lichess/tournament-chess-games仓库的高质量对局,移除了元数据、时间戳、时钟评估标记和步数编号,以提供简洁的棋步序列。数据集包含两个独立配置:clean配置提供原始、严格合法的棋步字符串,适用于基础文本生成模型或需要无错误句法移动历史的强化学习设置;annotated配置保留人类评估标记(如?!、?、!!)和数字注释标记(如$14、$19),使高级模型能够学习上下文战术评估。数据集分为训练集和测试集,其中annotated配置包含89,976个训练样本和4,736个测试样本,clean配置包含82,270个训练样本和4,330个测试样本。每个样本仅包含一个文本字段,存储棋步序列。该数据集适用于国际象棋移动预测、游戏生成、战术分析等任务,旨在促进机器学习在棋类游戏中的应用。

The OMLCheT Chess SAN Base dataset is designed for training lightweight language models and reinforcement learning agents, focusing on chess game sequences in pure Standard Algebraic Notation format. It sources high-quality games from the Lichess/tournament-chess-games repository, removing metadata, timestamps, clock evaluation markers, and move numbers to provide concise move sequences. The dataset includes two configurations: the clean configuration offers raw, strictly legal move strings suitable for basic text generation models or reinforcement learning settings requiring error-free syntactic move histories; the annotated configuration retains human evaluation markers (e.g., ?!, ?, !!) and numeric annotation markers (e.g., $14, $19), enabling advanced models to learn contextual tactical assessments. It is split into training and test sets, with the annotated configuration containing 89,976 training samples and 4,736 test samples, and the clean configuration containing 82,270 training samples and 4,330 test samples. Each sample consists of a single text field storing the move sequence. The dataset is suitable for tasks like chess move prediction, game generation, and tactical analysis, aiming to promote the application of machine learning in board games.

创建时间:
2026-06-27
原始信息汇总

数据集概述:OMLCheT Chess SAN Base

这是一个为训练轻量级语言模型(LMs)和强化学习(RL)代理而设计的国际象棋棋局序列数据集,所有棋步均使用标准代数记法(SAN)。数据源自 Lichess/tournament-chess-games 仓库中的高质量对局,并已去除元数据、时间戳、时钟评估标记和棋步编号。

数据集配置

该数据集包含两个独立的子集,每个子集都有独立的训练/测试划分。

  • clean 配置

    • 内容: 仅包含严格合法的纯棋步字符串,无任何注释。
    • 用途: 适用于基础文本生成模型或需要错误语法棋步历史的强化学习设置。
    • 示例: e4 e5 Nf3 Nc6 Bc4 Nf6 d3 Bc5 O-O d6 c3 a6
  • annotated 配置

    • 内容: 保留了人类评估符号(如 ?!, ?, !!)和数字注释字形(NAGs,如 $14, $19)。
    • 用途: 允许高级模型学习上下文战术评估,例如识别被标记为错误或优势的棋步。
    • 示例: Nf1?! d5 c4 e6 Nc3 Nf6 Nf3 Be7 Bf4 O-O e3 c5 Bg5 #5 $14

数据规模与划分

配置 训练集行数 测试集行数 总行数
annotated 89,976 4,736 94,712
clean 82,270 4,330 86,600

注意: clean 配置的行数略少,原因是在严格解析过程中,少数短对局或带有大量注释的求和棋谱被过滤掉了。

数据特征

所有配置均只包含一个特征:

  • text:字符串类型,存储棋局序列文本。

快速加载

可通过 Hugging Face datasets 库直接加载:

python from datasets import load_dataset

加载纯棋步数据

dataset_pure = load_dataset("OMLCheT/chess-san-base", "clean")

加载带评估注释的数据

dataset_eval = load_dataset("OMLCheT/chess-san-base", "annotated")

搜集汇总
数据集介绍
chess-san-base 数据集图片
构建方式
在人工智能与棋类博弈交叉研究领域,标准化代数记谱法(SAN)作为国际象棋棋谱的国际通用描述格式,为语言模型学习棋局序列提供了理想的数据载体。该数据集源自Lichess平台高质量锦标赛对局,由OMLCheT项目精心构建,通过剔除时间戳、时钟评估标记、回合编号及元数据等非记谱信息,将原始对局转化为纯粹的SAN字符串序列。数据集提供两种配置:clean版本保留严格合法且无标注的干净走法序列,适用于基础文本生成与强化学习训练;annotated版本则完整保留人类评估符号(如?!、!!)及数字注释标记(NAG),使模型能够学习棋局中战术局势的上下文评估。所有数据均按独立训练/测试集划分,分别包含82270/4330与89976/4736条样本。
特点
该数据集以两种差异化配置满足多元训练需求,具有明确的层进式设计特征。clean配置专注于语法纯净的棋局流,排除任何主观评估信息,为规则学习与基础生成提供无噪声数据源;annotated配置则嵌入人类棋手常用的评估符号与NAG标记系统,使模型在习得走法规范的同时,能感知棋步背后隐含的战略优劣判断——例如区分正常走法与被视为失误或优势的走法。两种配置均采用统一的纯文本格式,以空格分隔的SAN字符串表达完整对局,数据量级适中(训练集约8-9万条),既避免了海量数据带来的计算负担,又保证模型能充分捕捉棋局结构规律。
使用方法
该数据集通过Hugging Face datasets库实现一键加载,极大简化了使用流程。用户只需调用load_dataset函数并指定配置名称即可获取对应数据:选择'clean'得到无标注的纯走法序列用于基础训练,选择'annotated'得到带评估符号的增强文本用于高级策略学习。加载后,数据以标准格式存储于可迭代数据集中,每条样本的'text'字段对应一个完整的SAN格式棋局字符串,可直接输入至语言模型或构建词表用于序列建模。对于强化学习场景,clean配置的确定性走法序列尤其适合作为环境的状态-动作历史;而annotated配置的评估符号则能为基于价值的RL算法提供隐式的奖励信号参考。
背景与挑战
背景概述
在自然语言处理与强化学习交叉领域中,如何将棋类对弈的结构化序列高效转化为语言模型可理解的文本表示,成为近年来的研究热点。OMLCheT chess-san-base数据集由开放机器学习国际象棋锦标赛(OMLCheT)团队于近期创建,依托Lichess平台的高质量对弈记录,专门提取纯标准代数记法(SAN)的棋局序列,旨在为轻量级语言模型与强化学习智能体提供标准化训练资源。该数据集包含cleaned与annotated两个子集,前者提供严格的合法走法序列,后者则保留了人类评估标志与数值注释符号,从而支持模型从战术评估与语法结构中学习。通过其规范的格式与明确的分割,该数据集有效推动了对弈策略学习、文本生成与评估推理等研究领域的发展,为低资源场景下的智能决策系统奠定了基础。
当前挑战
该数据集面临的核心挑战之一在于领域问题的复杂性:将棋类对弈转化为纯文本序列后,模型需同时捕捉长程依赖的战术关联与局部走法的语法合法性,这对语言模型的序列建模能力与强化学习的奖励设计提出了较高要求。此外,在构建过程中,从Lichess原始流数据中清洗元数据、时间戳与棋钟标记时,需保证走法语义的完整性,同时剔除因对局过短或注释过多导致的噪声样本,这导致了cleaned子集较annotated子集少了约8千条记录,体现了严格解析与数据保真度之间的权衡。最终,如何在小样本条件下从有限的对局序列中泛化出稳健的策略,并有效利用注释符号传递的评估信号,构成了该数据集在当前研究前沿的核心挑战。
常用场景
经典使用场景
国际象棋作为策略博弈的典范,其棋谱数据在自然语言处理与强化学习交叉领域中占据独特地位。OMLCheT Chess SAN Base数据集提供了两种精心配置的棋局序列:clean子集收录纯代数记谱法下绝对合法的棋步字符串,适用于基础的文本生成模型预训练或强化学习环境中无语法误差的棋局历史解析;annotated子集则保留了人类评注符号与数值注释标记,使得模型能够捕捉棋步背后的战术评估信息。这一设计为训练轻量级语言模型从零开始理解棋类语法结构、生成连贯棋谱以及开展基于环境反馈的策略学习提供了规范且标准化的语料基础。
解决学术问题
在计算博弈论与序列表示学习的研究中,该数据集解决了两个关键学术难题。其一,传统棋谱数据常混有时间戳、棋盘时钟评估等冗余元数据,干扰了模型对纯粹棋步序列模式的学习,该数据集通过彻底的清洗与格式化操作,为研究棋步生成的序列依赖性、策略转移的长期记忆机制提供了无噪声的基准语料。其二,通过在annotated子集中保留人类专家赋予的战术评价标记,它开创性地支持了语义粒度更细的小样本棋局质量评估任务:模型被要求不仅复现棋步,更要推断每一步背后的战术意图与得失判断,推动了从模式识别向认知推断的跨越。此外,它还为低资源条件下冷启动博弈智能体的语言基础构建提供了可行的数据解决方案。
衍生相关工作
该数据集催生了多条富有启示性的研究脉络。在轻量级基础语言模型方面,研究者基于clean子集探索了迷你化Transformer架构在结构化序列上的表示学习能力,证明了仅含数百万参数的小模型足以捕捉国际象棋开局与中局的局部模式,而设计特定轮次掩码策略可有效对齐棋谱的长程依赖关系。在注解生成方向上,annotated子集成为了一个微型的弱监督基准,多个团队利用序列到序列框架训练模型将棋步序列自动转化为图文评估报告,甚至尝试将NAG数值解读为可解释的战术注释。更为前沿的工作则将数据集作为环境的一部分引入离线强化学习范式,将语言模型的每一步输出视为动作,以胜负结果作为奖励信号,探索了语言模型作为博弈策略网络先验学习的可行路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务