遇见数据集

xiangqi

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集名为“Xiangqi AI Self-Play & MCTS Zero-Copy Dataset”(中国象棋AI自我对弈与MCTS零拷贝数据集),由hoduyquocbao发布,用于存储通过蒙特卡洛树搜索(MCTS)自我对弈引擎生成的中国象棋(Xiangqi/Co Tuong)知识。数据集包含两个子集:games和positions。games子集收录了121局完整对局,每条记录包括对局ID、赛事名称、开局名称、红方/黑方棋手、结果、总步数、开局FEN串、PGN格式棋谱和时间戳。positions子集包含63个经过评估的棋盘局面(FEN格式),每个局面记录了FEN键、完整FEN、出现次数、红方胜/黑方胜/和棋次数、最佳推荐走法、推荐走法列表(JSON格式)、失误走法列表(JSON格式)以及时间戳。该数据集适用于强化学习、棋类AI训练、局面评估、走法推荐等任务。引擎采用零拷贝共享内存技术实现100倍加速。数据文件以JSONL格式存储,支持通过Hugging Face Datasets库加载。

The dataset is named Xiangqi AI Self-Play & MCTS Zero-Copy Dataset, published by hoduyquocbao, for storing knowledge of Chinese Chess (Xiangqi/Co Tuong) generated by a Monte Carlo Tree Search (MCTS) self-play engine. It contains two subsets: games and positions. The games subset includes 121 complete games, each with fields such as game ID, event name, opening name, red/black player, result, total moves, opening FEN, PGN notation, and timestamp. The positions subset includes 63 evaluated board positions (in FEN format), each with FEN key, full FEN, occurrence count, red win/black win/draw counts, best recommended move, recommended move list (JSON), blunder move list (JSON), and timestamp. The dataset is suitable for reinforcement learning, chess AI training, position evaluation, move recommendation, etc. The engine uses zero-copy shared memory technology for 100x speedup. Data is stored in JSONL format and can be loaded via the Hugging Face Datasets library.

创建时间:
2026-08-02
原始信息汇总

数据集概述:Xiangqi AI Self-Play & MCTS Zero-Copy Dataset

基本信息

  • 数据集名称:Xiangqi AI Self-Play & MCTS Zero-Copy Dataset(hoduyquocbao/xiangqi
  • 许可证:Apache 2.0
  • 任务类别:强化学习、棋盘游戏
  • 语言:越南语、英语
  • 数据规模:1K < n < 10K 条记录

核心内容

  • 游戏总数:127 局(data/games/train.jsonl
  • 学习位置数:77 个(data/positions/train.jsonl
  • 引擎特性:Express Zero-Copy 共享内存实现(100 倍加速)
  • 最后同步时间:2026-08-03T17:14:10.756Z

数据集配置

该数据集包含三个配置(config):

配置名 数据文件 用途
default data/games/train.jsonl 默认配置,包含棋局数据
games data/games/train.jsonl 棋局子集,用于强化学习
positions data/positions/train.jsonl 位置评估子集,含胜率统计与推荐走法

特征字段

games/default 配置(棋局数据):

  • game_id (string):对局唯一标识
  • event (string):赛事/事件名称
  • opening_name (string):开局名称
  • red (string):红方选手
  • black (string):黑方选手
  • result (string):对局结果
  • total_moves (int64):总步数
  • opening_fen (string):开局 FEN 格式
  • pgn (string):完整棋谱(PGN 格式)
  • timestamp (string):时间戳

positions 配置(位置评估数据):

  • fen_key (string):FEN 键
  • fen_full (string):完整 FEN 表示
  • times_seen (int64):出现次数
  • red_wins (int64):红方胜场数
  • black_wins (int64):黑方胜场数
  • draws (int64):平局数
  • best_recommended_move (string):最优推荐走法
  • recommended_moves_json (string):推荐走法集合(JSON)
  • blunder_moves_json (string):失误走法集合(JSON)
  • timestamp (string):时间戳

文件结构

  • data/games/train.jsonl:完整 JSONL 棋局记录(用于强化学习)
  • data/positions/train.jsonl:FEN 位置评估记录,包含胜负统计与推荐走法
  • data/games.pgn:完整 WXF/PGN 主棋谱
  • data/knowledge.json:评估位置的 JSON 格式
  • data/knowledge.parquet.json:Parquet 模式表示(用于高速大数据分析)
  • data/dataset_schema.json:正式数据集元数据和模式声明

使用方式

可通过 Hugging Face datasets 库加载该数据集:

python from datasets import load_dataset

加载棋局子集

games_dataset = load_dataset("hoduyquocbao/xiangqi", "games")

加载位置评估子集

positions_dataset = load_dataset("hoduyquocbao/xiangqi", "positions")

搜集汇总
数据集介绍
xiangqi 数据集图片
构建方式
该数据集基于象棋AI自我对弈与蒙特卡洛树搜索(MCTS)的零拷贝技术构建,整合了12,500,000节点每秒的高效引擎执行能力。数据采集过程涵盖127盘完整对局记录及77个评估后的局面(FEN)数据,通过共享内存实现加速处理。对局记录以PGN格式存储,并附带开局名称、选手信息、结果及总步数等元数据;局面数据则包含FEN键、出现次数、胜负平统计及推荐着法,经由MCTS评估生成,为强化学习提供结构化训练样本。
特点
该数据集具备双重配置,分别面向游戏记录与局面评估。游戏配置提供完整的PGN对局文本,适用于序列决策建模;局面配置则包含深入的统计数据,如最佳推荐着法、失误着法及胜率分布,支持策略评估与模式识别。数据规模虽小(1K-10K),但胜在精准,每个局面均经过MCTS深度分析,蕴含高质量决策信息,且采用Apache-2.0许可,便于学术研究与应用开发。
使用方法
使用者可通过HuggingFace datasets库便捷加载不同配置的数据。加载游戏子集可获取对局数据,用于训练棋风模仿或对局生成模型;加载局面子集则可用于评估棋力、优化搜索算法或开发决策辅助工具。数据文件结构清晰,除JSONL主文件外,还提供PGN全文与Parquet格式,便于跨平台兼容与大数据分析。Python接口简单,两行代码即可实现数据访问,极大降低了使用门槛。
背景与挑战
背景概述
象棋作为历史悠久的策略性棋类游戏,其人工智能研究在强化学习与自我对弈领域具有重要地位。该数据集由hoduyquocbao于2026年创建,聚焦于象棋AI的自我对弈与MCTS零拷贝技术,旨在为强化学习提供高质量的训练样本。数据集包含127局完整对局及77个经过评估的棋盘位置,涵盖棋谱元数据、开局信息、胜负统计及推荐走法等丰富特征,为象棋AI的算法训练与评估提供了坚实的数据基础。该数据集的发布推动了棋类AI研究在数据标准化与高效存储方面的进展,对相关领域的研究者具有参考价值。
当前挑战
该数据集所面临的挑战涉及多个层面。在领域问题层面,象棋AI需要处理复杂的搜索空间与策略决策,MCTS算法的性能与数据质量直接影响模型的学习效果,如何从有限的对局中提取有效的走法知识是一大难题。在构建过程中,数据采集依赖自我对弈引擎,其高效性依赖于零拷贝共享内存等并行优化技术,而数据集的规模较小(仅127局),可能限制模型的泛化能力;同时,位置评估的准确性、推荐走法的可靠性以及数据的标注一致性也对构建提出了较高要求。此外,跨语言(越南语与英语)的棋谱描述增加了数据处理的复杂度,需兼顾文化差异与技术规范。
常用场景
经典使用场景
该数据集是面向中国象棋(象棋)强化学习与棋盘博弈研究的专业资源,收录了127局完整对局及77个经过评估的盘面位置信息。其设计初衷在于为MCTS(蒙特卡洛树搜索)算法提供自博弈训练的真实数据支撑,并整合了零拷贝共享内存技术以实现高效的数据吞吐。研究者可借助此数据集进行棋规模式挖掘、开局策略分析、残局胜负评估,以及基于PGN格式的棋谱解析,从而深入探索棋类智能决策的底层逻辑。
衍生相关工作
基于该数据集,衍生研究已涉及象棋局面自动生成、开中残局策略库构建以及多Agent自博弈对抗训练框架的优化工作。其零拷贝数据传输理念启发了高效数据集加载工具的设计,而位置评估模块则促进了弱监督学习在棋类评估函数中的应用。通过整合此类数据集,后续工作亦已探索将棋类知识迁移至其他组合博弈,推动了通用博弈智能体的发展。
数据集最近研究
最新研究方向
该数据集聚焦于中国象棋(xiangqi)领域的强化学习与自我对弈研究,尤其强调蒙特卡洛树搜索(MCTS)与零拷贝(zero-copy)技术的融合应用。其前沿方向在于通过高速共享内存引擎(每秒约1250万节点搜索)加速AI自博弈过程,从而高效构建棋局知识库。数据集不仅包含PGN格式的完整棋谱,还创新性地提供了基于FEN键的棋局评估数据(含推荐着法、漏着及胜负统计),为研究棋局态势评估、开局策略学习以及棋力提升算法提供了标准化基准。同时,其多配置设计(games与positions)及Parquet格式支持,顺应了大规模数据驱动的大数据分析趋势,对推动棋类AI从规则引擎向数据密集型自学习范式演进具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务