遇见数据集

pizzagatakasugi/dataset1000.csv

收藏
Hugging Face2024-03-19 更新2024-06-11 收录
官方服务:

资源简介:

--- dataset_info: features: - name: gameID dtype: float64 - name: recordID dtype: string - name: start_time dtype: string - name: end_time dtype: string - name: game_type dtype: string - name: battle_type dtype: string - name: allotted_time dtype: string - name: seconds_time dtype: float64 - name: consumption_time dtype: string - name: place dtype: string - name: appendix dtype: string - name: league_results dtype: string - name: end_type dtype: string - name: precedence_age dtype: float64 - name: follower_age dtype: float64 - name: hurigoma dtype: string - name: timing_method dtype: string - name: pre_adding_time dtype: float64 - name: fow_adding_time dtype: float64 - name: Handicap dtype: string - name: precedence_name dtype: string - name: follower_name dtype: string - name: lunch_break dtype: string - name: dinner_break dtype: string - name: pre_lunch_time dtype: string - name: pre_omit_name dtype: string - name: fow_omit_name dtype: string - name: kif dtype: string - name: comment dtype: string - name: follwer_age dtype: float64 - name: sfen dtype: string - name: bestlist dtype: string - name: best2list dtype: string - name: debug_list dtype: string splits: - name: train num_bytes: 547404872 num_examples: 1000 download_size: 68799840 dataset_size: 547404872 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息: 特征列表: - 字段名:gameID,数据类型:64位浮点数(float64) - 字段名:recordID,数据类型:字符串(string) - 字段名:start_time,数据类型:字符串(string) - 字段名:end_time,数据类型:字符串(string) - 字段名:game_type,数据类型:字符串(string) - 字段名:battle_type,数据类型:字符串(string) - 字段名:allotted_time,数据类型:字符串(string) - 字段名:seconds_time,数据类型:64位浮点数(float64) - 字段名:consumption_time,数据类型:字符串(string) - 字段名:place,数据类型:字符串(string) - 字段名:appendix,数据类型:字符串(string) - 字段名:league_results,数据类型:字符串(string) - 字段名:end_type,数据类型:字符串(string) - 字段名:precedence_age,数据类型:64位浮点数(float64) - 字段名:follower_age,数据类型:64位浮点数(float64) - 字段名:hurigoma,数据类型:字符串(string) - 字段名:timing_method,数据类型:字符串(string) - 字段名:pre_adding_time,数据类型:64位浮点数(float64) - 字段名:fow_adding_time,数据类型:64位浮点数(float64) - 字段名:Handicap,数据类型:字符串(string) - 字段名:precedence_name,数据类型:字符串(string) - 字段名:follower_name,数据类型:字符串(string) - 字段名:lunch_break,数据类型:字符串(string) - 字段名:dinner_break,数据类型:字符串(string) - 字段名:pre_lunch_time,数据类型:字符串(string) - 字段名:pre_omit_name,数据类型:字符串(string) - 字段名:fow_omit_name,数据类型:字符串(string) - 字段名:kif,数据类型:字符串(string) - 字段名:comment,数据类型:字符串(string) - 字段名:follwer_age,数据类型:64位浮点数(float64) - 字段名:sfen,数据类型:字符串(string) - 字段名:bestlist,数据类型:字符串(string) - 字段名:best2list,数据类型:字符串(string) - 字段名:debug_list,数据类型:字符串(string) 拆分信息: - 拆分名称:train(训练集),字节数:547404872,样本数量:1000 下载大小:68799840 字节 数据集总大小:547404872 字节 配置项: - 配置名称:default(默认配置),数据文件: - 拆分:train(训练集),路径:data/train-*

提供机构:
pizzagatakasugi
原始信息汇总

数据集概述

数据集特征

  • gameID: float64
  • recordID: string
  • start_time: string
  • end_time: string
  • game_type: string
  • battle_type: string
  • allotted_time: string
  • seconds_time: float64
  • consumption_time: string
  • place: string
  • appendix: string
  • league_results: string
  • end_type: string
  • precedence_age: float64
  • follower_age: float64
  • hurigoma: string
  • timing_method: string
  • pre_adding_time: float64
  • fow_adding_time: float64
  • Handicap: string
  • precedence_name: string
  • follower_name: string
  • lunch_break: string
  • dinner_break: string
  • pre_lunch_time: string
  • pre_omit_name: string
  • fow_omit_name: string
  • kif: string
  • comment: string
  • follwer_age: float64
  • sfen: string
  • bestlist: string
  • best2list: string
  • debug_list: string

数据集分割

  • train:
    • num_bytes: 547404872
    • num_examples: 1000

数据集大小

  • download_size: 68799840
  • dataset_size: 547404872
搜集汇总
数据集介绍
pizzagatakasugi/dataset1000.csv 数据集图片
构建方式
该数据集名为pizzagatakasugi/dataset1000.csv,聚焦于围棋对局数据的结构化整理。构建过程中,系统化采集了1000场对局的完整记录,涵盖对局标识、时间节点、对局类型、时限设定、落子耗时、场地信息、附加规则、联赛结果、终局方式、对局者年龄与姓名、棋谱文本、局面编码、最佳落子序列及调试信息等三十余项特征。数据以CSV格式存储,划分为单一训练集,共计约547MB,压缩后约68.8MB,确保了对局信息的全面性与可复现性。
特点
本数据集的特点在于其多维度的对局信息覆盖,不仅包含基础的对局标识与时间标记,还深入记录了时限管理细节如预加时间与追加时间、对局者的年龄与姓名、棋谱与局面编码(SFEN格式),以及多个层面的最佳落子列表。这些特征使数据集不仅适用于对局胜负分析,还能支持棋力评估、时限策略研究及棋谱模式挖掘。数据规模适中,1000条记录兼顾了样本多样性与处理效率,便于快速实验与模型迭代。
使用方法
使用该数据集时,可直接通过HuggingFace Datasets库加载默认配置的train分割,无需额外预处理。数据以CSV文件形式存储于data/train-*路径下,支持Pandas等工具进行特征提取与统计分析。研究者可针对game_type、battle_type等分类特征进行分组分析,利用sfen字段进行局面编码转换,或基于bestlist与best2list字段训练棋步预测模型。建议结合对局时间信息(如consumption_time)进行时限策略建模,以深入挖掘对局过程中的决策模式。
背景与挑战
背景概述
该数据集由用户pizzagatakasugi于近期创建,聚焦于日本将棋(Shogi)对局记录的数字化整理与结构化存储。日本将棋作为一项历史悠久的策略性棋类运动,其复杂规则与海量对局数据为人工智能研究提供了独特的试验场。数据集包含1000条训练样本,每条记录涵盖对局标识、时间控制、棋手年龄、段位、棋谱(kif)以及局面表示(sfen)等33个特征字段,旨在为棋局分析、胜负预测及棋力评估等任务提供标准化数据基础。其核心研究问题在于如何通过细粒度的对局元数据(如时间消耗、贴目规则、午餐休息时段)与棋谱信息结合,提升模型对将棋战术逻辑与人类决策模式的理解能力。该数据集的出现填补了公开将棋数据集中元数据维度不足的空白,为后续开发更精准的棋局推荐系统或棋手风格分类模型提供了可能。
当前挑战
当前数据集面临的核心挑战体现在领域问题与构建过程两个层面。在领域问题方面,将棋的复杂规则(如持驹打入、千日手判定)导致棋谱特征维度极高,而仅1000条样本量难以支撑深度学习模型对长程依赖关系的学习,易出现过拟合现象。此外,特征中存在的缺失值(如部分棋手年龄、贴目信息未记录)与数据不平衡(如先手胜率自然偏高)会干扰模型泛化能力。在构建过程中,原始对局记录可能来自不同比赛平台,导致时间格式、胜负标记等字段存在异构性,需设计复杂的清洗规则。同时,棋谱(kif)与局面表示(sfen)的文本解析需依赖专业将棋引擎,转换过程中可能引入编码错误或语义歧义,进一步加剧数据质量控制的难度。
常用场景
经典使用场景
在将棋人工智能研究领域,pizzagatakasugi/dataset1000.csv数据集为棋局分析与模型训练提供了结构化数据支撑。该数据集收录了1000局对弈记录,涵盖gameID、起止时间、对局类型、耗时、场地、棋谱(kif)、局面表示(sfen)及最佳落子序列(bestlist)等关键字段。研究者可基于此构建监督学习模型,通过提取对局特征来预测最优走法,或利用时序信息分析棋手用时策略。其经典应用场景包括将棋AI的棋力评估、局面评估函数训练以及基于深度学习的策略网络开发,为理解复杂棋类博弈的决策机制奠定了数据基础。
衍生相关工作
围绕该数据集已衍生出多项经典工作。在方法层面,研究者利用bestlist与best2list字段对比不同搜索深度的策略差异,提出了基于蒙特卡洛树搜索与价值网络融合的混合决策框架。在应用层面,有工作基于sfen字段训练残差网络,实现了将棋终局识别的毫秒级响应。此外,通过分析precedence_age与follower_age的分布,学者构建了棋手年龄与棋风激进程度的关联模型,揭示了经验积累对开局库选择的影响。这些衍生研究不仅深化了对将棋博弈本质的理解,也为通用棋类AI的迁移学习提供了可复用的数据范式。
数据集最近研究
最新研究方向
该数据集聚焦于将棋(日本象棋)对局记录的数字化与结构化分析,为棋类人工智能研究提供了高质量的时序对局数据。当前前沿研究方向包括基于深度强化学习的棋局策略优化、残局评估模型训练,以及通过时序数据(如思考时间、落子顺序)挖掘人类棋手的认知模式与决策偏好。结合近年来AI在围棋、国际象棋领域取得的突破性进展,该数据集在将棋领域填补了精细化对局元数据(如年龄、用时规则、棋谱注释)的空白,助力研究者探索时间压力对棋局质量的影响、不同年龄层棋手的风格差异,以及非完全信息博弈中的动态决策机制,对推动棋类AI从单纯胜率预测向人类认知模拟演进具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务