遇见数据集

faience-games

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

Faïence 数据集是来自 Faïence 浏览器应用程序的 Azul 棋局游戏人类与神经网络对战记录集合。该数据集由 Faïence 收集器从 Faïence 游戏页面收集,除非玩家关闭了共享选项。数据集旨在作为训练数据供玩家查看,并完全公开。所有记录均为匿名,仅包含移动、发牌、使用的神经网络以及得分,不包含姓名、账户、IP 地址或用户代理。数据以 JSONL 格式存储,文件按日期组织在 `games/YYYY-MM-DD/` 目录下,每条记录为一行 JSON 对象。记录格式为 `faience-game/1`,由收集器通过真实引擎重放验证,确保发牌、最终分数和回合数完全匹配。字段包括:`received_at`(服务器时间)、`created_at`(客户端时间,可为空)、`seed`(随机数种子)、`human_seat`(人类座位)、`human_first`(人类是否先手)、`net`(对手神经网络信息,包括运行、检查点、ELO、参数、后端)、`think_time_s`(AI 搜索预算)、`moves`(移动列表,每个移动包含 ply、玩家、动作编码、仿真次数、价值)、`deals`(每轮工厂、袋子、盖子计数)、`final`(最终结果,包括是否完成、分数、结果、回合数、是否耗尽)。注意事项:可能存在重复记录,需通过 `(seed, human_seat, moves, final.scores, final.finished)` 去重;放弃的游戏可能重复出现,建议优先使用完成状态为 `true` 的记录;玩家水平参差不齐。数据集采用 CC0 公共领域许可。

The Faïence dataset is a collection of human vs. neural network game records of the Azul board game from the Faïence browser application. The dataset is collected by the Faïence collector from the Faïence game page, unless the player has disabled sharing. It is intended as training data for players to view and is fully public. All records are anonymous, containing only moves, deals, the neural network used, and scores, without names, accounts, IP addresses, or user agents. Data is stored in JSONL format, with files organized by date in the `games/YYYY-MM-DD/` directory, each line being a JSON object. The record format is `faience-game/1`, verified by the collector through replay with the real engine to ensure that deals, final scores, and number of turns match exactly. Fields include: `received_at` (server time), `created_at` (client time, can be null), `seed` (random seed), `human_seat` (human seat), `human_first` (whether human goes first), `net` (opponent neural network info including run, checkpoint, ELO, parameters, backend), `think_time_s` (AI search budget), `moves` (list of moves, each containing ply, player, move encoding, simulation count, value), `deals` (factory, bag, lid counts per round), `final` (final result, including finished, scores, result, turns, exhausted). Notes: duplicate records may exist and should be deduplicated by `(seed, human_seat, moves, final.scores, final.finished)`; abandoned games may appear multiple times, and it is recommended to prefer records with `finished: true`; player skill levels vary. The dataset is licensed under CC0 Public Domain.

创建时间:
2026-08-19
原始信息汇总

Faïence 人类对战神经网络 Azul 游戏数据集

数据集概述

该数据集收集了在 Faïence 免费浏览器端 Azul(Michael Kiesling 设计的游戏)实现中,人类玩家与通过自我对弈训练的神经网络进行的所有对局记录(前提是玩家未关闭共享功能)。数据集的公开性旨在让玩家完全了解项目收集的所有信息。

数据布局

  • 存储路径games/YYYY-MM-DD/<timestamp>-<n>.jsonl
  • 格式:每个批次一个文件,每行一个 JSON 对象
  • 特性:数据不可变,新批次只增加文件,不修改已有内容

记录格式(faience-game/1

每条记录由收集器(RemiFabre/faience-ingest)在真实引擎中重放游戏后重建,仅保留发牌、最终得分和回合数完全复现的记录。字段包括:

  • 时间戳received_at(服务器时钟)和 created_at(客户端时钟,可能为空)
  • 随机种子:游戏的 RNG 种子(mulberry32)
  • 座位信息human_seathuman_first,标识人类玩家所在位置
  • 神经网络信息:对手的 {run, checkpoint, elo, params, backend}
  • 思考时间:AI 每步的搜索预算(0 表示仅使用策略头)
  • 对局记录:每步的 {ply, player, action, sims?, value?},动作编码为 source*30 + color*6 + dest
  • 发牌信息:每轮五个工厂以及袋子和盖子数量,确保记录可独立重放
  • 最终状态{finished, scores, outcome, rounds, exhausted}finished: false 表示弃局

注意事项

  • 收集器按内容去重重试提交,但重启可能偶尔导致重复记录,可按 (seed, human_seat, moves, final.scores, final.finished) 去重
  • 同一标签页中中断后恢复并完成的对局可能出现两次,建议优先使用 finished: true 的记录
  • 玩家水平差异较大,涵盖从新手到高水平俱乐部玩家

来源与许可

Faïence ingest SpaceFaïence 游戏页面 收集,代码和方法详见 RemiFabre/ludometer。记录均属于公有领域(CC0)。Azul 是 Michael Kiesling 的游戏,该粉丝研究项目与其出版商无关联或获得背书。

搜集汇总
数据集介绍
faience-games 数据集图片
构建方式
该数据集源自浏览器端Azul对弈平台Faïence,每局游戏由人类玩家与经自我对弈训练而成的神经网络进行对抗。采集流程依托专用ingest模块,将每一批提交的记录经真实引擎重放验证,仅当牌局发牌、最终得分与轮数完全吻合时才予以保留,并重建为规范化记录。所有记录按摄取时间分文件存储,以JSONL格式逐行组织,且永不覆写,仅以新增批次的方式累积,从而保障数据可追溯与可复现。
特点
数据集以匿名化为构建前提,仅包含移动、发牌、对手网络与得分等对局信息,不涉及姓名、账户、IP或用户代理。每条记录囊括随机数种子、人类座位、网络检查点及其Elo、搜索预算、逐步动作与模拟次数、根节点估值、各轮发牌明细以及终局状态,并采用统一动作编码以兼容JavaScript与Python引擎。记录强度跨度较大,涵盖初次接触者至资深俱乐部玩家,且含少量未完成对局,使用时需按内容去重并优先选取已完成的对局。
使用方法
该数据集主要服务于强化学习与对弈行为研究。使用者可依据文件路径按日期与批次读取JSONL记录,借助发牌字段在无随机数移植的情况下独立重放牌局;通过动作编码解析每一步的落子位置与颜色。对含模拟次数与根节点估值的记录,可用于策略与价值网络的训练或评估;对未完成对局,则需审慎决定是否纳入价值头训练。若需去重,可依据种子、人类座位、移动序列、最终得分与完成标志进行判定。
背景与挑战
背景概述
在强化学习与博弈决策研究领域,高质量的对局数据是推动算法进步的关键资源。Faïence数据集由独立研究者Rémi Fabre创建,源自其开发的免费浏览器版《花砖物语》(Azul)实现,该实现允许人类玩家与通过自我对弈训练而成的神经网络对弈,并匿名收集对局记录。数据集旨在为研究人类与AI在策略游戏中的行为差异、改进自我对弈训练方法提供公开、可复现的数据基础,其匿名化设计与公共领域授权为相关研究提供了伦理与法律上的便利,对博弈AI及人机交互研究具有潜在影响力。
当前挑战
该数据集所应对的领域问题在于:如何从非受控的真实人机对弈环境中获取高质量、可复现的博弈数据,以支撑强化学习模型的训练与评估。构建过程中面临多重挑战:其一,数据来自自选样本的浏览器访客,玩家水平参差不齐,导致对局质量波动剧烈;其二,尽管收集器通过内容去重,但系统重启可能导致重复记录,且同一局游戏若中途放弃后恢复完成,会同时出现未完成与已完成两条记录,需谨慎处理;其三,部分对局标记为未完成,缺乏最终结果,为价值网络训练带来困难。这些挑战要求使用者在数据清洗与利用时采取审慎策略。
常用场景
经典使用场景
在强化学习与博弈决策的交汇处,Faïence数据集构筑了一方独特的实验场。该数据集汇聚了人类玩家与自对弈神经网络在《花砖物语》对局中的完整记录。其经典使用场景聚焦于离线强化学习与模仿学习研究,研究者可藉此训练智能体从真实人类决策中汲取策略,或评估不同强度神经网络在复杂回合制游戏中的表现。每一局记录均包含详尽的状态转移、行动编码与终局得分,为构建决策模型提供了细粒度且可复现的数据基础。
实际应用
在产业实践中,Faïence数据集可服务于游戏 AI 的迭代优化与玩家体验分析。开发者能够利用其对弈记录训练更强对手,或构建动态难度调整系统,根据玩家历史表现匹配适宜强度的神经网络。此外,该数据集亦可用于设计教学工具,通过复盘人类与 AI 的决策路径,帮助玩家理解高级策略。其匿名且公开的构造方式,还为隐私保护下的用户行为研究提供了合规范例,适用于需要兼顾数据效用与伦理的在线交互场景。
衍生相关工作
以Faïence数据集为基石,衍生了一系列围绕自对弈训练、人机协作及游戏理解的研究工作。例如,基于其中记录的神经网络参数与模拟次数,学者们探究了蒙特卡洛树搜索预算对棋力提升的边际效应;利用人类座位与先手信息,分析了先发优势在不同水平对局中的表现差异。此外,该数据集还激发了关于弃局价值学习、重复对局去重策略以及跨引擎动作编码兼容性的方法论讨论,为后续类似在线对弈数据集的构建与利用提供了可借鉴的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务