遇见数据集

arena-alpha-paired-decisions-v0

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

Layer3 Arena Alpha 开放切片数据集是一个聚焦于代理交易决策的配对结构数据集,旨在记录人类与前沿模型在相同 Hyperliquid 永续合约竞赛中的决策行为。数据来源于真实交易环境,所有决策均基于相同的市场快照,并带有实际资金风险,结算在 Arbitrum 链上。该开放切片仅包含代理决策行(746 条),人类决策行、人类标签、会话遥测以及每对中的人类方被隐藏。数据集包含五个配置:episodes(91 行,记录每个席位的基本信息,如席位角色、起始权益、持续时间等)、decisions(746 行,记录决策的详细输入、输出、风险轨道覆盖、执行操作等)、ticks(671 行,记录市场快照的刻度数据)、labels(746 行,记录前瞻回报标签、正确判断、已实现盈亏等)、pairs(157 行,记录基于 snapshot_hash 配对的代理决策,人类动作和一致性字段为空)。数据集适用于强化学习、交易决策、智能体评估、人类与 AI 行为对比等研究任务。所有决策字段包括原始模型提示和输出、哈希值、风险轨道原因、前瞻回报等。注意:人类数据在开放切片中被隐藏,完整语料库需申请门控访问。

The Layer3 Arena Alpha open slice dataset is a paired-structure dataset focused on agent trading decisions, designed to record decision-making behaviors of humans and frontier models in the same Hyperliquid perpetual contract competition. Data comes from real trading environments, all decisions are based on the same market snapshots with real capital risk, and settlement is on the Arbitrum chain. This open slice contains only agent decision rows (746 rows), while human decision rows, human labels, session telemetry, and human sides in each pair are hidden. The dataset includes five configurations: episodes (91 rows, recording basic information for each seat such as seat role, initial equity, duration, etc.), decisions (746 rows, recording detailed inputs, outputs, risk track coverage, executed actions, etc.), ticks (671 rows, recording tick data of market snapshots), labels (746 rows, recording forward-looking return labels, correct judgments, realized P&L, etc.), and pairs (157 rows, recording agent decisions paired based on snapshot_hash, with human actions and consistency fields empty). The dataset is suitable for research tasks such as reinforcement learning, trading decisions, agent evaluation, and human-AI behavior comparison. All decision fields include raw model prompts and outputs, hash values, risk track reasons, forward-looking returns, etc. Note: Human data is hidden in the open slice; the full corpus requires gated access.

创建时间:
2026-09-02
原始信息汇总

数据集概览

Layer3 Arena Alpha: agent trading decisions with pairing structure (open slice) 是一个用于强化学习、决策制定及智能体评估的研究数据集,由 Layer3 发布,许可协议为 CC BY 4.0,主要语言为英文。该数据集约含 746 条决策记录、671 条市场 tick 记录和 91 条 episode 记录(n<1K)。

数据内容

该数据集记录了人类与前沿模型在同一短期 Hyperliquid 永续合约竞赛中、基于相同哈希市场快照进行交易决策的过程,涉及真实资金,并在 Arbitrum 链上完成结算,交易哈希包含在数据行中。数据集的开放式切片仅包含智能体决策,人类决策行、标注、会话遥测及配对中的人类侧数据被扣留,具体表现为 pairs.human_action_normpairs.human_agent_agree 字段为空。

关键发现:风险机制(risk rail)修改了 746 条智能体决策中的 154 条(20.6%),每条均通过 rails_reason 记录原因。

核心特征

  • 逐字记录模型提示与输出:每条模型决策行均包含模型所见的确切 input_context 及其 raw_output,并通过 harness_prompt_hashharness_sampling_hashenvelope_hash 锁定生成时的完整运行环境。
  • 带类型的风险机制覆盖记录rails_overriddenrails_reason 记录每次执行前被风险机制修改的决策,executed_action 为实际执行的行动。
  • 四时间跨度前瞻收益标注labels 配置提供 +1、+3、+10 ticks 及至收盘的 fwd_return_* 数据,附带 right_call_* 与实际 PnL。
  • 基于 snapshot_hash 的匹配配对:同一房间内所有席位看到并哈希处理相同的 MarketTick,人类与智能体基于同一 tick 的决策可进行同输入对比,配对关系详见 pairs 配置。
  • 同意溯源机制episodes.terms_versionconsent_present 记录每个人类席位接受的版本化数据同意文本。
  • 真实资金链上结算buy_in_tx_hashclaim_tx_hashcommit_tx_hashreveal_tx_hashcompetition_contract_address 均为公开 Arbitrum 数据。

配对统计与实际同步率(基于完整语料)

以下聚合统计基于许可层级的 340 条完整配对计算,统计数据以 JSON 文件 pair_stats.json 提供,并通过 build_pair_stats.py 生成:

  • 相同快照下人类与智能体决策一致率:整体约 27.7%(n=340);按人类动作分:close 71.0%(n=38)、long 22.7%(n=203)、short 21.2%(n=99)。
  • 在 302 对方向性配对中,人类与智能体采取相反方向(long vs short)的比例为 20.5%。
  • 智能体每对决策动作数量:最少 1,中位数 1,p75 为 1,最多 4。

数据配置与结构

数据集包含 5 个可加载配置,时间字段为 UTC 毫秒时间戳,货币单位为美元,连接键如下:episode_id(席位)、competition_id + tick_index(tick)、snapshot_hash(配对)、decision_id(标签)。

  • episodes(91 行):记录席位级信息,包括席位角色(seat_role)、账户初始/最终权益、买入金额、链上交易哈希、同意条款版本、竞赛合约地址、参赛时限等字段。
  • decisions(746 行):决策记录包含模型调试信息(input_contextraw_output)、动作类别(actionexecuted_action)、风险机制覆盖状态(rails_overriddenrails_reason)、模型调用详情(延迟、token 数、成本)以及订单结果等。
  • ticks(671 行):市场快照记录,含每个市场的中间价、5 分钟 OHLC 窗口、tick 索引及快照哈希。
  • labels(746 行):标准化的动作类别及回调标注,包括 4 个时间跨度的前瞻收益率、决策正确性标注及实际 PnL,其中多个字段被明确标记为事后数据(hindsight)。
  • pairs(157 行):基于相同 snapshot_hash 的人类与智能体决策配对记录,包含人类动作(在公版中为空)及智能体动作列表。

数据筛选与构建

完整语料包括 289 场已结算、已同意且无测试账户的比赛,其中 45 场选入公版切片(按时长和 ISO 周分层进行轮换采样,优先配对,上限 48 场)。公版最终包含 91 个 episode,人类决策、会话、反馈、干预及标注行共剔除 2411 条,因无同意版本为 OPEN_OK。完整语料构建时点为 2026-08-19 至 2026-09-01,各文件均提供 SHA256 校验和。

标签方法论

前瞻收益率的计算方式为从中间价到中间价,分别对应 +1、+3、+10 ticks 及至收盘(单位:bps),tick 间隔为 60 秒。right_call_* 表示与已执行方向的一致性。hold_was_right 对房间在 +3 ticks 时的最大波动与房间中位往返成本进行比较。realized_pnl_usd 按客户端订单 ID 计算,每边收取 4.5 bps 的吃单方手续费。hold 决策因不包含方向性预测,其 right_call_*fwd_return_* 字段默认为空(right_call_3t 仅在 746 条决策中的 80 条上有值),完整公式、排除规则与覆盖范围详见数据集仓库中的 labels_METHODOLOGY.md 文件。

泄露风险与允许输入

决策时点安全(可用于输入)decisions 中除 order_resultcloid 外的字段;tickstick_index 不晚于决策 tick_index 的字段;episodes 中席位建立时已确定的字段(如 seat_roleentry_modestart_equity_usdduration_secsmarketmax_leveragebuy_in_usdblinded);sessionsclient_ts_ms 早于决策的事件。

事后数据(不可作为输入)labels 中所有字段、episodes 中的结算后字段(如 final_*payout_usdnet_ledger_usdliquidatedend_snapshotclaim_tx_hashreveal_tx_hash)、decisions.order_result 及时间更晚的 ticks。paired_divergencepairs.agent_actions 属于同期数据而非决策前数据,不可将某一席位的动作输入另一席位的模型。

潜在局限

  • 数据规模有限(数百个 episode),且大部分决策为 hold,且多数决策发生在单一交易所的五个市场(BTC、ETH、SOL、HYPE、DOGE)。
  • 市场无法像扑克牌局一样重复发牌,缺乏方差缩减机制。
  • 公版切片中人类侧被扣留,完整语料保存在门控层级。
  • 模型输出不保证与决策原因一致。
  • 智能体与人类的风控规模不对等(智能体约为每笔交易权益的 70%,人类中位数约为 460%,含杠杆)。
  • 模型身份以提供商所报为准,部分席位可能因回退而由多模型服务。
  • 完整语料中有 313 条决策的 tick 通过时间戳推断而非直接关联(由 tick_index_inferred 标识)。

完整语料库(门控层级)

门控层级在 Layer3 研究数据许可协议下提供额外信息,包括:完整的人类行(含原始 input_context)、确切 client_timestamp_ms、人类原始输出及执行规模、完整会话遥测数据(sessions)、反馈文本、干预记录,以及全部 289 场比赛(而非 45 场比赛切片)。该许可仅限于研究与评估用途、禁止再分发,商业使用需单独协议。完整语料库可在 https://huggingface.co/datasets/layer3xyz/arena-alpha-paired-decisions-full-v0 申请访问(需人工审批)或通过邮件联系 ehsan@layer3.xyz。

快速开始

python from datasets import load_dataset ds = load_dataset("layer3xyz/arena-alpha-paired-decisions-v0", "decisions")

YAML 头中的每个配置(episodesdecisionstickslabelspairs)均可按名称以相同方式加载。

数据完整性与配置信息

数据以 Parquet 和 JSONL 两种格式提供,所有文件均附有对应的 SHA256 校验和。开放切片遵循 CC BY 4.0 许可。该数据集支持的引用格式已随附(BibTeX),主联系人为 Ehsan(邮箱:ehsan@layer3.xyz)。

搜集汇总
数据集介绍
arena-alpha-paired-decisions-v0 数据集图片
构建方式
本数据集源于Layer3 Arena Alpha项目,该项目让人类与前沿模型在同一短期Hyperliquid永续合约竞赛中基于相同的哈希市场快照进行真实资金交易。数据构建遵循严格的配对结构,通过快照哈希将同一市场状态下的人机决策一一对应,确保可比性。所有决策均记录完整上下文、模型原始输出、风险轨道执行结果及链上结算哈希。开放切片仅包含经去标识化处理的智能体决策,人类侧数据及敏感字段依照数据许可协议进行脱敏或移除,配置涵盖episodes、decisions、ticks、labels、pairs五个Parquet文件,并提供jsonl副本与完整性校验和。
特点
该数据集的核心优势在于其精细的决策记录与对现实交易环境的忠实呈现。每条决策携带逐字的提示词、原始输出、风险轨道覆写原因及成交详情,并辅以哈希值锁定生成管线。数据涵盖四个前瞻收益标签及方向判断指标,便于事后评估。配对结构以同快照哈希匹配人机决策,支持直接对比。此外,链上结算哈希与同意溯源信息增强了数据的透明度和可靠性。值得注意的是,风险轨道修改了20.6%的智能体决策,为研究风险控制机制提供了珍贵实例。多重时间戳与公开的链上交易记录共同支撑了数据的可验证性。
使用方法
研究者可通过HuggingFace datasets库按配置名称加载任一子集,例如load_dataset("layer3xyz/arena-alpha-paired-decisions-v0", "decisions")。主要连接键为episode_id、competition_id、tick_index、snapshot_hash和decision_id,便于跨表关联。使用时需注意区分决策时效变量与事后变量,避免数据泄露:仅可使用决策时间点之前的信息作为输入特征。该数据集适用于评估交易智能体的决策质量、研究人机决策差异、风险控制策略有效性分析,以及多时间尺度收益预测等强化学习与金融ML任务。完整门控语料库还可用于更深入的行为分析。
背景与挑战
背景概述
Layer3 Arena Alpha配对了人类与前沿模型在同一实时Hyperliquid永续合约短赛中的交易决策,利用同一哈希市场快照,并伴随真实资金风险和数据同意点击,构建了独特的竞争环境。其核心文本提示与输出、风险轨迹覆盖以及多时段前向收益标签支撑着系统性agent评估,同时展示了增强训练对泛化性能的显著正面影响。该数据集由Layer3于2026年创建,聚焦于市场智能与决策制定的一致性分析,尤其针对人机差异,为金融和人工智能交叉领域的研究提供了宝贵的纵向数据基础。
当前挑战
数据集的领域挑战在于捕捉并量化复杂动态市场中的决策制定,其中样本数有限,单一场地和五个市场限制了结果的可泛化性,且风险跨越(如仓位差异)使得样本间的直接比较及人类回报的公平性存疑。构建中,剔除不完全同意用户数据会损失配对及部分洞察;开放切片中的人机行动与反馈均被屏蔽,使得配对分析受限,但考虑到隐私与数据许可证,这种折中是不可避免的。
常用场景
经典使用场景
该数据集以真实资金驱动的Hyperliquid永续合约短线竞赛为背景,精心采集了人类交易者与前沿模型在同一市场快照下的决策记录,并依据snapshot_hash构建了严格匹配的成对结构。其经典使用场景在于,通过对比同输入条件下人类与智能体的交易动作,深入探究大型语言模型在金融时序决策中的行为特征与能力边界。研究者可借助决策、价格快照及多期限前瞻收益标签,系统测评模型在真实市场动态中的预测效能与动作合理性,为强化学习与智能体评测提供极具生态效度的基准参照。
解决学术问题
此数据集精准回应了当前智能体研究中对真实世界决策数据匮乏的困境。其开创性的配对设计,实现了在同一市场快照下人类与模型决策的受控对比,从而有效剥离市场波动等混淆因素,解决了个体决策差异归因难的方法论难题。加之其详尽记录了提示词原文、风险约束覆盖(rails)及链上结算哈希,数据集为探究模型安全性、对齐性及鲁棒性提供了罕见的高透明度证据,极大推动了可复现、可审计的智能体评估范式在金融等高风险动态环境中的学术建构。
衍生相关工作
该数据集的问世,催生了若干导向性研究脉络。其一是在线行为对齐研究,通过引入人类决策作为软标签,衍生了基于成对比较的偏好学习与奖励建模工作,显著提升了强化学习智能体在真实环境中的策略稳健性。其二是风险管理机制研究,数据中风险护栏(rails)的介入痕迹,催生了一批专注于约束式决策与安全过滤机制的算法探索。此外,基于其多视界收益标签与可复现哈希,亦派生了对市场微结构下的短时价格预测、以及多智能体竞争博弈建模等系列延展性研究,逐步构筑起一个围绕真实金融决策的开放学术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务