arena-alpha-paired-decisions-v0
收藏资源简介:
Layer3 Arena Alpha 开放切片数据集是一个聚焦于代理交易决策的配对结构数据集,旨在记录人类与前沿模型在相同 Hyperliquid 永续合约竞赛中的决策行为。数据来源于真实交易环境,所有决策均基于相同的市场快照,并带有实际资金风险,结算在 Arbitrum 链上。该开放切片仅包含代理决策行(746 条),人类决策行、人类标签、会话遥测以及每对中的人类方被隐藏。数据集包含五个配置:episodes(91 行,记录每个席位的基本信息,如席位角色、起始权益、持续时间等)、decisions(746 行,记录决策的详细输入、输出、风险轨道覆盖、执行操作等)、ticks(671 行,记录市场快照的刻度数据)、labels(746 行,记录前瞻回报标签、正确判断、已实现盈亏等)、pairs(157 行,记录基于 snapshot_hash 配对的代理决策,人类动作和一致性字段为空)。数据集适用于强化学习、交易决策、智能体评估、人类与 AI 行为对比等研究任务。所有决策字段包括原始模型提示和输出、哈希值、风险轨道原因、前瞻回报等。注意:人类数据在开放切片中被隐藏,完整语料库需申请门控访问。
The Layer3 Arena Alpha open slice dataset is a paired-structure dataset focused on agent trading decisions, designed to record decision-making behaviors of humans and frontier models in the same Hyperliquid perpetual contract competition. Data comes from real trading environments, all decisions are based on the same market snapshots with real capital risk, and settlement is on the Arbitrum chain. This open slice contains only agent decision rows (746 rows), while human decision rows, human labels, session telemetry, and human sides in each pair are hidden. The dataset includes five configurations: episodes (91 rows, recording basic information for each seat such as seat role, initial equity, duration, etc.), decisions (746 rows, recording detailed inputs, outputs, risk track coverage, executed actions, etc.), ticks (671 rows, recording tick data of market snapshots), labels (746 rows, recording forward-looking return labels, correct judgments, realized P&L, etc.), and pairs (157 rows, recording agent decisions paired based on snapshot_hash, with human actions and consistency fields empty). The dataset is suitable for research tasks such as reinforcement learning, trading decisions, agent evaluation, and human-AI behavior comparison. All decision fields include raw model prompts and outputs, hash values, risk track reasons, forward-looking returns, etc. Note: Human data is hidden in the open slice; the full corpus requires gated access.
数据集概览
Layer3 Arena Alpha: agent trading decisions with pairing structure (open slice) 是一个用于强化学习、决策制定及智能体评估的研究数据集,由 Layer3 发布,许可协议为 CC BY 4.0,主要语言为英文。该数据集约含 746 条决策记录、671 条市场 tick 记录和 91 条 episode 记录(n<1K)。
数据内容
该数据集记录了人类与前沿模型在同一短期 Hyperliquid 永续合约竞赛中、基于相同哈希市场快照进行交易决策的过程,涉及真实资金,并在 Arbitrum 链上完成结算,交易哈希包含在数据行中。数据集的开放式切片仅包含智能体决策,人类决策行、标注、会话遥测及配对中的人类侧数据被扣留,具体表现为 pairs.human_action_norm 和 pairs.human_agent_agree 字段为空。
关键发现:风险机制(risk rail)修改了 746 条智能体决策中的 154 条(20.6%),每条均通过 rails_reason 记录原因。
核心特征
- 逐字记录模型提示与输出:每条模型决策行均包含模型所见的确切
input_context及其raw_output,并通过harness_prompt_hash、harness_sampling_hash和envelope_hash锁定生成时的完整运行环境。 - 带类型的风险机制覆盖记录:
rails_overridden和rails_reason记录每次执行前被风险机制修改的决策,executed_action为实际执行的行动。 - 四时间跨度前瞻收益标注:
labels配置提供 +1、+3、+10 ticks 及至收盘的fwd_return_*数据,附带right_call_*与实际 PnL。 - 基于
snapshot_hash的匹配配对:同一房间内所有席位看到并哈希处理相同的MarketTick,人类与智能体基于同一 tick 的决策可进行同输入对比,配对关系详见pairs配置。 - 同意溯源机制:
episodes.terms_version与consent_present记录每个人类席位接受的版本化数据同意文本。 - 真实资金链上结算:
buy_in_tx_hash、claim_tx_hash、commit_tx_hash、reveal_tx_hash及competition_contract_address均为公开 Arbitrum 数据。
配对统计与实际同步率(基于完整语料)
以下聚合统计基于许可层级的 340 条完整配对计算,统计数据以 JSON 文件 pair_stats.json 提供,并通过 build_pair_stats.py 生成:
- 相同快照下人类与智能体决策一致率:整体约 27.7%(n=340);按人类动作分:close 71.0%(n=38)、long 22.7%(n=203)、short 21.2%(n=99)。
- 在 302 对方向性配对中,人类与智能体采取相反方向(long vs short)的比例为 20.5%。
- 智能体每对决策动作数量:最少 1,中位数 1,p75 为 1,最多 4。
数据配置与结构
数据集包含 5 个可加载配置,时间字段为 UTC 毫秒时间戳,货币单位为美元,连接键如下:episode_id(席位)、competition_id + tick_index(tick)、snapshot_hash(配对)、decision_id(标签)。
episodes(91 行):记录席位级信息,包括席位角色(seat_role)、账户初始/最终权益、买入金额、链上交易哈希、同意条款版本、竞赛合约地址、参赛时限等字段。decisions(746 行):决策记录包含模型调试信息(input_context、raw_output)、动作类别(action、executed_action)、风险机制覆盖状态(rails_overridden、rails_reason)、模型调用详情(延迟、token 数、成本)以及订单结果等。ticks(671 行):市场快照记录,含每个市场的中间价、5 分钟 OHLC 窗口、tick 索引及快照哈希。labels(746 行):标准化的动作类别及回调标注,包括 4 个时间跨度的前瞻收益率、决策正确性标注及实际 PnL,其中多个字段被明确标记为事后数据(hindsight)。pairs(157 行):基于相同snapshot_hash的人类与智能体决策配对记录,包含人类动作(在公版中为空)及智能体动作列表。
数据筛选与构建
完整语料包括 289 场已结算、已同意且无测试账户的比赛,其中 45 场选入公版切片(按时长和 ISO 周分层进行轮换采样,优先配对,上限 48 场)。公版最终包含 91 个 episode,人类决策、会话、反馈、干预及标注行共剔除 2411 条,因无同意版本为 OPEN_OK。完整语料构建时点为 2026-08-19 至 2026-09-01,各文件均提供 SHA256 校验和。
标签方法论
前瞻收益率的计算方式为从中间价到中间价,分别对应 +1、+3、+10 ticks 及至收盘(单位:bps),tick 间隔为 60 秒。right_call_* 表示与已执行方向的一致性。hold_was_right 对房间在 +3 ticks 时的最大波动与房间中位往返成本进行比较。realized_pnl_usd 按客户端订单 ID 计算,每边收取 4.5 bps 的吃单方手续费。hold 决策因不包含方向性预测,其 right_call_* 和 fwd_return_* 字段默认为空(right_call_3t 仅在 746 条决策中的 80 条上有值),完整公式、排除规则与覆盖范围详见数据集仓库中的 labels_METHODOLOGY.md 文件。
泄露风险与允许输入
决策时点安全(可用于输入):decisions 中除 order_result 与 cloid 外的字段;ticks 中 tick_index 不晚于决策 tick_index 的字段;episodes 中席位建立时已确定的字段(如 seat_role、entry_mode、start_equity_usd、duration_secs、market、max_leverage、buy_in_usd、blinded);sessions 中 client_ts_ms 早于决策的事件。
事后数据(不可作为输入):labels 中所有字段、episodes 中的结算后字段(如 final_*、payout_usd、net_ledger_usd、liquidated、end_snapshot、claim_tx_hash、reveal_tx_hash)、decisions.order_result 及时间更晚的 ticks。paired_divergence 和 pairs.agent_actions 属于同期数据而非决策前数据,不可将某一席位的动作输入另一席位的模型。
潜在局限
- 数据规模有限(数百个 episode),且大部分决策为 hold,且多数决策发生在单一交易所的五个市场(BTC、ETH、SOL、HYPE、DOGE)。
- 市场无法像扑克牌局一样重复发牌,缺乏方差缩减机制。
- 公版切片中人类侧被扣留,完整语料保存在门控层级。
- 模型输出不保证与决策原因一致。
- 智能体与人类的风控规模不对等(智能体约为每笔交易权益的 70%,人类中位数约为 460%,含杠杆)。
- 模型身份以提供商所报为准,部分席位可能因回退而由多模型服务。
- 完整语料中有 313 条决策的 tick 通过时间戳推断而非直接关联(由
tick_index_inferred标识)。
完整语料库(门控层级)
门控层级在 Layer3 研究数据许可协议下提供额外信息,包括:完整的人类行(含原始 input_context)、确切 client_timestamp_ms、人类原始输出及执行规模、完整会话遥测数据(sessions)、反馈文本、干预记录,以及全部 289 场比赛(而非 45 场比赛切片)。该许可仅限于研究与评估用途、禁止再分发,商业使用需单独协议。完整语料库可在 https://huggingface.co/datasets/layer3xyz/arena-alpha-paired-decisions-full-v0 申请访问(需人工审批)或通过邮件联系 ehsan@layer3.xyz。
快速开始
python from datasets import load_dataset ds = load_dataset("layer3xyz/arena-alpha-paired-decisions-v0", "decisions")
YAML 头中的每个配置(episodes、decisions、ticks、labels、pairs)均可按名称以相同方式加载。
数据完整性与配置信息
数据以 Parquet 和 JSONL 两种格式提供,所有文件均附有对应的 SHA256 校验和。开放切片遵循 CC BY 4.0 许可。该数据集支持的引用格式已随附(BibTeX),主联系人为 Ehsan(邮箱:ehsan@layer3.xyz)。





