遇见数据集

same-bar-llm-disagreement

收藏
Hugging Face2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

Same-Bar Cross-Model Disagreement 数据集记录了20多个LLM系列(包括GPT-5.x、Gemini-3.x、GLM-5.2、Grok-4.20、Claude-Opus-5等)对相同SPY 30分钟bar的决策判断,所有模型使用字节一致、哈希固定的提示。数据集包含约907,000个决策,覆盖39个模型路线、33,344个SPY 30分钟bar(2016-2026年),其中28,877个bar被至少4个不同模型评判。每个bar的决策包括模型动作(HOLD/OPEN_CALL/OPEN_PUT/CLOSE)、规模、合约规格、理由、哈希值以及因果模拟结果(PNL)。该数据集旨在支持路由器与集成研究、DPO偏好对挖掘、校准研究以及行为指纹分析等任务。数据集提供样本(4,000+决策),完整数据集通过研究许可获取,不支持直接重新分发。

The Same-Bar Cross-Model Disagreement dataset records decision-making of over 20 LLM series (including GPT-5.x, Gemini-3.x, GLM-5.2, Grok-4.20, Claude-Opus-5, etc.) on identical SPY 30-minute bars, with all models using byte-consistent, hash-fixed prompts. The dataset contains approximately 907,000 decisions, covering 39 model lineages and 33,344 SPY 30-minute bars (2016-2026), of which 28,877 bars are evaluated by at least 4 different models. Each bars decision includes model action (HOLD/OPEN_CALL/OPEN_PUT/CLOSE), size, contract specifications, reasoning, hash value, and causal simulation results (PNL). The dataset is designed to support tasks such as router and ensemble research, DPO preference pair mining, calibration research, and behavioral fingerprint analysis. It provides a sample (4,000+ decisions), while the full dataset is available under a research license and does not support direct redistribution.

创建时间:
2026-08-03
原始信息汇总

数据集概述

Same-Bar Cross-Model Disagreement (LLM Trading Decisions) 是一个用于研究多个大语言模型(LLM)在同一市场状态下决策分歧的数据集,旨在为路由、集成学习、偏好对挖掘、校准研究及行为指纹识别等领域提供基础数据。

核心特点

  • 数据规模:完整数据集包含约 907,000 条模型决策,覆盖 39 个模型路线(20+ 模型家族),数据每日更新。
  • 市场数据范围:基于 33,344 根 SPY 30分钟K线(2016年5月至2026年7月),其中 28,877 根K线由至少4个不同模型在字节级一致、哈希固定的提示词下进行判断,平均每根K线约有 27 条模型决策
  • 免费样本:提供 4,000+ 条决策 样本可供免费使用。

数据集内容

  • 每个K线记录包含模型对 HOLD / OPEN_CALL / OPEN_PUT / CLOSE 四种操作的决策、理由说明及约100字的备忘录。
  • 每条记录包含提示词哈希(user_prompt_sha256system_prompt_sha256),确保提示词的字节级一致性。
  • 交易结果使用 因果模拟(决策在K线收盘时做出,30分钟后成交),避免了前视偏差。
  • 实验表明,日期盲化处理仅影响约 1/40 的K线决策(97.5%一致性),证明模型并非依赖记忆的日历日期。

关键洞察

  • 在样本中,58% 的多模型K线 显示模型间存在行动分歧。
  • 在完整数据集的 10,844 根分歧K线中,不同模型路线的“正确率”从 65%(gpt-5.5-instant)到 45%(gpt-oss-120b)不等,且一些低成本模型(如 gemini-3-flash 达 63%、laguna-s 达 64%)表现优于多个旗舰模型。

可用切片

  • 完整数据集支持按市场状态(regime)、模型家族、DPO 偏好对等自定义切片导出。

获取方式

  • 完整数据集需通过 研究许可 获取,联系邮箱:kinase@tutanota.com,需说明用途。
  • 允许基于数据集产出衍生模型和论文(需引用),但禁止重新分发数据集本身
搜集汇总
数据集介绍
same-bar-llm-disagreement 数据集图片
构建方式
该数据集以SPY 30分钟K线为基准,通过密码学哈希固定系统提示词与用户提示词,确保所有模型在字节级完全一致的条件下进行决策。数据集构建过程中,严格遵循无前瞻性原则,采用决策后30分钟成交的模拟方式,并记录每笔交易的盈亏。此外,数据集通过日期盲化实验验证了模型未依赖记忆中的日历日期,并通过代码指纹与提示哈希保证了数据的可验证性与可复现性。
使用方法
该数据集适用于多种研究方向,包括路由与集成学习,可利用分歧数据构建分市场状态的模型选择策略;偏好对挖掘,通过相同输入下模型的分歧行为与因果结果生成DPO训练数据;校准研究,分析模型置信度与实际收益的一致性;行为指纹分析,识别不同模型家族的行动分布特征。数据集提供JSON格式的样本文件,并支持自定义切片,如按市场状态或模型族导出子集,便于研究者灵活使用。
背景与挑战
背景概述
该数据集名为same-bar-llm-disagreement,由独立研究者于2026年创建,旨在探索大型语言模型在金融交易决策中的一致性。其核心研究问题聚焦于:当多个LLM面对完全相同的市场状态时,它们的行为分歧能否作为评估模型能力、构建集成系统或进行偏好学习的信号。数据集包含约90.7万条决策记录,覆盖39个不同模型系列(如GPT-5.x、Gemini-3.x等),对33,344个SPY 30分钟K线进行了判断,每个K线平均有27个模型决策。该数据集的独特性在于,所有模型均基于字节级一致的提示(哈希固定)进行判断,确保了比较的公平性。其影响力体现在为模型路由、集成学习、校准研究及行为指纹识别等领域提供了前所未有的基准资源,推动了对LLM在金融领域应用可靠性的深入理解。
当前挑战
该数据集所解决的领域问题在于,LLM在金融决策中的输出常缺乏可比性,导致模型选择与集成困难。现有基准多基于静态任务,无法捕捉市场多变环境下的模型分歧。此数据集通过加密固定提示和因果填充,克服了提示不一致和未来函数窥视的挑战,后者曾导致P&L膨胀约25倍。构建过程中,研究者还面临数据分布稀疏、模型间分歧率高达58%的复杂性,以及确保数据可验证性的难题,如通过哈希和代码指纹实现字节级可复现。此外,如何有效利用这些分歧数据(如提取偏好对、构建路由启发式)仍是后续研究的核心挑战,要求平衡模型多样性、决策解释性与市场实际表现之间的关系。
常用场景
经典使用场景
该数据集以SPY 30分钟K线为统一市场状态,在字节级一致且哈希固定的提示词约束下,汇聚20余个主流大语言模型家族的近百万次交易决策。其经典使用场景聚焦于多模型分歧分析,为研究者提供同一市场状态下模型间行动差异的高保真观测样本,支撑构建模型行为对比基准、分歧归因分析及鲁棒性评估等研究范式。
解决学术问题
数据集有效解决了缺乏可控多模型对比环境这一长期制约大语言模型金融决策研究的瓶颈问题。通过密码学级固定提示词与因果填充机制,排除了提示词漂移和未来信息泄漏的干扰,使研究者能可信地量化模型在真实市场状态下的分歧程度、置信度校准质量及决策胜率,为模型能力评估和选择性集成提供坚实的数据基础。
实际应用
在实际应用层面,该数据集的即时价值体现在算法交易系统研发中。金融科技机构可基于各模型在分歧场景下的历史胜率与风格偏向训练路由网关,依据市场制度动态分配决策权重,从而提升组合收益稳定性。同时,分歧样本可转化为偏好对,用于偏好优化和模型微调,实现低成本、高拟真度的策略迭代验证。
数据集最近研究
最新研究方向
该数据集聚焦于金融交易决策领域,通过同杆跨模型分歧现象,为模型路由、集成学习及偏好优化提供了独特的研究素材。其前沿方向包括基于真实市场状态的多模型分歧分析,用于构建按市场状态动态选择最优模型的动态路由机制,以及利用分歧作为弱监督信号生成偏好对,结合因果模拟结果进行DPO训练。此外,数据集还支持模型校准研究,通过比较模型置信度与实际收益来揭示过度自信或保守倾向,并借助行为指纹识别模型家族特质,推动可解释人工智能在金融决策中的应用。其严格的因果填充协议与哈希固定提示设计,保障了研究的可复现性,为探究模型在复杂金融环境下的泛化能力与协同决策提供了新视角。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务