遇见数据集

DualBlind

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

DualBlind 推理与偏好数据集是一个合成生成的双盲AI竞技场基准共识数据集,旨在提供高质量的监督微调(SFT)推理轨迹和直接偏好优化(DPO)偏好对。该数据集将双盲竞技场中获胜的推理路径与错误的备选方案进行对比,从而训练和校准模型在已验证的底层逻辑上。数据集包含两个部分:SFT推理轨迹文件(data/sft_reasoning_train.jsonl,共996条),每条记录是经过验证的逐步推理证明,适用于教授模型结构化逻辑、代码合成和分析推理;DPO偏好对文件(data/dpo_preferences_train.jsonl,共995条),每条记录包含一个较优逻辑(chosen)和一个有缺陷、低效或错误的推理尝试(rejected),适用于使用Hugging Face TRL、Unsloth或Axolotl进行对齐训练。数据格式为JSONL,可通过Hugging Face datasets库直接加载。

DualBlind Reasoning and Preference Dataset is a synthetically generated double-blind AI arena benchmark consensus dataset designed to provide high-quality supervised fine-tuning (SFT) reasoning traces and direct preference optimization (DPO) preference pairs. The dataset contrasts winning reasoning paths from the double-blind arena with erroneous alternatives, thereby training and calibrating models on verified underlying logic. The dataset consists of two parts: an SFT reasoning trace file (data/sft_reasoning_train.jsonl, 996 entries), each record is a verified step-by-step reasoning proof, suitable for teaching models structured logic, code synthesis, and analytical reasoning; a DPO preference pair file (data/dpo_preferences_train.jsonl, 995 entries), each record contains a superior logic (chosen) and a flawed, inefficient, or erroneous reasoning attempt (rejected), suitable for alignment training using Hugging Face TRL, Unsloth, or Axolotl. The data format is JSONL and can be loaded directly via the Hugging Face datasets library.

创建时间:
2026-09-04
原始信息汇总

GlimmaryKarl/DualBlind 数据集概述

数据集简介

GlimmaryKarl/DualBlind 是一个通过双盲多智能体竞技场(DualBlind AI Benchmark Arena)生成的精选前沿推理与直接偏好优化(DPO)数据集。在该竞技场中,两个独立的 Frontier AI 模型进行多轮双盲对话,共同解决高难度基准问题,相互验证对方的证明、提出反例并达成数学共识。

质量门槛

  • 严格的质量控制:仅收录通过自动化验证、达到 100% 准确率且与标准答案完全一致的试验样本。
  • 总竞技场试验数:1832 个
  • 已验证 100% 准确的合格样本:1573 个(通过率 85.9%)
  • 被过滤的不合格样本(<100% 或被反驳):259 个
  • 质量政策:对未经验证或不完美的推测零容忍,每个样本均提供经数学与算法验证的标准解答。

数据子集

  1. sft_reasoning(1428 个样本):监督微调记录,包含高密度的逐步思维链推理过程,最终导向 100% 验证的正确解答。
  2. dpo_preferences(1427 对):直接偏好优化数据对(promptchosenrejected),将 100% 验证的共识性证明作为 chosen,将存在缺陷的同行推测或被反驳的假设作为 rejected

覆盖的基准套件

基准 运行次数
GPQA Diamond 192
MMLU-Pro 164
Game Theory 264
ARC Challenge 215
IFEval 142
MATH / AIME 74
SWE-bench 197
FrontierMath 62
Humanitys Last Exam 63
Formal Logic 177
General Benchmark 23

涉及的代表性模型

数据集涵盖了超过 45 个模型,包括但不限于:

  • Gemini 系列gemini-2.5-flashgemini-2.0-flashgemini-3.7-flashgemini-1.5-flashgoogle-gemini-3.7-flash
  • DeepSeek 系列deepseek/deepseek-r1:freedeepseek/deepseek-r1-distill-llama-70b:freedeepseek-r1deepseek-deepseek-v3deepseek/deepseek-chat:free
  • Llama 系列meta-llama/llama-3.1-8b-instruct:freemeta-llama/llama-3.3-70b-instruct:freemeta-llama/llama-3.2-3b-instruct:freemeta-llama/llama-3.1-70b-instruct
  • Qwen 系列qwen/qwen-2.5-72b-instruct:freeqwen/qwq-32b:freeqwen/qwen-2.5-coder-32b-instruct:free
  • OpenAI 系列openai/gpt-3.5-turboopenai/gpt-4o-minio3-minigpt-4.5-previewgpt-4o
  • 其他模型claude-3-7-sonnet-20250219anthropic-claude-3-haikumistralai/mistral-small-24b-instruct-2501:freemicrosoft/phi-3-mini-128k-instruct:freegoogle/gemma-2-9b-it:free

数据集配置与使用

  • config 名称sft_reasoning(默认)和 dpo_preferences
  • 语言:英语
  • 任务类型:文本生成、问答
  • 数据规模:1K < n < 10K
  • 许可证:Apache 2.0,可免费用于商业、研究和教育用途

可通过 Hugging Face datasets 库加载:

python from datasets import load_dataset

加载 SFT 推理子集

sft_ds = load_dataset("GlimmaryKarl/DualBlind", "sft_reasoning", split="train")

加载 DPO 偏好子集

dpo_ds = load_dataset("GlimmaryKarl/DualBlind", "dpo_preferences", split="train")

数据集特点总结

  • 推理数据均经过双盲多智能体验证,质量要求严格(100% 准确率)
  • 同时支持**监督微调(SFT)直接偏好优化(DPO)**两种训练范式
  • 覆盖从数学推理、代码到逻辑等广泛的高难度基准任务
  • 合成数据中包含了多个前沿模型的多轮交互推理轨迹,适合用于提升模型在复杂推理任务上的表现
搜集汇总
数据集介绍
DualBlind 数据集图片
构建方式
DualBlind数据集源自于一项前沿的多智能体双盲评测体系,该体系旨在模拟严苛的学术同行评审过程。其构建过程颇为精巧:两个独立的前沿AI模型被置于多轮对话环境中,共同解决极高难度的基准问题,相互验证彼此的推演证明,提出反例,直至达成数学共识。该数据集设定了严格的质量门禁,仅收录自动验证准确率达100%的实验记录。在共计2254次竞技试验中,有1971次(87.4%)通过验证,而283次不完整或被驳斥的试验被坚决剔除,确保了数据的高度纯净与可靠性。
特点
该数据集的核心特质在于其双盲架构与严苛的验证标准,这不仅消除了单模型潜在偏见,也融入了多模型协作的智慧结晶。其内容覆盖了广泛的前沿基准测试,如GPQA Diamond与Swe-bench等,横跨数学、形式逻辑、编码等多个领域,展现出优异的多样性。数据组织形式包括用于监督微调的详尽链式推理记录和用于直接偏好优化的偏好对,后者将已验证的共识证明作为首选响应,与具有缺陷的推测或已被驳斥的假设形成鲜明对比,为模型对齐提供了高质量的训练信号。
使用方法
此数据集具备即插即用的便捷性,可无缝集成于Hugging Face生态系统。通过datasets库的一行代码即可加载,分别获取‘sft_reasoning’配置下的监督微调集,或‘dpo_preferences’配置下的偏好对集。示例代码清晰展示了如何访问数据条目中的消息、chosen与rejected字段。更进一步,数据集作者提供了一套基于Unsloth库的高效微调指南,允许研究者在免费的Google Colab T4 GPU上于约25分钟内完成对Llama-3.1-8B或Qwen-2.5-7B等模型的微调,大幅降低了前沿推理能力培育的技术门槛。
背景与挑战
背景概述
DualBlind数据集由GlimmaryKarl团队于2025年创建,旨在应对前沿人工智能在极端难度推理任务中面临的验证与共识挑战。该数据集基于双盲多智能体竞技场(DualBlind AI Benchmark Arena)生成,其中两个独立的前沿模型通过多轮双盲对话协作求解问题,相互验证推理、提出反例并达成数学共识。其核心研究问题在于如何通过多智能体协作提升推理可靠性,并生成高质量的训练数据以支持监督微调(SFT)和直接偏好优化(DPO)。数据集覆盖GPQA Diamond、Humanity's Last Exam、FrontierMath等十余个高难度基准,包含40余种模型,规模超过2000次试验,对推理增强、模型对齐及多智能体协作研究具有重要影响力,为社区提供了严格验证的高质量资源。
当前挑战
DualBlind数据集面临的挑战多维且严峻。首先,在领域问题层面,极端难度推理任务(如数学证明、算法设计)的自动验证极为困难,依赖单一模型输出往往存在幻觉或逻辑漏洞,而多智能体协作虽能提升可靠性,却引入了共识达成与对抗性验证的复杂性,如何设计高效的双盲交互协议以平衡探索与确认仍是未解难题。其次,在构建过程中,严格的100%准确率质量门槛导致约12.6%的试验被拒,凸显了数据生成的昂贵与筛选的严苛;同时,多模型(40余种)与多基准的多样性带来了数据分布不均衡和标准化难题,例如各基准的运行次数差异悬殊,可能引入偏好偏差。此外,合成数据的真实性验证与伦理风险,如模型间错误共识的潜在传播,也是构建中必须持续应对的挑战。
常用场景
经典使用场景
DualBlind数据集源自双盲多智能体竞技场评估框架,旨在捕捉前沿AI模型在极端困难基准问题上的协同推理过程。该数据集最经典的使用场景是作为大语言模型推理能力的监督微调(SFT)语料,其核心包含高密度的逐步思维链推理轨迹,这些轨迹经由多模型双盲对话达成数学共识,并严格通过100%自动化验证。研究者可借助此数据集精炼模型在复杂数学证明、算法推导及逻辑演绎中的推理能力,使模型内化严谨的推理路径与自我校验机制,从而提升在GPQA Diamond、Humanity's Last Exam等高难度基准上的表现。此外,其DPO偏好对子集亦常用于偏好对齐训练,通过将验证过的共识解作为优选响应,引导模型规避错误猜想。
实际应用
在实际应用中,DualBlind数据集可直接用于对开源基座模型(如Llama-3.1-8B、Qwen-2.5-7B)进行低成本微调,通过LoRA等技术在单张消费级GPU上即可在约25分钟内完成训练,快速提升模型在数学解题、代码生成、逻辑问答等场景的推理性能。其覆盖的SWE-bench与FrontierMath等基准也使其适用于软件工程自动化与高级数学求解等专业领域。对于需要高可信度输出的行业,如金融量化分析、法律逻辑推演或科学研究助手,该数据集的严格质量门控能有效辅助构建抗幻觉的专用模型。此外,DPO子集支持偏好对齐,使模型在生成最终答案时更倾向于选择经得起验证的推导路径。
衍生相关工作
围绕DualBlind数据集,衍生出了一系列探讨多智能体协作与可信推理的研究工作。其采集机制已发展为一种可复用的基准评估范式,即双盲多智能体竞技场,被后续研究用作设计协作式推理评估框架的参考模板。数据中的SFT推理链条催生了对长链思维链可解释性与压缩方法的研究,而DPO偏好对则激发了对偏好优化算法(如DPO变体)在复杂推理任务中效力的深入探索。部分工作聚焦于利用该数据集的验证机制构建自动推理校验器,也有研究将其作为基准测试新模型在数学共识达成能力上的表现。同时,该数据集的零容错质量政策也推动了研究社区对合成数据质量门控标准的讨论与改进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务