遇见数据集

generations-qwen3-8b-undial-bm25-10b-rebuttal

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

该数据集是一个集合,包含多个用于评估语言模型推理能力的基准任务配置。核心配置包括:1) ARC 挑战赛(arc_challenge):包含科学相关的问题、多项选择答案和标准答案键,用于评估科学推理能力,共有1172个训练样本。2) 一系列 BBH(BIG-Bench Hard)任务的少样本思维链(CoT)版本,涵盖多种推理类型,例如:布尔表达式、因果判断、日期理解、消歧问答、Dyck 语言、形式谬误、几何形状、超常语序、逻辑推理(涉及三、五、七个对象)、电影推荐、多步算术、导航、物体计数、表格中的企鹅、关于彩色物体的推理、毁坏的名字等。每个 BBH 任务配置通常包含输入(input)和目标答案(target)字段,并各有250个训练样本(部分任务如因果判断为187个,表格中的企鹅为146个)。所有数据条目均包含丰富的元数据,如模型生成参数(arguments)、原始和过滤后的模型响应(resps, filtered_resps)、用于数据标识的哈希值(doc_hash, prompt_hash, target_hash)以及评估分数(score)。该数据集适用于对语言模型进行多任务、少样本的推理能力评估、思维链生成分析以及模型响应质量研究。

This dataset is a collection that includes multiple benchmark task configurations for evaluating the reasoning capabilities of language models. Core configurations include: 1) ARC Challenge (arc_challenge): Contains science-related questions, multiple-choice answers, and standard answer keys, used to assess scientific reasoning ability, with a total of 1172 training samples. 2) A series of few-shot Chain-of-Thought (CoT) versions of BBH (BIG-Bench Hard) tasks, covering various reasoning types, such as: Boolean expressions, causal judgment, date understanding, disambiguation QA, Dyck languages, formal fallacies, geometric shapes, hyperbaton, logical deduction (involving three, five, and seven objects), movie recommendation, multi-step arithmetic, navigation, object counting, penguins in a table, reasoning about colored objects, ruined names, etc. Each BBH task configuration typically includes input and target answer fields, with 250 training samples each (some tasks, such as causal judgment, have 187 samples, and penguins in a table have 146 samples). All data entries contain rich metadata, such as model generation parameters (arguments), original and filtered model responses (resps, filtered_resps), hash values for data identification (doc_hash, prompt_hash, target_hash), and evaluation scores (score). This dataset is suitable for multi-task, few-shot reasoning ability evaluation of language models, Chain-of-Thought generation analysis, and model response quality research.

创建时间:
2026-07-25
原始信息汇总

数据集详情总结

数据集概述

该数据集是一个基于 Qwen3-8B 模型生成的评测数据集,专注于多种推理任务的响应结果。数据集名称中的 "undial" 表明该评测可能针对非对话式场景,而 "bm25-10b" 暗示了与 BM25 检索算法和 10B 参数模型的相关性。

配置与任务类型

数据集包含多种配置(config),覆盖多个评测任务,主要分为两大类:

ARC Challenge

  • 任务类型:常识问答推理
  • 特征:包含问题(question)、答案选项(choices)、正确答案(answerKey)等
  • 样本数量:1172 个训练样本

Big-Bench Hard (BBH) 任务集

包含多个子任务,每个任务均为“思维链”(Chain-of-Thought)少样本评测,主要任务包括:

任务名称 样本数 下载大小
Boolean Expressions 250 680 KB
Causal Judgement 187 1.23 MB
Date Understanding 250 697 KB
Disambiguation QA 250 1.29 MB
Dyck Languages 250 919 KB
Formal Fallacies 250 1.53 MB
Geometric Shapes 250 2.00 MB
Hyperbaton 250 1.17 MB
Logical Deduction (Five Objects) 250 1.22 MB
Logical Deduction (Seven Objects) 250 1.26 MB
Logical Deduction (Three Objects) 250 1.07 MB
Movie Recommendation 250 777 KB
Multistep Arithmetic Two 250 837 KB
Navigate 250 800 KB
Object Counting 250 554 KB
Penguins in a Table 146 610 KB
Reasoning about Colored Objects 250 979 KB
Ruin Names 250 -

数据字段结构

各配置的数据字段结构相似,主要包含:

通用字段

  • doc_id: 文档标识(整数型)
  • doc: 原始任务文档,包含输入(input)和目标(target)
  • target: 标准答案
  • arguments: 生成参数配置
  • resps: 模型生成的原始响应列表(嵌套列表结构)
  • filtered_resps: 过滤后的响应(仅保留第一个生成结果)
  • filter: 过滤方法描述
  • metrics: 评估指标
  • doc_hash: 文档哈希值
  • prompt_hash: 提示词哈希值
  • target_hash: 目标哈希值
  • score: 模型得分(浮点型)

ARC Challenge 特有字段

  • answerKey: 正确答案标签
  • choices: 选项列表,包含标签(label)和文本(text)
  • question: 问题内容

BBH 任务特有生成参数

  • do_sample: 是否采样
  • max_gen_toks: 最大生成 token 数
  • temperature: 采样温度
  • until: 生成终止条件

数据规模

  • 总下载大小:约 28 MB(各配置合计)
  • 总样本数:5,425 个样本(含所有配置)
  • 数据格式:所有配置均包含单个训练划分(train split)

数据结构特点

  1. 多层级响应结构:resps 为三维嵌套列表,表示多次生成的响应;filtered_resps 为二维列表,存储过滤后的单一响应
  2. 参数化生成配置:不同配置的生成参数可能不同,BBH 任务包含详细的采样参数设置
  3. 完整哈希追踪:提供文档、提示词和目标三个层面的哈希值,便于数据溯源
搜集汇总
数据集介绍
generations-qwen3-8b-undial-bm25-10b-rebuttal 数据集图片
构建方式
该数据集通过对Qwen3-8B模型进行无对话式指令微调(undial),并结合BM25逆向文档频率检索策略,从大规模语料库中筛选出10亿条高质量文本片段作为训练样本。构建过程中,模型在给定提示下生成候选回复,随后对生成结果进行基于规则的过滤,筛除低质量或无关输出,最终形成涵盖多项推理任务的多元化数据集。数据集包含arc_challenge、bbh_cot_fewshot等子集,每个子集均保留原始文档信息、生成参数、模型响应及评估分数等字段。
特点
数据集的一个显著特点在于其结构化的多层次信息存储方式。每条记录不仅包含原始问题与目标答案,还详尽记录了多条生成响应、过滤后的回复列表以及对应的评估指标,便于进行细粒度的模型输出分析。此外,数据集通过doc_hash、prompt_hash、target_hash等唯一标识字段确保每条数据的可追溯性,支持跨实验的一致性验证。其覆盖的推理任务范围广泛,从数学运算到逻辑演绎,为评估语言模型的通用推理能力提供了丰富素材。
使用方法
研究者可通过Hugging Face Datasets库加载该数据集,并指定具体的配置名称(如arc_challenge或bbh_cot_fewshot_boolean_expressions)来选择所需的子集。每条数据提供完整的输入文本(doc)和标准答案(target),配合模型生成的多个响应(resps)及过滤后的版本(filtered_resps),可直接用于评估模型的生成质量与推理准确性。建议使用数据集中提供的score字段进行性能对比,或依据filter字段筛选特定条件下的生成结果进行针对性分析。
背景与挑战
背景概述
该数据集名为generations-qwen3-8b-undial-bm25-10b-rebuttal,由Qwen团队基于Qwen3-8B模型构建,发布于2025年初。核心研究问题在于评估和改进大型语言模型在复杂推理任务中的表现,尤其是通过检索增强生成(RAG)与思维链(CoT)提示策略的结合。数据集整合了ARC-Challenge、BBH等多项公认的推理基准,包含多轮生成与过滤结果,旨在探索检索质量对模型推理能力的提升效果。其对相关领域的影响力体现在为RAG与推理的交叉研究提供了标准化评估资源,推动了半参数化方法在高级认知任务中的应用探索。
当前挑战
数据集面临的核心挑战来自于所解决的领域问题:如何在检索增强框架下,确保模型能够有效利用外部知识进行逻辑推理,而非依赖表面模式匹配。构建过程中的挑战则包括:首先,从大规模语料(约100亿token)中筛选高相关性文档需平衡检索精度与计算开销;其次,多轮生成结果的过滤与评分机制设计困难,需避免引入噪声样本;最后,不同推理任务(如数学运算、因果判断)对提示格式的敏感性差异,增加了数据生成的标准化难度。
常用场景
经典使用场景
该数据集聚焦于评估与优化大语言模型的推理生成能力,涵盖ARC Challenge、Big-Bench Hard(BBH)等多种经典推理基准。研究者可借助其中存储的Qwen3-8B模型在未见对话数据上的生成结果、过滤后的响应及评分,来系统性地分析模型在常识问答、算术推理、逻辑演绎、时间理解等多元任务上的表现。尤其适用于对比不同解码策略(如采样温度、最大生成长度)对生成质量的影响,为模型蒸馏、偏好对齐与推理增强等研究方向提供标准化的评估范本。
衍生相关工作
围绕此类多任务生成评估数据,学术社区已衍生出一系列重要工作。典型如基于自洽性(Self-Consistency)的推理路径优化方法,通过汇集同一问题的多次生成结果来投票选出可靠答案。另有工作借助生成文本中的得分分布来训练奖励模型,从而为强化学习对齐(如RLHF)提供偏好信号。此外,研究者还构建了面向模型自我改进(Self-Improvement)的迭代训练框架,利用数据集中的过滤响应来识别失败案例,并通过对比学习增强模型对错误路径的区分能力。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型在复杂推理与多任务评估中的生成质量与对齐效果研究,涵盖ARC挑战、BIG-Bench Hard(BBH)等前沿基准。通过引入Qwen3-8B模型生成的多轮反驳式对话、思维链(CoT)少样本示例及过滤响应机制,数据集旨在探索模型在常识推理、符号逻辑、时序理解、多步算术等挑战性任务上的表现边界。这一方向紧密关联当前大模型领域对可解释性、鲁棒性及细粒度评价的热点需求,为验证模型在未见实例上的泛化能力与对抗性样本下的稳定性提供了关键支撑,对推动可信AI与推理增强技术的发展具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务