遇见数据集

generations-qwen3-8b-rmu-bm25-10b-rebuttal

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

该数据集是一个多配置集合,主要用于评估语言模型在复杂推理任务上的性能。核心数据来源于两个知名基准:ARC(AI2推理挑战赛)和BBH(Big-Bench Hard)。数据集包含多个具体任务配置,例如ARC挑战赛配置,以及一系列带有“bbh_cot_fewshot_”前缀的BBH任务配置(如布尔表达式、因果判断、日期理解、形式谬误、逻辑推理、多步算术、对象计数等),这些配置均采用了思维链(Chain-of-Thought)和少样本(Few-shot)的提示设置。每个数据样本结构丰富,通常包含原始问题文档(如问题文本、选择题选项和答案键)、目标输出、用于生成模型响应的参数配置、模型生成的多轮原始响应、经过过滤的响应、用于唯一标识的哈希值以及一个评估分数。数据规模因配置而异,例如ARC挑战赛配置包含1172个训练样本,而大多数BBH配置包含250个训练样本。该数据集适用于研究语言模型的推理能力、评估模型在多样化任务上的泛化性能,以及对模型生成过程进行深入分析。

This dataset is a multi-configuration collection primarily used to evaluate the performance of language models on complex reasoning tasks. The core data is sourced from two well-known benchmarks: ARC (AI2 Reasoning Challenge) and BBH (Big-Bench Hard). The dataset includes multiple specific task configurations, such as the ARC challenge configuration, and a series of BBH task configurations prefixed with bbh_cot_fewshot_ (e.g., boolean expressions, causal judgment, date understanding, formal fallacies, logical reasoning, multi-step arithmetic, object counting, etc.), all of which employ Chain-of-Thought and Few-shot prompting settings. Each data sample has a rich structure, typically containing the original question document (e.g., question text, multiple-choice options, and answer key), target output, parameter configurations for generating model responses, raw multi-turn responses generated by models, filtered responses, a hash for unique identification, and an evaluation score. The data scale varies by configuration; for example, the ARC challenge configuration includes 1172 training samples, while most BBH configurations include 250 training samples. This dataset is suitable for researching the reasoning capabilities of language models, evaluating their generalization performance across diverse tasks, and conducting in-depth analysis of the model generation process.

创建时间:
2026-07-25
原始信息汇总

数据集概述

该数据集为 anime-sh/generations-qwen3-8b-rmu-bm25-10b-rebuttal,是 Hugging Face 上的一个数据集,包含多个配置(config),每个配置对应不同的推理任务评测数据。

数据集内容

数据集主要由多个配置组成,每个配置对应一个具体的推理任务,具体包括:

  • arc_challenge(AI2 推理挑战)
  • bbh_cot_fewshot 系列,涵盖多个推理任务,例如:
    • boolean_expressions(布尔表达式)
    • causal_judgement(因果判断)
    • date_understanding(日期理解)
    • disambiguation_qa(消歧问答)
    • dyck_languages(Dyck 语言)
    • formal_fallacies(形式谬误)
    • geometric_shapes(几何形状)
    • hyperbaton(修辞倒装)
    • logical_deduction_five_objects(五对象逻辑推理)
    • logical_deduction_seven_objects(七对象逻辑推理)
    • logical_deduction_three_objects(三对象逻辑推理)
    • movie_recommendation(电影推荐)
    • multistep_arithmetic_two(多步算术)
    • navigate(导航)
    • object_counting(物体计数)
    • penguins_in_a_table(表格中的企鹅)
    • reasoning_about_colored_objects(彩色物体推理)
    • ruin_names(损毁名称)

数据结构

各配置的数据特征如下:

  • arc_challenge

    • doc_id(int64):文档 ID
    • doc:包含 answerKeychoices(label 和 text)、idquestion 等原始评测信息
    • target(string):目标输出
    • arguments:包含 5 组生成参数(gen_args_0 至 gen_args_4),每组含两个参数
    • resps:嵌套列表结构,存模型原始响应
    • filtered_resps:过滤后的响应
    • filtermetricsdoc_hashprompt_hashtarget_hashscore 等元数据
  • bbh_cot_fewshot 系列

    • doc_id(int64)
    • doc:包含 inputtarget 字段
    • target(string):目标输出
    • arguments:生成参数,包含 arg_0(string)和 arg_1(内含 do_samplemax_gen_tokstemperatureuntil 等采样配置)
    • resps:模型响应列表
    • filtered_resps:过滤后的响应列表
    • filtermetricsdoc_hashprompt_hashtarget_hashbypassscore 等元数据

各配置数据规模

所有配置均仅包含 train 分割。以下为各配置的样本数量与大小示例:

配置名称 样本数 数据集大小(字节) 下载大小(字节)
arc_challenge 1,172 1,903,272 1,729,033
bbh_cot_fewshot_boolean_expressions 250 696,817 686,773
bbh_cot_fewshot_causal_judgement 187 1,248,292 1,240,870
bbh_cot_fewshot_date_understanding 250 624,494 612,634
bbh_cot_fewshot_disambiguation_qa 250 1,397,907 1,398,329
bbh_cot_fewshot_dyck_languages 250 999,319 997,882
bbh_cot_fewshot_formal_fallacies 250 1,766,553 1,751,353
bbh_cot_fewshot_geometric_shapes 250 1,842,570 1,833,163
bbh_cot_fewshot_hyperbaton 250 1,183,277 1,180,939
bbh_cot_fewshot_logical_deduction_five_objects 250 1,343,420 1,341,006
bbh_cot_fewshot_logical_deduction_seven_objects 250 1,533,663 1,543,001
bbh_cot_fewshot_logical_deduction_three_objects 250 1,098,087 1,095,022
bbh_cot_fewshot_movie_recommendation 250 892,361 885,178
bbh_cot_fewshot_multistep_arithmetic_two 250 876,072 881,541
bbh_cot_fewshot_navigate 250 827,206 819,266
bbh_cot_fewshot_object_counting 250 565,339 554,402
bbh_cot_fewshot_penguins_in_a_table 146 607,633 615,440
bbh_cot_fewshot_reasoning_about_colored_objects 250 966,205 960,272
bbh_cot_fewshot_ruin_names(信息不完整) - - -

总结

该数据集是用于评估 Qwen3-8B 模型在多种推理任务上的生成结果数据集,覆盖 ARC-Challenge 以及 BIG-Bench Hard(BBH)中的多项推理任务(如逻辑推理、日期理解、数学计算、导航等)。每个配置中包含模型的原始响应、过滤后的响应以及相应的评分与哈希信息,适用于分析模型在不同推理场景下的表现与评估结果。

搜集汇总
数据集介绍
generations-qwen3-8b-rmu-bm25-10b-rebuttal 数据集图片
构建方式
该数据集基于Qwen3-8B模型,通过RMU(Representation Misdirection for Unlearning)技术与BM25检索算法联合构建,旨在评估大语言模型在反学习(unlearning)场景下的多任务泛化能力。数据来源于ARC Challenge、BBH(Big-Bench Hard)等多个推理挑战基准,每个配置项包含原始问题文档、模型生成的候选回答(resps)、过滤后的响应(filtered_resps)以及对应的评分(score)。构建过程中,采用多样化生成参数(如温度、采样策略、最大生成长度)对同一问题进行多次推理,从而获得丰富的模型输出样本,为后续的鲁棒性分析奠定基础。
特点
数据集涵盖广泛的认知推理子任务,包括常识问答(ARC)、逻辑演绎、因果判断、数学运算与空间导航等,总计超过20个独立的配置项。每个样本保留完整的结构化元信息,包括文档哈希、提示哈希与目标哈希,便于追溯与验证。尤为突出的是,数据集中存储了模型针对同一问题的多次生成结果及其过滤版本,为研究模型在反学习干预后的输出一致性、置信度变化以及潜在遗忘机制提供了细腻的观测视角。评分字段的引入使得定量评估模型行为变迁成为可能。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,指定对应配置名(如'arc_challenge'或'bbh_cot_fewshot_boolean_expressions')以获取特定子任务的数据。加载后,每条样本的'doc'字段提供原始评测问题与选项,'resps'与'filtered_resps'则分别包含模型的原始与处理后的生成序列。研究者可利用'score'字段进行性能对比,或结合'arguments'中的生成参数分析不同推理设置对模型输出的影响。适用于反学习效果评估、模型鲁棒性测试及生成质量分析等场景。
背景与挑战
背景概述
该数据集名为generations-qwen3-8b-rmu-bm25-10b-rebuttal,创建于大语言模型对齐与安全性研究快速发展的时期,由致力于提升模型精准性与鲁棒性的研究团队构建。核心研究问题在于如何系统性地评估并缓解语言模型在面对对抗性输入或知识边界挑战时产生的有害或错误生成。通过整合包括ARC挑战集、BIG-Bench Hard(BBH)推理任务等多种细致标注的配置,该数据集旨在为科研社区提供一套标准化、多维度的大模型生成质量评估与反驳基准,对推动可信人工智能的发展具有重要影响力。
当前挑战
当前所面临的挑战主要体现在两个层面:其一,在领域问题层面,该数据集致力于攻克语言模型在复杂常识推理、多步逻辑演绎及数学计算等核心能力上的脆弱性,暴露了现有模型在鲁棒性与事实一致性上的显著短板。其二,在构建过程中,面临的挑战包括如何设计并统一多任务的回答格式与评分策略,确保不同推理子任务间的可比性;同时,还需保障生成数据的多样性与覆盖度,避免因采样参数设置不当或数据过滤偏差而导致评估结果失真,这要求开发者在数据规模、质量与成本之间取得精细平衡。
常用场景
经典使用场景
该数据集专注于构建大规模、多维度的大语言模型推理能力评测样本,尤其关注学术推理多步算术、逻辑演绎与常识问答的深度评估。经典应用场景涵盖基于链式思维(Chain-of-Thought)的少样本推理任务,如BBH系列中的布尔表达式推导、因果判断、日期理解、对象计数等多类认知挑战。同时融合ARC Challenge数据集,为复杂科学推理的零样本与少样本评估提供标准测试床。示例包含详细的多步骤生成参数(温度、采样策略),并记录模型原始回复与过滤后结果,特别适合用于分析指令微调、知识编辑或对齐技术对推理能力的影响。其结构化的文档标识与评分机制,可以便捷地进行模型间、配置间横向比较。
实际应用
在实际应用层面,该数据集可以直接服务于大语言模型安全审计平台与教育评估系统。例如在智能教育领域,借助BBH中的日期理解与几何形状推理样本,可以构建面向K-12学生的多步逻辑思维能力自动检测工具;金融风控场景中,利用因果判断与多步算术内容,建立合同条款中的复杂规则推理验证流程。工程上,由于每个样本保留多组独立生成的结果和过滤标记,方便用户实施自定义的质量控制规则,如基于自洽性投票机制筛选最可靠的输出,从而提升问答系统的落地可信度。
衍生相关工作
该数据集的架构设计显著推动了多项后续研究的开展,衍生的经典工作包括基于‘拒绝采样+自我批判’的推理增强策略的研究,以及利用本数据集中‘filter’字段开发轻量级校验器(verifier)的方法。研究者借助其丰富的BBH子任务配置,探索了多任务提示学习与跨领域迁移的可解释性分析;此外,部分工作通过对比不同‘gen_args’下的采样输出,提出了梯度无关的推理路径优化框架。该数据集还催生了一批面向定量评测的基准库,如将bbh_cot_fewshot与特定指令解码器结合,用以衡量模型在对抗性提示下的推理韧性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务