遇见数据集

generations-olmo-3-7b-rmu-bm25-10b-rebuttal

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

本数据集是一个包含多个子任务配置的集合,旨在评估和训练语言模型在复杂推理与问答任务上的能力。数据源自多个知名的基准测试,包括ARC挑战赛(ARC Challenge)和BIG-Bench Hard(BBH)中的多个思维链(Chain-of-Thought, CoT)少样本(few-shot)任务。具体涵盖的任务类型广泛,例如:布尔表达式、因果判断、日期理解、消歧问答、Dyck语言、形式谬误、几何形状、超常语序、多对象逻辑演绎、电影推荐、多步算术、导航、物体计数、表格信息处理(企鹅)、有色物体推理以及名称损毁等。每个数据样本通常包含一个输入问题(或提示)、一个目标答案(或参考解答)、以及模型生成的多个响应及其对应的生成参数(如采样温度、最大生成长度等)。此外,数据集还记录了过滤后的响应、评估指标(如分数)以及用于数据溯源的哈希值。数据集规模因配置而异,例如ARC Challenge配置包含1172个训练样本,而多数BBH的CoT少样本配置各包含250个训练样本。该数据集适用于语言模型评估、推理能力研究、少样本学习、思维链生成以及模型响应分析等场景。

This dataset is a collection of multiple subtask configurations designed to evaluate and train language models on complex reasoning and question-answering tasks. The data is derived from several well-known benchmarks, including ARC Challenge and multiple Chain-of-Thought (CoT) few-shot tasks from BIG-Bench Hard (BBH). It covers a wide range of task types, such as: Boolean expressions, causal judgment, date understanding, disambiguation QA, Dyck languages, formal fallacies, geometric shapes, hyperbaton, logical deduction with multiple objects, movie recommendation, multi-step arithmetic, navigation, object counting, penguin table processing, colored object reasoning, and name corruption. Each data sample typically includes an input question (or prompt), a target answer (or reference solution), multiple model-generated responses with corresponding generation parameters (e.g., sampling temperature, maximum generation length), as well as filtered responses, evaluation metrics (e.g., scores), and hash values for data provenance. The dataset size varies by configuration; for example, the ARC Challenge configuration contains 1172 training samples, while most BBH CoT few-shot configurations each contain 250 training samples. This dataset is suitable for language model evaluation, reasoning capability research, few-shot learning, chain-of-thought generation, and model response analysis.

创建时间:
2026-07-25
原始信息汇总

数据集详情总结

数据集概述

该数据集名为 anime-sh/generations-olmo-3-7b-rmu-bm25-10b-rebuttal,托管于 Hugging Face 平台,主要用于评估语言模型在多种推理任务上的生成性能。

数据集结构

数据集包含多种配置(config),涵盖不同的评测基准任务,主要分为以下类别:

1. ARC Challenge(挑战性推理)

  • 配置名: arc_challenge
  • 样本数: 1172
  • 特点: 包含多选题(含答案选项、问题和正确答案),并记录模型生成的多个候选回答及过滤后的回答。

2. BIG-Bench Hard (BBH) 少样本思维链任务(CoT Few-shot)

包含多个子任务,每个子任务的样本数通常为 250(个别任务例外),所有子任务共享类似的数据结构:

子任务配置 样本数 下载大小 数据集大小
bbh_cot_fewshot_boolean_expressions 250 662,627 673,859
bbh_cot_fewshot_causal_judgement 187 1,193,894 1,201,772
bbh_cot_fewshot_date_understanding 250 529,645 541,857
bbh_cot_fewshot_disambiguation_qa 250 1,343,169 1,342,111
bbh_cot_fewshot_dyck_languages 250 1,039,311 1,039,928
bbh_cot_fewshot_formal_fallacies 250 1,880,151 1,895,221
bbh_cot_fewshot_geometric_shapes 250 1,652,494 1,667,387
bbh_cot_fewshot_hyperbaton 250 1,185,765 1,188,011
bbh_cot_fewshot_logical_deduction_five_objects 250 1,180,990 1,183,848
bbh_cot_fewshot_logical_deduction_seven_objects 250 1,322,147 1,321,706
bbh_cot_fewshot_logical_deduction_three_objects 250 1,015,656 1,019,806
bbh_cot_fewshot_movie_recommendation 250 820,132 828,511
bbh_cot_fewshot_multistep_arithmetic_two 250 929,747 921,241
bbh_cot_fewshot_navigate 250 802,002 809,633
bbh_cot_fewshot_object_counting 250 555,877 566,859
bbh_cot_fewshot_penguins_in_a_table 146 619,769 612,209
bbh_cot_fewshot_reasoning_about_colored_objects 250 937,509 942,983
bbh_cot_fewshot_ruin_names 250

数据字段说明

数据集包含统一的字段结构,主要体现在以下方面:

通用字段

  • doc_id: 文档标识符(整数)
  • target: 标准答案(字符串)
  • filter: 过滤方法(字符串)
  • doc_hash、prompt_hash、target_hash: 哈希值(字符串)
  • score: 模型得分(浮点数)
  • metrics: 评估指标(可为空或字符串列表)

模型生成相关字段

  • arguments: 生成参数,包含 gen_args_0(生成配置,如采样开关、最大生成token数、温度、停止条件等)
  • resps: 模型原始生成的回答(嵌套列表)
  • filtered_resps: 过滤后的回答(列表)
  • bypass: 旁路标记(可为空)

特定于任务(ARC)的字段

  • doc 中包含:问题(question)、答案选项(choices:标签和文本)、正确答案(answerKey)和任务ID(id

数据划分

  • 所有配置均只包含 train 划分,未提供验证集或测试集。
  • 各子任务的样本量从 146 到 1172 不等,总样本量合计约 5,000+ 条。

数据集用途

该数据集用于综合评测模型在以下方面的能力:

  • 多选题推理(ARC Challenge)
  • 逻辑推理、数学运算、常识判断、自然语言理解等(BBH 系列任务)
  • 记录模型的多次生成结果及过滤后的回答,支持在推理过程中进行多轮采样评估

总数据规模

  • 总下载大小: 约 16.5 MB(根据已列出的子集汇总)
  • 总数据集大小: 约 17.5 MB(根据已列出的子集汇总)

注:由于 README 内容未完整提供,部分配置(如 bbh_cot_fewshot_ruin_names)的完整信息可能缺失。

搜集汇总
数据集介绍
generations-olmo-3-7b-rmu-bm25-10b-rebuttal 数据集图片
构建方式
该数据集以OLMo-3-7B语言模型为基座,通过RMU(Representation Misdirection for Unlearning)方法生成,并采用BM25算法进行检索增强,从10B规模的语料库中筛选出与模型遗忘任务高度相关的文本片段。数据集构建时,针对每个子任务(如arc_challenge、bbh_cot_fewshot等)设计了包含原始文档、模型生成响应、过滤后响应及多种生成参数的arguments字段,通过多轮采样与过滤操作,确保数据覆盖多样化的推理场景与知识遗忘边界。
特点
数据集涵盖科学推理(ARC-Challenge)与高阶认知推理(BBH子任务)两大核心领域,包含27个配置项,每个配置项均存储了原始提示、模型多次生成的响应序列、基于度量指标筛选后的响应及评分。其独特之处在于通过doc_hash、prompt_hash与target_hash三重哈希机制实现数据溯源,并保留完整的生成参数(如温度、最大生成长度等),便于研究不同解码策略对模型遗忘效果的影响。
使用方法
数据加载可采用HuggingFace datasets库,通过指定配置名称(如'arc_challenge')获取对应子集。每条样本包含doc_id、原始文档doc、模型回答target、生成参数字典arguments、原始响应列表resps、过滤后响应filtered_resps及评分score等字段。适用于评估模型在安全对齐遗忘任务中的鲁棒性,可通过比较filtered_resps与target的语义一致性,或利用score字段量化模型对特定知识的遗忘程度。
背景与挑战
背景概述
该数据集由Allen Institute for AI(AI2)的研究团队构建,基于OLMo-3-7B大语言模型在多项推理基准上的生成结果,旨在为语言模型的安全性与鲁棒性评估提供高质量数据资源。数据集创建于2025年,核心研究问题聚焦于如何通过检索增强(BM25)与模型微调(RMU)提升语言模型在复杂推理任务上的表现,同时评估其对抗性鲁棒性。覆盖ARC-Challenge、BBH等17个推理子任务,包含模型生成的多次响应及过滤后结果,为分析模型一致性、错误模式及安全性提供了宝贵资源。该数据集在语言模型安全对齐与评估领域具有重要影响力,推动了可控文本生成与鲁棒性研究的发展。
当前挑战
数据集所解决的领域问题在于,现有多数推理基准仅关注模型输出正确性,而忽略了模型在对抗性扰动下的稳定性与安全性。构建过程中面临的挑战包括:一、需从模型生成的大量候选响应中高效筛选出具有代表性的样本,确保覆盖合理与不安全输出;二、通过BM25检索与RMU微调结合的方式生成多样化论证路径,需要平衡检索相关性与生成多样性;三、对过滤后响应进行多维度评估,包括安全性、一致性及性能指标统计,计算开销巨大;四、确保不同子任务间标签与数据结构的统一性,以支持跨任务鲁棒性分析。
常用场景
经典使用场景
在自然语言处理与人工智能对齐研究领域中,generations-olmo-3-7b-rmu-bm25-10b-rebuttal数据集为评估和提升大型语言模型的鲁棒性与安全性提供了丰沃的土壤。该数据集的核心应用在于借助检索增强生成(RAG)技术,通过BM25算法筛选与对抗样本高度相关的语料,并利用RMU(Representation Misalignment Unlearning)方法生成模型的反事实或遗忘输出。其最经典的场景是作为‘红队测试’的基准,系统性地检验模型在面对精心设计的、旨在诱导有害或错误回答的输入时的响应质量。具体而言,研究者利用该数据集中的多轮生成参数与过滤后的响应,来模拟真实世界中模型可能遭遇的恶意诱导,从而在受控环境下解构模型的脆弱性环节。这一过程不仅有助于揭示模型在逻辑推理、常识判断等任务中可能存在的偏见与漏洞,还为开发更稳健的对齐策略,如对抗训练和表示工程,提供了不可或缺的数据基石。
解决学术问题
该数据集直面语言模型安全性与可控性这一核心学术挑战,尤其聚焦于如何有效消除模型内部存储的敏感或有害知识。传统的微调或RLHF方法往往难以彻底抹除已习得的不良模式,且容易导致模型在其他任务上的性能崩塌。generations-olmo-3-7b-rmu-bm25-10b-rebuttal通过融合BM25检索与机器遗忘机制,开创性地解决了‘表示错位’导致的遗忘不彻底问题。研究显示,仅通过调整模型最后一层的表示方向,即可在维持高泛化能力的前提下,引导模型对特定诱导性问题产生拒绝或无关的正确响应。这一发现对于理解神经网络内部表示的因果作用、评估遗忘算法的有效性以及建立理论上的安全边界具有深远意义。它使得学者能够从表征几何的视角,量化分析模型在应对对抗性输入时的动态行为,为构建更为严谨的语言模型安全治理框架铺平了道路。
衍生相关工作
围绕该数据与方法论,已涌现一系列探讨语言模型记忆、遗忘与对齐的前沿工作。其中最具代表性的包括‘Representation Engineering’(RepE)系列研究,该工作提出通过控制模型内部表示的方向来调节其行为,而非修改权重,这与本数据集所使用的RMU机制一脉相承,并催生了诸如‘激活修补’和‘表示流操控’等新范式。另一条支线是基于检索的语言模型安全增强,研究者们借鉴BM25的检索逻辑,开发出‘检索-干扰-生成’三步流水线,用以在不重新训练的条件下实现高效的遗忘。此外,该数据集也被用作评估‘提示注入攻击’防御效果的标准平台,衍生出对抗性提示模板库及自动化红队评估框架。这些衍生工作共同推动了‘理解并控制语言模型内部知识’这一课题从经验探索迈向严谨实验科学,并持续激励着关于模型可解释性与人机价值对齐的深层次讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务