遇见数据集

unlearning-cleanslate/generations-20-DEBUG-llama-3_1-8b-simnpo-gentle-igm-10b-target-100-localtrain-checkpoint-1

收藏
Hugging Face2026-05-01 更新2026-05-03 收录
官方服务:

资源简介:

该数据集包含多个配置,用于评估语言模型的推理和问题解决能力。配置包括arc_challenge(AI推理挑战)、bbh_cot_fewshot_boolean_expressions(布尔表达式少样本思维链)、bbh_cot_fewshot_causal_judgement(因果判断少样本思维链)等,覆盖逻辑推理、数学、日期理解、对象计数、电影推荐等多种任务。每个示例包含输入问题、目标答案、生成参数、模型响应和评分,旨在测试模型在少样本或零样本设置下的表现。数据集结构详细,包括训练分割,示例数量从146到1172不等,适用于NLP研究和基准测试。

This dataset includes multiple configurations for evaluating language models reasoning and problem-solving abilities. Configurations encompass arc_challenge (AI reasoning challenge), bbh_cot_fewshot_boolean_expressions (Boolean expressions few-shot chain-of-thought), bbh_cot_fewshot_causal_judgement (causal judgement few-shot chain-of-thought), among others, covering tasks such as logical reasoning, mathematics, date understanding, object counting, movie recommendation, and more. Each example contains input questions, target answers, generation arguments, model responses, and scores, designed to test model performance in few-shot or zero-shot settings. The dataset features detailed structures, including training splits with example counts ranging from 146 to 1172, suitable for NLP research and benchmarking.

提供机构:
unlearning-cleanslate
搜集汇总
数据集介绍
unlearning-cleanslate/generations-20-DEBUG-llama-3_1-8b-simnpo-gentle-igm-10b-target-100-localtrain-checkpoint-1 数据集图片
构建方式
该数据集基于LLaMA-3.1-8B模型在SimNPO算法框架下进行推理生成,采用gentle-igm-10b策略并设定目标为100,在本地训练过程中从checkpoint-1处采集生成结果。数据构建融合了多个经典推理基准,涵盖ARC-Challenge、BBH系列(如boolean_expressions、causal_judgement、date_understanding等)共20余个子任务,每个子任务独立配置字段结构,包含原始文档、目标答案、生成参数、模型响应、过滤后的响应及评分等关键信息。
特点
该数据集的显著特征在于其多维度、多任务的结构化设计。每个样本均记录doc_id以保证追踪溯源,同时保存了gen_args系列参数(如do_sample、temperature、max_gen_toks等)用于复现生成过程。响应字段包含原始输出与过滤后结果,并附有filter标识与score评分,便于后续分析模型表现。特别地,arc_challenge配置中含有choices字段结构,适用于选择题型;而BBH系列则统一使用input-target格式,便于链式思维推理任务的评估。
使用方法
研究者可通过HuggingFace Datasets库加载该数据集,依据config_name参数选择特定子任务(如'arc_challenge'或'bbh_cot_fewshot_boolean_expressions')进行使用。数据以训练集形式提供,可直接用于评估模型在多项推理任务上的生成质量。结合doc、target与resps字段,可计算模型响应与标准答案的一致性;借助filtered_resps与score,可分析过滤策略的效果。生成参数字段为复现和调试推理过程提供了完整参考。
背景与挑战
背景概述
该数据集诞生于大语言模型对齐与推理能力优化的前沿探索时期,由研究团队基于 Llama 3.1 8B 模型,采用 SimNPO(一种偏好优化方法)结合 gentle-igm 策略生成,旨在解决模型在复杂推理任务中的对齐问题。核心研究问题聚焦于如何通过生成多样化推理路径来提升模型在 ARC-Challenge、BBH 等基准上的表现。数据集覆盖了从常识推理到数学、逻辑、符号操作等广泛的高阶认知任务,为研究模型内化推理偏好、减少错误生成提供了重要资源。其影响力体现在为偏好优化研究开辟了新范式,即通过显式记录模型生成的中间推理步骤及其过滤、评分过程,使研究者得以细致分析模型决策边界与对齐效果。
当前挑战
该数据集致力于攻克的核心领域挑战在于:大语言模型在面对需要多步逻辑推导、符号操作及常识整合的任务时,普遍存在推理不稳定、偏好对齐困难的问题,尤其在 ARC-Challenge 和 BBH 等要求严苛的基准上,模型常生成似是而非的推理链。构建过程中面临的挑战包括:如何设计高效的生成参数(如温度、生成长度)以平衡推理多样性与连贯性;如何制定合理的过滤与评分机制,从海量生成结果中甄别出正确且信息量丰富的推理路径;以及如何确保跨任务(如几何推理、日期理解)的数据格式归一化与哈希一致性,以支持后续的分析与复用。
常用场景
经典使用场景
该数据集作为大语言模型对齐优化过程中的中间产物,最经典的使用场景是用于SimNPO(SimPO变体)等偏好优化算法的训练与验证。它存储了在特定生成参数配置下,模型对多元推理任务(如ARC挑战、BBH因果判断、日期理解等)产生的原始响应及过滤后的结果,可精准评估不同对齐策略对模型推理能力的影响,是偏好学习、强化学习从人类反馈(RLHF)等方向研究的核心训练材料。
解决学术问题
该数据集解决了大语言模型偏好对齐研究中数据稀缺与泛化性评估困难的问题。其涵盖的多领域推理任务(包括逻辑演绎、几何推理、多步算术等)为衡量模型在复杂认知场景下的偏好一致性提供了标准化基准。通过对比原始响应与过滤后响应,学者可系统分析对齐算法对模型过度优化或覆盖不足的缺陷,对理解免奖励模型离线优化策略的边界效应具有重要的方法论意义。
衍生相关工作
该数据集衍生了系列关于免奖励偏好优化的经典工作,特别是在SimNPO与DPO(直接偏好优化)的对比研究中,其作为中间监督信号被广泛引用。相关后续工作进一步探索了基于该数据的响应筛选策略,如采用自洽性过滤与拒绝采样机制,推动了Evolve-Align等迭代式对齐框架的发展。此外,其在BBH任务上的结构化响应记录为推理链长度与模型性能的耦合分析提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务