遇见数据集

ganglii/8B_mmlu_n10

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: prompt dtype: string - name: question dtype: string - name: answer dtype: string - name: generations list: string - name: ave_token_logprob list: float64 - name: seq_len list: int64 - name: seq_logprob list: float64 - name: generations_gt list: string - name: ave_token_logprob_gt list: float64 - name: seq_len_gt list: int64 - name: seq_logprob_gt list: float64 splits: - name: train num_bytes: 24075920 num_examples: 1531 download_size: 23216320 dataset_size: 24075920 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
ganglii
搜集汇总
数据集介绍
ganglii/8B_mmlu_n10 数据集图片
构建方式
该数据集名为8B_mmlu_n10,其构建基于大规模多任务语言理解(MMLU)基准测试,通过抽取8B参数规模的模型在MMLU任务上的生成结果构建而成。数据集涵盖了1531个训练样本,每个样本包含原始提示词(prompt)、问题(question)、标准答案(answer)以及模型生成的10次回答(generations)及其相关概率与长度信息。通过记录每一次生成的对数概率(ave_token_logprob)、序列长度(seq_len)和序列对数概率(seq_logprob),并同时提供标准答案的对应指标(generations_gt、ave_token_logprob_gt、seq_len_gt、seq_logprob_gt),形成了可供深入分析模型行为的多维数据架构。
特点
该数据集的核心特色在于其对模型生成过程的全方位刻画。每条数据不仅记录了问题与标准答案,更保存了同一模型针对同一问题的多次生成结果及其置信度指标,使得研究者能够细致探究模型输出的稳定性和不确定性。通过比较模型生成答案与标准答案在对数概率、长度分布上的差异,可以揭示模型在不同知识领域上的表现偏差。此外,数据集的规模适中(1531条),兼顾了分析深度与计算可行性,为语言模型的可信度与一致性研究提供了宝贵资源。
使用方法
该数据集可广泛应用于模型行为分析与评估研究。使用者可加载train分割数据,通过解析generations字段获得模型的多轮采样输出,结合ave_token_logprob和seq_logprob计算各生成结果的置信度评分。进而可对比标准答案的各项指标,评估模型在不同难度或领域问题上的生成稳定性与准确性。数据以JSON格式存储于data/train-*文件中,支持直接通过HuggingFace Datasets库进行加载与预处理,便于集成到现有的实验与分析流程中。
背景与挑战
背景概述
大规模语言模型在复杂知识推理任务中的表现已成为自然语言处理领域的研究热点,而MMLU(Massive Multitask Language Understanding)作为覆盖57个学科的多项选择基准,为评估模型推理能力提供了核心测试平台。8B_mmlu_n10数据集由研究团队针对8B参数级别的语言模型构建,其创建旨在系统性地探究模型在MMLU任务中的生成一致性与概率分布特性。该数据集包含1531个精心筛选的样本,每个样本均记录模型对同一问题的10次生成结果及其对数概率,为分析模型输出的稳定性和置信度提供了细粒度的结构化数据。通过引入生成序列的token级概率特征,这一资源有效弥补了传统仅关注最终答案准确率的评估局限,推动了对模型内部推理机制的理解,在可解释性和鲁棒性研究方面具有重要参考价值。
当前挑战
该数据集面临的核心挑战源于MMLU基准本身的学科广度与知识密集性,模型需要在缺乏外部知识库支持下,仅依赖预训练记忆完成从医学、法律到物理等领域的精确推理,这对参数有限的8B模型构成严峻认知负担。此外,构建过程中需克服生成过程的随机性波动:同一问题在10次采样中可能出现答案分歧,如何从对数概率特征中准确界定模型可信区间并排除偶然性干扰,成为数据质量控制的技术难点。同时,原始问题与生成序列的领域特异性导致特征对齐复杂,例如长序列的对数概率计算易受词汇频率偏差影响,需要设计鲁棒的归一化策略以削弱统计噪声。这些挑战共同制约了数据集在模型校准与不确定性量化任务中的推广,亟需更先进的概率建模方法来提升其应用效能。
常用场景
经典使用场景
8B_mmlu_n10数据集专为评估和微调中等规模语言模型(约8B参数)在多任务语言理解(MMLU)基准上的表现而设计。该数据集包含1531个精心挑选的样本,覆盖从人文学科到科学技术的广泛领域,每个样本包含原始问题、正确答案、模型生成的多个候选回答(n=10)以及对应的对数概率和序列长度等细粒度信息。研究者可借助这些丰富的元数据,深入分析模型在推理过程中的不确定性、置信度校准及生成质量,从而对语言模型的知识边界和推理能力进行精确诊断。
衍生相关工作
8B_mmlu_n10的发布催生了一系列相关研究,包括基于对数概率的特征工程方法用于检测模型知识盲区、利用多候选生成进行模型融合策略的改进,以及开发面向置信度校准的新型损失函数。研究者还借鉴其结构,构建了针对不同规模模型(如7B、13B参数)的类似数据集,系统对比模型规模与知识泛化能力的关系。此外,该数据集还被用于探索对比解码、自我一致性等推理增强技术在MMLU任务上的效果,为语言模型推理优化提供了新的实验基准。
数据集最近研究
最新研究方向
该数据集聚焦于大规模语言模型在复杂知识推理任务中的行为分析,尤其关注模型生成答案的置信度与一致性评估。通过记录模型对多轮生成结果的token级对数概率、序列长度等细粒度指标,研究者得以深入剖析模型在MMLU等基准测试上的表现波动性,从而推动对模型不确定性量化、幻觉检测以及自洽性验证等前沿问题的探索。这一方向与大语言模型在医疗、法律等高风险场景中的可信部署需求紧密相连,为提升模型决策的透明度与鲁棒性提供了关键实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务