遇见数据集

latent-sft-eval-benchmarks

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

Latent-SFT评估基准是一个用于评估Latent-SFT轨迹生成和模型诊断的标准化数据集集合。该数据集整合了多个学术评估基准,包括MMLU-Pro、GPQA、SuperGPQA和BBEH,旨在支持批量思维链(CoT)轨迹生成任务。数据以JSONL格式提供,分为主规范化文件和审计文件:主文件包含标准化的问题(problem)和答案(answer)字段,适用于模型推理;审计文件则保留原始数据源的ID、类别、领域等元数据,用于追溯和分析。数据集规模具体为:MMLU-Pro包含验证集70个样本和测试集12032个样本;GPQA钻石子集包含198个样本;SuperGPQA包含26529个样本;BBEH包含4520个样本。使用要求:在生成CoT轨迹时,最终框定答案应仅出现在响应或cot_answer字段中,推理部分不得包含额外答案。该数据集为纯文本格式,排除了依赖图像的TheoremQA样本,适用于文本生成和问答任务的研究与评估。

The Latent-SFT Evaluation Benchmark is a standardized dataset collection for evaluating Latent-SFT trajectory generation and model diagnosis. It integrates multiple academic evaluation benchmarks, including MMLU-Pro, GPQA, SuperGPQA, and BBEH, aiming to support batch Chain-of-Thought (CoT) trajectory generation tasks. The data is provided in JSONL format, divided into main normalized files and audit files: the main files contain standardized problem and answer fields suitable for model inference; the audit files retain metadata such as original data source IDs, categories, and domains for traceability and analysis. The dataset scale is as follows: MMLU-Pro includes a validation set of 70 samples and a test set of 12,032 samples; the GPQA diamond subset contains 198 samples; SuperGPQA contains 26,529 samples; and BBEH contains 4,520 samples. Usage requirements: when generating CoT trajectories, the final framed answer should only appear in the response or cot_answer field, and the reasoning part must not contain additional answers. The dataset is in plain text format, excluding image-dependent TheoremQA samples, and is suitable for research and evaluation in text generation and question-answering tasks.

创建时间:
2026-07-18
原始信息汇总

数据集概述

数据集名称:Latent-SFT Evaluation Benchmarks

许可证:未知

语言:英语(en)

任务类别:问答、文本生成

标签:mmlu-pro, gpqa, supergpqa, bbeh


数据集描述

该数据集是用于Latent-SFT轨迹生成和模型诊断的评估数据集,经过处理打包为批量CoT(思维链)轨迹生成格式。提示要求仅在生成响应或cot_answer中包含最终框出的答案,推理部分不应包含多余的框出答案。


文件结构

文件 行数 键值
mmlu_pro_validation.jsonl 70 answer, problem
mmlu_pro_validation_audit.jsonl 70 answer, answer_index, category, question_id, src
mmlu_pro_test.jsonl 12032 answer, problem
mmlu_pro_test_audit.jsonl 12032 answer, answer_index, category, question_id, src
gpqa_diamond.jsonl 198 Correct Answer, Explanation, High-level domain, Incorrect Answer 1, Incorrect Answer 2, Incorrect Answer 3, Question, Record ID, Subdomain
gpqa_diamond_unshuffled_normalized.jsonl 198 answer, problem
supergpqa_all.jsonl 26529 answer, problem
supergpqa_all_audit.jsonl 26529 answer, answer_text, difficulty, discipline, field, subfield, uuid
bbeh_all.jsonl 4520 answer, problem
bbeh_all_audit.jsonl 4520 index, mini, target, task

注意事项

  • 主要的标准化文件使用problemanswer键(如可用)。
  • *_audit.jsonl文件保留了原始ID和数据集特定元数据。
  • gpqa_diamond.jsonl采用GPQA原始格式列;gpqa_diamond_unshuffled_normalized.jsonl为标准化多项选择视图。
  • 故意排除TheoremQA,因为此纯文本包不包含其图像依赖样本。
  • 本包不包含任何生成的CoT轨迹。

数据格式

所有JSONL文件以.jsonl.gz压缩格式上传,可通过Hugging Face datasets库直接流式读取。生成的最终框出答案应仅出现在response/cot_answer中,不应出现在推理部分。

搜集汇总
数据集介绍
latent-sft-eval-benchmarks 数据集图片
构建方式
该数据集是针对Latent-SFT轨迹生成与模型诊断而精心构建的评估基准。其构建过程整合了多个权威基准测试源,包括MMLU-Pro、GPQA、SuperGPQA以及BBEH,通过提取各源核心数据并进行标准化处理,形成统一的问题与答案格式。所有样本以JSONL格式存储,并辅以审计文件保留原始元数据。为适应文本处理场景,特排除了包含图像的TheoremQA样本,确保数据集的纯粹性与可用性。
使用方法
使用者可通过Hugging Face的datasets库直接流式读取压缩后的JSONL文件,无需预先解压。在生成任务中,模型应仅在最终响应或cot_answer字段内输出带框的最终答案,推理过程则不应包含额外框选内容。建议先通过验证集(如mmlu_pro_validation)进行配置调试,再扩展至全量测试集。各数据集的审计文件可用于按类别或难度进行分层评估与分析。
背景与挑战
背景概述
Latent-SFT Evaluation Benchmarks 数据集由研究团队于近期创建,旨在为潜在空间监督微调(Latent-SFT)的轨迹生成与模型诊断提供标准化评估平台。该数据集整合了多项知名基准测试的评估子集,包括 MMLU-Pro、GPQA、SuperGPQA 和 BBEH,覆盖了从常识问答到高难度专业领域推理的广泛任务。通过提供经过规范化处理的 JSONL 格式文件,该数据集有效支持批处理思维链(CoT)轨迹生成,为评估大型语言模型在复杂推理任务中的表现提供了可靠工具。其在 HuggingFace 平台上的发布,为自然语言处理社区在模型训练与诊断领域注入了新的活力。
当前挑战
所面临的领域问题挑战主要在于:现有评估基准难以有效区分模型在复杂推理任务中的真实能力与表面模式匹配,尤其是在多步骤推理和跨领域知识整合方面。构建过程中遇到的挑战包括:确保不同来源基准测试(如 MMLU-Pro 与 GPQA)的评估格式高度一致,同时保留各自特有的元数据以支持深入诊断;处理如 TheoremQA 等依赖图像信息的任务时的文本化适配;以及维持大规模数据集(如 SuperGPQA 含 26529 条样本)的存储与流式访问效率,同时避免在数据包中预置 CoT 轨迹以保持评估的无偏性。
常用场景
经典使用场景
Latent-SFT评估基准数据集的核心用途在于为语言模型的隐空间监督微调(Latent-SFT)提供标准化的评估平台。该数据集整合了MMLU-Pro、GPQA、SuperGPQA及BBEH等多个知名基准测试的子集,覆盖从常识推理到高阶科学探究的广阔知识域。研究者常利用其规范化的‘problem-answer’对格式,批量生成链式思维轨迹,并评估模型在复杂推理任务上的表现。该数据集特别强调推理过程与最终答案的分离,要求模型仅在生成响应中输出框定答案,这为诊断模型内部推理质量与答案准确性间的关联提供了精准的测试环境。其结构化的文件设计使得批次处理与轨迹生成尤为便捷,已成为评估隐空间监督微调成效的必备工具。
解决学术问题
该数据集精准回应了当前大语言模型评估中的两个核心学术问题:如何有效度量模型在复杂推理任务上的真实能力,以及如何诊断隐空间监督微调对模型推理过程的影响。传统评估往往因数据污染或提示词敏感性而导致结果失真,而Latent-SFT评估基准通过整合多个高质量子集(如MMLU-Pro的进阶多选试题、GPQA的博士学位级问答)并保持原始元数据,为研究者提供了更纯净、更具挑战性的评估镜头。其强制分离推理步骤与最终答案的设计,使得学术界能够深入考察模型‘想’与‘答’之间的一致性,从而推动了对隐空间推理机制的理解。该数据集的意义在于奠定了隐空间监督微调评估的标准化基石,促进了该领域从经验探索向可复现、可比较的科学研究范式的转变。
实际应用
在实际应用中,Latent-SFT评估基准迅速成为大模型开发与迭代中不可或缺的质控工具。工程团队利用其多维度、涵盖不同难度层次的问题集,针对性地测试模型在医疗、法律、科学等专业领域的问题解答能力。例如,GPQA子集被用于检验模型处理研究生级别科学问题的熟稔度,而BBEH子集则评估基础行为理解的鲁棒性。数据集的标准化‘problem-answer’格式简化了自动化评测管线的集成,模型训练后可直接在该基准上进行批量评测,快速定位知识盲区或推理缺陷。对于构建高可靠性AI助手的企业而言,该数据集提供了一套经过精心筛选与去噪的测试用例,有效降低了模型在真实场景中出现荒谬错误的风险,是保障产品上线前模型质量的可靠屏障。
数据集最近研究
最新研究方向
当前,大语言模型的逻辑推理与思维链生成能力成为前沿研究焦点。Latent-SFT评估基准的构建,正是为了精准度量模型在复杂问答及文本生成任务中的隐性微调(Latent-SFT)效果。该数据集整合了MMLU-Pro、GPQA、SuperGPQA及BBEH等权威测试集,覆盖广泛学科领域与高难度问题,特别是通过标准化处理确保CoT轨迹生成的可靠性。其发布顺应了AI领域对模型诊断与可解释性提升的迫切需求,为评估模型在抽象推理与知识整合方面的真实水平提供了关键工具,对推动大模型从‘表面契合’向‘深层理解’演进具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务