遇见数据集

humanitys-second-last-exam

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

本数据集是“人类第二最后考试”(Humanitys Second Last Exam, HSLE)基准测试的科学输入数据,旨在复现该基准测试。数据集包含491个最终目标问题,其中417个为纯文本问题,74个涉及图像引用。每个目标问题附带两个上下文示例(共982个),用于进行上下文学习评估。数据以CSV文件形式呈现,主要文件为`data/hsle_consolidated.csv`,包含491行和174列,每行包括目标记录、实例1记录和实例2记录,每个记录有58个字段(如问题、答案、推理等)。所有问题、答案和推理值均非空或保持原始空白状态。此外,还提供了处理后的CSV文件(如问题、上下文示例、链接记录)、图像文件(258个唯一图像)以及详细的更正记录(针对172个目标问题的文本、答案或推理进行了更正)。数据集适用于文本问答和视觉问答任务,支持少样本学习评估。数据来源于cais/hle、HLE-Verified等外部数据集,并进行了版本固定和完整性校验。许可证为GNU通用公共许可证v3.0。

This dataset is the scientific input data for the Humanitys Second Last Exam (HSLE) benchmark, designed to reproduce the benchmark. The dataset contains 491 final target questions, of which 417 are pure text questions and 74 involve image references. Each target question is accompanied by two context examples (982 in total) for in-context learning evaluation. The data is presented in CSV format, with the main file `data/hsle_consolidated.csv` containing 491 rows and 174 columns, each row including a target record, instance 1 record, and instance 2 record, each with 58 fields (e.g., question, answer, reasoning). All question, answer, and reasoning values are either non-empty or remain in their original blank state. Additionally, processed CSV files (e.g., questions, context examples, link records), image files (258 unique images), and detailed correction records (with corrections to text, answers, or reasoning for 172 target questions) are provided. The dataset is suitable for text question answering and visual question answering tasks, supporting few-shot learning evaluation. The data originates from external datasets such as cais/hle and HLE-Verified, with version pinning and integrity checks. The license is GNU General Public License v3.0.

创建时间:
2026-08-24
原始信息汇总

数据集概述:Humanitys Second Last Exam: Scientific Inputs

基本信息

  • 数据集名称:Humanitys Second Last Exam: Scientific Inputs
  • 创建者与维护者:Shashank Agnihotri
  • 语言:英语(en)
  • 许可证:GNU General Public License v3.0
  • 任务类别:问答(Question-Answering)、视觉问答(Visual Question-Answering)
  • 标签:基准测试、评估、少样本学习、多模态

数据集内容

本数据集包含复现 Humanitys Second Last Exam (HSLE) 基准所需的科学输入数据,不包含任何模型响应、评审响应、聚合指标或图表等生成产物。

核心统计

项目 数量
目标问题总数 491
纯文本目标问题 417
引用图像的目标问题 74
上下文示例 982(每个目标问题关联2个)
目标与上下文示例合并总行数 1,473
目标到上下文示例的链接记录 491
唯一引用图像文件 258

数据构成

主数据集

  • 文件data/hsle_consolidated.csv
  • 规模:491行 × 174列
  • 结构:每行包含完整的58字段目标记录、58字段实例1记录和58字段实例2记录,原始rationale字段以reasoning形式呈现,无任何源字段被省略。

其他文件

路径 行数/文件数 用途
processed/hsle_original_questions.csv 491 修正后的目标问题
processed/hsle_context_examples.csv 982 每个目标的上下文示例
processed/hsle_all_rows.csv 1,473 归一化的完整表
processed/hsle_question_example_links.csv 491 目标与示例映射
processed/hsle_image_manifest.csv 491 图像来源与匹配信息
processed/dataset_metadata.json 1 计数、修订、哈希等元数据
images/ 258 引用的唯一图像文件
corrections/ 多个 修正审计与来源追踪文件

质量说明

  • 所有491个目标问题及答案、982个关联实例问题及答案均非空
  • 489/491 目标推理值、417/982 实例推理值为非空,其余源推理单元格本身为空白,未被虚构或静默填充。
  • 目标集是为本研究筛选的交集,而非完整的2,500行HLE测试集。

修正信息

  • 172个目标问题至少有一个组件被修正,各组件修正数量有重叠:
    • 问题文本修正:22
    • 答案修正:93(其中91个改变语义答案,2个仅规范化)
    • 推理修正:160
    • 同时修正问题与答案的目标:9
  • 982个上下文示例中,有1行有文档化的手动科学修正。

来源与追溯

来源 范围 固定修订版本
cais/hle test;2,500行 5a81a4c7271a2a2a312b9a690f0c2fde837e4c29
skylenage-ai/HLE-Verified 选定目标的验证证据 0bc83643672d4f68a5f89998617a639d85e7318b
futurehouse/hle-gold-bio-chem 重叠ID的附加金标准证据 1feb9e1d545731dba81e594438330406830e5260

数据集还提供了多个关键的SHA-256哈希值,用于识别历史合并输入、整合数据集、修正清单及选定的目标内容。

加载方式

可通过 load_dataset 直接加载主表,或使用 pandas 直接读取 CSV 文件。图像引用字符串为 data/images/<filename> 形式,在独立数据集中需将文件名解析至 images/ 目录。文本评估可使用 target_has_image 为 false 的417行;视觉评估需使用 has_image 及图像引用字段。

引用方式

bibtex @misc{agnihotri2026hsle, author = {Shashank Agnihotri}, title = {Humanitys Second Last Exam}, year = {2026}, howpublished = {Hugging Face dataset and GitHub software release}, url = {https://huggingface.co/datasets/shashankskagnihotri/humanitys-second-last-exam} }

搜集汇总
数据集介绍
humanitys-second-last-exam 数据集图片
构建方式
本数据集由研究者Shashank Agnihotri构建,旨在复现“人类倒数第二次考试”(Humanity's Second Last Exam)基准测试所需的核心科学输入。其构建过程严谨且透明,从权威源cais/hle的2,500行测试集中精心筛选出491个目标问题,并关联两个上下文实例,形成1,473行的综合表格。所有数据均经过人工校正,针对172个目标问题修正了问题文本、答案或理由,并详细记录了校正审计、证据关联及来源修订版本,确保每个字段的完整性与可靠性。
特点
该数据集独具匠心地融合了文本与图像模态,包含417个纯文本目标与74个带图目标,关联258个唯一图像文件,为多模态评估提供坚实基础。其核心亮点在于详尽无遗的数据记录,每行涵盖目标及两个实例的58字段完整记录,共174列,不遗漏任何源字段。数据集的校正机制尤为瞩目,不仅修正了目标问题,还对上下文示例进行科学校正,并通过哈希值固定版本,确保可重复性与审计追溯能力,为基准测试的公平性与科学性树立了新标杆。
使用方法
数据集的使用便捷灵活,用户可通过Hugging Face的load_dataset接口直接加载491行测试集,或使用pandas读取CSV文件。针对视觉问答任务,可利用has_image字段筛选带图样本,并解析image-reference字段指向images目录中的具体图像。文本-only评估则可筛选417行无图样本。规范化的辅助表格位于processed/目录下,便于深入审计与定制化分析。数据集的JSON元数据文件提供完整计数、来源修订与哈希信息,指导用户精准复现论文结果,是科学评测与模型比较的理想工具。
背景与挑战
背景概述
在人工智能迅猛发展的当下,大规模语言模型与多模态系统的能力评估已成为衡量其科学性与实用性的关键环节。2026年,由研究者Shashank Agnihotri创建并维护的“Humanity's Second Last Exam”数据集应运而生,旨在精准测量前沿模型在跨学科、多模态任务中的推理极限。该数据集源自CAIS发布的HLE测试集,经过严格筛选与精校,最终精选491个具有代表性的科学问题,并配备982个上下文示例及258幅关联图像,构建了一个兼顾深度与广度的评测基准。其研究核心在于通过高难度问题的交互式评估,揭示模型在深层次认知与知识整合方面的真实能力,对推动人工智能评测方法论的发展具有里程碑意义。
当前挑战
该数据集直面多重挑战。首要挑战在于领域问题的复杂度:需覆盖科学、数学、医学等众多高深领域,跨越文本与图像模态,对模型的跨域泛化与多模态推理构成严峻考验。其次,构建过程中要求极致的精确性,通过锚定外部权威来源,对172个目标问题进行了成分级修正,其中93处答案更正中有91处涉及语义变化,同时保留详尽溯源与冲突记录,以确保基准的可靠性与可审计性。此外,如何平衡数据的完整性(如保留非空推理值)与处理的规范性(如图像引用路径统一)亦构成技术难题,最终通过哈希值固定与元数据记录实现可复现性,为后续研究树立了严苛标准。
常用场景
经典使用场景
作为一项严苛的科学评测基准,Humanity's Second Last Exam(HSLE)数据集在人工智能领域扮演着试金石的角色。它精心挑选了491个涵盖文本与图像模态的尖端科学问题,并配以详尽的推理过程与成对的上下文示例,旨在检验并推动前沿模型在复杂科学推理、多步逻辑演绎及跨学科知识整合上的极限能力。研究者常借助该数据集进行少样本学习、上下文学习及多模态理解的基准测试,以严苛的指标衡量模型是否真正掌握了科学知识的深层结构,而非浅层的模式匹配。其严谨的题设与客观的评估流程,使之成为衡量大语言模型及多模态模型科学素养的权威标尺。
衍生相关工作
HSLE数据集作为前沿基准,已衍生出系列关于评估方法论与模型能力提升的研究工作。其严谨的修正流程与来源固定机制,启发了后续研究对现有大型数据集中潜在错误标注的系统性审计,带动了自动纠错与数据质量评估工具的研发。围绕该数据集,学者们探索了基于‘思维链’、‘自我一致性’及‘外部知识检索’的推理增强策略,以期攻克其高难问题。同时,HSLE的文本-图像混合设置也促进了跨模态推理与视觉-语言模型对齐研究的发展。该数据集公开的完整证据链与哈希校验手段,为构建可追溯、可复现代码的AI研究社区树立了规范典范,推动着更透明、更可靠的AI评估文化的发展。
数据集最近研究
最新研究方向
在人工智能评估领域,Humanity's Second Last Exam(HSLE)数据集的发布标志着对大规模语言模型与多模态模型能力边界探索的又一里程碑式推进。该基准精心构建了491项尖端科学问题,并配以982个上下文示例与258幅图像,旨在通过严格的纠错机制与可追溯的源数据锚定,对模型的推理能力进行极限压力测试。其研究前沿聚焦于从单一文本问答向多模态复杂推理的范式迁移,尤其强调在少样本学习情境下,模型能否凭借科学严谨的上下文示例,展现跨模态的知识整合与逻辑演绎能力。通过透明化的修正审计与版本锁定,该数据集为评估协议的可靠性树立了新标杆,对推动语言模型在科学发现、复杂决策等高风险领域的可信应用具有深远意义,也为未来构建更贴近人类专家认知深度的评估体系提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务