遇见数据集

HLE-BioMedX

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

HLE-BioMedX是一个多语言版本的生物学与医学问答数据集,源自Humanitys Last Exam(HLE)基准测试中的生物学/医学子集。该数据集包含280个问题,每个问题提供9种语言版本:英语(原始)、中文、日语、韩语、法语、泰语、德语、西班牙语和约鲁巴语。其中,英语版本为原始问题与答案;中文、日语、韩语、法语和泰语版本由机器翻译后经人类专家审核与修订;德语、西班牙语和约鲁巴语版本仅通过机器翻译生成,未经过人工验证。所有语言子集通过相同的id对齐,便于逐项比较。数据字段包括:id(原始HLE问题ID)、question(问题文本,语言相应翻译)、answer(正确答案,语言相应翻译)。数据以Parquet格式存储,每个子集也提供CSV文件供便捷使用。需要注意的是,部分原始问题原本附带图片,但本数据集未包含图片,因此仅凭文本可回答。另外,日语中有一个问题(id: 6734b4befaf4e6eb454c1c92)缺失,存储为null,而其他语言版本均存在。该数据集适用于多语言问答、推理能力评估、机器翻译质量评测以及医学/生物学知识测试等场景。

HLE-BioMedX is a multilingual version of the biology and medicine question-answering dataset, derived from the biology/medicine subset of the Humanitys Last Exam (HLE) benchmark. The dataset contains 280 questions, each provided in 9 languages: English (original), Chinese, Japanese, Korean, French, Thai, German, Spanish, and Yoruba. The English version contains the original questions and answers; the Chinese, Japanese, Korean, French, and Thai versions were machine-translated and then reviewed and revised by human experts; the German, Spanish, and Yoruba versions were generated solely by machine translation without human verification. All language subsets are aligned by the same id for easy item-by-item comparison. Data fields include: id (original HLE question ID), question (question text in the corresponding language), and answer (correct answer in the corresponding language). The data is stored in Parquet format, and each subset is also available as a CSV file for convenience. Note that some original questions originally included images, but this dataset does not include images, so only text-based answers are possible. Additionally, one question (id: 6734b4befaf4e6eb454c1c92) is missing in Japanese and stored as null, while it exists in all other language versions. This dataset is suitable for multilingual question answering, reasoning ability evaluation, machine translation quality assessment, and medical/biological knowledge testing.

提供机构:
LiLab
创建时间:
2026-08-28
原始信息汇总

HLE-BioMedX 数据集概述

基本信息

  • 许可证: MIT
  • 任务类型: 问答(question-answering)
  • 语言: 英语、中文、日语、韩语、法语、泰语、德语、西班牙语、约鲁巴语
  • 数据规模: 1K < n < 10K(每个子集包含280个问题)
  • 标签: 医学、生物学、多语言、推理

数据集结构

该数据集是 Humanitys Last Exam (HLE) 基准中“生物学/医学”子集的多语言版本,按语言分为9个子集:

分组 语言 翻译方式
源语言 en 原始英文问题与答案
机器翻译+专家验证/修订 zh, ja, ko, fr, th 机器翻译后由人类专家验证和修订
仅机器翻译 de, es, yo 机器翻译,无人工验证

所有子集包含相同的 280个问题,通过 id 对齐且顺序一致,便于逐项比较。

数据字段

字段 描述
id 原始HLE问题ID,所有子集共享
question 问题文本(英文为原始,其他语言为翻译)
answer 标准答案(英文为原始,其他语言为翻译)

加载方式

可通过 Hugging Face datasets 库加载指定语言子集,例如: python from datasets import load_dataset en = load_dataset("li-lab/HLE-BioMedX", "en")["test"] zh = load_dataset("li-lab/HLE-BioMedX", "zh")["test"]

补充说明

  • 问题来源于HLE生物学/医学类别的纯文本部分,少量原问题附带图片,但图片未在此发布,仅可基于文本作答。
  • 一个日语问题(6734b4befaf4e6eb454c1c92)缺失,存储为null;对应英文、中文、韩语、法语、泰语、德语、西班牙语和约鲁巴语条目存在。
搜集汇总
数据集介绍
HLE-BioMedX 数据集图片
构建方式
HLE-BioMedX数据集的构建源于对生物医学领域高难度推理测试的跨语言扩展,其母本为Humanity's Last Exam(HLE)中生物学与医学子集,涵盖了文本型问答题目。为确保多语言覆盖的严密性,数据集采用分层构建策略:英语为原始源语言;中文、日语、韩语、法语及泰语则经机器翻译后由领域专家逐条核验与修订;德语、西班牙语及约鲁巴语仅接受机器翻译处理,未经人工审核。所有子集均包含280道题目,通过原始ID对齐,保证了跨语言版本间可逐项对照的严谨结构。
特点
该数据集的核心特征在于其多语言与领域专精的双重属性。九种语言版本(英语、中文、日语、韩语、法语、泰语、德语、西班牙语、约鲁巴语)展现了覆盖广泛语种的设计意图,其中专家验证的语种确保了翻译质量的高可靠性,而未经审核的语种则提供了研究机器翻译对推理任务影响的天然对照。所有题目源自HLE生物医学高难度题库,具备深度推理要求;数据集字段简洁统一(id, question, answer),便于直接加载与评估,且每子集另有CSV副本,增强了易用性。需注意,个别题目缺失图像依赖及一处日语条目缺失,这些细节为研究边界提供了明确说明。
使用方法
在应用层面,HLE-BioMedX提供了即取即用的标准化接口。研究者可通过HuggingFace的datasets库便捷加载指定语言子集,如`load_dataset("li-lab/HLE-BioMedX", "en")["test"]`,迅速获取测试集数据。该数据集设计用于多语言问答系统的性能评估,特别适用于跨语言知识迁移、机器翻译质量对推理影响的分析,以及生物医学领域大型语言模型的基准测试。由于所有子集共享同一ID序列,可无缝进行跨语言逐题对比,支持细粒度诊断模型在不同语言下的知识差异。数据存放为parquet格式,附带CSV副本,适应多样化的数据处理工作流。
背景与挑战
背景概述
HLE-BioMedX数据集诞生于2025年,由li-lab团队基于《人类最后考试》(Humanity's Last Exam, HLE)中生物医学子集构建而成。该数据集聚焦于评估和推动多语言环境下的大型语言模型在复杂生物学与医学推理任务中的表现,其原始基准由未来智能研究中心(CAIS)等机构于2025年发布,旨在挑战模型的前沿推理能力。HLE-BioMedX通过将280道高难度问答题翻译为九种语言(英语、中文、日语、韩语、法语、泰语、德语、西班牙语和约鲁巴语)并人工校验,构建了首个覆盖多语种的生物医学推理基准,为跨语言医学人工智能研究提供了关键测试平台,对促进医疗领域多语言NLP发展具有重要影响力。
当前挑战
该数据集面临的挑战主要包含两方面:其一,生物医学领域本身的高门槛问题,即原始问题涉及深奥的医学、生物学专业知识和复杂逻辑推理,对语言模型的科学素养与推理能力要求严苛,且部分问题依赖图像信息,文本化后导致信息缺失。其二,多语言构建的复杂性,包括机器翻译难以精准传达医学术语在不同语言中的细微语义差异,人工校验过程耗时且易受专家主观性影响,部分语言(如约鲁巴语)缺乏双语专家资源,导致仅依赖机器翻译而缺乏质量保证。此外,数据缺失(如一个日语问题)也削弱了跨语言对比的完整性,为评估模型性能带来隐性偏差。
常用场景
经典使用场景
HLE-BioMedX作为多语言生物医学领域的推理评估基准,广泛应用于跨语言的大规模语言模型(LLM)性能测试。研究者利用其包含的280个高难度专家级问题,对模型在英语及八种非英语语言上的生物医学知识掌握和复杂推理能力进行定量衡量。该数据集特别适用于评估模型在多语言环境下的知识迁移和跨语言泛化能力,是检验LLM在专业领域内多语种表现的标准工具。
解决学术问题
该数据集解决了多语言生物医学问答中缺乏高质量、难度均衡评估数据的问题。它通过统一的问题集,实现了不同语言间性能的直接对比,从而探究机器翻译质量对模型推理的影响。这有助于学术界理解LLM在多语言知识表示中的薄弱环节,推动多语言推理技术的前沿研究,并为构建更公平、更具挑战性的跨语言评估方法提供了数据基础。
衍生相关工作
该数据集的发布衍生出了多项相关研究,包括构建更强大的多语言医学LLM微调基准,探索基于该数据集的跨语言知识蒸馏方法,以及开发针对生物医学命名实体的多语言识别和推理增强技术。后续工作还延伸至对机器翻译质量对推理性能影响的系统性分析,以及建立从高资源语言(如英语)向低资源语言(如约鲁巴语)的医学知识迁移框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务