遇见数据集

livek12bench

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

LiveK12Bench是一个双语(中文/英文)的K12高中教育基准数据集,专门用于评估模型在STEM(科学、技术、工程和数学)领域的学科能力。该数据集覆盖数学、物理、化学和生物四个核心科目,所有问题均源自真实的中国高中考试试卷,并提供对应的中文和英文版本。数据集包含四个划分:zh_2603、zh_2605、en_2603和en_2605,每个数据样本包括唯一标识符、批次、科目、问题类型、分值、问题文本(含LaTeX内联数学公式)、答案列表、分步解决方案、知识点、图像列表和子集标签。总共有2,114个问题样本,其中1,096个为纯文本问题,1,018个为图文结合问题,2,114个以“仅图像”模式呈现;问题类型包括1,473个选择题、164个填空题和477个问答题;科目分布为数学772个(36.5%)、物理396个(18.7%)、化学532个(25.2%)、生物414个(19.6%)。该数据集适用于教育问答基准测试、多模态理解评估、多步推理能力评估和跨语言模型对比研究,采用CC BY-NC 4.0许可,仅限非商业的研究和教育用途。

LiveK12Bench is a bilingual (Chinese/English) K12 high school education benchmark dataset specifically designed to evaluate model capabilities in STEM (Science, Technology, Engineering, and Mathematics) subjects. It covers four core subjects: mathematics, physics, chemistry, and biology, with all questions sourced from real Chinese high school exam papers and provided in both Chinese and English versions. The dataset includes four splits: zh_2603, zh_2605, en_2603, and en_2605. Each data sample contains multiple structured fields: unique identifier, batch, subject, question type (e.g., multiple-choice, fill-in-the-blank, essay/proof), point value, question text (including LaTeX inline math formulas), answer list, step-by-step solution, knowledge points, image list, and subset labels for special attributes. In total, there are 2,114 question samples, comprising 1,096 text-only questions, 1,018 text-image combined questions, and 2,114 presented in image-only mode from original exams. The question type distribution includes 1,473 multiple-choice questions, 164 fill-in-the-blank questions, and 477 essay questions. Subject distribution is mathematics 772 (36.5%), physics 396 (18.7%), chemistry 532 (25.2%), and biology 414 (19.6%). This dataset is suitable for educational question-answering benchmarks, multimodal understanding (text and image) evaluation, multi-step reasoning assessment, and cross-language (Chinese-English) model comparison studies. It is licensed under CC BY-NC 4.0 for non-commercial research and educational use only.

创建时间:
2026-05-21
原始信息汇总

数据集名称

LiveK12Bench

数据集概述

LiveK12Bench 是一个双语(中文/英文)K12 高中基准数据集,涵盖四个 STEM 科目:数学、物理、化学和生物学。所有题目均来自真实的中国高考或模拟考试试卷,并提供了中英文双语版本。

语言与许可证

  • 语言:中文、英文
  • 许可证:CC BY-NC 4.0(仅限非商业研究与教育用途)

数据集规模

  • 总样本数:2,114 个问题
  • 数据分片:共 4 个分片,总计约 4228 条记录(每个分片包含对应的题目)
  • 数据集总大小:约 310 MB(下载大小约 315 MB)

数据分片

分片名称 语言 描述 样本数
zh_2603 中文 2026年3月批次 1,487
zh_2605 中文 2026年5月批次 627
en_2603 英文 2026年3月批次 1,487
en_2605 英文 2026年5月批次 627

数据集特征

每条记录包含以下字段:

  • id:字符串,唯一标识符(如 zh_2603_math_0001
  • set:字符串,来源批次("2603""2605"
  • subject:字符串,科目(biology / chemistry / math / physics
  • question_type:字符串,题型(选择题、填空题、解答题、证明题 / Multiple Choice、Fill in the Blank、Open-ended、Proof)
  • point_value:整数,题目分值
  • question:字符串,题目文本(LaTeX 内联数学公式用 $...$ 表示)
  • answer:字符串列表,答案(选择题如 ["A"],填空题/解答题为文本)
  • solution:字符串,详细解题步骤
  • knowledge_points:字符串,涉及的知识点或学习目标
  • images:图像列表,引用的图表/图片(若无则为空列表)
  • subset:字符串列表,子集标签(如 complex_layoutrigorous_processlong_reason,仅 set=2603 的题目有标签)

统计信息

类别 总计 数学 物理 化学 生物学
任务模态
纯文本 (TO) 1,096 617 (56.3%) 65 (5.9%) 240 (21.9%) 174 (15.9%)
文本+图像 (TI) 1,018 155 (15.2%) 331 (32.5%) 292 (28.7%) 240 (23.6%)
仅图像 (IO, 考试模式) 2,114 772 (36.5%) 220 (10.4%) 532 (25.2%) 414 (19.6%)
题型
选择题 (MCQ) 1,473 444 (30.1%) 274 (18.6%) 419 (28.4%) 336 (22.8%)
填空题 (FIB) 164 119 (72.6%) 26 (15.9%) 18 (11.0%) 1 (0.6%)
问答题 (Q&A) 477 209 (43.8%) 96 (20.1%) 95 (19.9%) 77 (16.1%)
总计 2,114 772 (36.5%) 396 (18.7%) 532 (25.2%) 414 (19.6%)

使用方式

可通过 Hugging Face datasets 库加载: python from datasets import load_dataset ds = load_dataset("Shawn-wxh/livek12bench")

引用

bibtex @misc{livek12bench2026, title = {LiveK12Bench}, author = {Wang, Xiaohan and Yin, Mingze and Zhao, Yilin and Sinbadliu and Li, Dian}, year = {2026}, url = {https://github.com/QQ-MM/LiveK12Bench} } @misc{wang2026livek12bench, title={LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?}, author={Xiaohan Wang and Mingze Yin and Yilin Zhao and Gang Liu and Dian Li}, year={2026}, archivePrefix={arXiv}, url={https://arxiv.org/abs/2605.26781}, }

搜集汇总
数据集介绍
livek12bench 数据集图片
构建方式
LiveK12Bench是一个面向K12阶段STEM学科的双语评估基准数据集。该数据集精心采集自中国真实的高中考试试卷,涵盖数学、物理、化学与生物学四大核心领域。原始试题首先经专业编排与翻译处理,形成中文与英文两个平行版本,随后依据其来源批次被组织为2603与2605两个时间节点下的四个独立子集,分别对应中英文的3月与5月批次。每个数据样本均配备了诸如问题标识符、学科类别、题型标签、分值、问题文本、标准答案、详细解题步骤、知识点标注、关联图片及子集标签等结构化字段,为多维度评测提供了坚实的数据支撑。
使用方法
用户可通过HuggingFace的datasets库便捷加载LiveK12Bench数据集。借助load_dataset函数即可一键获取全部子集,并利用filter方法依据学科、题型或子集标签进行精细化数据筛选。例如,研究者可轻松抽取中文数学试题或英文生物学选择题进行专项评测。数据集中每个样本的question字段包含LaTeX格式的行内数学公式,answer字段提供标准答案列表,而solution字段则记录了完整的推理步骤,便于实现从输入到输出的端到端模型评估与深度分析。
背景与挑战
背景概述
在教育评估与人工智能的交叉领域,如何客观衡量大型多模态模型在结构化知识体系中的真实能力,始终是学界关注的核心命题。LiveK12Bench数据集由Xiaohan Wang、Mingze Yin、Yilin Zhao等研究者于2026年创建,旨在构建一个覆盖数学、物理、化学、生物学四门STEM学科的双语(中英)K12高中水平评估基准。该数据集的试题源自真实中国高考及模拟试卷,并经过专业翻译与结构化标注,包含选择题、填空题、解答题等多种题型,总计2114道题目。LiveK12Bench的发布为评估多模态模型在复杂推理、多步解题及图文理解等方面的综合表现提供了标准化测试平台,其细粒度的子集划分(如复杂布局、严谨推理链)更推动了教育领域AI评测的精细化发展,对衡量模型是否真正掌握高中知识具有重要参考价值。
当前挑战
LiveK12Bench所解决的核心领域挑战在于,现有基准多侧重单一模态或简单知识问答,难以全面评估模型在多学科、多题型及图文融合场景下的真实学业水平。该基准要求模型不仅具备文本理解能力,还需解析包含公式、图表和复杂视觉布局的题目,同时完成严谨的多步逻辑推理。在构建过程中,挑战体现在三个方面:其一,试题来源的多样性与版权合规要求,需从真实考卷中筛选并确保学术使用合法性;其二,题型结构的复杂性,如图像仅作为题面背景的题目与需结合图像细致分析的题目需精准区分,且子集标签的客观性依赖严谨的人工标注;其三,双语版本的一致性维护,确保中文原题与英文翻译在知识考核点上等价而不失真,这对翻译质量和领域知识提出了极高要求。
常用场景
经典使用场景
在基础教育的学术评估领域,LiveK12Bench作为一个双语(中文与英文)、覆盖数学、物理、化学和生物学四大STEM学科的高中水平基准数据集,为大型语言模型和多模态模型在学科知识推理能力上的评测提供了标准化的测试平台。其题目源自真实的中国高考模拟试卷,并包含文本与图像等多种模态,支持选择题、填空题、解答题及证明题等多种题型,用于衡量模型在知识理解、逻辑推导和复杂视觉布局解析等方面的综合表现。
解决学术问题
该数据集的核心学术价值在于填补了针对K12阶段、具备真实考试难度与多模态特性的中文基准的空白。它有效解决了现有基准中题目难度较低、模态单一或缺乏严格推理链评估的问题,能够系统性地检验模型在严谨多步推理(rigorous_process)、长链条推理(long_reason)以及复杂视觉布局理解(complex_layout)等高级认知任务上的能力,为评估人工智能在基础教育领域的真实水平提供了关键标尺。
实际应用
在实际应用层面,LiveK12Bench不仅服务于学术评测,更有潜力推动教育科技产品的智能化升级。它可以作为智能辅导系统和大规模语言模型在自动阅卷、个性化学习路径推荐以及自适应题库生成等场景中的质量验证基准。教育机构可利用其双语特性,构建跨语言的教学辅助工具;对于开发者而言,该数据集也提供了训练和优化教育领域垂直模型的高质量语料与评估体系,促进教育资源的智能化普及。
数据集最近研究
最新研究方向
LiveK12Bench数据集为评估大型多模态模型在K12教育阶段的推理能力提供了全新的双语基准,涵盖数学、物理、化学和生物学四个核心STEM学科。其独特之处在于题目源自真实的高中考试真题,并同时提供中英文版本,从而能有效考查模型在跨语言环境下的学科知识迁移与复杂问题求解能力。该数据集精细划分了纯文本、文本-图像及纯图像等多种任务模态,并标注了长链推理、复杂视觉布局等关键子集,这使其成为衡量前沿大模型是否真正掌握高中阶段逻辑思维和科学方法的重要标尺,尤其有助于揭示模型在严谨的多步推理与图文融合理解方面的现存瓶颈,对推动教育智能体的实用化进程具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务