遇见数据集

taiwan-exams-results

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集是any-to-bench基准测试工具生成的评估结果,用于衡量不同语言模型在台湾考试(taiwan-exams)上的表现。数据集包含多个配置,每个配置代表一个特定的模型(如Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Luna)在特定推理努力水平(低、中、高、极高)下的表现。每个配置包含754个测试样本,涵盖21份试卷,字段包括条目ID、模型名称、努力水平、源仓库、子集、运行索引、问题ID、章节ID、题号、问题类型、规则类型、模式、最高分、得分、比例、评判结果、评判分布以及详细JSON信息。数据集的用途是作为排行榜,方便比较不同模型和推理策略在台湾考试上的表现。

This dataset is the evaluation results generated by the any-to-bench benchmarking tool, used to measure the performance of different language models on Taiwan exams (taiwan-exams). The dataset contains multiple configurations, each representing a specific model (e.g., Claude Opus 5, Claude Sonnet 5, GPT-5.6 Sol, GPT-5.6 Luna) under a specific reasoning effort level (low, medium, high, very high). Each configuration includes 754 test samples covering 21 exam papers, with fields including entry ID, model name, effort level, source repository, subset, run index, question ID, chapter ID, question number, question type, rule type, mode, maximum score, score, ratio, judgment result, judgment distribution, and detailed JSON information. The purpose of the dataset is to serve as a leaderboard, facilitating comparison of different models and reasoning strategies on Taiwan exams.

创建时间:
2026-08-20
原始信息汇总

数据集概述:taiwan-exams-results

基本信息

  • 数据集名称:any-to-bench results — taiwan-exams-results
  • 任务类型:问答(question-answering)
  • 标签:leaderboard、evaluation、benchmark、any-to-bench
  • 数据集地址:https://huggingface.co/datasets/JacobLinCool/taiwan-exams-results

内容简介

该数据集是由 any-to-bench 工具生成的基准测试结果。每个子集代表一个“参赛者配置”,即某个模型在特定推理努力水平下,针对台湾考试(taiwan-exams)的答题结果。数据集中包含多个模型的评测记录,每个条目都详细记录了模型在每一道题目上的得分情况。

数据集结构

配置(Configs)

数据集包含 19 个子配置,每个配置对应一种模型与推理努力水平的组合,具体如下:

Claude 系列(8 个配置)

  • results-claude-opus-5-high / results-claude-opus-5-low / results-claude-opus-5-medium / results-claude-opus-5-xhigh
  • results-claude-sonnet-5-high / results-claude-sonnet-5-low / results-claude-sonnet-5-medium / results-claude-sonnet-5-xhigh

Codex GPT 系列(8 个配置)

  • results-codex-gpt-5-6-luna-high / results-codex-gpt-5-6-luna-low / results-codex-gpt-5-6-luna-medium / results-codex-gpt-5-6-luna-xhigh
  • results-codex-gpt-5-6-sol-high / results-codex-gpt-5-6-sol-low / results-codex-gpt-5-6-sol-medium / results-codex-gpt-5-6-sol-xhigh

Gemini 系列(3 个配置)

  • results-google-cloud-gemini-3-7-flash-high / results-google-cloud-gemini-3-7-flash-low / results-google-cloud-gemini-3-7-flash-medium

数据划分

每个配置均包含一个 test 划分,包含 754 个样本(样本数为逐题评分记录)。

特征字段

所有配置共用以下 18 个字段:

字段名 类型 说明
entry_id string 条目标识
model string 模型名称
effort string 推理努力水平
source_repo string 来源仓库
subset string 子集名称
run_index int32 运行索引
question_id string 题目 ID
section_id string 部分 ID
number string 题号
question_type string 题目类型
rule_kind string 规则类型
mode string 模式
max_points float64 满分
awarded float64 得分
ratio float64 得分比例
judge_verdicts int32 评判判定次数
judge_spread float64 评判分数分布
detail_json string 详细评分信息(JSON)

数据规模(各配置示例)

  • results-claude-opus-5-high:下载大小 15,338 字节,数据集大小 251,009 字节
  • results-google-cloud-gemini-3-7-flash-medium:下载大小 15,517 字节,数据集大小 272,825 字节

使用方式

Python 加载示例

python from datasets import load_dataset ds = load_dataset("JacobLinCool/taiwan-exams-results", "results-<entry>", split="test")

数据文件说明

  • results-index.json:目录文件,每个配置的概览信息
  • results-<entry>/entry.json:该配置的逐卷(per-paper)得分
  • results-<entry>/raw/<subset>/:包含完整的 bench.json、答题卡和评分报告
  • 查看器表格:每个已评分题目一行

补充说明

  • 数据集的评审结果 依赖评审模型,每个条目会标注使用的评审模型名称
  • 该数据集可作为排行榜使用,可在线浏览:https://jacoblincool.github.io/any-to-bench/results.html?repo=JacobLinCool/taiwan-exams-results
搜集汇总
数据集介绍
taiwan-exams-results 数据集图片
构建方式
该数据集源于any-to-bench框架对台湾地区考试的评测结果,针对不同模型与推理努力水平(如低、中、高、极高)的配置,系统性地收集了多款前沿大语言模型(如Claude、GPT、Gemini系列)在标准化试题上的作答表现。每条记录详尽记录了题目标识、所属科目、题号、题型、评分规则、满分与实得分、得分率,以及评判模型的判定结果与离散度等关键维度。数据通过统一的打分流程生成,并以test分割形式组织,每个配置对应一个独立子集。
特点
数据集具有高度的结构性与多维度评估特性。其特色在于囊括了多种推理努力设置下的横向对比,使研究者得以洞察不同模型在不同推理强度下的表现差异。每条记录不仅包含量化的得分,还附有评判模型的元信息与详细的作答详情(JSON格式),这为深入分析模型的主观题解答质量、评分分布及评判一致性提供了丰富素材。所有数据均以标准化schema存储,便于跨配置、跨模型进行系统性比较与二次分析。
使用方法
研究者可通过HuggingFace datasets库便捷地加载所需配置的测试集,例如使用load_dataset("JacobLinCool/taiwan-exams-results", "results-<entry>", split="test"))。该数据集可直接作为评估基准,用于复现特定模型在台湾考试上的表现,或作为训练数据增强、模型调优的评估参考。其丰富的字段设计亦支持构建自定义评分分析,如探究不同评判模型的严格度、分析各题型的得分率,或结合question_id与外部题库数据进行细粒度错误分析。
背景与挑战
背景概述
taiwan-exams-results数据集由JacobLinCool团队于2024年创建,旨在系统评估大型语言模型在台湾地区各类考试中的表现。该数据集通过any-to-bench框架,将多个主流模型(如Claude Opus 5、Sonnet 5、GPT-5.6及Gemini 3.7 Flash)在低、中、高、超高四种推理强度下的作答结果进行结构化记录,涵盖754道试题,每个配置包含详细的评分信息,如满分、得分、得分比例及裁判判定等。作为基准测试(benchmark)的组成部分,该数据集为研究者提供了跨模型、跨推理成本的性能对比视角,尤其关注标准化考试场景下的复杂推理与知识应用能力,对中文教育评估及大模型能力图谱的构建具有重要参考价值。
当前挑战
该数据集面临的挑战主要体现在两方面。领域层面,台湾考试涵盖多学科、多题型(如问答题、计算题),要求模型具备深厚的语义理解与逻辑推理能力,而当前模型在长文本推理和跨领域知识融合上仍存在瓶颈,得分比例(ratio)的波动反映了模型在不同问题类型上的不稳定性。构建层面,数据集的规范化需确保各模型在统一规则(rule_kind)下公平评分,但不同裁判模型(judge)的评判标准可能存在偏差,导致judge_verdicts和judge_spread的统计差异;同时,推理强度(effort)的设置虽能模拟不同计算成本,但如何平衡效率与准确性,以及如何避免评分模型的主观性影响结果一致性,仍是数据集迭代中亟待优化的难点。
常用场景
经典使用场景
该数据集以台湾地区考试试题为基准,构建了一个大规模、细粒度的大语言模型评估框架。其经典使用场景聚焦于多模型多推理强度下的性能对比,通过统一的评分标准(如max_points与awarded)量化模型在客观题与主观题上的表现差异,为研究者提供了一种可复现、可扩展的评测范式。
解决学术问题
该数据集解决了传统问答基准中评估维度单一、缺乏领域适配性的问题,尤其在中文语境下,它弥补了现有评测集对地区性教育内容覆盖不足的缺憾。它支持细粒度分析模型在不同题型、不同规则下的得分率,为探究模型推理能力与知识迁移提供了数据支撑,推动了评测理论从粗粒度准确率向多维度能力剖析的深化。
衍生相关工作
该数据集衍生出一系列相关研究,例如基于judge_verdicts与judge_spread数据的多评判器一致性分析,探索模型评分稳定性;利用detail_json字段进行错误模式挖掘,揭示模型在特定知识点上的薄弱环节;此外,其多配置(不同模型与effort组合)的对比数据为元学习与提示词优化研究提供了实验素材,催生了关于推理强度与性能关系的实证探讨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务