evaleval/EEE_datastore
收藏资源简介:
Every Eval Ever Datastore项目是一个共享模式和众包评估数据库,用于存储AI评估结果。它包括一个元数据模式、验证以及现有评估日志的转换器。数据集结构包含各种基准测试和模型,并为贡献者提供了详细的提交新基准测试和评估的指南。该数据集旨在标准化不同框架评估结果的比较、复制和重用。
The Every Eval Ever Datastore project is a shared schema and crowdsourced eval database for storing AI evaluation results. It includes a metadata schema, validation, and converters for existing evaluation logs. The dataset is structured with various benchmarks and models, and it provides detailed instructions for contributors on how to submit new benchmarks and evals. The dataset is designed to standardize the comparison, reproduction, and reuse of evaluation results from different frameworks.
数据集概述
数据集名称
Every Eval Ever Datastore (EEE_datastore)
维护方
EvalEval Coalition
- 点赞数: 28
- 关注数: 76
数据集规模
- 总行数: 10K - 100K
- 模态: Text(文本)
- 许可证: MIT
数据集结构
数据集采用扁平化存储视图(Flat datastore view),每个基准测试作为逻辑上的数据集子集(subset/config),包含两个逻辑分割(split):
| 分割名称 | 说明 |
|---|---|
aggregate |
每个 UUID 对应一个聚合结果 JSON 对象 |
instance_level |
每个实例对应一行 JSONL 记录,并链接回其聚合对象 UUID |
子集(Subset)数量: 92 个,涵盖多种基准测试,包括但不限于:
- GAIA
- IFEval
- MMMU-Multiple-Choice / MMMU-Open-Ended
- MathVista
- ace / agentharm / alphaxiv
- arc-agi / artificial-analysis-llmsbfcl
- big_bench_hard / browsecompplus
- caparena-auto / cocoabench / commonsense_qa
- cvebench / cybench / cyse2 系列
- facts-grounding / fibble 系列
- gdm_intercode_ctf / global-mmlu-lite / gpqa_diamond
- gsm-mc / gsm8k
- hal 系列(hal-assistantbench, hal-corebench-hard, hal-gaia 等)
- hellaswag / helm 系列(helm_air_bench, helm_capabilities, helm_instruct 等)
- hfopenllm_v2 / hle / journalistic-bias / judgebench_samples
- la_leaderboard / live_bench / livecodebenchpro
- llm-stats / math-mc / mbpp / mmlu-pro / mt-bench
- multi-swe-bench-leaderboard / openai_humaneval / openeval
- piqa / reward-bench / reward-bench-2 / sciarena
- swe-bench / swe-bench-verified-leaderboard 等
- tau-bench-2 系列(airline, retail, telecom)
- terminal-bench-2.0 / theory_of_mind_samples / vals-ai
- wmt25_bhojpuri_maasai / wordle_arena
注意: 部分子集(如 helm_classic)当前显示为 ❌(不可用/不存在)。
数据用途
该数据集是 Every Eval Ever 项目的核心数据存储库,旨在为 AI 评估结果定义一个标准化的元数据格式,存储来自排行榜爬取、研究论文和本地评估运行等不同来源的评估结果。主要目标包括:
- 使来自不同框架的评估结果能够进行比较、复现和复用
数据提交方式
用户可以两种方式贡献新数据:
- Option A: 通过 Hugging Face 拖放上传,以 Pull Request 形式提交
- Option B: 克隆 GitHub 仓库,在
data/目录下添加数据后发起 PR
数据结构规范
- JSON Schema: 遵循
eval.schema.json(当前版本 0.2.0) - UUID 命名: 每个评估结果文件使用 UUID v4 命名,确保唯一性
- 文件夹结构:
data/{benchmark_name}/{developer_name}/{model_name}/ - 实例级数据: 可选的
{uuid}.jsonl文件存储每个样本的详细结果,支持三种交互类型:single_turn(标准问答、多选题、分类)multi_turn(多轮对话评估)agentic(工具调用与沙箱执行评估)
仓库结构
data/ └── {benchmark_name}/ └── {developer_name}/ └── {model_name}/ ├── {uuid}.json # 聚合结果 └── {uuid}.jsonl # 实例级结果(可选)




