相关数据集
evaleval/EEE_datastore
Every Eval Ever Datastore项目是一个共享模式和众包评估数据库,用于存储AI评估结果。它包括一个元数据模式、验证以及现有评估日志的转换器。数据集结构包含各种基准测试和模型,并为贡献者提供了详细的提交新基准测试和评估的指南。该数据集旨在标准化不同框架评估结果的比较、复制和重用。
Hugging Face2026-06-30 更新100
evaleval/every_eval_score_ever
评估统计数据集包含AI模型评估的详细性能统计数据,包括不同评估基准、数据集和AI模型的各种评估分数和相关信息。
Hugging Face2025-09-12 更新90
evaleval/card_backend
Eval Cards Backend数据集包含预计算的支持Eval Cards前端使用的评估数据。该数据集提供了关于模型、评估和基准测试的详细统计信息,包括文件结构和访问模式。数据集旨在支持模型评估和基准测试,重点是为前端消费提供结构化的层次数据。
Hugging Face2026-07-21 更新30
evaleval/every_eval_ever
该数据集名为Every Eval Ever Dataset,主要收集了来自不同AI模型排行榜的评估结果。数据集包含多个排行榜的数据,如global_mmlu_lite、hfopenllm_v2和livecodebenchpro。每条数据记录包括模型信息(名称、ID、开发者)、排行榜名称、评估结果(以JSON字符串形式存储)以及其他用于确保可重复性的元数据。数据集通过GitHub Actions实现
Hugging Face2025-12-17 更新90
evaleval/social_impact_eval_annotations
--- language: - en license: odc-by size_categories: - 1K<n<10K dataset_info: features: - name: provider dtype: string - name: name dtype: string - name: size dtype: string - name
Hugging Face2025-11-28 更新50



