遇见数据集

llm-benchmark-usage

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

LLM Benchmark Usage (2023–2026) 是一个结构化数据集,用于追踪和分析2023年7月至2026年7月期间39个AI实验室评估其大型语言模型(LLM)时使用的基准测试。该数据集通过手工整理62篇论文、技术报告、系统卡片、模型卡片和博客文章构建而成,覆盖128个模型。数据集包含两个核心表:models表(128行)记录每个模型的基本信息,包括模型ID、发布实验室、发布日期、来源ID以及参与的Hugging Face排行榜列表;sources表(62行)记录每个来源文档的详细信息,包括文档类型、标题、URL、arXiv ID、关联的模型ID列表、注释以及评估套件详情。数据集对基准测试名称进行了规范化处理,统一了约250种原始名称变体,同时保留了真正不同的基准测试变体。数据集存在一些已知局限性:样本并非随机或完整,而是通过滚雪球方式构建,偏向2026年上半年数据;部分数据来源于截图或次级聚合器;实验室归属基于Hugging Face命名空间。该数据集适用于分析模型评估趋势、基准测试采用情况、实验室间评估实践比较以及作为模型评估研究的元数据来源。

LLM Benchmark Usage (2023–2026) is a structured dataset for tracking and analyzing benchmark tests used by 39 AI laboratories when evaluating their large language models (LLMs) between July 2023 and July 2026. This dataset is built through manual curation of 62 papers, technical reports, system cards, model cards and blog posts, covering 128 models. It includes two core tables: 1. The `models` table (128 rows) records basic information of each model, including model ID, releasing laboratory, release date, source ID and the list of Hugging Face Leaderboard participations; 2. The `sources` table (62 rows) documents detailed information of each source document, including document type, title, URL, arXiv ID, associated model ID list, annotations and evaluation suite details. The dataset standardizes benchmark test names, unifying approximately 250 original name variants while retaining truly distinct benchmark variations. There are several known limitations: the sample is not random or comprehensive, but constructed via snowball sampling, with a bias towards data from the first half of 2026; some data is sourced from screenshots or secondary aggregators; laboratory attribution is based on the Hugging Face namespace. This dataset is suitable for analyzing model evaluation trends, benchmark adoption status, cross-laboratory comparison of evaluation practices, and serving as a metadata source for model evaluation research.

创建时间:
2026-07-07
原始信息汇总

数据集概述:LLM Benchmark Usage (2023–2026)

该数据集手工整理自62篇论文、技术报告、系统卡、模型卡和博客文章,涵盖了2023年7月至2026年7月期间39个AI实验室发布的128个模型所使用的评估基准。旨在展示各实验室如何评估其模型以及评估基准随时间的变化。

数据集构成

数据集包含两个子集,可通过 datasets 库按名称加载:

  • models: 每个模型一行,共128行。

    • model_id (string): 开放权重模型的Hugging Face仓库ID(如 Qwen/Qwen3.5-397B-A17B)或闭源API模型的简单标识(如 claude-opus-4-8)。
    • lab (string): 发布该模型的机构/实验室。
    • release_date (timestamp): 发布日期。对于开放权重模型,使用HF仓库创建日期(近似值);对于闭源模型,使用手动研究的公告/系统卡日期。
    • source_id (string): 外键,关联 sources 表,指向描述该模型评估的论文/报告/卡片。
    • leaderboards (list[string]): 该模型出现的HF Hub排行榜列表(如 ["hle", "SWE-bench_Pro"]),闭源API模型此项为空。
  • sources: 每个论文/报告/卡片/博客一行,共62行。多个模型可能共享同一个来源。

    • id (string): 主键,与 models.source_id 匹配。
    • type (string): 来源类型,包括 paperreportmodel_cardblog
    • title (string): 论文/报告/卡片/文章的标题。
    • url (string, 可空): 来源链接。
    • arxiv_id (string, 可空): arXiv论文的ID。
    • models (list[string]): 该来源的基准列表默认适用的所有 model_id
    • notes (string, 可空): 注意事项,如数据质量标记、基准是模型专属还是共享、可信度等。
    • benchmarks (list[struct]): 评估套件。每个元素包含:
      • name (string): 基准名称,已规范化(如统一为 GPQA-Diamond)。
      • category (string): 来源中标注的自由文本类别(如 knowledge, agentic_coding, preparedness_bio_chem)。
      • models (list[string], 可空): 当为 null 时,表示该基准适用于来源中 models 列表的所有模型;当有值时,表示该基准仅适用于所列出的模型。

基准名称规范化

数据集将约250个原始名称变体(因大小写、连字符、跨实验室转写差异导致)进行去重并统一为规范名称。对于真正不同的基准变体(如 GPQA vs GPQA-Diamond vs GPQA Hard, 或 HumanEval vs HumanEval+)则保持区分。

已知限制

  • 并非所有已发布模型的随机或完整样本,是通过从2026年的四个HF排行榜(GPQA, HLE, SWE-bench Pro, Terminal-Bench 2.0)、一组手工挑选的闭源模型以及约18个额外实验室中筛选出的旗舰模型构建的,总体偏向2026年上半年。
  • Grok系列(xAI)的部分数据来源于公告页面的截图(阻止自动抓取)以及二级聚合器,每个Grok来源的 notes 字段详细说明了哪些基准为已验证、哪些为二手来源。
  • lab 归属基于HF命名空间;其他实验室对另一个实验室检查点的社区量化版本(如exolabs/RedHat AI对NVIDIA模型的重新打包)归因于原始实验室,因为重新量化不构成独立的基准选择。
搜集汇总
数据集介绍
llm-benchmark-usage 数据集图片
构建方式
该数据集由人工从62篇学术论文、技术报告、系统卡、模型卡及博客文章中精心构建而成,覆盖了2023年7月至2026年7月间39个AI实验室发布的128个模型。构建过程采用滚雪球式抽样策略,从2026年Hugging Face的四个排行榜(GPQA、HLE、SWE-bench Pro、Terminal-Bench 2.0)出发,逐步扩展至一组精心挑选的闭源模型,并额外从约18个实验室中抓取旗舰模型以补充历史深度,确保时间跨度的完整性。数据集包含两个核心子表:models表记录每个模型的标识、发布机构、发布日期、关联来源及排行榜信息;sources表详细列出每个文献来源的类型、标题、链接及所涵盖的基准测试套件,通过source_id字段实现模型与来源的关联。
使用方法
该数据集可通过Hugging Face的load_dataset函数轻松加载,按配置名称选择models或sources子表。例如,使用`load_dataset("SaylorTwift/llm-benchmark-usage", "models")`获取模型表,或使用`load_dataset("SaylorTwift/llm-benchmark-usage", "sources")`获取来源表。加载后的数据集可直接用于分析不同实验室的基准测试选择趋势、时间演变以及模型与测试套件的关联关系。需要注意的是,数据集并非所有已发布模型的随机完整样本,而是基于特定排行榜和旗舰模型的有偏抽样,尤其偏重2026年上半年。此外,实验室归属由Hugging Face命名空间决定,社区重量化版本被归回原始实验室,因为重量化不构成独立的基准测试选择行为。
背景与挑战
背景概述
大型语言模型(LLM)的评估基准是衡量其能力与进步的核心工具。随着2023至2026年间AI实验室竞相发布新模型,学界与工业界亟需系统化了解各机构采用的评估标准及其演变趋势。由SaylorTwift等人构建的LLM Benchmark Usage数据集应运而生,它手工采集自62篇论文、技术报告、系统卡、模型卡及博客文章,覆盖39家AI实验室的128个模型,时间跨度从2023年7月至2026年7月。该数据集通过标准化基准名称(如将τ²-Bench统一为TAU2-Bench)并记录模型与评估的对应关系,为理解评估实践的动态变迁提供了关键参考,对推动评估标准化与透明度研究具有重要价值。
当前挑战
该数据集旨在应对两大核心挑战。领域层面,当前LLM评估基准名称混乱、跨机构变体繁多(如GPQA、GPQA-Diamond与GPQA Hard共存),阻碍了公平比较与趋势分析的可靠性;同时,闭源API模型因无法登陆HuggingFace排行榜,评估信息零散且难追踪,加剧了评估体系的碎片化。构建过程中,数据采集面临样本偏差——依赖从特定排行榜出发的滚雪球法,导致非旗舰模型覆盖不足;此外,部分来源(如xAI的Grok系列)依赖截图或二手聚合器,信息核实困难,需在注释中明确标记置信度。模型归属亦存争议,社区量化版本(如Red Hat AI对NVIDIA模型的再封装)需合理归因至原实验室,以确保数据的准确性与一致性。
常用场景
经典使用场景
在自然语言处理和人工智能领域,模型评估基准的选取与演变一直是衡量技术进步的核心议题。llm-benchmark-usage数据集系统性地梳理了2023年至2026年间39个顶尖AI实验室在62篇论文、技术报告、模型卡片及博客中公布的128个模型所使用的评估基准信息,涵盖开源和闭源模型。该数据集最经典的使用场景在于,研究者可以高效地追踪和对比不同实验室、不同时期模型所依赖的评估体系,从而洞察评测范式的演化脉络。例如,通过分析特定基准(如GPQA-Diamond、SWE-bench Pro)的引用频次与覆盖模型范围,能够揭示哪些任务领域日益受到重视,以及模型能力评估标准如何从传统的知识问答向复杂的智能体编码等前沿场景迁移。这为理解大语言模型竞争格局和能力变迁提供了结构化的量化依据。
解决学术问题
该数据集的核心学术贡献在于,它系统性地解决了大语言模型评估基准使用情况高度分散、缺乏统一溯源与跨时间对比框架的问题。以往,研究者需要手动翻阅大量零散的模型发布文档才能获知特定评测配置,且不同实验室对同一基准的命名变体(如τ²-Bench与TAU2-Bench)增加了横向比较的难度。llm-benchmark-usage通过精心的名称规范化处理,将约250种原始名称变体统一映射为标准化基准标识,并保留具有实质差异的变体(例如区分GPQA、GPQA-Diamond与GPQA Hard)。这一工作使得定量分析基准使用热度如何随时间演化、特定基准是否成为评估新模型的标准配置等关键学术问题成为可能,从而推动了评测科学从经验性描述向数据驱动的研究范式转变。
实际应用
在实际应用层面,llm-benchmark-usage为AI开发机构、企业决策者及行业分析师提供了极具价值的战略参考资源。当需要评估新发布模型的综合能力时,开发团队可利用该数据集快速定位同类模型所经历过的评测流程,据此设计更具针对性与可比性的内部测试方案。对于计划建立或更新模型竞技平台的机构而言,数据集揭示的基准使用流行度趋势可直接指导评测集的选择优先级,例如从数据中观察到SWE-bench Pro等代码相关基准在2025年后迅速普及,便可将其纳入标准化评测套件。此外,风险投资与政策研究人员也能借助这一数据洞察各实验室的技术侧重领域,从而更客观地判断大模型产业的技术成熟度与潜在风险分布。
数据集最近研究
最新研究方向
LLM基准测试使用模式的系统性追踪与演化分析。该数据集通过手工构建的62篇论文、技术报告及模型卡片,系统梳理了2023至2026年间39个AI实验室对128个模型采用的评估基准变迁。其核心价值在于揭示了基准选择从早期通用指标(如GPQA)向专业化、多维评估体系(如SWE-bench Pro、Terminal-Bench 2.0)的跃迁,映射出大语言模型研究从基础能力验证向复杂任务适配的范式转型。数据集的跨实验室标准化处理(统一约250种基准名称变体)为量化分析行业基准采纳趋势、识别前沿评估共性提供了珍贵基础资源,尤其对跟踪Agent能力、代码生成等热点方向的评估方法学演进具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务