登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
LLM Benchmarks & Capabilities 2020-2026
LLM Benchmarks & Capabilities 2020-2026
收藏
kaggle
2026-05-27 更新
2026-06-17 收录
大型语言模型评估
性能基准测试
数据链接:
https://www.kaggle.com/datasets/sergionefedov/llm-benchmarks-and-capabilities-2020-2026
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
113 large language models tracked across 17 benchmarks, monthly API pricing hist
应用场景:
创建时间:
2026-05-27
相关数据集
open-llm-leaderboard/details_DreadPoor__Eros_n_Psyche-7B-Model_Stock
大型语言模型评估
多任务评估
--- pretty_name: Evaluation run of DreadPoor/Eros_n_Psyche-7B-Model_Stock dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [DreadPoor/Eros_n_Psyche-7B-Model_Stoc
Hugging Face
2024-04-06 更新
11
0
smalleval/mmlu-nano
大型语言模型评估
多任务语言理解
# SmallEval: Browser-Friendly LLM Evaluation Datasets 🚀 [](https://cloudcode.ai) SmallEval is a curated
Hugging Face
2025-01-20 更新
9
0
AUPR and AUROC values for mouse datasets using BWERF and GENIE3.
基因调控网络
性能基准测试
AUPR and AUROC values for mouse datasets using BWERF and GENIE3.
NIAID Data Ecosystem
5
0
OMNIX_Benchmarks_Latest
大型语言模型评估
模型基准测试
OMNIX Benchmarks 是一个用于评估和基准测试大型语言模型性能的数据集。它旨在通过一套标准化的指标对模型进行综合比较,涵盖格式遵循、逻辑推理、知识回忆、约束遵循、成功率(首次通过和最终)以及推理延迟等多个关键维度。该数据集支持文本生成和问答任务类别,并提供了对多个流行模型(如 Qwen、Gemma、Llama 等系列的不同版本)在上述维度上的量化评分和排名分析,帮助研究人员和开发者了解
Hugging Face
2026-07-07 更新
10
0
open-llm-leaderboard/details_chlee10__T3Q-Platypus-Mistral7B
大型语言模型评估
基准测试
该数据集是在评估模型chlee10/T3Q-Platypus-Mistral7B时自动生成的,包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,用于计算和展示在Open LLM Leaderboard上的聚合指标。
Hugging Face
2024-03-12 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广