登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
AI Rankings 2026 | The Best Value for Your Logic
AI Rankings 2026 | The Best Value for Your Logic
收藏
kaggle
2026-03-12 更新
2026-03-21 收录
AI基准测试
AI定价
数据链接:
https://www.kaggle.com/datasets/sohaibdevv/which-ai-is-best-benchmark-and-pricing-dataset-2026
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
188+ models compared by price and performance.
对188款及以上模型进行了价格与性能两方面的对比
应用场景:
创建时间:
2026-03-12
相关数据集
lab-bench
生物信息学
AI基准测试
# LAB-Bench The Language Agent Biology Benchmark, or ```LAB-Bench```, is an evaluation dataset for AI systems intended to benchmark capabilities foundational to scientific research in biology. The
魔搭社区
2026-07-08 更新
80
0
open-llm-leaderboard/details_MaziyarPanahi__M7Yamshadowexperiment28_Experiment26T3q
大型语言模型评估
AI基准测试
该数据集是在模型MaziyarPanahi/M7Yamshadowexperiment28_Experiment26T3q的评估运行期间自动创建的,用于在Open LLM Leaderboard上进行评估。数据集由63个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为r
Hugging Face
2024-04-09 更新
12
0
Anonymous1-afk-ops/rubric-grounded-faithfulness-eval
图像生成忠实度评估
AI基准测试
该数据集是一个用于评估AI生成图像忠实度的资源,名为Rubric-Grounded Faithfulness Evaluation Resource。它是为NeurIPS 2026的评估和数据集提交而准备的。数据集包含多个资产,如完整的AIGCIQA2023评分标签、证据点和反事实诊断子集、重新标记的2400张T2I-CompBench人类评估压力测试图像等。但数据集不包含源基准图像或模型权重。数
Hugging Face
2026-05-02 更新
8
0
MCPToolBench++
AI基准测试
智能体评估
MCPToolBench++是一个大规模、多领域的AI Agent工具使用基准测试。截至2025年6月,该基准测试包括来自MCP和GitHub社区的45个类别的4k+ MCP服务器。数据集包含不同类别的单步和多步工具调用。我们还评估了一些最先进的Agent LLMs和基于RAG的系统。
github
2025-07-15 更新
34
0
open-llm-leaderboard/details_mahiatlinux__MasherAI-v6.1-7B-checkpoint6-pro
大型语言模型评估
AI基准测试
该数据集是在模型mahiatlinux/MasherAI-v6.1-7B-checkpoint6-pro在Open LLM Leaderboard上的评估运行过程中自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳命名。"train"分割始终指向最新的结果。此外,"results"配置存储了运行
Hugging Face
2024-04-03 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广