登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Leading AI model score in HLE 2025
Leading AI model score in HLE 2025
收藏
Statista
2026-04-11 收录
AI基准测试
通用智能评估
数据链接:
https://www.statista.com/statistics/1611887/ai-humanity-last-exam-hle-accuracy/
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Leading artificial intelligence (AI) models in humanity's last exam (HLE) in 2025
应用场景:
相关数据集
FigureBench
科学插图生成
AI基准测试
FigureBench是由西湖大学团队构建的首个面向长文本科学插图生成的大规模基准数据集,包含3300组高质量科学文本-插图对,覆盖论文、综述、博客和教材四类来源。数据集平均文本长度达10300词,包含41.2%的图文密度和6.4个平均形状组件,通过GPT-5筛选和人工标注(Cohen's κ=0.91)确保质量。该数据集旨在解决科学插图自动生成中结构保真度与美学表现的平衡问题,为AI科学家提供可
arXiv
2026-02-04 更新
193
0
ClockBench
视觉推理
AI基准测试
ClockBench是一个视觉推理AI基准测试数据集,包含10个时钟(完整私有数据集包含180个时钟)。该数据集专门设计用于评估AI模型的视觉推理能力,通过OpenRouter API对选定模型进行评估和评分。
github
2025-09-04 更新
42
0
open-llm-leaderboard/details_PulsarAI__CollectiveCognition-v1.1-Nebula-7B
语言模型评测
AI基准测试
该数据集是在Open LLM Leaderboard上对模型PulsarAI/CollectiveCognition-v1.1-Nebula-7B进行评估时自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。它包含1次运行的结果,每次运行都作为一个特定的分割,分割名称由运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个results配置存储了所有运行的聚合结果,用于计算和
Hugging Face
2023-11-12 更新
14
0
MIMIC-III
AI基准测试
互联网服务
MIMIC-III数据集是由中国科学院计算技术研究所用于ICU患者监测场景的重要数据资源。该数据集包含了多种患者数据,如生命体征和液体平衡等,用于支持心脏衰竭预测和终点预测等AI基准测试。数据集的创建过程涉及从虚拟客户端设备收集数据,通过云服务器进行训练,并在边缘计算层进行预测。MIMIC-III数据集的应用领域主要集中在医疗健康领域,旨在通过AI技术提高ICU患者的监测效率和准确性。
arXiv
2019-08-06 更新
154
0
OmniaBench
通用AI代理评估
AI基准测试
OmniaBench是一个用于评估通用AI代理的广泛诊断基准,其场景知识来源于应用商店、产品文档、行业资源和网络检索,涵盖90个一级和354个二级领域。它通过四种互补的构建路线合成任务,包含1,431个任务,并提供一个644个任务的挑战子集用于高效评估。数据集支持十维能力分类和八个难度因素的细粒度分析。
github
2026-07-17 更新
33
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广