登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Benchmark scores HyperCLOVA X 2024, by category
Benchmark scores HyperCLOVA X 2024, by category
收藏
Statista
2026-04-25 收录
语言模型评测
AI基准测试
数据链接:
https://www.statista.com/statistics/1557413/hyperclova-x-benchmark-scores-by-category/
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Benchmark scores of HyperCLOVA X 2024, by category
应用场景:
相关数据集
ClockBench
视觉推理
AI基准测试
ClockBench是一个视觉推理AI基准测试数据集,包含10个时钟(完整私有数据集包含180个时钟)。该数据集专门设计用于评估AI模型的视觉推理能力,通过OpenRouter API对选定模型进行评估和评分。
github
2025-09-04 更新
42
0
CoffeeGitta/difficulty-aime_1983-2024-generations
数学研究
语言模型评测
该数据集是一个针对AIME(美国数学邀请赛,1983-2024年)问题的LLM生成解决方案集合。它包含多个模型(如Qwen2.5-Math、DeepSeek-R1、GPT-OSS-20B等)在不同配置下生成的数学问题解答,覆盖训练、验证和测试分割。数据集中每个条目包括问题陈述、生成的解决方案列表(带分数和成本信息)、成功率、多数投票正确性等字段,旨在用于研究LLM的失败预测,即通过生成前的激活来预
Hugging Face
2026-05-25 更新
10
0
Cameron-Chen/countdown-opd
推理评估
语言模型评测
--- dataset_info: features: - name: target dtype: int64 - name: nums list: int64 - name: prompt list: - name: content dtype: string - name: role dtype: string
Hugging Face
2026-03-21 更新
6
0
open-llm-leaderboard/details_grimjim__Mistral-7B-Instruct-demi-merge-v0.2-7B
语言模型评测
基准测试
该数据集是在Open LLM Leaderboard上对模型grimjim/Mistral-7B-Instruct-demi-merge-v0.2-7B进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到特定的分割,分割以运行的时间戳命名。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,并用于
Hugging Face
2024-03-27 更新
19
0
math-extraction-comp/OpenBuddy__openbuddy-qwen2.5llamaify-14b-v23.3-200k
语言模型评测
答案质量评估
这是一个包含问题、答案和相关评分的数据集,适用于机器学习模型训练。数据集包含训练集,可用于模型对问题回答的预测和评估。
Hugging Face
2025-01-25 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广