登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
nemotron-ultra
nemotron-ultra
收藏
The Canadian Dataverse Repository
2025-01-01 更新
2026-04-17 收录
语言模型评测
生成式AI基准测试
数据链接:
https://borealisdata.ca/citation?persistentId=doi:10.5683/SP3/L11SJR
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
nemotron-ultra testbench data, contains 102 prompts and 5 trials per prompt.
应用场景:
提供机构:
University of Toronto, Max Planck Institute; University of Toronto
创建时间:
2025-01-01
相关数据集
open-llm-leaderboard/details_Qwen__Qwen1.5-110B-Chat
语言模型评测
多任务基准测试
该数据集是在评估模型Qwen/Qwen1.5-110B-Chat时自动创建的,评估在Open LLM Leaderboard上进行。数据集由63个配置组成,每个配置对应一个评估任务。数据集由1次运行创建,每次运行可以在每个配置中找到,运行的时间戳作为分割名称。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上
Hugging Face
2024-04-29 更新
25
0
CoffeeGitta/difficulty-aime_1983-2024-generations
数学研究
语言模型评测
该数据集是一个针对AIME(美国数学邀请赛,1983-2024年)问题的LLM生成解决方案集合。它包含多个模型(如Qwen2.5-Math、DeepSeek-R1、GPT-OSS-20B等)在不同配置下生成的数学问题解答,覆盖训练、验证和测试分割。数据集中每个条目包括问题陈述、生成的解决方案列表(带分数和成本信息)、成功率、多数投票正确性等字段,旨在用于研究LLM的失败预测,即通过生成前的激活来预
Hugging Face
2026-05-25 更新
10
0
math-extraction-comp/OpenBuddy__openbuddy-qwen2.5llamaify-14b-v23.3-200k
语言模型评测
答案质量评估
这是一个包含问题、答案和相关评分的数据集,适用于机器学习模型训练。数据集包含训练集,可用于模型对问题回答的预测和评估。
Hugging Face
2025-01-25 更新
8
0
open-llm-leaderboard/details_grimjim__Mistral-7B-Instruct-demi-merge-v0.2-7B
语言模型评测
基准测试
该数据集是在Open LLM Leaderboard上对模型grimjim/Mistral-7B-Instruct-demi-merge-v0.2-7B进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到特定的分割,分割以运行的时间戳命名。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,并用于
Hugging Face
2024-03-27 更新
19
0
open-llm-leaderboard/details_DreadPoor__Sphinx-7B-Model_Stock
语言模型评测
多任务基准测试
该数据集是在Open LLM Leaderboard上对模型DreadPoor/Sphinx-7B-Model_Stock进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中生成的,每次运行在每个配置中表示为特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了运行的所有聚合结果,用于计算和显示
Hugging Face
2024-04-08 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广