登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
NuminaMath-TIR
NuminaMath-TIR
收藏
kaggle
2025-01-02 更新
2025-02-22 收录
推理评估
AI数学奥林匹克
数据链接:
https://www.kaggle.com/datasets/jorgeplazas/numinamath-tir
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Project Numina - AI-MO Progress Prize
Project Numina - AI-MO 进步奖
应用场景:
创建时间:
2025-01-02
相关数据集
math-extraction-comp/Qwen__Qwen2.5-Math-72B-Instruct
推理评估
语言模型评测
该数据集是一个问答或文本评估任务的数据集,包含问题、参考答案、模型预测答案、实际预测答案等字段,以及多个评估系统给出的答案抽取结果及其评分。数据集包含一个训练集部分。
Hugging Face
2025-01-26 更新
11
0
pkuHaowei/kumo-easy
视觉语言模型
推理评估
KUMO是一个评估大型语言模型复杂推理能力的基准测试数据集,通过程序生成的推理游戏进行。数据集包含五个环境:MedicalEnv、EducationEnv、MusicEnv、FantasyEnv和ChemicalEnv,每个环境有50个示例。还包括100个自动生成的示例领域,涉及计算机科学、生物学、艺术等多个类别,每个领域包含约50个真相和30个动作。
Hugging Face
2025-04-10 更新
9
0
asingh15/arc-barc-processed-direct-max4k-gpt5miniabstractions-comparegold-test-uf-qwensols-4of16
推理评估
模型性能测试
--- dataset_info: features: - name: prompt dtype: string - name: responses list: string - name: train dtype: string - name: test dtype: string - name: source dtype: str
Hugging Face
2025-12-16 更新
7
0
riddle_sense
推理评估
谜语问答理解
RiddleSense专注于谜语风格的常识问答,旨在评估模型在复杂常识推理、比喻语言理解和反事实推理方面的能力。它包含5.7k个示例,提供了一个多项选择的问答任务数据集,其中包含问题、答案以及多个选项。数据集分为训练集、验证集和测试集,每个样本包括问题文本、答案选项(标签和文本)以及正确答案的键值。该数据集的授权许可允许用户将其用于研究目的,但禁止商业用途和二次分发。
OpenCSG
2024-07-19 更新
11
0
Performance evaluation of inference methods on DREAM4 10-gene and 100-gene continuous data sets.
基因调控网络
推理评估
Performance evaluation of inference methods on DREAM4 10-gene and 100-gene continuous data sets.
NIAID Data Ecosystem
7
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广