登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
TIGER-Lab/mmlu_pro_leaderboard_submission
TIGER-Lab/mmlu_pro_leaderboard_submission
收藏
Hugging Face
2025-09-01 更新
2025-04-12 收录
多模态语言理解
排行榜评估
数据链接:
https://hf-mirror.com/datasets/TIGER-Lab/mmlu_pro_leaderboard_submission
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
应用场景:
提供机构:
TIGER-Lab
搜集汇总
数据集介绍
背景与挑战
背景概述
该数据集是MMLU-Pro基准测试的排行榜提交结果,记录了多个语言模型在15个学科领域的得分和总体得分,用于模型性能评估和比较。
以上内容由遇见数据集搜集并总结生成
相关数据集
TIGER-Lab/OmniEdit-Filtered-1.2M
图像编辑
机器学习
OmniEdit数据集是一个用于处理七种不同图像编辑任务的通用编辑器。数据集包含源图像和编辑后的图像,以及编辑指令、任务类型、语义一致性评分、感知质量评分和总体评分等信息。数据集通过专家蒸馏合成,并经过VIEScore过滤,包含120万对图像编辑对。
Hugging Face
2024-12-06 更新
29
0
TIGER-Lab/MMEB-eval
多模态嵌入模型
视觉语言模型
--- dataset_info: - config_name: A-OKVQA features: - name: qry_text dtype: string - name: qry_img_path dtype: string - name: tgt_text sequence: string - name: tgt_img_path se
Hugging Face
2024-10-28 更新
10
0
TIGER-Lab/EditReward-Data
图像编辑
偏好学习
EditReward-数据集是一个大规模、高保真的指令引导图像编辑人类偏好数据集。该数据集包含超过20万对手动画注的偏好对,由经过培训的专家按照严格的标准化协议进行精心筛选,确保与考虑的人类判断高度一致并最小化标签噪声。数据集覆盖了由七种最先进模型生成的十二种不同来源的编辑,作为EditReward等评估指令引导图像编辑模型与人类偏好对齐情况的关键训练数据。
Hugging Face
2025-10-12 更新
8
0
TIGER-Lab/TheoremExplainBench
数学定理解释
自然语言处理
TheoremExplainBench是一个为了评估和提升大型语言模型(LLM)理解和解释数学和科学定理的能力而设计的数据库。该数据库包含240个定理,按照难度和学科领域分类,以支持结构化的基准测试。每个定理都有一个描述,但这个描述不一定完全阐述定理,它主要是为LLM提供上下文帮助区分使用场景。
Hugging Face
2025-03-31 更新
16
0
jerome-white/leaderboard-documents-mmlu
自然语言理解
排行榜评估
该数据集包含文档文本(doc)和信息字段(info)。信息字段中包含答案(answer)、答案索引(answer_index)、分类(category)、上下文内容(cot_content)、选项(options)、问题(question)、问题ID(question_id)和文档ID(doc_id)。这些字段表明数据集可能是用于问答系统的训练,其中包含问题、答案和选项等。训练集的大小为96295
Hugging Face
2025-02-05 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广