登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
MMLU
MMLU
收藏
Figshare
2024-01-30 更新
2026-04-08 收录
语言模型评估
多任务理解基准
数据链接:
https://figshare.com/articles/dataset/MMLU/25050032/5
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Measuring Massive Multitask Language Understandinghttps://github.com/hendrycks/test
应用场景:
提供机构:
Choudhary, Kamal
创建时间:
2024-01-30
相关数据集
IDEA-CCNL/Ziya-Writing-Eval-Chinese
中文写作评估
语言模型评估
姜子牙写作任务中文评估数据集(Ziya-Writing-Eval-Chinese)用于评估大语言模型在中文写作任务上的水平,通常采用Side-by-Side评测。该评测集包含了多个写作子任务,分为应用写作和创意写作两大类。应用写作包括公文、通知、报告、论文、征稿、函件和申请书等;创意写作包括书信、作文、文案、小说、视频脚本、攻略、广告、剧本和童话等。
Hugging Face
2024-01-03 更新
125
0
JVASP-4307.zip
密度泛函理论计算
材料性能模拟
JARVIS-DFT data test
Figshare
2021-06-30 更新
5
0
miladalsh/docent-val-Qwen3-VL-8B-Instruct-bbox-w-text_no_ref
细粒度图像编辑
语言模型评估
--- dataset_info: features: - name: uuid dtype: string - name: step dtype: int64 - name: items list: string - name: segment_ids list: int64 - name: segment_positions li
Hugging Face
2026-04-09 更新
4
0
open-llm-leaderboard/details_Josephgflowers__Tinyllama-1.5B-Cinder-Test-2
语言模型评估
学科知识
--- pretty_name: Evaluation run of Josephgflowers/Tinyllama-1.5B-Cinder-Test-2 dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [Josephgflowers/Tinyllama-1.5B-Ci
Hugging Face
2024-04-05 更新
12
0
JVASP-5782.zip
计算材料学
密度泛函理论
JARVIS-DFT data test
Figshare
2021-06-30 更新
4
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广