登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
TIGER-Lab/LongICL_leaderboard_submission
TIGER-Lab/LongICL_leaderboard_submission
收藏
Hugging Face
2024-06-13 更新
2025-04-12 收录
数据链接:
https://hf-mirror.com/datasets/TIGER-Lab/LongICL_leaderboard_submission
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
--- 许可证:Apache许可证2.0(Apache-2.0) ---
应用场景:
提供机构:
TIGER-Lab
相关数据集
TIGER-Lab/MMLU-Pro
多任务语言理解
语言模型评估
MMLU-Pro数据集是一个更为鲁棒和具有挑战性的大规模多任务理解数据集,旨在更严格地评估大型语言模型的能力。该数据集包含12K个复杂问题,涵盖多个学科。与原始MMLU数据集相比,MMLU-Pro增加了每个问题的选项数量,从4个增加到10个,以提高评估的复杂性和鲁棒性。此外,MMLU-Pro还集成了更多需要推理的问题,使得CoT(Chain-of-Thought)推理的效果比PPL(Perplex
Hugging Face
2026-05-02 更新
122
0
TIGER-Lab/OmniEdit-Filtered-1.2M
图像编辑
机器学习
OmniEdit数据集是一个用于处理七种不同图像编辑任务的通用编辑器。数据集包含源图像和编辑后的图像,以及编辑指令、任务类型、语义一致性评分、感知质量评分和总体评分等信息。数据集通过专家蒸馏合成,并经过VIEScore过滤,包含120万对图像编辑对。
Hugging Face
2024-12-06 更新
29
0
VisPhyWorld-Sub-Generated-Videos
视频生成
物理推理
VisPhyWorld Sub Generated Videos数据集包含为VisPhyBench/VisPhyWorld的sub分割生成的视频,按渲染引擎和模型组织。该数据集旨在用于模型比较、错误分析以及代码驱动或直接视频生成结果的定性检查。数据集内容按渲染引擎(threejs、p5js、video)和模型组织,具体包括三种引擎下的多种模型生成的视频文件。数据集规模在1K到10K之间,适用于物理
Hugging Face
2026-04-22 更新
13
0
TIGER-Lab/MMEB-train
多模态嵌入模型
视觉语言模型
MMEB(大规模多模态嵌入基准)数据集用于训练VLM2Vec模型,涵盖了4个元任务和36个数据集。每个数据集包含查询、查询图像路径、正文本、正图像路径、负文本和负图像路径等特征。数据集主要用于评估多模态嵌入模型的能力,每个数据集包含1000个评估示例,每个示例包含一个查询和一组目标,目标和查询可以是图像和文本的任意组合。
Hugging Face
2025-01-28 更新
58
0
TIGER-Lab/TheoremExplainBench
数学定理解释
自然语言处理
TheoremExplainBench是一个为了评估和提升大型语言模型(LLM)理解和解释数学和科学定理的能力而设计的数据库。该数据库包含240个定理,按照难度和学科领域分类,以支持结构化的基准测试。每个定理都有一个描述,但这个描述不一定完全阐述定理,它主要是为LLM提供上下文帮助区分使用场景。
Hugging Face
2025-03-31 更新
16
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广