登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
EAR Benchmark
EAR Benchmark
收藏
Figshare
2025-06-20 更新
2026-04-08 收录
实体消歧
视觉语言模型
数据链接:
https://figshare.com/articles/dataset/EAR_Benchmark/29368739/1
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
EARBench: Evaluating the Entity Ambiguity Resolution Ability of LLMs
应用场景:
提供机构:
Chen
创建时间:
2025-06-20
相关数据集
ViPlan
视觉语言模型
机器人规划
ViPlan是一个用于评估视觉规划任务中视觉语言模型(VLMs)的开源基准。该数据集包含两个领域的一系列具有挑战性的任务:一个是经典Blocksworld规划问题的视觉变体,另一个是模拟的家庭机器人环境。ViPlan旨在评估不同大小和类型的VLMs,以及它们在视觉规划任务中的表现。该数据集旨在帮助研究人员更好地理解VLMs在视觉规划任务中的能力和局限性,并为未来的研究提供参考。
arXiv
2025-05-19 更新
40
0
VLKEB Dataset
视觉语言模型
知识编辑
A Large Vision-Language Model Knowledge Editing Benchmark
kaggle
2024-06-05 更新
10
0
CaptionEmporium/midjourney-niji-1m-llavanext
视觉语言模型
图像合成
midjourney-niji-1m-llavanext数据集包含2,079,886条合成描述,对应1,039,943张图片,这些图片来自midjourney-v6-520k-raw和nijijourney-v6-520k-raw数据集。描述是通过LLaVA-NeXt模型生成的,并经过清理和缩短处理。数据集主要用于文本到图像和图像到文本的任务,所有图片及其元数据以MozJPEG编码的JPEG格式存
Hugging Face
2024-08-21 更新
7
0
open-llm-leaderboard/details_allknowingroger__StrangeMonarch-7B-slerp
视觉语言模型
模型评估
该数据集是在评估模型allknowingroger/StrangeMonarch-7B-slerp时自动创建的,包含63个配置,每个配置对应一个评估任务。数据集由一次运行创建,每个运行以时间戳命名的特定分割存在。此外,还有一个名为"results"的配置,存储所有运行的聚合结果,用于计算和显示在Open LLM Leaderboard上的聚合指标。
Hugging Face
2024-04-11 更新
11
0
CIVET
视觉语言模型
模型评估
CIVET是一个用于系统评估视觉语言模型(VLMs)理解能力的框架。该框架通过生成可控的视觉场景和自然语言输入,对VLMs的理解能力进行系统性的研究。CIVET旨在解决当前VLMs在理解和识别物体属性和关系方面的局限性,并提供一个标准化的评估工具,以帮助研究人员更准确地评估VLMs的性能。
arXiv
2025-06-05 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广