登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Sterzhang/aitw_image
Sterzhang/aitw_image
收藏
Hugging Face
2025-07-04 更新
2025-10-25 收录
数据链接:
https://hf-mirror.com/datasets/Sterzhang/aitw_image
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
应用场景:
提供机构:
Sterzhang
相关数据集
Sterzhang/image-textualization
图像描述
多模态理解
Image-Textualization数据集包含220K个图像-文本对,旨在促进大规模多模态语言模型的研究和开发,特别是在图像描述、视觉问答和多模态理解等任务中。数据集格式为JSONL,包含图像文件路径、图像对应的文本描述以及描述图像的问题。数据来源包括COCO train2017、SA-1B和VG。该数据集展示了在对象密集的图像数据集中获取高质量描述的出色可扩展性。
Hugging Face
2024-06-29 更新
89
0
Sterzhang/PVIT-3M
视觉指令调优
多模态学习
PVIT-3M数据集是一个专门为个性化视觉指令调优任务设计的数据集,包含300万对图像-文本对。该数据集旨在提升多模态大语言模型(MLLMs)在个性化视觉输入下的响应生成能力,使其更贴合个体用户的需求和偏好。数据集中的图像被组织在40个独立的文件夹中,每个文件夹包含不同类型的图像数据。JSON文件结构详细记录了每个对话实例的图像路径和对话内容。
Hugging Face
2024-11-02 更新
14
0
Sterzhang/vlm2-bench
视觉语言模型
视觉匹配线索
VLM2-Bench是一个全面的基准测试,用于评估视觉语言模型(VLMs)在多图像序列和视频中对匹配视觉线索的链接能力。该基准测试包含9个子任务,超过3000个测试案例,旨在评估人类日常生活中使用的视觉链接基本能力,如在不同照片中识别同一个人而无需事先知道其身份。数据集分为三个主要类别:通用线索、以对象为中心的线索和以人物为中心的线索。
Hugging Face
2025-10-26 更新
16
0
Sterzhang/spacenum-train
--- license: apache-2.0 ---
Hugging Face
2026-05-27 更新
1
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广