Visual Harmful Dataset 11K (VHD11K)|有害内容检测数据集|视觉问答数据集
收藏Visual Harmful Dataset 11K (VHD11K)
概述
- 数据集名称: Visual Harmful Dataset 11K (VHD11K)
- 数据类型: 图像和视频
- 数据量: 10,000张图像和1,000个视频
- 来源: 从互联网爬取和由4个生成模型生成
- 类别数量: 10个有害类别
- 注释框架: 多代理视觉问答(VQA)任务
评估
- 评估结果:
- 注释框架与人类注释高度一致,确保了VHD11K的可靠性。
- 数据集成功识别了现有有害内容检测方法的不足,并提升了有害性识别方法的性能。
- 数据集在有害性识别方法上优于基线数据集SMID。
数据集下载
-
下载链接: VHD11K数据集
-
文件结构:
dataset_10000_10000 |-- croissant-vhd11k.json # VHD11K的元数据 |-- harmful_image_10000_ann.json # VHD11K有害图像的注释文件 |-- harmful_images_10000.zip # 10000张有害图像 |-- harmful_video_1000_ann.json # VHD11K有害视频的注释文件 |-- harmful_videos_1000.zip # 1000个有害视频 |-- ICL_samples.zip # 注释器中使用的上下文学习样本 |-- ICL_images # 上下文学习图像 |-- ICL_videos_frames # 每个上下文学习视频的帧
引用
@misc{yeh2024t2vsmeetvlmsscalable, title={T2Vs Meet VLMs: A Scalable Multimodal Dataset for Visual Harmfulness Recognition}, author={Chen Yeh and You-Ming Chang and Wei-Chen Chiu and Ning Yu}, year={2024}, eprint={2409.19734}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2409.19734}, }

- 1T2Vs Meet VLMs: A Scalable Multimodal Dataset for Visual Harmfulness Recognition国立阳明交通大学 · 2024年
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
RAVDESS
情感语音和歌曲 (RAVDESS) 的Ryerson视听数据库包含7,356个文件 (总大小: 24.8 GB)。该数据库包含24位专业演员 (12位女性,12位男性),以中性的北美口音发声两个词汇匹配的陈述。言语包括平静、快乐、悲伤、愤怒、恐惧、惊讶和厌恶的表情,歌曲则包含平静、快乐、悲伤、愤怒和恐惧的情绪。每个表达都是在两个情绪强度水平 (正常,强烈) 下产生的,另外还有一个中性表达。所有条件都有三种模态格式: 纯音频 (16位,48kHz .wav),音频-视频 (720p H.264,AAC 48kHz,.mp4) 和仅视频 (无声音)。注意,Actor_18没有歌曲文件。
OpenDataLab 收录
红外谱图数据库
收集整理红外谱图实验手册等数据,建成了红外谱图数据库。本数据库收录了常见化合物的红外谱图。主要包括化合物数据和对应的红外谱图数据。其中,原始红外谱图都进行了数字化处理,从而使谱峰检索成为可能。用户可以在数据库中检索指定化合物的谱图,也可以提交谱图/谱峰数据,以检索与之相似的谱图数据,以协助进行谱图鉴定。
国家基础学科公共科学数据中心 收录
CT-ORG
3D CT, 140 Cases, 6 Categories of Organ Segmentation.
github 收录
中国食物成分数据库
食物成分数据比较准确而详细地描述农作物、水产类、畜禽肉类等人类赖以生存的基本食物的品质和营养成分含量。它是一个重要的我国公共卫生数据和营养信息资源,是提供人类基本需求和基本社会保障的先决条件;也是一个国家制定相关法规标准、实施有关营养政策、开展食品贸易和进行营养健康教育的基础,兼具学术、经济、社会等多种价值。 本数据集收录了基于2002年食物成分表的1506条食物的31项营养成分(含胆固醇)数据,657条食物的18种氨基酸数据、441条食物的32种脂肪酸数据、130条食物的碘数据、114条食物的大豆异黄酮数据。
国家人口健康科学数据中心 收录