面向不良视听内容的样本库与知识库
收藏国家基础学科公共科学数据中心2026-01-30 收录
官方服务:
资源简介:
面向不良视听内容的样本库与知识库为不良视听内容识别任务的支撑资源,涵盖网络平台中传播的违规视听内容,通过对视频、图像、文本、语音等多模态数据的采集、清洗与分类标注后,加工形成可支持不良内容检测的高质量资源。该样本库与知识库包含视频、图像、文本、语音4种模态的特征文件,都以txt文件格式存储:视频video模态下有CNN、帧内纹理、关键帧平均法3类,图像image模态下有颜色直方图、Canny算子、Sobel算子3类,文本text模态下有TF-IDF、Word2Vec词向量、BERT句子向量3类,语音audio模态下有MFCC梅尔频谱图、过零率3类,数据量约8GB。
提供机构:
国家广播电视总局广播电视科学研究院搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集面向不良视听内容识别任务,汇集了网络平台中的违规视听内容,通过对视频、图像、文本、语音四种模态进行采集、清洗与分类标注,形成高质量资源。数据以txt格式存储各模态特征文件(如CNN、颜色直方图、TF-IDF、MFCC等),总量约8GB。
以上内容由遇见数据集搜集并总结生成



