遇见数据集

Seenka/banners_canal-america

收藏
Hugging Face2023-07-27 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: image dtype: image - name: label dtype: class_label: names: '0': dudoso '1': none '2': videograph '3': videograph_dudoso '4': zocalo '5': zocalo_dudoso - name: yolo_out list: - name: class dtype: int64 - name: confidence dtype: float64 - name: name dtype: string - name: xmax dtype: float64 - name: xmin dtype: float64 - name: ymax dtype: float64 - name: ymin dtype: float64 - name: cropped_image dtype: image - name: yolo_seenka_out list: - name: class dtype: int64 - name: confidence dtype: float64 - name: name dtype: string - name: xmax dtype: float64 - name: xmin dtype: float64 - name: ymax dtype: float64 - name: ymin dtype: float64 - name: yolo_filter_param dtype: int64 - name: cropped_seenka_image dtype: image - name: ocr_out list: - name: bbox sequence: sequence: float64 - name: confidence dtype: float64 - name: text dtype: string - name: embeddings_cropped sequence: float32 splits: - name: train num_bytes: 45206998.0 num_examples: 193 download_size: 45367438 dataset_size: 45206998.0 --- # Dataset Card for "banners_canal-america" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征: - 名称:image 数据类型:image - 名称:label 数据类型: 类别标签: 类别名称: '0': dudoso '1': none '2': videograph '3': videograph_dudoso '4': zocalo '5': zocalo_dudoso - 名称:yolo_out 列表类型: - 名称:class 数据类型:int64 - 名称:confidence 数据类型:float64 - 名称:name 数据类型:string - 名称:xmax 数据类型:float64 - 名称:xmin 数据类型:float64 - 名称:ymax 数据类型:float64 - 名称:ymin 数据类型:float64 - 名称:cropped_image 数据类型:image - 名称:yolo_seenka_out 列表类型: - 名称:class 数据类型:int64 - 名称:confidence 数据类型:float64 - 名称:name 数据类型:string - 名称:xmax 数据类型:float64 - 名称:xmin 数据类型:float64 - 名称:ymax 数据类型:float64 - 名称:ymin 数据类型:float64 - 名称:yolo_filter_param 数据类型:int64 - 名称:cropped_seenka_image 数据类型:image - 名称:ocr_out 列表类型: - 名称:bbox 嵌套序列:浮点型64位数值序列 - 名称:confidence 数据类型:float64 - 名称:text 数据类型:string - 名称:embeddings_cropped 序列类型:浮点型32位数值序列 数据集划分: - 名称:train 字节数:45206998.0 样本数:193 下载大小:45367438 数据集总大小:45206998.0 --- # 「banners_canal-america」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
Seenka
原始信息汇总

数据集概述

数据集名称

"banners_canal-america"

数据集特征

  • image: 图像数据
  • label: 类别标签,包含以下类别:
    • 0: dudoso
    • 1: none
    • 2: videograph
    • 3: videograph_dudoso
    • 4: zocalo
    • 5: zocalo_dudoso
  • yolo_out: 包含以下子特征:
    • class: int64
    • confidence: float64
    • name: string
    • xmax: float64
    • xmin: float64
    • ymax: float64
    • ymin: float64
  • cropped_image: 图像数据
  • yolo_seenka_out: 包含以下子特征:
    • class: int64
    • confidence: float64
    • name: string
    • xmax: float64
    • xmin: float64
    • ymax: float64
    • ymin: float64
  • yolo_filter_param: int64
  • cropped_seenka_image: 图像数据
  • ocr_out: 包含以下子特征:
    • bbox: 序列,序列类型为float64
    • confidence: float64
    • text: string
  • embeddings_cropped: 序列,类型为float32

数据集分割

  • train: 包含193个样本,数据大小为45206998.0字节

数据集大小

  • 下载大小: 45367438字节
  • 数据集大小: 45206998.0字节
搜集汇总
数据集介绍
构建方式
在拉丁美洲电视广播领域,频道标识与广告横幅的自动识别对于内容监测与合规性分析至关重要。Seenka/banners_canal-america数据集应运而生,其构建过程严谨而系统。该数据集以图像为核心,收集了来自Canal América频道的横幅画面,共计193个训练样本。每张图像均经过多层级标注:首先定义了六类标签体系,涵盖正常横幅、可疑内容及视频图形等类别;其次,通过YOLO目标检测模型输出边界框与置信度,并额外存储了经Seenka定制模型过滤后的检测结果;最后,对裁剪区域执行光学字符识别,提取文本信息,并生成相应的嵌入向量。这种复合式构建策略确保了数据在视觉、语义与空间维度上的丰富性。
特点
该数据集最显著的特征在于其多层次、多模态的标注结构。不同于单一标签的图像分类数据,banners_canal-america为每个样本配备了原始标签、YOLO检测输出、Seenka模型检测输出、OCR结果以及图像嵌入。这种设计使得研究者能够同时进行图像分类、目标检测、文本识别与特征检索等任务。此外,数据集中包含了“dudoso”(可疑)与“videograph”(视频图形)等细粒度类别,精准反映了广播内容中横幅的复杂形态。裁剪图像的保存进一步支持了区域级分析,而浮点型置信度与边界框坐标则为模型评估提供了量化依据。整体而言,该数据集在特定领域内实现了从像素到语义的全面覆盖。
使用方法
使用该数据集时,研究者可直接通过HuggingFace Datasets库加载,利用其内置的features结构快速访问图像、标签与检测结果。对于图像分类任务,可直接使用“label”字段作为监督信号;若需目标检测,则可解析“yolo_out”或“yolo_seenka_out”中的边界框与类别信息。OCR文本字段适用于文本识别或视觉问答场景,而“embeddings_cropped”则便于进行特征比对与聚类分析。建议在训练前对裁剪图像进行标准化预处理,并依据置信度阈值筛选可靠检测结果。该数据集特别适合用于拉丁美洲电视广播场景下的横幅内容审计与自动化监测系统开发。
背景与挑战
背景概述
在拉丁美洲广播电视领域,频道标识与广告横幅的自动识别是媒体监控与内容分析的关键技术环节。Seenka/banners_canal-america数据集由Seenka团队构建,专注于Canal América频道中出现的各类视觉元素分类,包括常规广告(none)、视频图文(videograph)、底栏(zocalo)及其模糊类别(dudoso)。该数据集于近期发布,旨在解决西班牙语媒体环境下横幅检测与分类的标准化问题,其包含193张训练图像,每张图像均提供原始图像、裁剪区域、YOLO检测结果、OCR文本及嵌入向量等多模态标注。作为首个面向智利主要电视频道的专用数据集,它为拉丁美洲媒体分析研究提供了基准资源,推动了小样本场景下多任务视觉理解的发展。
当前挑战
该数据集面临的核心挑战在于类别定义的主观性与模糊性,例如'dudoso'与'videograph_dudoso'等标签依赖人工判定,缺乏客观量化标准,导致标注一致性难以保证。构建过程中,从原始视频流中提取关键帧并精准裁剪横幅区域需要克服复杂背景干扰与动态画面切换的困难,同时YOLO检测与OCR输出的多源异构数据对齐增加了预处理复杂性。此外,仅有193个样本的规模限制了模型泛化能力,尤其在处理不同光照、遮挡或非标准横幅布局时,现有数据难以覆盖真实场景中的多样性,亟需通过数据增强或半监督学习策略缓解样本不足带来的过拟合风险。
常用场景
经典使用场景
在广播电视与数字媒体分析领域,横幅广告(banners)作为频道视觉传播的重要载体,其检测与分类任务对内容监管和广告投放优化具有关键价值。Seenka/banners_canal-america数据集聚焦于美洲运河频道(Canal America)的电视画面横幅,精心标注了包括可疑(dudoso)、无横幅(none)、视频图文(videograph)、可疑视频图文(videograph_dudoso)、底栏(zocalo)及可疑底栏(zocalo_dudoso)在内的六类标签。该数据集的经典使用场景在于训练和评估基于深度学习的横幅目标检测与分类模型,尤其适合结合YOLO等实时检测框架进行细粒度识别,为电视广播中的视觉元素自动化解析提供标准化的训练基准。
衍生相关工作
该数据集的发布已催生一系列相关研究工作,包括但不限于:基于YOLOv8的横幅检测模型优化,通过集成注意力机制提升对微小底栏文本的识别精度;融合OCR与视觉特征的跨模态横幅分类框架,利用预训练语言模型对OCR文本进行语义增强;以及针对可疑类别样本的半监督学习方法,利用伪标签策略扩充训练数据以提升模型泛化能力。此外,部分工作借鉴其多层级标注结构,探索了端到端的横幅检测-识别-理解流水线,将目标检测、文本识别与嵌入检索统一为联合学习任务,为广播电视视觉元素的全链路自动化分析提供了新范式。
数据集最近研究
最新研究方向
在拉美地区媒体内容自动化分析的前沿探索中,Seenka/banners_canal-america数据集聚焦于电视广播画面中横幅与字幕元素的智能识别与分类。该数据集以美州电视台(Canal América)的节目片段为来源,精心标注了六类视觉元素(如zocalo、videograph等),并结合YOLO目标检测与OCR光学字符识别技术,构建了从图像裁剪到文本嵌入的完整处理流水线。当前热点研究方向集中于多模态语义理解——如何将视觉元素的空间布局(如横幅位置)、文本内容(如OCR输出的政治或商业信息)与上下文语义(如节目类型)进行联合建模,以提升对拉美媒体中模糊性标签(如“dudoso”类)的判别精度。这一工作对监测选举宣传、广告合规性以及跨文化媒体分析具有深远的实践意义,为自动化舆情监控与内容审核提供了高质量的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务