遇见数据集

pravda-sk-images

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集包含来自斯洛伐克新闻文章的图像及其相关文本信息。共14792个训练样本,每个样本包含图像、标题、标题来源、文章标签、子域、文章URL、文章标题、发布时间、章节标签、是否赞助标记以及图像来源。标题来源分为三类:alt(图像自身的alt文本,最具体)、article_description(文章摘要,用于英雄图像)、none(无标题)。数据集可用于图像描述生成、多模态检索、新闻分析等任务。数据集中约96%的行包含标题,赞助内容被标记并保留。

This dataset contains images from Slovak news articles along with their associated text information. There are 14,792 training samples, each containing an image, caption, caption source, article tag, subdomain, article URL, article title, publication time, section tag, sponsored flag, and image source. The caption sources are divided into three categories: alt (the images own alt text, most specific), article_description (article summary, used for hero images), and none (no caption). The dataset can be used for tasks such as image caption generation, multimodal retrieval, and news analysis. Approximately 96% of the rows in the dataset contain captions, and sponsored content is marked and retained.

创建时间:
2026-08-21
原始信息汇总

数据集概述:pravda-sk-images

基本信息

  • 数据集名称:pravda-sk-images
  • 数据集规模:训练集包含 14,792 个样本,总大小约 4.14 GB(下载大小约 6.39 GB
  • 单一配置:默认配置(default),仅包含 train 数据划分

数据字段说明

字段 类型 描述
image Image 嵌入的图像本身,无需外部获取
caption string 图像说明文字;若无则可能为 null
caption_source string 说明文字来源:altarticle_descriptionnone
tags list[string] 文章级主题标签(斯洛伐克语),来自发布者元数据
subdomain string 文章所属栏目(如 spravysportweb
article_url string 源文章链接
article_title string 文章标题
published string 发布时间戳(ISO 8601 格式,部分数据可能缺失)
section_label string 子栏目名称(位于 subdomain 之下)
is_sponsored bool 是否赞助/软文内容
image_source string 图像来源:inline(正文内)或 meta(文章社交分享主图)

说明文字来源(重要筛选依据)

说明文字来自两个不同渠道,通过 caption_source 字段区分:

  • alt:图像自身的替代文本,最具体,直接描述该图片内容
  • article_description:文章摘要/描述元数据,用于没有独立替代文本的主图;描述的是文章,虽主题相关但不一定是图像的逐字描述
  • none:无说明文字,该行仍保留,供使用者自行决定处理方式

补充说明:约 96% 的行含有说明文字;若需要严格的“图像-说明”对齐,建议筛选 caption_source == "alt" 的数据。

赞助内容说明

软文/特约文章(发布于 /inzercia/ 目录下)包含在数据集中,并通过 is_sponsored 字段进行标记。

搜集汇总
数据集介绍
pravda-sk-images 数据集图片
构建方式
该数据集源于斯洛伐克主流新闻媒体Pravda的公开内容,通过系统化抓取与结构化整理构建而成。构建过程从文章正文内嵌图像及社交媒体分享首图两条路径采集视觉素材,同步提取图像对应的替代文本、文章摘要描述或标记为无标题三类来源信息,并整合文章标题、发布时点、所属栏目、主题标签及广告标识等元数据,最终以训练集形式发布,共计14792个样本,涵盖多个新闻子领域。
特点
数据集以多模态新闻图像为核心,嵌入了完整的图像数据而无需外部获取,每张图像配有标题、来源类型、文章级主题标签、子域归属、原始链接、文章标题、发布时间、栏目标签、赞助内容标识及图像来源路径等信息。约96%的样本配有标题,其中替代文本来源的标题最具图像特异性,文章摘要来源的标题则与主题相关但不一定直接描述图像。赞助类文章被保留并通过布尔字段加以区分。
使用方法
研究者可依据caption_source字段筛选严格图文对齐的样本,选择alt来源获取图像的直接描述,或使用article_description来源进行主题级关联分析。借助is_sponsored字段可排除或单独分析广告内容,利用tags、subdomain及section_label等字段可实现领域分层与细粒度分类。图像列已内嵌数据,可直接加载用于多模态模型训练、图文检索或新闻视觉内容分析。
背景与挑战
背景概述
随着多模态学习在视觉-语言任务中的广泛应用,面向特定语言和文化背景的图像-文本数据集成为推动跨语言视觉理解的关键资源。pravda-sk-images数据集由研究者于近年构建,旨在为斯洛伐克语提供大规模、高质量的新闻图像-文本对,数据源自斯洛伐克主流新闻门户Pravda.sk。该数据集涵盖约1.48万张图像,每张图像配有标题、标签、所属栏目、发布时间及是否为赞助内容等丰富元数据,核心研究问题在于如何利用新闻语境的弱监督信号提升斯洛伐克语多模态模型的图像描述与检索能力。其发布填补了低资源语言在视觉-语言领域的数据空白,对促进多语言多模态研究具有重要影响力。
当前挑战
该数据集所应对的领域问题在于低资源语言环境下图像-文本对齐的稀缺性与噪声性,具体表现为斯洛伐克语缺乏大规模人工标注的图像描述语料,且新闻图像的标题来源多样(alt文本、文章描述或无标题),导致图文语义对齐程度参差不齐。构建过程中,研究者需从新闻网站中系统抽取图像及其元数据,并解决标题来源异质性、赞助内容混入、图像与文章主题部分相关等挑战,同时保留无标题样本以维持数据完整性,这要求使用者在训练模型时谨慎设计过滤策略与噪声鲁棒机制,以确保多模态表示学习的有效性。
常用场景
经典使用场景
在跨模态表征学习领域,pravda-sk-images数据集为图像与斯洛伐克语文本的联合建模提供了典型的训练资源。其经典使用场景在于图文匹配与跨语言检索任务,研究者利用图像及其对应的alt文本或文章描述构建正负样本对,训练模型学习视觉与斯洛伐克语语义的共享嵌入空间。该数据集包含约1.5万张新闻图像,覆盖新闻、体育等子领域,并保留了图注来源、标签和是否赞助内容等元数据,支持细粒度的多模态预训练与评估。
实际应用
在新闻媒体与内容审核等实际场景中,pravda-sk-images可用于自动生成图像描述、增强文章检索与推荐系统的多模态理解能力,以及识别赞助内容中的图像使用模式。斯洛伐克语新闻机构可借助该数据集训练本地化的图文摘要模型,提升视障用户的无障碍阅读体验,同时为跨语言新闻聚合平台提供图像-文本对齐的技术支撑。
衍生相关工作
基于pravda-sk-images,已有研究衍生出面向斯洛伐克语的CLIP风格对比学习模型、多模态新闻分类器以及图文检索基准。该数据集亦被用于评估多语言视觉-语言模型在低资源语言上的零样本迁移性能,并启发了对新闻图像中赞助内容检测与偏差分析的相关工作,推动了中东欧语言多模态资源建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务