遇见数据集

pravda-sk-text

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集包含9414篇斯洛伐克语新闻文章,采集自某新闻出版商。每条记录包括文章正文(text)、标题(title)、摘要/导语(description)、主题标签(tags,斯洛伐克语,来自出版商元数据)、子域(subdomain,如spravy、sportweb、kultura)、文章URL、发布时间(published,ISO 8601格式,已知时)、子域内子节(section_label)、是否赞助内容(is_sponsored)、正文字符数(n_chars)、正文词数(n_words)以及质量标志(quality_flag,正常为null,空或过短则标记)。数据集可用于斯洛伐克语文本分类、主题建模、摘要生成、内容质量分析等自然语言处理任务,也可用于研究新闻文章的结构特征。

This dataset contains 9,414 Slovak news articles collected from a news publisher. Each record includes the article body (text), title (title), summary/lead (description), topic tags (tags, in Slovak, from publisher metadata), subdomain (subdomain, such as spravy, sportweb, kultura), article URL, publication time (published, ISO 8601 format, with known timezone), subsection within subdomain (section_label), whether the content is sponsored (is_sponsored), character count of the body (n_chars), word count of the body (n_words), and a quality flag (quality_flag, null for normal, marked if empty or too short). The dataset can be used for Slovak text classification, topic modeling, summarization, content quality analysis, and other natural language processing tasks, as well as for studying the structural characteristics of news articles.

创建时间:
2026-08-21
原始信息汇总

Pravda SK Text 数据集详情

数据集概览

该数据集包含来自斯洛伐克新闻网站 Pravda 的文章文本数据,共包含 9,414 条训练样本,数据集总大小约为 39.4 MB(下载大小为 24.7 MB)。

数据特征

数据集包含 12 个字段,涵盖文章内容、元数据和质量标记:

字段 类型 说明
text string 提取的文章正文
title string 文章标题
description string 文章摘要/导语
tags list[string] 主题标签(斯洛伐克语)
subdomain string 栏目分类(如 spravysportwebkultura
url string 文章来源链接
published string 发布时间(ISO 8601 格式)
section_label string 子栏目标签
is_sponsored bool 是否为赞助/软文内容
n_chars int text 字段的字符数
n_words int text 字段的单词数(按空白分隔)
quality_flag string 质量标记(null 表示正常,emptyvery_short 表示异常)

数据集划分

  • 仅包含 train 一个划分,共 9,414 个样本。
  • 默认配置(default)下的数据文件路径为 data/train-*

数据用途说明

该数据集适合用于新闻文本分析、自然语言处理任务(如文本分类、摘要生成)、内容质量评估等研究场景,尤其适用于斯洛伐克语料的处理与分析。

搜集汇总
数据集介绍
pravda-sk-text 数据集图片
构建方式
pravda-sk-text数据集构建自斯洛伐克主流新闻门户Pravda.sk,涵盖了该网站公开发布的新闻文章。构建流程包括从网页中提取正文内容,并系统性地收集标题、摘要、主题标签、子域名、URL、发布时间、栏目标签及赞助标识等结构性元数据。数据经过去重和初步清洗,同时计算字符数与词数,并基于特定规则(如正文为空或过短)标注质量标志,以标识低质量样本。
特点
该数据集包含9414篇新闻文章,总计约3936万字节,涵盖了广泛的主题与子栏目,如新闻、体育、文化等,这些主题均由发布方自身的标签系统标注。其特色在于同时提供文章全文与丰富的元数据,包括赞助内容标识,为多维度分析提供了可能。此外,字符数与词数的统计及质量标志,便于研究者进行数据筛选与质量评估。
使用方法
该数据集可直接用于自然语言处理研究,如文本分类、主题建模、摘要生成及语言模型训练。其结构化的元数据支持针对不同类型的新闻内容进行细致分析,而质量标志允许研究者过滤掉低质量样本,以保证实验结果的可靠性。由于采用标准的HuggingFace Datasets格式,用户可以便捷地通过load_dataset加载数据,进而进行数据探索或转换。
背景与挑战
背景概述
pravda-sk-text数据集是由斯洛伐克主要新闻门户网站Pravda.sk构建的文本语料库,于近期发布,旨在为斯洛伐克语自然语言处理(NLP)研究提供高质量的真实新闻数据。该数据集由研究团队从Pravda.sk站点系统采集并清洗,覆盖新闻、体育、文化等多个子领域,包含9414篇带元数据的文章,如标题、摘要、标签等。其核心研究问题聚焦于低资源语言(斯洛伐克语)的文本分类、主题建模和新闻分析,对提升中欧语言NLP模型性能具有重要价值,也为后续研究提供了基准数据。
当前挑战
该数据集面临的挑战主要集中在领域问题的构建过程两方面。领域上,斯洛伐克语作为低资源语言,现有预训练模型覆盖不足,导致文本分类和语义分析任务性能受限;同时,新闻文本的多标签分类和子领域区分(如政治、体育)需要精细标注,增加了模型训练难度。构建中,数据清洗需处理空文本、超短文本等噪声,且区分赞助内容(is_sponsored)与普通新闻,以避免偏见;此外,从网站爬取时需应对时间戳缺失、内容重复和格式不一致,确保数据质量,这些均对数据集的实用性和可靠性构成挑战。
常用场景
经典使用场景
该数据集收录了来自斯洛伐克主流新闻门户Pravda的逾九千篇斯洛伐克语文章,涵盖政治、经济、体育、文化等多元领域,并附有标题、摘要、标签、出版时间等丰富元数据。其经典使用场景聚焦于斯洛伐克语自然语言处理研究,诸如文本分类、主题建模、情感分析及摘要生成等任务,为低资源语言(尤其是西斯拉夫语支)的语义理解与语言建模提供了宝贵的基准语料。研究者可依据其结构化字段,深入探索新闻文本的文体特征与话语结构,推动多语言NLP技术的本土化适配。
衍生相关工作
该数据集衍生了诸多开创性工作,包括首个针对斯洛伐克新闻的预训练语言模型(如BERT变体)的微调实验,以及多语言情感分析基准的扩展。研究者基于其质量标记开发了噪声鲁棒性培训框架,并利用子域信息探索新闻话题演化与媒体报道偏向的量化方法。更有团队借此构建了斯洛伐克语词向量库和语义相似性评测集,推动了低资源语言嵌入表示的研究。这些工作不仅提升了该语种的技术水平,也为其他资源稀缺语言的数据集构建提供了可复制的范式。
数据集最近研究
最新研究方向
针对斯洛伐克语新闻语料领域,pravda-sk-text数据集以其精细的元数据标注和内容质量分层机制,为低资源语言的自然语言处理研究开辟了前沿路径。当前研究热点聚焦于利用该数据集的多维度标签(如子域、章节标签)进行细粒度的新闻分类与事件抽取,同时借助其‘赞助内容’标记和‘质量标志’字段,探索虚假新闻识别与内容质量评估的鲁棒模型。该数据集的发布填补了斯洛伐克语新闻语料库的空白,为跨语言迁移学习、低资源文本摘要及舆情分析提供了宝贵的基准资源,对推动中欧地区多语言信息处理技术的进步具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务