遇见数据集

community-datasets/gnad10

收藏
Hugging Face2024-06-24 更新2024-06-15 收录
官方服务:

资源简介:

10k German News Articles Datasets数据集包含10273篇来自奥地利在线报纸DER Standard的德语新闻文章。每篇文章由专业的论坛版主分类为9个类别之一。该数据集是从One Million Posts Corpus扩展而来,旨在支持德语主题分类任务。数据集分为训练集(9245篇文章)和测试集(1028篇文章)。数据集的创建是为了解决英语文本分类模型在德语文本上效果不佳的问题,因为德语的语法结构更为复杂。数据集的结构包括两个字段:text(包含文章标题和内容)和label(9个可能的主题类别之一)。

The 10k German News Article Dataset consists of 10273 German language news articles from the online Austrian newspaper website DER Standard. Each news article has been classified into one of 9 categories by professional forum moderators employed by the newspaper. This dataset is extended from the original One Million Posts Corpus. The dataset was created to support topic classification in German because a classifier effective on an English dataset may not be as effective on a German dataset due to higher inflections and longer compound words. The dataset is split into a training set consisting of 9245 articles and a test set consisting of 1028 articles. The dataset structure includes two fields: text (containing the title and content of the article) and label (one of 9 possible topic categories).

提供机构:
community-datasets
原始信息汇总

10k German News Articles Datasets 数据集概述

数据集描述

数据集摘要

10k German News Article Dataset 包含 10273 篇来自奥地利在线报纸网站 DER Standard 的德语新闻文章。每篇文章由专业论坛版主分类为 9 个类别之一。该数据集是从 One Million Posts Corpus 扩展而来,旨在支持德语主题分类,因为针对英语数据集训练的分类器可能不适用于德语数据集。

支持的任务和排行榜

该数据集可用于训练模型(如 BERT)进行德语新闻文章的主题分类,共有 9 个可能的类别。

语言

数据集中的文本为德语,来自奥地利在线报纸网站,德语的 BCP-47 代码为 de-DE

数据集结构

数据实例

一个数据实例包含一篇德语新闻文章(标题和内容拼接)及其对应的主题类别。

json { "text": "Die Gewerkschaft GPA-djp lanciert den All-in-Rechner und findet, dass die Vertragsform auf die Führungsebene beschränkt gehört. Wien – Die Gewerkschaft GPA-djp sieht Handlungsbedarf bei sogenannten All-in-Verträgen.", "label": "Wirtschaft" }

数据字段

  • text: 包含文章的标题和内容。
  • label: 可以是 9 个可能的主题类别之一(Web, Panorama, International, Wirtschaft, Sport, Inland, Etat, Wissenschaft, Kultur)。

数据分割

数据分为训练集(包含 9245 篇文章)和测试集(包含 1028 篇文章)。

数据集创建

策划理由

该数据集旨在支持德语主题分类。英语文本分类数据集较为常见(如 AG News20 Newsgroup),但德语数据集较少。由于语法差异,针对英语数据集训练的分类器可能不适用于德语文本。因此,需要一个德语数据集来有效评估模型性能。

源数据

初始数据收集和规范化

10k German News Article Dataset 是从 One Million Posts Corpus 扩展而来。从该大型语料库中收集了 10273 篇德语新闻文章。在 One Million Posts Corpus 中,每篇文章都有一个主题路径,如 Newsroom/Wirtschaft/Wirtschaftpolitik/Finanzmaerkte/Griechenlandkrise。10kGNAD 使用主题路径的第二部分作为主题标签。文章标题和内容拼接成一个文本,并移除作者姓名,以避免基于频繁撰写特定主题的作者进行关键词分类。

源语言生产者

语言生产者是奥地利报纸网站 DER Standard 的作者。

注释

注释过程

[更多信息需补充]

注释者

[更多信息需补充]

个人和敏感信息

[更多信息需补充]

使用数据的注意事项

数据集的社会影响

[更多信息需补充]

偏见讨论

[更多信息需补充]

其他已知限制

[更多信息需补充]

附加信息

数据集策展人

该数据集由 Timo Block 策展。

许可信息

该数据集根据 Creative Commons Attribution-NonCommercial-ShareAlike 4.0 许可证授权。

引用信息

如果您使用该数据集,请考虑引用 "One Million Post Corpus" 的作者: bibtex @InProceedings{Schabus2017, Author = {Dietmar Schabus and Marcin Skowron and Martin Trapp}, Title = {One Million Posts: A Data Set of German Online Discussions}, Booktitle = {Proceedings of the 40th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR)}, Pages = {1241--1244}, Year = {2017}, Address = {Tokyo, Japan}, Doi = {10.1145/3077136.3080711}, Month = aug }

贡献

感谢 @stevhliu 添加此数据集。

搜集汇总
数据集介绍
community-datasets/gnad10 数据集图片
构建方式
在自然语言处理领域,针对德语文本的主题分类任务长期面临数据集匮乏的挑战,而英语数据集训练的模型因德语词形变化复杂、复合词冗长等特性往往表现不佳。为此,10k German News Articles Dataset(简称10kGNAD)应运而生。该数据集源自奥地利在线报纸DER Standard的百万帖子语料库(One Million Posts Corpus),从中精选出10,273篇德语新闻文章。构建过程中,研究者提取了原始语料中文章主题路径的第二层级作为类别标签,并将标题与正文拼接为单一文本字段,同时移除作者姓名以避免因作者写作偏好导致的分类偏差。最终形成涵盖9个类别(如Web、国际、经济、体育等)的标注数据集,其中训练集包含9,245篇,测试集包含1,028篇,确保数据划分的科学性与评估的可靠性。
特点
10kGNAD数据集的核心特点在于其针对德语新闻文本的精细主题分类设计。所有文章均由报社专业论坛版主人工标注,确保了标签的权威性与一致性。类别体系涵盖Web、全景、国际、经济、体育、国内、版面、科学、文化等维度,既反映了新闻内容的多样性,又保持了类目间的语义区分度。数据集以单语言德语呈现,其文本来源具有鲜明的地域特征——奥地利德语表达,为德语区域变体的自然语言处理研究提供了独特资源。此外,数据集规模适中(10K级),既避免了小样本导致的过拟合风险,又降低了计算资源门槛,适合作为德语主题分类任务的基准测试平台。
使用方法
该数据集在Hugging Face平台以community-datasets/gnad10标识符发布,可通过datasets库便捷加载。用户只需执行load_dataset('community-datasets/gnad10')即可获取预划分的训练集与测试集。每条数据包含'text'(新闻标题与正文拼接文本)和'label'(对应类别索引)两个字段,可直接用于训练深度学习模型(如BERT)进行文本分类。研究者可基于9个预设类别构建分类器,评估模型在德语新闻主题识别上的性能。数据集采用CC BY-NC-SA 4.0许可协议,允许非商业用途的分享与改编,但需注明原始出处。建议引用时同时提及百万帖子语料库的原始论文,以尊重学术贡献。
背景与挑战
背景概述
在自然语言处理领域,文本分类任务长期以英文数据集为主导,如AG News和20 Newsgroup,这导致针对其他语言,尤其是形态变化丰富的德语,相关资源匮乏。德语因其高屈折变化和长复合词结构,使得基于英文训练的模型在该语言上表现欠佳,亟需专门的数据集以推动德语文本分类研究。为此,Timo Block等人于2017年基于奥地利《标准报》的“一百万帖子语料库”创建了10k德国新闻文章数据集(10kGNAD),该数据集包含10273篇德语新闻文章,由报社专业论坛版主标注为9个主题类别。该数据集发布于GitHub和HuggingFace平台,旨在为德语主题分类提供标准化基准,填补了非英语文本分类资源的空白,对多语言自然语言处理研究具有重要推动作用。
当前挑战
该数据集所解决的领域问题在于,德语文本分类任务因语言特性(如复合词和词形变化)而面临独特挑战,通用模型难以直接迁移,因此需要专门数据集以开发更鲁棒的分类器。在构建过程中,主要挑战包括:首先,从原始“一百万帖子语料库”中筛选出10273篇新闻文章时,需确保类别均衡且避免主题偏差,同时处理长尾类别;其次,为减少对作者姓名的关键词分类偏倚,人工移除了作者信息并拼接标题与正文,这增加了数据清洗的复杂性;此外,标注工作依赖论坛版主的专业判断,但标注一致性未明确验证,可能引入主观误差;最后,数据集规模较小(训练集仅9245篇),限制了深度模型的泛化能力,且仅覆盖单一奥地利媒体来源,存在领域和地域偏差风险。
常用场景
经典使用场景
在自然语言处理领域,德语主题分类任务长期面临标注数据匮乏的困境,而英语数据集如AG News等虽应用广泛,却难以直接迁移至形态更为复杂的德语文本。该数据集应运而生,作为德语新闻主题分类的基准测试集,涵盖Web、Panorama、International等九个细粒度类别,为研究者提供了标准化的训练与评估平台。其经典使用场景在于构建和验证基于深度学习的分类模型,如BERT、XLM-R等跨语言预训练模型,通过该数据集的监督信号,有效衡量模型在德语语境下对语义层次和语篇结构的理解能力。
实际应用
在实际应用中,该数据集为德语地区的新闻聚合平台、舆情监控系统及智能推荐算法提供了关键支撑。例如,新闻门户网站可利用基于该数据集训练的模型,自动将海量报道归类至体育、经济或文化等栏目,提升内容分发效率。企业舆情分析系统亦能借助该分类能力,从德语社交媒体与新闻源中精准提取特定主题信息,辅助品牌监测与市场洞察。此外,该数据集还可用于构建德语智能问答系统的主题过滤模块,确保检索结果与用户意图高度相关。
衍生相关工作
该数据集衍生了一系列德语自然语言处理的经典工作,如基于其构建的德语BERT模型微调基线,以及针对德语复合词分割的改进型分词器研究。研究者还将其作为多任务学习中的辅助数据集,与情感分析、命名实体识别等任务联合训练,验证了共享表示对德语语义理解的提升效果。此外,该数据集被用于德英跨语言知识迁移的对比实验,揭示了语种特异性特征在分类任务中的重要性,为后续德语低资源场景下的少样本学习研究奠定了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务