遇见数据集

dennlinger/klexikon

收藏
Hugging Face2022-10-25 更新2024-03-04 收录
官方服务:

资源简介:

Klexikon数据集是一个德语资源,包含德语维基百科和儿童词典Klexikon之间的文档对齐文本。该数据集旨在联合进行文本简化和摘要任务,包含近2900个对齐的文章对。儿童文章使用的语言比原始维基百科文章更简单,且源(维基百科)和目标(Klexikon)领域之间存在明显的长度差异。数据集的结构包括数据实例、数据字段和数据分割。数据实例表示维基百科文本和Klexikon文本,数据字段包括唯一标识符、标题、URL和文本句子列表。数据集创建过程涉及数据收集、对齐和注释,使用考虑包括社会影响、偏见讨论和其他已知限制。

The Klexikon dataset is a German-language resource consisting of document-aligned text pairs between the German Wikipedia and the children's dictionary Klexikon. This dataset is designed for joint text simplification and summarization tasks, and contains nearly 2,900 aligned article pairs. The language used in the children-focused articles is simpler than that of the original Wikipedia articles, and a notable length difference exists between the source (Wikipedia) and target (Klexikon) domains. The dataset structure covers data instances, data fields, and data splits. Data instances represent Wikipedia texts and Klexikon texts, while the data fields include unique identifiers, titles, URLs, and lists of text sentences. The dataset creation process involves data collection, alignment, and annotation, with considerations including social impact, discussions on bias, and other known limitations.

提供机构:
dennlinger
原始信息汇总

数据集概述

数据集名称

  • 名称: Klexikon
  • 别名: 无

数据集描述

  • 语言: 德语(de-DE)
  • 许可证: CC-BY-SA-4.0
  • 多语言性: 单语
  • 大小: 1K<n<10K
  • 源数据集: 原始数据
  • 任务类别: 摘要生成、文本到文本生成
  • 任务ID: 文本简化
  • 标签: 条件文本生成、简化、文档级

数据集结构

  • 数据实例: 每个实例包含Wikipedia文本(wiki_text)和Klexikon文本(klexikon_text),以及各自的URL(wiki_urlklexikon_url),一个唯一标识符(u_id)和页面标题(title)。
  • 数据字段:
    • u_id: 唯一标识符(整数)
    • title: Klexikon页面标题(字符串)
    • wiki_url: Wikipedia文章URL(字符串)
    • klexikon_url: Klexikon文章URL(字符串)
    • wiki_text: Wikipedia文章句子列表(字符串列表)
    • klexikon_text: Klexikon文章句子列表(字符串列表)
  • 数据分割: 根据Wikipedia和Klexikon文章的长度进行分层分割,训练集2350个样本,验证集274个样本,测试集274个样本。

数据集创建

  • 采集和归一化: 数据从Klexikon和德国Wikipedia收集,通过标题匹配和内容审查进行对齐。
  • 注释过程: 通过手动审查URL进行文章对齐。
  • 注释者: 数据集作者(Dennis Aumiller)。

使用数据注意事项

  • 社会影响: 有助于提高网络文本的可访问性,特别是对弱势读者群体。
  • 偏见讨论: 未测试特定类型的偏见,可能存在由于样本量限制导致的特定内容偏见。
  • 其他已知限制: 由于文章独立编写,不能保证简化文章中的句子与原始文章完全对应。

附加信息

  • 数据集管理员: Dennis Aumiller
  • 许可信息: CC BY-SA 许可
  • 引用信息: 使用数据集或相关代码时,请引用相关论文。
搜集汇总
数据集介绍
dennlinger/klexikon 数据集图片
构建方式
在自然语言处理领域中,文本简化与摘要生成的交叉研究长期受限于高质量双语平行语料的匮乏。Klexikon数据集正是为弥合这一鸿沟而构建的德语资源,其核心在于将德国维基百科的成人化表述与儿童百科“Klexikon”的简化文本进行文档级对齐。数据采集于2021年4月,从Klexikon提取约3145篇文章后,采用半自动方式与维基百科条目匹配:优先通过标题精确对应,对存在歧义的页面则由数据集作者人工审核,确保至少66%的段落内容可对应。最终仅保留预处理后维基文档段落数不少于15篇的对齐对,形成包含近2900对文章的平行语料库。
特点
该数据集最显著的特点在于其兼具文本摘要与简化的双重挑战性。与CNN/DailyMail等常见摘要数据集不同,Klexikon的源文档(维基百科)与目标文档(Klexikon)在篇幅和语言复杂度上存在显著差异,避免了简单截取前几句即可获得高ROUGE分数的位置偏差。同时,Klexikon文章专为8至13岁儿童设计,语言经过同行评审,呈现出更低的词汇难度和更简洁的句式结构。数据集还提供了基于句子数的分层划分策略,确保训练集、验证集和测试集在文档长度分布上保持均衡,从而支持更可靠的模型评估。
使用方法
该数据集主要面向文本摘要与简化两大任务,支持使用序列到序列模型进行端到端训练。每个数据样本以句子列表形式存储维基百科原文与Klexikon简化文本,并附带唯一标识符、页面标题及来源URL。用户可直接加载预分割的句子序列,无需额外分词处理。评估时可采用ROUGE指标衡量内容保留度,并结合Flesch可读性分数评估简化效果;但需注意,由于缺乏句子级对齐,SARI等需对齐的简化指标不适用。数据集已集成至HuggingFace Datasets库,可通过简单API调用,便于快速开展德语文本简化与摘要生成的研究实验。
背景与挑战
背景概述
Klexikon数据集由德国海德堡大学的研究人员Dennis Aumiller和Michael Gertz于2022年创建,旨在弥合文本摘要与文本简化两大自然语言处理任务之间的鸿沟。该数据集聚焦于德语领域,收录了约2900对文档级对齐的文章,分别来自德国维基百科和面向儿童的在线百科全书Klexikon。其核心研究问题在于探索端到端简化系统对长文本输入的可行性,为语言障碍群体(如儿童、语言学习者及阅读困难者)提供可访问的信息资源。Klexikon的发布填补了非英语语言在文档级简化与摘要联合任务上的数据空白,推动了多语言文本简化研究的发展,并在计算语言学领域产生了重要影响。
当前挑战
Klexikon数据集所面临的挑战体现在多个层面。在领域问题层面,现有文本简化数据集多聚焦于句子级对齐或英文语料,而Klexikon需解决德语文档级简化与摘要的联合任务,其源文与目标文在长度和词汇复杂度上存在显著差异,传统ROUGE等评估指标难以准确衡量简化质量。在构建过程中,挑战尤为突出:首先,文章对齐需依赖半自动方法,对于标题不匹配或存在歧义的页面,需人工审核以确保至少66%的段落内容一致;其次,数据清洗需排除列表、图注等非段落内容,并处理维基百科与Klexikon独立撰写导致的信息覆盖不完全问题;此外,数据集规模有限(约2900对),可能引入对特定文章类型的偏好,影响模型的泛化能力。
常用场景
经典使用场景
Klexikon数据集作为德语文本简化与摘要联合学习的标杆资源,其经典使用场景聚焦于文档级别的条件文本生成任务。研究人员利用该数据集中维基百科原文与儿童百科全书Klexikon简化版本的对齐语料,训练模型在压缩文本长度的同时实现词汇与句法层面的可读性提升。相较于CNN/DailyMail等存在位置偏置的摘要数据集,Klexikon要求模型摆脱对首句摘录的依赖,转而执行更具挑战性的内容重构与语义凝练,从而推动生成式模型在复杂文本简化领域的纵深发展。
实际应用
在实际应用中,Klexikon驱动的简化模型可部署于儿童数字阅读平台、德语作为外语(DaF)教学系统及认知障碍辅助工具中,通过将复杂百科条目转化为适龄化表述,降低信息获取的认知门槛。例如,面向8至13岁儿童的教育门户可借助该数据集训练的模型,实时生成符合Flesch可读性标准的科普内容。此外,该资源还可服务于跨语言信息检索场景,为德语母语与非母语用户提供语义等价的轻量化知识呈现。
衍生相关工作
Klexikon的发布催生了多项后续研究,包括基于多任务学习的摘要-简化联合框架、融合可读性指标的强化学习优化策略,以及针对德语特性的形态句法感知解码方法。部分工作进一步扩展了语料覆盖范围,如构建德语维基百科与简易维基百科的跨领域对齐数据集,或探索结合外部常识知识库的神经简化模型。这些衍生工作共同推动了非英语文本简化评测体系从ROUGE等表面指标向语义保真度与可读性均衡评估的范式转向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务