遇见数据集

deepset/germandpr

收藏
Hugging Face2023-04-06 更新2024-03-04 收录
官方服务:

资源简介:

--- language: - de multilinguality: - monolingual source_datasets: - original task_categories: - question-answering - text-retrieval task_ids: - extractive-qa - closed-domain-qa thumbnail: >- https://thumb.tildacdn.com/tild3433-3637-4830-a533-353833613061/-/resize/720x/-/format/webp/germanquad.jpg license: cc-by-4.0 --- ![bert_image](https://thumb.tildacdn.com/tild3433-3637-4830-a533-353833613061/-/resize/720x/-/format/webp/germanquad.jpg) # Dataset Card for germandpr ## Table of Contents - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-instances) - [Data Splits](#data-instances) - [Additional Information](#additional-information) - [Dataset Curators](#dataset-curators) - [Citation Information](#citation-information) ## Dataset Description - **Homepage:** https://deepset.ai/germanquad - **Repository:** https://github.com/deepset-ai/haystack - **Paper:** https://arxiv.org/abs/2104.12741 ### Dataset Summary We take GermanQuAD as a starting point and add hard negatives from a dump of the full German Wikipedia following the approach of the DPR authors (Karpukhin et al., 2020). The format of the dataset also resembles the one of DPR. GermanDPR comprises 9275 question/answerpairs in the training set and 1025 pairs in the test set. For eachpair, there are one positive context and three hard negative contexts. ### Supported Tasks and Leaderboards - `open-domain-qa`, `text-retrieval`: This dataset is intended to be used for `open-domain-qa` and text retrieval tasks. ### Languages The sentences in the dataset are in German (de). ## Dataset Structure ### Data Instances A sample from the training set is provided below: ``` { "question": "Wie viele christlichen Menschen in Deutschland glauben an einen Gott?", "answers": [ "75 % der befragten Katholiken sowie 67 % der Protestanten glaubten an einen Gott (2005: 85 % und 79 %)" ], "positive_ctxs": [ { "title": "Gott", "text": "Gott\ === Demografie === Eine Zusammenfassung von Umfrageergebnissen aus verschiedenen Staaten ergab im Jahr 2007, dass es weltweit zwischen 505 und 749 Millionen Atheisten und Agnostiker gibt. Laut der Encyclopædia Britannica gab es 2009 weltweit 640 Mio. Nichtreligiöse und Agnostiker (9,4 %), und weitere 139 Mio. Atheisten (2,0 %), hauptsächlich in der Volksrepublik China.\\\\\\\\ Bei einer Eurobarometer-Umfrage im Jahr 2005 wurde festgestellt, dass 52 % der damaligen EU-Bevölkerung glaubt, dass es einen Gott gibt. Eine vagere Frage nach dem Glauben an „eine andere spirituelle Kraft oder Lebenskraft“ wurde von weiteren 27 % positiv beantwortet. Bezüglich der Gottgläubigkeit bestanden große Unterschiede zwischen den einzelnen europäischen Staaten. Die Umfrage ergab, dass der Glaube an Gott in Staaten mit starkem kirchlichen Einfluss am stärksten verbreitet ist, dass mehr Frauen (58 %) als Männer (45 %) an einen Gott glauben und dass der Gottglaube mit höherem Alter, geringerer Bildung und politisch rechtsgerichteten Ansichten korreliert.\\\\\\\\ Laut einer Befragung von 1003 Personen in Deutschland im März 2019 glauben 55 % an einen Gott; 2005 waren es 66 % gewesen. 75 % der befragten Katholiken sowie 67 % der Protestanten glaubten an einen Gott (2005: 85 % und 79 %). Unter Konfessionslosen ging die Glaubensquote von 28 auf 20 % zurück. Unter Frauen (60 %) war der Glauben 2019 stärker ausgeprägt als unter Männern (50 %), in Westdeutschland (63 %) weiter verbreitet als in Ostdeutschland (26 %).", "passage_id": "" } ], "negative_ctxs": [], "hard_negative_ctxs": [ { "title": "Christentum", "text": "Christentum\ \ === Ursprung und Einflüsse ===\ Die ersten Christen waren Juden, die zum Glauben an Jesus Christus fanden. In ihm erkannten sie den bereits durch die biblische Prophetie verheißenen Messias (hebräisch: ''maschiach'', griechisch: ''Christos'', latinisiert ''Christus''), auf dessen Kommen die Juden bis heute warten. Die Urchristen übernahmen aus der jüdischen Tradition sämtliche heiligen Schriften (den Tanach), wie auch den Glauben an einen Messias oder Christus (''christos'': Gesalbter). Von den Juden übernommen wurden die Art der Gottesverehrung, das Gebet der Psalmen u. v. a. m. Eine weitere Gemeinsamkeit mit dem Judentum besteht in der Anbetung desselben Schöpfergottes. Jedoch sehen fast alle Christen Gott als ''einen'' dreieinigen Gott an: den Vater, den Sohn (Christus) und den Heiligen Geist. Darüber, wie der dreieinige Gott konkret gedacht werden kann, gibt es unter den christlichen Konfessionen und Gruppierungen unterschiedliche Auffassungen bis hin zur Ablehnung der Dreieinigkeit Gottes (Antitrinitarier). Der Glaube an Jesus Christus führte zu Spannungen und schließlich zur Trennung zwischen Juden, die diesen Glauben annahmen, und Juden, die dies nicht taten, da diese es unter anderem ablehnten, einen Menschen anzubeten, denn sie sahen in Jesus Christus nicht den verheißenen Messias und erst recht nicht den Sohn Gottes. Die heutige Zeitrechnung wird von der Geburt Christi aus gezählt. Anno Domini (A. D.) bedeutet „im Jahr des Herrn“.", "passage_id": "" }, { "title": "Noachidische_Gebote", "text": "Noachidische_Gebote\ \ === Die kommende Welt ===\ Der Glaube an eine ''Kommende Welt'' (Olam Haba) bzw. an eine ''Welt des ewigen Lebens'' ist ein Grundprinzip des Judentums. Dieser jüdische Glaube ist von dem christlichen Glauben an das ''Ewige Leben'' fundamental unterschieden. Die jüdische Lehre spricht niemandem das Heil dieser kommenden Welt ab, droht aber auch nicht mit Höllenstrafen im Jenseits. Juden glauben schlicht, dass allen Menschen ein Anteil der kommenden Welt zuteilwerden kann. Es gibt zwar viele Vorstellungen der kommenden Welt, aber keine kanonische Festlegung ihrer Beschaffenheit; d. h., das Judentum kennt keine eindeutige Antwort darauf, was nach dem Tod mit uns geschieht. Die Frage nach dem Leben nach dem Tod wird auch als weniger wesentlich angesehen, als Fragen, die das Leben des Menschen auf Erden und in der Gesellschaft betreffen.\ Der jüdische Glaube an eine kommende Welt bedeutet nicht, dass Menschen, die nie von der Tora gehört haben, böse oder sonst minderwertige Menschen sind. Das Judentum lehrt den Glauben, dass alle Menschen mit Gott verbunden sind. Es gibt im Judentum daher keinen Grund, zu missionieren. Das Judentum lehrt auch, dass alle Menschen sich darin gleichen, dass sie weder prinzipiell gut noch böse sind, sondern eine Neigung zum Guten wie zum Bösen haben. Während des irdischen Lebens sollte sich der Mensch immer wieder für das Gute entscheiden.", "passage_id": "" }, { "title": "Figuren_und_Schauplätze_der_Scheibenwelt-Romane", "text": "Figuren_und_Schauplätze_der_Scheibenwelt-Romane\ \ === Herkunft ===\ Es gibt unzählig viele Götter auf der Scheibenwelt, die so genannten „geringen Götter“, die überall sind, aber keine Macht haben. Erst wenn sie durch irgendein Ereignis Gläubige gewinnen, werden sie mächtiger. Je mehr Glauben, desto mehr Macht. Dabei nehmen sie die Gestalt an, die die Menschen ihnen geben (zum Beispiel Offler). Wenn ein Gott mächtig genug ist, erhält er Einlass in den Cori Celesti, den Berg der Götter, der sich in der Mitte der Scheibenwelt erhebt. Da Menschen wankelmütig sind, kann es auch geschehen, dass sie den Glauben verlieren und einen Gott damit entmachten (s. „Einfach Göttlich“).", "passage_id": "" } ] }, ``` ### Data Fields - `positive_ctxs`: a dictionary feature containing: - `title`: a `string` feature. - `text`: a `string` feature. - `passage_id`: a `string` feature. - `negative_ctxs`: a dictionary feature containing: - `title`: a `string` feature. - `text`: a `string` feature. - `passage_id`: a `string` feature. - `hard_negative_ctxs`: a dictionary feature containing: - `title`: a `string` feature. - `text`: a `string` feature. - `passage_id`: a `string` feature. - `question`: a `string` feature. - `answers`: a list feature containing: - a `string` feature. ### Data Splits The dataset is split into a training set and a test set. The final GermanDPR dataset comprises 9275 question/answer pairs in the training set and 1025 pairs in the test set. For each pair, there are one positive context and three hard negative contexts. | |questions|answers|positive contexts|hard negative contexts| |------|--------:|------:|----------------:|---------------------:| |train|9275| 9275|9275|27825| |test|1025| 1025|1025|3075| ## Additional Information ### Dataset Curators The dataset was initially created by Timo Möller, Julian Risch, Malte Pietsch, Julian Gutsch, Tom Hersperger, Luise Köhler, Iuliia Mozhina, and Justus Peter, during work done at deepset.ai ### Citation Information ``` @misc{möller2021germanquad, title={GermanQuAD and GermanDPR: Improving Non-English Question Answering and Passage Retrieval}, author={Timo Möller and Julian Risch and Malte Pietsch}, year={2021}, eprint={2104.12741}, archivePrefix={arXiv}, primaryClass={cs.CL} } ```

提供机构:
deepset
原始信息汇总

数据集概述

数据集名称

  • GermanDPR

语言

  • 德语 (de)

数据集来源

  • 原始数据集

任务类别

  • 问答
  • 文本检索

任务ID

  • 抽取式问答 (extractive-qa)
  • 封闭领域问答 (closed-domain-qa)

数据集结构

  • 数据实例:每个实例包含问题、答案、正向上下文和三个硬负向上下文。
  • 数据字段
    • question: 字符串类型
    • answers: 字符串列表类型
    • positive_ctxs: 包含标题、文本和段落ID的字典类型
    • negative_ctxs: 包含标题、文本和段落ID的字典类型
    • hard_negative_ctxs: 包含标题、文本和段落ID的字典类型
  • 数据分割
    • 训练集:9275个问题/答案对,每个对有一个正向上下文和三个硬负向上下文。
    • 测试集:1025个问题/答案对,每个对有一个正向上下文和三个硬负向上下文。

许可证

  • CC-BY-4.0

数据集创建者

  • Timo Möller, Julian Risch, Malte Pietsch, Julian Gutsch, Tom Hersperger, Luise Köhler, Iuliia Mozhina, Justus Peter

引用信息

@misc{möller2021germanquad, title={GermanQuAD and GermanDPR: Improving Non-English Question Answering and Passage Retrieval}, author={Timo Möller and Julian Risch and Malte Pietsch}, year={2021}, eprint={2104.12741}, archivePrefix={arXiv}, primaryClass={cs.CL} }

搜集汇总
数据集介绍
构建方式
在开放域问答与文本检索领域,高质量的训练数据是模型性能的关键。GermanDPR数据集以GermanQuAD为基础,遵循DPR论文(Karpukhin等人,2020)的方法,通过引入从完整德语维基百科转储中提取的硬负样本来增强数据质量。数据集包含训练集和测试集,分别拥有9275对和1025对问答实例。每个问答对配备一个正例上下文和三个硬负例上下文,从而构建出结构严谨的检索训练数据。
特点
该数据集的核心特点在于其精心设计的负样本策略。不同于传统的随机负采样,GermanDPR通过检索语义相似但答案不相关的段落作为硬负例,显著提升了模型对细粒度语义差异的辨别能力。此外,数据完全使用德语,覆盖了广泛的领域主题,确保了语言特性和文化语境的真实性。数据格式与DPR标准一致,包含问题、答案、正例上下文及硬负例上下文字段,便于直接用于密集段落检索任务的训练与评估。
使用方法
GermanDPR专为开放域问答和文本检索任务而设计,可无缝集成至Haystack等检索框架中。使用时,模型需基于问题与上下文之间的语义匹配进行训练,其中正例上下文提供正确答案,硬负例则作为挑战性干扰项。数据集已预先划分为训练集与测试集,用户可直接加载用于微调密集检索模型(如DPR或ColBERT)。评估时,可通过检索准确率或召回率等指标衡量模型在德语场景下的段落检索性能。
背景与挑战
背景概述
在自然语言处理领域,开放域问答与文本检索任务长期以英语为主导,非英语语言资源的匮乏成为制约多语言智能系统发展的关键瓶颈。为弥合这一鸿沟,deepset团队于2021年推出了GermanDPR数据集,由Timo Möller、Julian Risch、Malte Pietsch等研究人员在deepset.ai机构主导创建。该数据集以GermanQuAD为基础,借鉴Karpukhin等人提出的稠密段落检索范式,通过引入从德语维基百科全量数据中挖掘的硬负样本,构建了一个专为德语开放域问答与段落检索任务设计的高质量基准。GermanDPR包含9275个训练样本与1025个测试样本,每个问答对配备一个正例上下文与三个硬负例上下文,其发布不仅填补了德语密集检索领域的资源空白,更推动了非英语多语言检索技术的标准化进程,为跨语言信息获取系统的评估提供了可靠基石。
当前挑战
GermanDPR直面两大核心挑战:其一,在领域问题层面,德语开放域问答面临检索精度与语言特异性的双重困境。与英语相比,德语具有复杂的形态变化、长距离依赖及复合词结构,传统稀疏检索方法难以捕捉语义关联,而稠密检索模型又因缺乏大规模标注数据而受限。该数据集通过硬负样本挖掘技术,迫使模型区分细微语义差异,从而提升对德语文本的深度理解能力。其二,在构建过程中,团队需克服数据稀缺与标注成本高昂的难题。从GermanQuAD的初始问答对出发,需从海量维基百科文档中精准筛选出与问题语义相近但答案错误的负例,这一过程涉及复杂的相关性判别与噪声控制。此外,确保正负例在主题、句法结构上的平衡性,避免模型陷入简单模式识别,亦是构建中的关键挑战。
常用场景
经典使用场景
GermanDPR数据集专为德语的开放域问答与文本检索任务而设计,其核心应用场景在于训练和评估基于密集段落检索的问答系统。该数据集以GermanQuAD为基础,通过引入从德语维基百科全文中挖掘的硬负样本,构建了经典的检索-阅读两阶段框架的训练数据。每一问答对均配备一个正例上下文和三个高难度的负例上下文,这使得模型能够在精细的语义区分中学习判别相关性,从而显著提升对德语复杂问句的检索精度与回答质量。在学术研究中,该数据集常被用于微调双编码器模型(如DPR),以验证其在非英语语言上的跨语言迁移能力与领域适应性。
实际应用
在实际应用中,GermanDPR驱动的问答系统可被部署于德语企业的知识管理平台,例如帮助客户服务团队从海量文档中快速定位技术手册或政策条款中的准确答案。在学术领域,该数据集支撑了德语维基百科的智能问答界面开发,使用户能够以自然语言提问并获取精准答案。此外,基于GermanDPR训练的检索模型还可集成至法律、医疗等垂直行业的文档检索工具中,辅助专业人士在德语法规或病例报告中高效提取关键信息。其增强的负样本设计尤其适用于对检索精度要求严苛的场景,如合规性审查或学术文献综述。
衍生相关工作
GermanDPR的提出催生了多项围绕非英语密集检索的后续研究。例如,研究者基于该数据集探索了跨语言DPR模型的训练策略,验证了德语预训练模型(如German BERT)在检索任务中的有效性。此外,GermanDPR被用作基准数据集,用于评估对比学习、知识蒸馏等进阶技术在德语问答中的表现。相关工作还包括将其与生成式模型(如T5)结合,构建端到端的德语阅读理解系统。该数据集还促进了多语言检索领域的标准化评估流程,激发了针对其他语种(如法语、西班牙语)类似数据集的构建工作,推动了多语言自然语言处理生态的繁荣。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务