遇见数据集

mrpc_german

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

MRPC German(德语Microsoft Research释义语料库)是一个高质量的德语翻译数据集,源自GLUE基准中的Microsoft Research Paraphrase Corpus(MRPC)。该数据集包含从新闻来源提取的句子对,每个句子对带有一个二元标签,指示两个句子是否语义等价(即是否为释义)。翻译工作通过OpenRouter使用luna-5.6大语言模型精心完成,并采用了一种专门的、标签感知的提示工程技术,以保留原始英语语料库的语言复杂性和细微语义差别。对于释义对(标签1),模型被明确指示保留原文的结构多样性、同义词和不同的词序,确保两个德语句子在措辞上保持不同但语义等价;对于非等价对(标签0),模型被严格提示保持两个句子之间的细微差异(如数字差异、实体替换或否定动词),确保语义陷阱在德语中得以完整保留。数据集包含以下字段:idx(原始GLUE MRPC数据集中的句子对标识符,int64类型)、label(int64类型,1表示释义,0表示非释义)、sentence1(第一个德语翻译句子,string类型)、sentence2(第二个德语翻译句子,string类型)。数据集分割完全镜像原始GLUE MRPC结构:训练集约3668个句子对,验证集约408个句子对,测试集约1725个句子对。该数据集适用于文本分类和句子相似性任务,特别是德语释义检测和语义等价性判断。

MRPC German (German Microsoft Research Paraphrase Corpus) is a high-quality German translation dataset derived from the Microsoft Research Paraphrase Corpus (MRPC) in the GLUE benchmark. It contains sentence pairs extracted from news sources, each with a binary label indicating whether the two sentences are semantically equivalent (i.e., paraphrases). The translation was carefully performed using the luna-5.6 large language model via OpenRouter, employing a specialized, label-aware prompt engineering technique to preserve the linguistic complexity and subtle semantic nuances of the original English corpus. For paraphrase pairs (label 1), the model was explicitly instructed to retain structural diversity, synonyms, and different word orders, ensuring the two German sentences remain different in wording but semantically equivalent. For non-equivalent pairs (label 0), the model was strictly prompted to maintain subtle differences between the two sentences (such as numerical differences, entity replacements, or negated verbs), ensuring that semantic traps are fully preserved in German. The dataset includes the following fields: idx (int64, identifier of the sentence pair from the original GLUE MRPC dataset), label (int64, 1 indicates paraphrase, 0 indicates non-paraphrase), sentence1 (string, first German sentence), sentence2 (string, second German sentence). The dataset splits exactly mirror the original GLUE MRPC structure: approximately 3668 sentence pairs in the training set, 408 in the validation set, and 1725 in the test set. This dataset is suitable for text classification and sentence similarity tasks, particularly German paraphrase detection and semantic equivalence judgment.

创建时间:
2026-08-25
原始信息汇总

数据集概述

MRPC German (Translated) 是一个高质量的德语翻译版本,源自 Microsoft Research Paraphrase Corpus (MRPC),该语料库是 GLUE 基准测试的组成部分。数据集包含从新闻来源提取的句子对,并附带一个二元标签,用于指示两个句子在语义上是否等价(即是否为释义关系)。

翻译方法

  • 使用 luna-5.6 大型语言模型(通过 OpenRouter)进行翻译。
  • 采用 标签感知的提示工程技术,针对不同标签动态调整翻译策略:
    • 释义对(标签 1):明确指示模型保留源文本的结构多样性、同义词和不同语序,确保德语译文在措辞上保持差异但语义等价。
    • 非等价对(标签 0):引导模型维持句子间的细微差异(如数字差异、实体替换或否定动词),使语义陷阱在德语中得以保留。

数据字段

字段 类型 描述
idx int64 原始 GLUE MRPC 数据集中的句子对标识符
label int64 1 表示句子为释义关系,0 表示非释义关系
sentence1 string 第一个句子的德语翻译
sentence2 string 第二个句子的德语翻译

数据划分

数据集完全镜像原始 GLUE MRPC 结构:

划分 样本数量
训练集 3,668 个句子对
验证集 408 个句子对
测试集 1,725 个句子对

数据集用途

  • 文本分类(text-classification)
  • 句子相似度(sentence-similarity)

示例实例

标签 1(释义):

  • sentence1: Amrozi beschuldigte seinen Bruder, den er „den Zeugen“ nannte, sein Beweismaterial absichtlich verfälscht zu haben.
  • sentence2: Amrozi warf seinem Bruder vor, seine Beweise vorsätzlich zu entstellen, wobei er ihn lediglich als Zeugen bezeichnete.

(注意保留了词汇变化:"beschuldigte" 与 "warf... vor",以及 "verfälscht" 与 "entstellen"。)

语言

  • 德语(de)
搜集汇总
数据集介绍
mrpc_german 数据集图片
构建方式
在自然语言处理领域, paraphrase识别任务长期依赖英文语料,非英语资源相对匮乏。该数据集以微软研究院释义语料库(MRPC)为蓝本,借助luna-5.6大语言模型经OpenRouter平台完成德语翻译。针对机器翻译易将同义句转为相同字符串的痼疾,构建流程引入标签感知的提示工程策略:对于释义对,明确要求保留源文本的句法多样性、同义词选择及语序变化;对于非释义对,则严格维持数值差异、实体替换或动词否定等细微分歧,从而在德语中完整复现原语料的语义陷阱与语言复杂度。
特点
作为GLUE基准中MRPC的高质量德语镜像,该数据集涵盖新闻来源的句子对,并附有二值标签以指示语义等价性。其核心特色在于翻译过程对标签信息的动态条件化,有效规避了同义句在目标语言中趋同的风险。数据集完整保留了原始语料的词汇变化与结构差异,例如释义对中“beschuldigte”与“warf... vor”、“verfälscht”与“entstellen”等表达并存,确保句对在德语中仍具区分度。数据划分为训练集3668对、验证集408对、测试集1725对,字段包含原始标识、标签及两句德语文本。
使用方法
该数据集可直接用于德语文本分类与句子相似度任务,其加载方式遵循HuggingFace数据集标准流程。用户通过指定配置名称“default”即可获取完整数据,各划分文件按测试、训练、验证分别存储于对应路径。在模型训练或评估中,以sentence1和sentence2为输入,label为监督信号,可执行二分类预测或相似度打分。鉴于数据集精确复刻GLUE MRPC的结构,研究者能够无缝迁移英文基准上的实验设置,开展跨语言对比分析,或利用其德语特性进行低资源语言下的释义识别与语义表征学习。
背景与挑战
背景概述
微软释义语料库(MRPC)作为GLUE基准的核心组成部分,自2005年问世以来长期服务于句子级语义等价判定任务,深刻推动了自然语言理解技术在释义识别方向的发展。为将这一资源拓展至德语语境,研究者基于luna-5.6大语言模型构建了MRPC German数据集,通过标签感知的提示工程策略,完整翻译了新闻领域抽取的句子对,并严格保留了原始训练、验证与测试集划分。该数据集为跨语言释义识别与句子相似度研究提供了高质量基准,有助于评估多语言模型在语义细微差异上的辨析能力,对推动德语自然语言处理及跨语言迁移学习具有重要价值。
当前挑战
该数据集所应对的核心领域问题在于释义识别:判断两个句子是否表达相同语义,这要求模型捕捉词汇替换、句法变换与语义等价之间的复杂关系。构建过程中的主要挑战源自机器翻译的固有倾向——模型易将语义相近的源句对译为目标语言中的完全一致字符串,从而彻底破坏释义识别任务所依赖的区分信号。为化解此风险,翻译流程须以标签为条件进行动态约束:对释义对强制保留结构多样性与同义表达,对非释义对则严格维持数值差异、实体替换或否定动词等细微语义陷阱。如何在目标语言中精准复现这些微妙反差,同时保证译文的自然流畅,构成了该数据集构建中最棘手的难题。
常用场景
经典使用场景
在自然语言处理领域,释义识别与句子相似度计算一直是语义理解的核心任务之一。MRPC German数据集凭借其高质量的德语句对与二元释义标签,成为评估模型在德语环境下捕捉语义等价能力的经典基准。其典型使用场景涵盖句子对分类、语义相似度建模及跨语言迁移学习,研究者常将其作为GLUE基准的德语延伸,用于训练和测试模型区分语义等价与表面相似但语义相异的能力。
解决学术问题
该数据集有效缓解了德语自然语言处理中缺乏高质量释义识别资源的困境,特别是针对机器翻译过程中容易出现的语义失真与结构同质化问题。通过标签感知的翻译策略,它保留了原英文MRPC中微妙的语义差异与词汇多样性,为学术研究提供了可靠的评估平台,推动了德语语义相似度计算、模型鲁棒性分析以及跨语言知识迁移等方向的发展。
衍生相关工作
基于MRPC German,研究者已开展多项衍生工作,包括德语预训练模型的微调与评测、跨语言释义识别模型的对比研究,以及面向低资源语言的语义等价数据增强方法。该数据集亦被用于探索标签感知翻译策略在其它语言对中的可迁移性,并催生了针对德语语义相似度任务的专用评测基准与公开排行榜。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务