遇见数据集

TextQ-German

收藏
arXiv2026-08-19 更新2026-08-21 收录
数据链接:
官方服务:

资源简介:

TextQ-German是一个面向德语自然语言生成的体验质量评估数据集,由柏林工业大学和德国人工智能研究中心联合创建。该数据集涵盖自动文本摘要和机器翻译两大任务,包含六个子集:原始语料、大语言模型扩展集及最终验证集,共计收集了人类对多种感知质量维度的评分。数据通过众包实验获取,参与者使用语义差分法对输出文本的多项感知属性进行评价,并据此识别出任务相关的质量维度。该数据集旨在为人本评估提供公开资源,推动预测模型开发,使自然语言生成系统更好地与人类质量感知对齐。

TextQ-German is a quality of experience (QoE) evaluation dataset for German natural language generation, jointly developed by Technische Universität Berlin and the German Research Center for Artificial Intelligence (DFKI). This dataset encompasses two core tasks: automatic text summarization and machine translation, and comprises six subsets, including the original corpus, large language model (LLM) extended set, and final validation set among others. In total, this dataset includes human ratings across multiple perceptual quality dimensions. The data is collected via crowdsourcing experiments, where participants evaluate various perceptual attributes of the generated text using the semantic differential method, and identify task-relevant quality dimensions based on these assessments. This dataset aims to serve as an open resource for human-centered evaluation, advance the development of predictive models, and enable natural language generation systems to better align with human quality perceptions.

创建时间:
2026-08-19
搜集汇总
数据集介绍
TextQ-German 数据集图片
构建方式
TextQ-German数据集的构建立足于自然语言生成(NLG)的质量体验(QoE)评估,覆盖自动文本摘要(ATS)与机器翻译(MT)两大任务。构建过程首先从GeWiki语料库和WMT19新闻翻译任务中选取源文本,通过多种抽取式与生成式模型(如Lead-3、Pointer-Generator、Transformer等)生成多样化的输出,并经由语言学家进行错误类型标注以确保质量层级的丰富性。随后,采用语义差异量表(Semantic Differential)设计众包实验,邀请德语母语者基于两极形容词对进行0-6分的评分,通过探索性因子分析(EFA)识别出每个任务的四个感知质量维度,如MT的精确性、复杂性、语法性和透明性,以及ATS的语言逻辑、复杂性、清晰性和可预测性。之后,通过验证实验确认了精简形容词对的有效性,并据此构建了包含维度级评分的初始数据集。此外,数据集扩展至LLM生成的文本,添加了总体QoE评分,并独立收集了验证集以评估模型泛化能力。整个构建过程注重平衡质量差异、注释可靠性和任务特异性,最终形成了六个子集,为QoE预测模型的开发与验证提供了坚实基础。
使用方法
TextQ-German数据集旨在支持多层次的自动QoE预测研究。研究者可将其用于维度级预测,即针对每个质量维度(如ATS的复杂性、MT的语法性)训练回归模型;亦可进行总体QoE评分预测,利用LLM子集(TextQ-ATS-LLM和TextQ-MT-LLM)中的总体标签。数据集组合灵活,支持将初始语料与LLM扩展合并以增强训练数据,或分别使用验证集(TextQ-ATS-Val、TextQ-MT-Val)进行外部泛化测试。典型使用方法包括:微调预训练德语Transformer模型(如gbart-large、gelectra-large)进行单任务或多任务回归;基于121种语言学特征(如可读性、词汇丰富度、句法复杂度)结合特征选择方法(如SFS、Lasso)训练线性模型;或构建混合模型,将Transformer嵌入与精选语言学特征融合,以提升预测精度。所有模型均采用7折交叉验证评估,确保结果稳健。数据集代码与特征计算脚本已在GitHub公开,便于复现与拓展。
背景与挑战
背景概述
TextQ-German数据集由柏林工业大学与德国人工智能研究中心(DFKI)的Dinh Nam Pham、Shushen Manakhimova等研究者于2025至2026年间创建,旨在从用户体验质量视角系统评估德语自然语言生成文本。核心研究问题在于突破传统自动评估指标(如BLEU、ROUGE)与人类感知之间的鸿沟,针对自动文本摘要与机器翻译两大任务,通过众包实验识别并量化精细感知维度,进而构建可泛化的自动QoE预测模型。该数据集首创性地将多媒体领域的QoE框架引入德语NLG评估,为德语这一相对被忽视的语言提供了首个多维度主观质量基准,其混合模型方法(融合语言模型与语言学特征)展现出优于纯神经模型的预测效能,对推动人本化NLG评估体系具有重要学术价值与应用潜力。
当前挑战
该领域面临的核心挑战在于文本质量的主观性与多维性:传统客观指标难以捕捉流畅性、连贯性、语义保真度等细粒度感知属性,而人工评估成本高昂且标注一致性难以保证。TextQ-German构建过程中需解决多重难题:通过语义差异量表提取稳定且可解释的质量维度(如MT的精确性、复杂度、语法性、透明性,ATS的语言逻辑、清晰度、可预测性),需在大规模众包中控制标注者动机与注意力;数据规模受限(每个子集约77-106个样本)制约了深度模型的训练与泛化,而LLM生成文本的多样性进一步加剧了维度预测的异质性。此外,维度级MT预测仍是最难的任务,其短句特性使得质量信号模糊,需要更精细的特征或更大规模的平衡数据才能突破当前瓶颈。
常用场景
经典使用场景
TextQ-German数据集作为德语自然语言生成质量评估的基准资源,其经典使用场景聚焦于自动文本摘要与机器翻译两种核心任务的主观质量评估。研究者借助该资源,基于众包实验获取的人类评分,系统性地探究不同生成系统输出文本的感知质量差异。该数据集提供多维度的细粒度质量标注以及整体体验质量评分,使得模型能够在统一框架下进行训练与验证,从而实现对未知文本的自动质量预测。其分层结构设计尤其适用于开发与评测各类预测模型,包括基于Transformer的深度模型、基于语言特征的浅层模型以及融合两者的混合模型,极大地促进了德语自然语言生成质量评估研究的发展。
解决学术问题
该数据集有效解决了传统自动评估指标(如BLEU、ROUGE)与人类感知质量相关性薄弱的问题,为自然语言生成领域提供了一个以用户体验为核心的评估基准。通过实证方法识别出针对翻译与摘要任务各自独特的感知质量维度,如精准性、复杂性、语法性、清晰度等,弥补了现有研究中缺乏德语语料支撑的空白。其数据使研究者得以深入探索语言特征与神经网络表征之间的互补性,从而构建出预测性能更优的混合模型。基于该数据集的实验表明,精心选择的语言特征能够逼近甚至超越微调语言模型的预测能力,为工业界与学术界提供了更符合人类主观感受的评估范式。
实际应用
在实际应用中,TextQ-German数据集的多元设计使其能够被广泛用于真实场景下的文本质量监控与优化。一方面,开发者可借助训练好的质量预测模型,对大规模机器翻译或自动摘要系统生成的德语文本进行实时、自动化的质量评估,替代昂贵且耗时的人工评审环节。另一方面,该资源可用于指导生成系统的迭代改进,通过识别文本在精准性、逻辑性、可读性等维度的不足,为系统调优提供明确方向。此外,由于数据集涵盖了传统神经模型与大型语言模型的生成输出,其评估体系亦可用于比较不同代际技术路线的质量表现,辅助企业在模型选型时做出更符合用户体验的决策。
数据集最近研究
最新研究方向
TextQ-German数据集聚焦于德语自然语言生成的质量体验评估,其最新研究动向在于摒弃传统自动指标的局限,转而通过众包实验识别并量化机器翻译与自动摘要中的多维感知质量属性。当前研究前沿着重于融合语言学特征与Transformer表示的混合模型,以更精准地预测用户整体满意度,并扩展至大语言模型生成文本的泛化验证,推动人本化评估体系在德语NLG领域的落地与深化。
相关研究论文
  • 1
    Assessing Quality of Experience in Natural Language Generation of German Text柏林工业大学; 德国人工智能研究中心 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务