遇见数据集

QUINTD-1

收藏
arXiv2026-08-24 更新2026-08-26 收录
官方服务:

资源简介:

QUINTD-1是一个跨域数据到文本生成基准数据集,涵盖五个领域及多种数据结构,旨在评估无领域内训练数据时的生成能力。该数据集包含1000条结构化输入(每个领域200条,分为开发集和测试集),以JSON、Markdown和CSV格式呈现,输入长度从122到3742 tokens不等,覆盖实体描述、体育赛事总结、天气预报、技术规格说明和图表描述等任务。数据集通过公开API收集并定义相应生成目标,为研究零样本迁移和知识蒸馏提供了关键基准,解决了缺乏领域内参考文本时的数据到文本生成难题。

QUINTD-1 is a cross-domain data-to-text generation benchmark dataset that covers five domains and diverse data structures, aiming to evaluate the generation capability when no in-domain training data is available. This dataset contains 1,000 structured inputs, with 200 samples per domain split into development and test sets, and is presented in JSON, Markdown and CSV formats. The input length ranges from 122 to 3742 tokens, covering tasks including entity description, sports event summarization, weather forecast, technical specification description and chart description. Collected via public APIs with corresponding generation goals defined, the dataset provides a critical benchmark for zero-shot transfer and knowledge distillation research, addressing the challenge of data-to-text generation when there is a shortage of in-domain reference texts.

创建时间:
2026-08-24
原始信息汇总

数据集概述

该仓库为跨领域数据到文本生成(Cross-Domain Data-to-Text, D2T)研究提供数据与代码资源,主要服务于论文评审期间的数据共享。

数据资源

仓库提供以下数据文件(以压缩包形式提供):

  • 人工评估集及标注结果:包含人工评估使用的样本集和对应的标注结果。
  • 模型输出及LLM评判标注:包含模型生成的输出以及由大语言模型(LLM)作为评判者给出的标注结果。
  • QUINTD-1训练集与测试集:用于跨领域D2T任务的第一版数据集(QUINTD-1)。
  • QUINTD-5训练集:用于跨领域D2T任务的第五版数据集(QUINTD-5)。

代码资源

仓库包含以下分析代码:

  • LLM-as-a-judge评估:通过API调用大语言模型进行自动评估。
  • 人工与LLM一致性分析:计算人工标注与LLM评判之间的一致性。
  • 人工间一致性分析(IAA):计算不同标注者之间的交叉一致性。
  • LLM间一致性分析:计算不同LLM评判之间的一致性。
  • 人工标注集构建:用于构建人工评估样本集的代码。
  • 评估分析:包括错误分析、长度分析等评估维度的分析工具。

训练与推理脚本

训练和推理过程基于MS-Swift库,仓库提供了运行实验所需的示例脚本。

搜集汇总
数据集介绍
QUINTD-1 数据集图片
构建方式
QUINTD-1数据集是在无目标领域标注文本的条件下构建的跨域数据到文本生成基准,涵盖Wikidata、Ice Hockey、OpenWeather、GSM Arena和OWID五个领域,数据分别来源于公开API,并统一以JSON、CSV或Markdown格式存储。每个领域包含100个开发集和100个测试集输入,开发集用于生成合成训练数据,测试集仅用于评估。为扩展数据规模,研究团队进一步构造了QUINTD-5,将每领域开发集扩至500个实例,从而在保持输入结构和长度分布的前提下增加真实数据的知识多样性。
特点
该数据集具有显著的多元异构性:输入结构涵盖知识图谱三元组、嵌套JSON、时间序列CSV等,生成任务从实体描述、比赛总结到图表标题各不相同,且输入长度跨度极大。尤为独特的是,数据集不提供任何参考文本,完全依赖无参考评估,这为跨域数据到文本生成研究提供了严苛的测试环境。此外,QUINTD-1与QUINTD-5的组合设计允许研究者区分数据规模与结构增强对模型性能的不同影响,凸显了其作为基准的精细控制力。
使用方法
数据集主要用于无目标领域训练文本条件下的跨域数据到文本生成研究。研究者可将开发集输入作为种子,使用大型语言模型生成合成文本,并结合结构化子采样与扰动增强构建训练数据,然后通过数据驱动知识蒸馏训练小型学生模型。测试集输入仅用于评估,采用LLM-as-a-Judge协议,利用GPT-5.1和Gemini-2.5-Pro对生成文本与结构化输入进行错误标注和覆盖率评分。该数据集也支持零样本推理和域外微调基线对比,以及通过QUINTD-5进行真实数据规模效应的消融实验。
背景与挑战
背景概述
QUINTD-1数据集由Kasner和Dusek于2024年构建,旨在评估大语言模型在跨领域数据到文本生成任务中的零样本能力。该数据集涵盖五个异构领域(维基数据实体描述、冰球比赛摘要、天气预报、手机规格描述和图表字幕生成),数据格式包括JSON、Markdown和CSV,每个领域提供100条开发集和100条测试集数据,但均无对应的人工参考文本。作为首个专门用于研究无参考跨领域数据到文本生成的基准,QUINTD-1挑战了传统监督学习范式,促进了无监督知识蒸馏和结构保持增强等新方法的发展,对推动数据到文本生成在真实场景中的应用具有重要意义。
当前挑战
QUINTD-1面临的核心挑战在于其无参考设定和多领域异构性。领域间输入结构差异显著,如嵌套深度、属性语义和格式不统一,导致模型难以学习统一表示。缺乏训练和测试参考文本,使得传统监督微调及基于参考的评估方法失效。此外,部分领域输入冗长且信息密集,如天气数据平均超过3000个token,严重限制了少样本提示的可行性。构建过程中,从公共API收集数据并统一预处理,还需确保不同领域数据格式的一致性,同时保持各领域的任务定义和结构完整性,这对数据管线的设计提出了较高要求。
常用场景
经典使用场景
QUINTD-1作为一项跨领域、多任务的数据到文本生成基准,其核心应用场景在于评估模型在完全缺失目标领域标注数据条件下的泛化能力。该数据集涵盖时间序列、知识图谱三元组、表格及图表等多种结构化输入,并对应天气报告、体育赛事摘要、实体描述及图表描述等多样化生成任务。研究者借助这一基准,系统性地对比零样本提示、领域外微调以及数据驱动的知识蒸馏等不同学习范式,从而深入探究模型对异构数据格式与生成目标的适应机制。
衍生相关工作
QUINTD-1的提出催生了一系列后续研究。原始工作揭示了零样本与微调方法在跨域数据到文本生成中的局限性,而近期研究则围绕数据驱动知识蒸馏框架展开,验证了结构保持的数据增强策略(如子采样与扰动)在提升小模型跨域迁移能力方面的卓越效果,并由此构建了其五倍扩展版本QUINTD-5,以系统探究真实数据规模扩张与合成数据增强之间的效益权衡。这些衍生工作不仅深化了对跨域生成中监督信号类型与数量影响的理解,也为在数据稀缺条件下训练高忠实度小模型提供了可复现的基准与方法论参考。
数据集最近研究
最新研究方向
当前,跨域数据到文本生成研究正聚焦于在缺乏目标域标注参考文本的条件下,通过数据驱动的知识蒸馏与结构保持的数据增强策略,将大型语言模型的生成能力高效迁移至小型模型。QUINTD-1数据集的提出为这一前沿方向提供了多结构、多任务的基准平台,其研究重点在于利用源域(如WebNLG)的监督信号与目标域的无标注结构化输入,通过合成数据生成与结构扰动技术,提升模型对异构数据模式(如JSON、CSV、Markdown)的适应性与忠实度。相关实验表明,相较于单纯的零样本推理或领域外微调,蒸馏与增强方法在恒定模型规模下可显著降低事实性错误,甚至在部分领域超越大型模型,展现了数据高效迁移的广阔前景。
相关研究论文
  • 1
    Cross-Domain, Multi-Task Data-to-Text Generation without In-Domain Training Data法国国家科学研究中心·洛林计算机科学实验室; 洛林大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务