遇见数据集

3LF

收藏
arXiv2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

3LF是由首尔大学研究团队构建的一个三层次正式性谱系数据集,旨在解决传统形式转换任务中的监督错位问题。该数据集包含4500条精心对齐的句子三元组,分别对应非正式、随意和正式三种语体层次,其数据源自GYAFC基准语料库,并经过基于GPT-4o的大语言模型辅助重写与人工修订流程。构建过程以'随意'语体作为风格锚点,通过分解大型风格转换任务为两个更可控的过渡阶段,确保了语义对齐与风格清晰度。该数据集主要应用于可控文本生成领域,特别针对形式转换任务,旨在通过提供理论驱动的、对齐人类感知的监督信号,提升模型生成真实正式语言的能力。

3LF is a three-level formality spectrum dataset constructed by a research team from Seoul National University, aiming to address the supervision misalignment issue in traditional formality transfer tasks. This dataset contains 4500 meticulously aligned sentence triplets corresponding to three stylistic levels: informal, casual, and formal. Its data is sourced from the GYAFC benchmark corpus, and has undergone a workflow of GPT-4o-based large language model-assisted rewriting and manual revision. The construction process takes "casual" style as the stylistic anchor, decomposes the large-scale style transfer task into two more controllable transition stages, ensuring semantic alignment and stylistic clarity. This dataset is primarily applied in the field of controllable text generation, particularly for formality transfer tasks, aiming to improve models' capability to generate authentic formal language by providing theory-driven, human perception-aligned supervision signals.

提供机构:
首尔大学
创建时间:
2026-05-28
原始信息汇总

数据集名称

3LF: Three-Level Formality Transfer Dataset

数据集概述

3LF 是一个用于三级语体正式度迁移的数据集,包含了从 GYAFC 语料库示例派生出的新创建的非正式和正式改写句子。

发布信息

  • 相关论文链接:https://arxiv.org/abs/2605.29365
  • 为尊重 GYAFC 的原始发布条件,本发布仅包含新创建的非正式和正式改写句子,不重新分发 GYAFC 的原始休闲句子。

数据集结构

  • informal:改写后的非正式句子
  • formal:改写后的正式句子

数据集规模

  • 1K < n < 10K

语言

  • 英语(en)

标签

  • formality(语体正式度)

许可证

  • 其他(license: other)

引用

若在研究中使用了 3LF 数据集,请引用以下文献: bibtex @misc{yu2026casualanchorresolvingsupervision, title={Casual as an Anchor: Resolving Supervision Misalignment in Formality Transfer Dataset}, author={Hyojeong Yu and Hyukhun Koh and Minsung Kim and Kyomin Jung}, year={2026}, eprint={2605.29365}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2605.29365} }

致谢

3LF 数据集基于 GYAFC 语料库的示例构建。用户在使用本数据集时,也应引用以下文献:

  • Rao, S. and Tetreault, J. (2018). Dear Sir or Madam, May I Introduce the GYAFC Dataset: Corpus, Benchmarks and Metrics for Formality Style Transfer. NAACL-HLT 2018.
搜集汇总
数据集介绍
3LF 数据集图片
构建方式
3LF(Three-Level Formality)数据集旨在解决传统二值化格式标注中监督信号与人类形式感之间的错位问题。其构建过程首先从GYAFC数据集的原始语料中,借助LLM(GPT-4o)基于理论驱动的决策树自动筛选出具有随意风格(casual)的句子。随后,在人工审核循环的框架下,由具备高级英语能力的标注员指导LLM将每个随意句子分别重写为正式(formal)和非正式(informal)变体,形成平行对齐的三元组。整个过程严格遵循既定的语言学特征分类规则,并通过多轮修订与一致性验证,最终构建了包含4500个样本(每个风格1500条)的高质量数据集。
特点
3LF数据集的核心特点在于将形式感建模为包含非正式、随意与正式三个等级的连续光谱,而非传统的二元对立。其中,随意风格作为明确的中间锚点,有效分解了从非正式到正式的大跨度转换,降低了语义推断的难度,并减少了意义扭曲的风险。该数据集通过显式定义的语言学特征(如俚语、缩略词、被动语态等)进行标注,确保了风格标签的清晰性与理论根基。此外,统计数据显示,3LF中正式句子在字符长度与词汇丰富度上显著高于非正式及随意句子,这一分层特征与语言学理论对正式语域的认知高度吻合,从而提供了更为可靠的监督信号。
使用方法
3LF数据集主要用于形式感迁移任务的模型训练与评估。研究者可将其作为平行语料库,用于微调各类文本生成模型(如GPT-4.1-nano、Flan-T5-Large、DeepSeek-Distill-Qwen-1.5B),通过提供非正式、随意与正式三个层次的显式监督,提升模型在非正式到正式方向上的迁移性能。使用时,应依据图1所示的决策树对输出进行风格分类验证。此外,该数据集还可与基准数据集(如GYAFC)进行对比实验,以检验对齐感知训练策略的有效性。其公开的Hugging Face仓库(数据集地址已在论文中提供)支持直接下载与集成,便于复现论文中的实验结果。
背景与挑战
背景概述
文本风格迁移,尤其是语体正式度转换,是可控制文本生成领域的核心任务。2026年,来自首尔国立大学的研究团队(Hyojeong Yu, Hyukhun Koh, Minsung Kim, Kyomin Jung)在HEAL@CHI'26上提出了3LF(3-Level Formality)数据集。该研究旨在解决现有基准如GYAFC中存在的监督信号错位问题——传统二元标注将语体正式度简单二分为正式与非正式,导致模型在非正式→正式的转换方向上系统性失败。3LF数据集创新性地将语体正式度建模为包含非正式、随意、正式的三级连续谱,其中“随意”作为明确的中间锚点,为模型提供了更精确且符合人类感知的监督信号。该数据集包含4500条平行序列,显著提升了GPT-4.1-nano等模型在非正式→正式方向上的F1得分(从0.06提升至0.88),对文本风格迁移领域的基准构建方法论产生了深远影响。
当前挑战
3LF数据集所解决的领域挑战源于传统二元标注框架的根本缺陷:现有基准将语体正式度视为相对偏好而非绝对属性,导致生成的“正式”文本仅去除了表面非正式特征,却缺乏真正的正式语言结构(如 hedging、名词化、被动语态)。这种监督信号错位使得模型倾向于产生伪正式输出,并在非正式→正式转换方向上持续失败。在数据集构建过程中,团队面临多重挑战:首先,非正式语句常存在句法不完整和语义不明确问题(如省略主语或谓语),进行正式化转换时需要重建隐含结构并补充缺失的上下文信息,而非简单调整表层风格;其次,为生成语义对齐的三级语体文本,研究团队设计了以“随意”为锚点的构建流程,通过人类在循环中参与的方式确保每一级语体均严格符合语言学定义标准,并克服了因模型生成误差导致的实体偏移、数字不准确和主观偏见注入等问题。
常用场景
经典使用场景
在文本风格迁移领域,3LF数据集被广泛用于评估和改进模型在语体转移任务中的表现,尤其是针对非正式到正式风格的转换。不同于传统二元标注基准如GYAFC将语体简单划分为非正式与正式两级,3LF引入了中间性的“随意”语体作为锚点,构建了非正式-随意-正式的三级平行语料。这一设计使得模型能够在更细腻的语体连续谱上学习风格转移,从而有效缓解以往模型在非正式转正式方向上的系统性失败。研究者常利用3LF进行微调实验,以检验模型在语体准确性、语义保持和生成流畅性方面的综合能力,并对比其在二元监督下的性能差异。
解决学术问题
3LF数据集解决了现有形式化转移基准中监督信号与人类语体感知严重错位的学术问题。传统基准如GYAFC的二元标注偏向于表面修正而非真正的正式表达,导致模型学习到的是相对风格偏移而非绝对语体对齐。3LF通过理论驱动的三层次语体定义,揭示了语体的渐变本质,并以“随意”语体作为明确中间状态,消解了标注中的模糊性。实验表明,基于3LF训练能大幅提升模型在非正式转正式方向上的F1分数,例如GPT-4.1-nano从0.06跃升至0.88,有力证明了监督设计对风格对齐的决定性影响,为可控文本生成中的人机对齐研究提供了新的理论视角和实践框架。
衍生相关工作
3LF数据集衍生了一系列引领风格迁移研究的前沿工作。围绕其提出的三层次语体光谱,学者们进一步探索了语体对齐的理论基础,如基于语用学的礼貌策略分析(Brown & Levinson)和基于语域理论的文体特征编码(Biber)。在方法论上,研究者开发了利用3LF进行多任务学习的框架,将语体转移与情感调节、回指消解等联合建模。此外,3LF还被用于评估大型语言模型在上下文学习与微调之间的效果差异,揭示了监督数据质量如何重塑模型的语体先验。这些工作共同推动了可控文本生成从粗粒度二元分类向细粒度连续控制的范式转变,深化了对语言风格本质的计算理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务