遇见数据集

CORA, Recipe

收藏
arXiv2026-09-01 更新2026-09-03 收录
官方服务:

资源简介:

本工作构建了两个面向不同领域的偏好数据集,CORA和Recipe,分别用于咖啡店助手对话回应和烹饪食谱程序性描述。CORA包含262条样本,每对包含TTS友好与不友好回应,涵盖符号、缩写、价格、时间等不利元素;Recipe源自RecipeNLG语料库,选取300条食谱,以类似方式构造偏好对。数据集通过自动规则与启发式方法生成,确保文本表面特征的多样性。该数据集旨在对齐大型语言模型,使其原生生成适合语音合成的文本,从而简化TTS流水线、降低延迟,提升多目标平衡下的听感友好性。

This work constructs two preference datasets for distinct domains: CORA and Recipe, which are respectively tailored for coffee shop assistant dialogue responses and procedural descriptions of cooking recipes. CORA consists of 262 samples, with each pair containing TTS-friendly and TTS-unfriendly responses, covering adverse elements such as symbols, abbreviations, prices, time references and other similar factors. Recipe is derived from the RecipeNLG corpus, where 300 recipes are selected and preference pairs are constructed in a similar manner. The datasets are generated through automated rules and heuristic approaches, ensuring diversity in surface-level textual characteristics. These datasets aim to align large language models (LLMs) to natively generate text suitable for speech synthesis, thereby simplifying TTS pipelines, reducing latency, and improving auditory friendliness under multi-objective trade-offs.

提供机构:
NAVER欧洲实验室
创建时间:
2026-09-01
搜集汇总
数据集介绍
CORA, Recipe 数据集图片
构建方式
CORA与Recipe数据集是在语音合成友好文本生成的研究背景下构建的,旨在为大型语言模型的偏好对齐提供训练资源。CORA是一个合成的咖啡订购助手对话基准,通过模拟真实场景生成包含符号、缩写、价格、时间等TTS不友好内容的问答对;Recipe则基于公开的RecipeNLG语料库,从中精选300个菜谱,针对程序性描述进行改造。两个数据集均构建了成对的TTS友好(优选)与TTS不友好(拒绝)响应,覆盖多种口语合成中的挑战性模式。每个数据集均从共享池中随机划分出5组训练、验证与测试子集,以支持多样化的实验设置与低资源场景的研究。
特点
CORA与Recipe数据集具有鲜明的多维度特点。它们分别聚焦于对话式响应与程序性描述两大领域,形成互补的研究场景。每一实例均由精确配对的TTS友好与不友好响应组成,凸显符号、缩写、数字简写、原始URL等典型障碍,尤其展现数字格式化与缩写密度等显著差异。数据集刻意控制规模,以贴近实际部署中的稀缺偏好数据情境,CORA与Recipe分别包含262与300个独立元组,其多样性经过验证在数百项后趋于饱和。此外,每个数据集提供五折划分,作为对方法鲁棒性的内在验证,有效支撑偏好对齐方法的评估与发展。
使用方法
CORA与Recipe数据集专为偏好对齐研究设计,支持多种对齐方法的训练与评估。使用时,可将TTS友好响应设为优选、TTS不友好响应设为拒绝,直接用于DPO、RFT、GRPO等算法的微调。数据集可应对数据稀缺情况,仅需10至100个样本即可开展实验,其五重划分便于交叉验证。为全面评价生成质量,建议结合基于模式的启发式评分、TTS→ASR回环评估与人工听力测试,其中启发式指标作为高效代理,与人类判断高度相关。研究者可根据目标场景选择匹配的任务设置与评价协议,如FaST框架中的特征发现与权重学习。
背景与挑战
背景概述
随着大型语言模型(LLM)在文本生成领域的飞速发展,其输出虽在语法与语义上日益精进,却往往未充分考虑下游语音合成(TTS)系统的特殊需求,导致生成的文本在口语化表达、数字拼写、符号处理等方面存在诸多不友好之处。为弥合这一鸿沟,NAVER LABS Europe的研究团队(Thibaut Thonet、Jos Rozen、Laurent Besacier)于2026年9月提出了一项开创性研究,将TTS友好文本生成视为一种偏好对齐问题,并为此构建了两个全新的偏好数据集——CORA与Recipe。CORA聚焦于咖啡订购助手的对话场景,Recipe则基于大规模烹饪食谱语料库,二者均包含成对的TTS友好与非友好响应,覆盖符号、缩写、数字简写及原始URL等典型非友好元素。该研究不仅为TTS友好文本生成提供了首个公开基准,还通过引入可解释特征驱动的对齐方法FaST,显著推动了文本生成与语音合成接口的优化进程,对构建更自然、更易理解的语音交互系统具有深远意义。
当前挑战
当前LLM生成的文本主要为书面阅读而优化,普遍存在大量TTS非友好特征,如数字缩写、符号、原始URL及紧凑的数值表达,这些内容在语音合成时易被误读或产生歧义,严重影响听感自然度与信息传达准确性。此外,TTS友好性本身是一个多目标优化问题,需在避免非友好表面形式的同时,保持文本的事实正确性与帮助性,二者往往存在张力。构建CORA与Recipe数据集的过程亦充满挑战,因缺乏现成基准,需从零开始设计并生成包含明确优劣对比的偏好对,既要确保覆盖多样化的非友好模式,又要控制数据规模以适应现实部署中的低资源场景,同时还需开发可靠且经济的评估指标,以有效衡量TTS友好性并与人耳听感保持高度一致。
常用场景
经典使用场景
CORA与Recipe数据集作为成对偏好语料,为研究大规模语言模型在文本生成任务中对语音合成友好性的对齐提供了全新基准。其经典使用场景聚焦于将TTS友好文本生成形式化为偏好对齐问题,通过在咖啡订购助手和烹饪菜谱描述两个迥异的领域内构建包含TTS友好与不友好响应的对照样本,研究者得以系统性地评估不同对齐策略在多目标权衡下的表现。该数据集尤其适用于低资源场景,仅凭十至百条样本便可检验各类方法的样本效率与泛化能力,从而为语音交互系统中的文本生成环节提供了可复现的标准化评估平台。
实际应用
在实际应用层面,CORA与Recipe数据集所支撑的TTS友好文本生成技术可直接赋能语音助手、智能客服以及有声内容生成等依赖级联式语言模型-语音合成架构的系统。例如在咖啡点单场景中,模型经对齐后能自动输出拼读数字、避免缩略符号的对话式应答,从而在部署于轻量级或边缘端TTS引擎时显著降低延迟与错误率;而在烹饪指导场景中,生成的自然散文式步骤描述取代了紧凑的符号化菜谱写法,极大提升了语音播报的流畅性与可理解性。这种源头生成方式免除了下游额外的文本归一化步骤,简化了系统架构,尤其适用于机器人嵌入式语音交互等计算资源受限的实用环境。
衍生相关工作
CORA与Recipe数据集的构建催生了一系列围绕TTS友好文本生成及其评估方法的延伸研究。最直接的衍生产物是验证了特征感知采样与调优框架(FaST)在该任务上的优越性,相较于基于黑盒奖励模型的GRPO或DPO等方法,FaST在极低数据量下便能达到理想的TTS友好性与有用性平衡,且其自动发现的文本特征(如数值格式化倾向、缩写密度等)为生成质量的归因分析提供了清晰的可解释依据。此外,数据集中采用的启发式评分指标与TTS回环评测管线被证实与人工听感高度相关,这一发现为构建低成本、无需人类参与的自动化TTS友好性评估模型开辟了道路,也为未来将此类指标直接用作可验证奖励的强化学习范式奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务