遇见数据集

sarvam/sft_saaras_flow

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

sft_saaras_flow数据集是一个用于ASR(自动语音识别)转录校正的合成SFT(监督微调)数据集,旨在将大型模型(Gemini 3.1 Pro)蒸馏为较小的校正模型。数据集包含1100个示例,覆盖11种语言:英语、印地语、马拉地语、古吉拉特语、卡纳达语、泰米尔语、泰卢固语、马拉雅拉姆语、奥里亚语、孟加拉语和旁遮普语,每种语言100个示例。每个示例包括原始ASR转录文本(使用口语的本土文字)、应用配置(如校正模式、风格预设、语言提示等参数)以及通过应用的真实格式化提示生成的校正后输出。数据集格式为SFT格式,其中messages列已准备好用于聊天SFT,包括系统提示(校正提示)、用户转录(原始转录)和助手校正转录(校正后转录)。其他列提供语言、用户转录、校正转录、各种轴配置(如模式、风格预设等)、检测到的语言、校正提示以及生成元数据(如步骤1和步骤3元数据、错误信息)。数据集适用于文本生成任务,支持多语言处理,并强调合成数据和ASR转录校正的应用。

The sft_saaras_flow dataset is a synthetic SFT (Supervised Fine-Tuning) dataset for ASR (Automatic Speech Recognition) transcription correction, designed to distill a large model (Gemini 3.1 Pro) into a smaller correction model. It contains 1100 examples across 11 languages: English, Hindi, Marathi, Gujarati, Kannada, Tamil, Telugu, Malayalam, Odia, Bengali, and Punjabi, with 100 examples per language. Each example includes a raw ASR transcript (in the native script of the spoken language), app configuration (such as correction mode, style preset, language hint, and other variation axes), and the corrected output generated by the apps real formatting prompt. The dataset is formatted for SFT, with the messages column ready for chat-SFT, comprising the system prompt (correction prompt), user transcript (raw transcript), and assistant corrected transcript (corrected transcript). Additional columns provide language, user transcript, corrected transcript, various axis configurations (e.g., mode, style preset, language hint, app category, detected patterns, faithfulness enabled, high polish, english full style, memory hints, persona bias), along with persona, variation, detected languages, correction prompt, and generation metadata (step1_meta, step3_meta, error). The dataset is suitable for text-generation tasks, supports multilingual processing, and emphasizes synthetic data and ASR transcription correction applications.

提供机构:
sarvam
原始信息汇总
  • 数据集名称: sarvam/sft_saaras_flow
  • 任务类型: 文本生成
  • 模态: 文本
  • 语言: 英语、印地语、马拉地语、古吉拉特语、卡纳达语、泰米尔语、泰卢固语、马拉雅拉姆语、奥里亚语、孟加拉语、旁遮普语,共11种语言
  • 规模: 1000 - 10000 行(具体为1100行)
  • 格式: parquet, optimized-parquet
  • 标签: Synthetic, asr, transcription-correction, sft, distillation
  • 许可证: Apache-2.0
  • 数据集描述: 该数据集是合成SFT数据,用于ASR转录纠错,旨在通过蒸馏大型模型(Gemini 3.1 Pro)来训练一个较小的纠错模型。每个样本包含一个真实的原始ASR转录(使用口语的本土文字)及其应用配置(变化轴)和纠正后的输出
  • 数据集结构:
    • 包含一个子集 default,共1100行,并只有一个分割 train
    • SFT格式 (messages列): 可直接用于聊天SFT训练:system 对应 correction_promptuser 对应 user_transcriptassistant 对应 corrected_transcript
    • 其他主要列: language, user_transcript, corrected_transcript, 配置列(mode, style_preset, language_hint, app_category, detected_patterns, faithfulness_enabled, high_polish, english_full_style, memory_hints, persona_bias),以及 persona, variation, detected_languages, correction_prompt, 元数据(step1_meta, step3_meta, error)。
  • 数据预览示例: 展示了10行数据,包括英语对话、技术场景,其中用户转录包含口语错误(如填充词、同音词错误),纠正后的转录会修正这些错误并规范化文本。
  • 每月下载量: 22
  • 总文件大小: 102 MB
搜集汇总
数据集介绍
sarvam/sft_saaras_flow 数据集图片
构建方式
该数据集通过知识蒸馏技术构建,旨在将Gemini 3.1 Pro等大型语言模型的ASR转录矫正能力迁移至更小型的校正模型。数据生成过程模拟真实场景,首先输入原始自动语音识别(ASR)转录文本,该文本以口语的本地文字呈现,同时附带应用配置参数(如模式、风格预设、语言提示等),随后由大模型依据格式化提示生成校正后的输出。最终数据集包含1100个样本,覆盖英语、印地语、马拉地语、古吉拉特语、卡纳达语、泰米尔语、泰卢固语、马拉雅拉姆语、奥里亚语、孟加拉语和旁遮普语共11种语言,每种语言均匀分布100个示例。
特点
数据集的核心特点在于其多语言覆盖与精细化的配置维度。每个样本不仅包含原始ASR转录和校正文本,还记录了丰富的轴配置信息,如模式(控制代码混合、音译、翻译或转录方向)、风格预设、语言提示、应用类别、检测模式等,使得数据集能够支持高度定制化的矫正任务。此外,数据采用聊天式SFT格式组织,`messages`列直接提供对话结构,便于直接用于模型微调。生成元数据(如分步信息)的保留进一步增强了数据集的透明度和可追溯性。
使用方法
用户可直接利用数据集中的`messages`列进行监督式微调(SFT),其中`system`字段为矫正提示,`user`字段为原始用户转录,`assistant`字段为校正后的转录。为适应不同应用场景,可通过调整`mode`参数(如codemix、translit、translate、transcribe)控制矫正目标。数据集还提供了丰富的轴配置列,允许研究人员在微调时引入条件控制,例如通过`language_hint`指定目标语言,或利用`style_preset`调整输出风格。训练时建议将配置参数作为输入特征的一部分,以提升模型对多样化矫正需求的泛化能力。
背景与挑战
背景概述
在语音识别技术日益普及的背景下,ASR转录文本的准确性成为影响下游任务性能的关键瓶颈。为应对多语言环境下转录错误的校正需求,研究者于近年构建了sft_saaras_flow数据集。该数据集由研究团队借助Gemini 3.1 Pro大模型合成生成,旨在通过知识蒸馏技术将大模型的校正能力迁移至轻量级模型。数据集覆盖英语及十种印度本土语言,包含1100条精心设计的样本,每条样本均模拟真实ASR转录文本与应用配置参数,为转录校正任务提供了标准化的微调训练资源。其对多语言、多模式(如码混合、音译、翻译)转录校正的研究具有重要的推动价值。
当前挑战
该数据集面临双重挑战。领域问题层面,ASR转录校正需应对语音识别中的方言差异、口音干扰及噪声环境导致的文本错误,同时需处理多语言混合输入下的复杂语义修正,传统模型难以在保持低延迟的同时兼顾高精度。构建过程层面,合成数据的真实性难以完全匹配真实场景的噪声分布,且知识蒸馏过程中可能丢失大模型对罕见语言现象的泛化能力;此外,11种语言在语法结构、字符体系上的显著差异增加了数据平衡与标注一致性的难度。
常用场景
经典使用场景
在现代多语言语音交互系统中,自动语音识别(ASR)转录错误是影响用户体验的核心痛点。该数据集专为ASR转录纠错任务而设计,涵盖了英语、印地语、马拉地语等11种使用天城文及相似文字体系的印度语言,每个语种均包含100条经过精心构造的样本。每条数据由原始ASR转录文本、应用配置参数(如语码混合、音译、翻译或纯转录模式)以及经过大型模型校正后的标准输出组成,系统提示词完整保留,使其成为训练小型纠错模型进行知识蒸馏的理想资源。研究者可直接利用其预制的多轮对话格式,在监督微调框架下训练模型学习从嘈杂转录到精准文本的映射关系。
衍生相关工作
基于该数据集的特点,已涌现出若干具有启发性的衍生研究方向。其一,围绕知识蒸馏策略,研究者可探索如何从Gemini等大型语言模型中高效迁移纠错能力至参数量更小的序列到序列模型,如T5或Mistral架构的变体,并尝试利用数据集中的多轴配置设计针对性的蒸馏损失函数。其二,该数据集中包含的语言提示、检测模式与记忆提示等元信息,为构建元学习框架提供了契机——例如,训练一个能够根据当前应用配置动态调整纠错策略的条件式模型。此外,数据集跨11种语言且每语种样本均衡的特点,促使了针对低资源语言ASR纠错的少样本学习与跨语言迁移学习研究,相关工作已在多模态语音理解基准测试中被引用为基线验证集。
数据集最近研究
最新研究方向
该数据集聚焦于利用大规模语言模型进行自动语音识别(ASR)转录文本的后处理修正,通过蒸馏技术将Gemini 3.1 Pro等大型模型的能力迁移至小型纠错模型,当前前沿研究方向涵盖多语言与跨脚本场景下的弱监督学习、知识蒸馏的高效性,以及处理语码混合(codemix)、音译(translit)等复杂转录错误的鲁棒性。作为合成SFT数据,其与全球语音助手和多语言内容创作的热点需求紧密相连,尤其在印度次大陆的11种语言上提供了结构化训练样本,有力推动了低资源语言ASR管道优化和小型化可部署模型的研发。这一数据集的意义在于为业界提供了一个可控、多轴的纠错训练基准,助力集成更精确、语境感知的转录后处理流水线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务