遇见数据集

hi-en-synth-cs

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

该数据集包含三个配置:bigrams、sentences和synth_t2。bigrams配置包含10,078个训练样本,每个样本包含bigram(字符串)、hi_word(字符串)、en_word(字符串)字段以及一个checks结构体(包含script和not_translation两个布尔值字段),可能用于双语词汇对分析或翻译验证任务。sentences配置包含15,733个训练样本,每个样本包含sent_id(字符串)、text(字符串)、bigram(字符串)和matrix_lang(字符串)字段,可能用于句子级语言分析或跨语言研究。synth_t2配置包含15,651个训练样本,是一个多模态数据集,包含音频(16kHz采样率)、utt_id(字符串)、text(字符串)、dur(浮点数)、speaker(字符串)、lang(字符串)、bigram(字符串)和matrix_lang(字符串)字段,可能用于语音合成、语音-文本对齐或多语言语音处理任务。所有配置均仅提供训练集。

The dataset includes three configurations: bigrams, sentences, and synth_t2. The bigrams configuration contains 10,078 training samples, each with fields including bigram (string), hi_word (string), en_word (string), and a checks struct (with boolean fields script and not_translation), potentially used for bilingual word pair analysis or translation validation tasks. The sentences configuration contains 15,733 training samples, each with fields including sent_id (string), text (string), bigram (string), and matrix_lang (string), potentially used for sentence-level language analysis or cross-linguistic research. The synth_t2 configuration contains 15,651 training samples and is a multimodal dataset, including audio (16kHz sample rate), utt_id (string), text (string), dur (float), speaker (string), lang (string), bigram (string), and matrix_lang (string), potentially used for speech synthesis, speech-text alignment, or multilingual speech processing tasks. All configurations provide only training sets.

创建时间:
2026-07-12
原始信息汇总

数据集概述

  • 数据集名称:hi-en-synth-cs
  • 数据集地址:https://huggingface.co/datasets/RohanRamesh/hi-en-synth-cs
  • 语言:印地语-英语(hi-en)

数据集配置

该数据集包含三个配置(子集),每个配置均为训练集(train):

1. bigrams(二元组)

  • 样本数:10,078
  • 数据集大小:546,656 字节
  • 特征
    • bigram(字符串):二元组
    • hi_word(字符串):印地语单词
    • en_word(字符串):英语单词
    • checks(结构体):
      • script(布尔值):脚本检查
      • not_translation(布尔值):非翻译检查

2. sentences(句子)

  • 样本数:15,733
  • 数据集大小:2,158,287 字节
  • 特征
    • sent_id(字符串):句子ID
    • text(字符串):文本内容
    • bigram(字符串):二元组
    • matrix_lang(字符串):矩阵语言

3. synth_t2(合成T2)

  • 样本数:15,651
  • 数据集大小:1,830,359,817.872 字节
  • 特征
    • audio(音频):音频数据,采样率为16,000 Hz
    • utt_id(字符串):话语ID
    • text(字符串):文本内容
    • dur(浮点数):持续时间
    • speaker(字符串):说话人
    • lang(字符串):语言
    • bigram(字符串):二元组
    • matrix_lang(字符串):矩阵语言
搜集汇总
数据集介绍
hi-en-synth-cs 数据集图片
构建方式
该数据集专为印地语-英语语码混合场景设计,通过系统化手段构建。其包含三个子集:bigrams、sentences与synth_t2。bigrams子集由自动提取的双语双词对构成,每对包含一个双词组合、对应的印地语与英语词条,并附有脚本正确性及是否直译的布尔校验字段。sentences子集则从自然语料中采集完整语句,标注句子ID、文本内容、主导双词对及矩阵语言。synth_t2子集进一步扩展,采用文本转语音技术合成15651条语音,每条包含16000Hz采样率的音频、话语ID、文本、时长、说话人、语言及双词标签,确保语音与文本对齐。所有子集均提供训练划分,数据规模从双词的10078条至句子的15733条不等。
特点
该数据集的核心特色在于其多模态与层次化结构。bigrams子集提供了双语词汇层面的精准对齐,并通过脚本与翻译校验确保质量。sentences子集聚焦于真实语境中的语码混合句子,携带矩阵语言标注,便于研究语言转换模式。synth_t2子集则以合成语音形式呈现相同文本,不仅具备高保真音频(16kHz采样率),还包含时长与说话人元数据,支持语音相关任务。数据集整体覆盖从词汇到句子再到语音的完整链条,每个子集均以双词为纽带,实现了跨模态的一致性与可关联性。
使用方法
该数据集可通过HuggingFace Datasets库便捷加载。用户需指定配置名称(如'bigrams'、'sentences'或'synth_t2')来获取对应子集。对于synth_t2子集,音频字段会自动解码为Audio对象,采样率为16000Hz,可直接用于语音识别或编码转换模型训练。sentences子集文本适合进行语码混合分析与语言建模。bigrams子集的双词对则可用于构建双语词典或研究词语层面的代码切换现象。数据集仅提供训练划分,用户可直接迭代访问示例,无需额外预处理步骤。
背景与挑战
背景概述
印地语-英语代码转换(Code-Switching)是自然语言处理领域的重要研究方向,尤其在多语社会如印度,其口语和书面语中广泛存在语言混合现象。该数据集由研究人员于近年构建,旨在系统性地模拟和捕捉印地语与英语之间的代码转换模式。核心研究问题包括双语言素对齐、语言身份识别以及语码转换的句法语义规律。通过提供大规模合成语音及文本数据,该数据集为多语语音识别、语言建模及代码转换生成等任务奠定了坚实基础,对推动南亚次区域多语技术发展具有重要意义。
当前挑战
该数据集所应对的核心挑战在于真实代码转换数据的稀缺性,以及自然语言中语言混合模式的复杂性与多样性。具体而言,构建过程需解决以下问题:如何生成符合真实语感的合成双语句对,并确保语言边界标注的准确性;如何在语音合成中保持自然韵律和不同语言的声学连贯性;以及如何设计高效的检查机制,以过滤纯直译或单一语言的片段,保证数据内部的语言混合真实性。
常用场景
经典使用场景
在跨语言语音合成与自然语言处理领域,hi-en-synth-cs数据集为语码混合研究提供了宝贵资源。该数据集包含印地语-英语双语词汇搭配(bigrams)、对应句子文本以及合成语音三部分,特别针对语码混合场景设计。经典使用场景包括训练与评估能够处理印地语和英语之间无缝切换的语音合成系统,研究者可借助此数据构建能够自然生成混杂印地语和英语词汇句子的语音模型,提升多语种交互系统的流畅度与真实感。
实际应用
在实际应用中,hi-en-synth-cs数据集可赋能多语种智能语音助手、跨语言客服系统及双语教育工具开发。例如,在印度地区广泛使用的印地语-英语混合交流场景下,基于该数据训练的语音合成与识别模型能够更自然地进行对话交互,提升用户体验。此外,该数据还能用于构建双语播报、新闻摘要等无障碍信息服务,促进语言技术的包容性与实用性。
衍生相关工作
基于hi-en-synth-cs数据集,研究者衍生出多项经典工作。例如,开发针对语码混合的端到端语音合成模型,利用其bigram标注信息增强双语词汇的发音准确率;构建跨语言声学特征映射网络,提升混合语言语音的韵律自然度。此外,该数据也被用于对比不同语码混合策略(如矩阵语言选择)对生成语音质量的影响,为后续高质量多语种合成系统的设计奠定了实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务