遇见数据集

transformersegmentation/CHILDES

收藏
Hugging Face2024-07-15 更新2024-06-11 收录
官方服务:

资源简介:

Phonemized Child Directed Speech数据集包含从CHILDES下载的语音数据,这些数据经过预处理并转换为音素转录。数据集保留了CHILDES中的许多列,并添加了新的列,如`is_child`、`processed_gloss`、`phonemized_utterance`、`language_code`和`character_split_utterance`。数据集按`target_child_age`列排序,并分为训练集和验证集。数据集涵盖了多种语言,每种语言的数据量、说话者数量、话语数量、单词数量和音素数量都有详细说明。

Phonemized Child Directed Speech数据集包含从CHILDES下载的语音数据,这些数据经过预处理并转换为音素转录。数据集保留了CHILDES中的许多列,并添加了新的列,如`is_child`、`processed_gloss`、`phonemized_utterance`、`language_code`和`character_split_utterance`。数据集按`target_child_age`列排序,并分为训练集和验证集。数据集涵盖了多种语言,每种语言的数据量、说话者数量、话语数量、单词数量和音素数量都有详细说明。

原始信息汇总

Phonemized Child Directed Speech Dataset

数据集概述

该数据集包含从CHILDES下载的经过预处理并转换为音素转录的语句。许多来自CHILDES的列被保留,以备实验使用(例如,词素数量、词性标签等)。处理脚本添加的关键列如下:

描述
is_child 语句是否由儿童说出。注意,此数据集中所有语句的此列均设置为False,但处理脚本有能力保留儿童语句。
processed_gloss 预处理的正字法语句。包括小写、修正英语拼写和添加标点符号。基于AOChildes预处理。
phonemized_utterance 语句的音素转录,空格分隔,单词边界用WORD_BOUNDARY标记。
language_code 用于生成音素转录的语言代码。可能与CHILDES提供的language列不匹配(例如,Eng-NA和Eng-UK通常用eng-us和eng-gb转录)。
character_split_utterance 通过简单地将处理过的正字法按字符分割而生成的语句转录,空格分隔。旨在与phonemized_utterance格式非常相似,用于比较语音转录和正字法转录的研究。

最后两列设计用于训练基于字符(音素)的语言模型,使用简单的空格分隔的标记器。processed_gloss列适用于基于单词(或子词)的语言模型,使用标准标记器。

数据已按target_child_age列排序,该列存储儿童年龄(以月为单位)。可以根据需要使用此列限制训练数据的最大儿童年龄。

每个数据子集分为包含大部分语句的训练集和包含10,000个语句的分布内验证集。以下语言包含在内(按音素数量排序):

语言 描述 说话者 语句 单词 音素
英语 (US) 从CHILDES的Eng-NA集合中的44个语料库提取,使用语言代码en-us进行音素化。 2,692 1,646,954 7,090,066 21,932,139
英语 (UK) 从CHILDES的Eng-NA集合中的14个语料库提取,使用语言代码en-gb进行音素化。 588 1,246,828 5,166,197 15,727,550
德语 从CHILDES的德语集合中的10个语料库提取,使用语言代码ge进行音素化。 627 850,888 3,893,168 14,058,836
印度尼西亚语 从CHILDES的EastAsian/Indonesian集合中的1个语料库提取,使用语言代码id进行音素化。 389 534,469 1,587,526 6,367,721
普通话 从CHILDES的Chinese/Mandarin集合中的15个语料库提取,使用拼音到IPA转换器进行音素化。 15 883 326,759 1,511,851
法语 从CHILDES的法语集合中的11个语料库提取,使用语言代码fr-fr进行音素化。 722 432,133 1,995,063 5,510,523
西班牙语 从CHILDES的西班牙语集合中的18个语料库提取,使用语言代码es进行音素化。 562 286,462 1,266,366 4,511,261
日语 从CHILDES的日语集合中的9个语料库提取,使用japanese语言进行音素化。 320 412,079 1,113,194 4,346,638
荷兰语 从CHILDES的DutchAfricaans/Dutch集合中的5个语料库提取,使用语言代码nl进行音素化。 86 297,497 1,246,006 4,034,742
爱沙尼亚语 从CHILDES的Other/Estonian集合中的9个语料库提取,使用语言代码et进行音素化。 118 103,343 544,680 2,347,066
粤语 从CHILDES的Chinese/Cantonese集合中的2个语料库提取,使用pingyam数据库将粤拼转换为IPA进行音素化。 80 136,727 591,314 2,118,731
瑞典语 从CHILDES的Scandinavian/Swedish集合中的3个语料库提取,使用语言代码sv进行音素化。 32 85,299 396,800 1,241,459
葡萄牙语 (葡萄牙) 从CHILDES的Romance/Portuguese集合中的3个语料库提取,使用语言代码pt进行音素化。 33 81,444 368,032 1,175,413
韩语 从CHILDES的EastAsian/Korean集合中的3个语料库提取,使用语言代码ko进行音素化。 95 66,576 201,078 1,076,296
意大利语 从CHILDES的Romance/Italian集合中的5个语料库提取,使用语言代码it进行音素化。 92 57,542 264,479 996,295
加泰罗尼亚语 从CHILDES的Romance/Catalan集合中的5个语料库提取,使用语言代码ca进行音素化。 159 56,588 248,999 839,462
克罗地亚语 从CHILDES的Slavic/Croatian集合中的1个语料库提取,使用语言代码hr进行音素化。 51 55,284 214,921 813,619
威尔士语 从CHILDES的Celtic/Welsh集合中的2个语料库提取,使用语言代码cy进行音素化。 65 55,871 269,295 785,569
冰岛语 从CHILDES的Scandinavian/Icelandic集合中的2个语料库提取,使用语言代码is进行音素化。 15 50,657 197,519 772,952
丹麦语 从CHILDES的Scandinavian/Danish集合中的1个语料库提取,使用语言代码da进行音素化。 25 48,976 192,527 579,375
挪威语 从CHILDES的Scandinavian/Norwegian集合中的2个语料库提取,使用语言代码nb进行音素化。 27 35,547 175,952 559,489
巴斯克语 从CHILDES的Other/Basque集合中的2个语料库提取,使用语言代码eu进行音素化。 150 36,614 135,866 565,633
匈牙利语 从CHILDES的Other/Hungarian集合中的3个语料库提取,使用语言代码hu进行音素化。 65 31,633 116,917 478,444
罗马尼亚语 从CHILDES的Romance/Romanian集合中的2个语料库提取,使用语言代码ro进行音素化。 21 31,550 110,067 380,828
葡萄牙语 (巴西) 从CHILDES的Romance/Portuguese集合中的2个语料库提取,使用语言代码pt-br进行音素化。 163 12,471 91,484 323,043
爱尔兰语 从CHILDES的Celtic/Irish集合中的2个语料库提取,使用语言代码ga进行音素化。 20 18,256 88,388 279,045
土耳其语 从CHILDES的Other/Turkish集合中的2个语料库提取,使用语言代码tr进行音素化。 35 14,487 43,823 230,737
克丘亚语 从CHILDES的Other/Quechua集合中的2个语料库提取,使用语言代码qu进行音素化。 7 13,425 33,102 204,692
波斯语 从CHILDES的Other/Farsi集合中的2个语料库提取,使用语言代码fa-latn进行音素化。 23 13,467 28,080 116,081
搜集汇总
数据集介绍
transformersegmentation/CHILDES 数据集图片
构建方式
该数据集源自CHILDES语料库,经过系统化预处理与音位化转换构建而成。具体流程包括对原始儿童导向语音进行文本规范化处理,涵盖小写化、英语拼写修正及标点符号添加,随后利用多种音位化工具(如phonemizer、epitran、pinyin_to_ipa、pingyam)依据各语言对应的音位清单将正交文本转换为国际音标序列。每个语料被分割为以词边界标记分隔的音素字符串,同时保留原始语料中的形态素数量、词性标注等元信息,并依据目标儿童年龄对数据进行排序,以支持基于年龄阈值的训练数据筛选。数据集涵盖31种语言变体,每种语言独立配置,便于按需加载。
特点
该数据集的核心特色在于其跨语言音位表征与正交表征的双轨并行设计。每个语料同时提供经过字符分割的正交文本和音素转录文本,后者以空格分隔并嵌入词边界标记,为比较音位级与字符级语言模型提供了直接对照。数据规模庞大,英语北美变体包含超过250万条语料,总音素数逾3000万,且所有语言均标注了说话者是否为儿童,当前版本专注于成人语音。此外,数据集按儿童月龄排序,支持认知发展阶段的纵向研究,并关联至Phoible音位清单数据库,赋予每条语料音系学背景。
使用方法
该数据集适用于训练音位级或字符级语言模型,亦可用于跨语言音系学与认知建模研究。用户可通过HuggingFace Datasets库加载指定语言配置,例如使用`load_dataset('transformersegmentation/CHILDES', 'EnglishNA')`获取英语北美子集。模型训练时,可直接利用`ipa_transcription`列结合基于空格的简单分词器构建音素序列语言模型,或使用`processed_gloss`列搭配标准子词分词器。通过`target_child_age`字段可限制训练数据至特定年龄范围,以模拟儿童语言习得过程。该数据集已应用于音位语言建模与词边界分割等下游任务,相关论文提供了详细基准。
背景与挑战
背景概述
IPA-CHILDES数据集由研究者于2024年创建,依托于国际儿童语言交流系统(CHILDES)的丰富语料库,旨在为跨语言音系学和音素级语言建模提供标准化的资源。该数据集覆盖31种语言,包括英语、法语、汉语等,通过自动化工具将儿童导向言语(Child-Directed Speech)转换为音素转录,并保留了原始语料中的形态、词性等元数据。核心研究问题聚焦于探索音素表征在认知建模和语言习得研究中的潜力,尤其关注儿童语言输入的音系结构。其影响力体现在为计算语言学、心理语言学和自然语言处理领域提供了大规模、多语种的音素级基准,推动了跨语言比较和儿童语言发展模型的构建。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,音素级语言建模需应对跨语言音系差异的复杂性,如不同语言的音素库大小和音位变体规则不一致,导致模型泛化困难;2)构建过程中,自动化音素转换工具(如phonemizer、epitran)对低资源语言(如Quechua、Basque)的覆盖不完善,可能引入转录误差;此外,CHILDES原始语料中儿童言语的过滤策略(当前仅保留成人话语)限制了模型对儿童语言产出模式的学习能力,而语料库中语言间数据量严重不均衡(如EnglishNA包含256万条话语,而Farsi仅2万条)加剧了跨语言建模的偏差风险。
常用场景
经典使用场景
在儿童语言习得与计算语言学交叉领域,IPA-CHILDES数据集为音素级语言建模提供了跨语言基准资源。其经典使用场景聚焦于训练基于音素的字符级语言模型,研究者可利用'ipa_transcription'与'character_split_utterance'列,通过简单的空白分词器比较音素与正字法转录对语言学习的影响。数据集涵盖31种语言,按儿童年龄排序的特性使学者能限定训练数据范围,模拟婴儿在特定发育阶段的语言输入,从而在控制语言输入量的条件下探究音系习得规律。这种设计使其成为研究儿童导向语音学特征与语言模型早期学习机制的标准测试平台。
实际应用
在实际应用中,IPA-CHILDES数据集直接服务于儿童语音助手与教育技术的开发。基于其音素化语料训练的语言模型可用于构建儿童语音识别系统,提升对非标准发音的鲁棒性。在语言障碍诊断领域,该数据集帮助研究者建立儿童音系发展的基线模型,通过对比自闭症或特定语言障碍儿童的语音产出模式,辅助早期筛查。同时,其多语言特性支持跨文化语言学习应用的本地化,例如为不同母语背景的儿童设计自适应语音学习工具,利用音素级输入优化发音纠错与词汇习得算法。
衍生相关工作
该数据集衍生出多项前沿研究,其中最具代表性的是利用其音素标注进行词边界分割的探针任务,相关工作如《BabyLM's First Words: Word Segmentation as a Phonological Probing Task》通过对比音素级与字符级语言模型在无监督分割上的表现,揭示了音系特征对词汇发现的促进作用。此外,基于该数据集发展的G2P+工具为跨语言字素-音素转换提供了增强特征资源,推动了低资源语言语音合成与音系分析工具的进步。这些工作共同构成了从音系建模到认知模拟的研究链条,强化了IPA-CHILDES作为儿童语言计算研究基础设施的地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务