遇见数据集

CHILDES-Aligned

收藏
arXiv2026-07-04 更新2026-07-07 收录
数据链接:
官方服务:

资源简介:

CHILDES-Aligned 是由伊利诺伊大学厄巴纳-香槟分校等机构联合创建的一个经过精心整理的儿童语音数据集,旨在解决原始CHILDES语料库中话语级时间戳噪声大、不完整或与音频未对齐的问题。该数据集包含413小时的自然儿童-成人互动长时录音,并提供了经过BEACON框架校正的精确话语级时间戳,同时从中提取了一个283小时的高质量子集用于语音识别训练。数据创建过程采用了多模型时间戳集成技术,通过聚合多个现成的ASR模型的预测结果,并采用共识投票策略来生成可靠的时间边界。该数据集主要应用于儿童语音识别、语言发展研究以及语音模型的训练与评估领域,旨在提升模型在真实儿童语音场景下的鲁棒性和准确性。

CHILDES-Aligned is a meticulously curated child speech dataset jointly created by the University of Illinois Urbana-Champaign and other institutions, aiming to resolve the issues of excessive utterance-level timestamp noise, incompleteness, and audio misalignment in the original CHILDES corpus. This dataset contains 413 hours of long-duration natural child-adult interactive recordings, and provides precise utterance-level timestamps corrected via the BEACON framework. Additionally, a 283-hour high-quality subset is extracted from it for speech recognition training. The data creation process adopts multi-model timestamp integration technology, which aggregates predictions from multiple off-the-shelf ASR models and employs a consensus voting strategy to generate reliable temporal boundaries. This dataset is primarily applied in the fields of child speech recognition, language development research, as well as speech model training and evaluation, with the goal of improving the robustness and accuracy of models in real-world child speech scenarios.

创建时间:
2026-07-04
搜集汇总
数据集介绍
CHILDES-Aligned 数据集图片
构建方式
CHILDES-Aligned数据集的构建基于一种称为BEACON的多模型时间戳集成框架。该框架首先利用四种架构各异的离线自动语音识别系统对长格式录音进行解码,生成词级时间戳流。随后,每一组词流被独立地与参考转录文本进行对齐,通过搜索窗口确定、窗内候选搜索以及单调动态规划路径选择等步骤,为每个语句分配候选时间跨度。最后,通过一致性投票机制整合来自不同模型的时间跨度提议,并对原有时戳进行校验、恢复或标记为未解决,从而生成最终的高精度语句级时间戳。
使用方法
CHILDES-Aligned数据集提供了两种版本以适应不同研究需求。通用版本保留了原始CHAT格式的注释标记,适用于语言学分析、语音与语言发展研究等场景。自动语音识别训练版本则提供了逐字规范化的转录文本,并经过严格的对齐质量筛选,可直接用于微调或预训练语音识别模型。研究人员可以通过代码仓库获取经过校正的语句级时间戳以及相应的音频片段,依据任务需求选择合适的数据版本,并将其作为训练或评估集,以提升模型在儿童语音识别任务上的表现。
背景与挑战
背景概述
CHILDES-Aligned数据集由伊利诺伊大学厄巴纳-香槟分校、香港中文大学(深圳)、IBM研究院及纽约州立大学布法罗分校的研究人员于2026年联合构建。该数据集旨在解决儿童语音识别领域长期面临的核心困境:尽管CHILDES语料库收录了大量自然语境下的儿童-成人交互录音及详尽的语言学标注,但其话语级时间戳普遍存在噪声大、不完整或与音频错位的问题,严重制约了这些珍贵数据在语音模型训练与评测中的直接应用。研究团队提出的BEACON框架,通过集成多种商用自动语音识别系统的时间戳预测结果,经对齐与共识投票策略,成功为413小时英语儿童语音数据恢复了精确的话语边界,并从中筛选出283小时高质量子集用于监督学习。这一成果不仅为儿童语音研究提供了可规模化利用的训练资源,更通过在下游四个跨领域儿童语音基准上的实验验证,证明了该数据集能够显著提升语音识别模型的泛化能力。
当前挑战
该数据集所应对的核心挑战在于三点。其一,领域层面,儿童语音因声学与语言学特征随年龄剧烈变化,导致主流成人语音识别模型性能急剧衰退,而高质量标注的儿童语音数据极度匮乏,限制了适应性技术的发展。其二,数据构建层面,CHILDES语料库的长形式录音中,原有话语级时间戳常因手动标注误差或录音条件限制而不可靠,传统强制对齐工具在处理长时、嘈杂的会话音频时容易产生偏移或幻觉,且无法保留原始说话人归属与语言学注释结构。其三,质量保障层面,研究团队需在保持高召回率的同时确保时间戳精度,通过多模型集成投票机制识别并剔除不一致片段,并设计严格的后处理过滤流程,以排除包含静音、非语音或转录不匹配的剪辑,最终在413小时通用数据中析取经质量控制的283小时可训练子集,这一精炼过程本身即是复杂的技术权衡。
常用场景
经典使用场景
在儿童语言发展研究中,CHILDES-Aligned数据集的核心价值在于其为自然主义亲子互动录音提供了精确且可靠的语句级时间戳校正。研究者可借此精准定位长篇录音中每个语轮的时间边界,从而将原始CHILDES语料库中丰富但时间标注混乱的语音数据,转化为可直接用于自动语音识别(ASR)模型训练与评估的结构化语音片段。该数据集特别适用于儿童语音识别系统的微调与基准测试,因其保留了原始人类转写文本与说话人属性标注,为探究儿童声学与语言特征的年龄依赖变化提供了高质量的训练材料。
解决学术问题
该数据集解决了儿童语音识别研究中长期存在的标注数据匮乏与时间戳噪声问题。尽管CHILDES语料库规模庞大且蕴含丰富的语言发展信息,但其语句级时间戳常因缺失、错误或与音频错位而难以直接利用。CHILDES-Aligned通过多模型时间戳集成方法BEACON,聚合多个异构ASR系统的词级时间预测,以共识投票机制校正边界,从而在不破坏原始转录文本的前提下,实现了对长篇嘈杂对话录音的精准语句分割。这一工作显著提升了儿童语音数据在ASR下游任务中的可用性,为探究儿童语音与成人语音的声学差异、年龄相关的发音变化以及弱监督条件下的语音对齐技术提供了关键数据支撑。
实际应用
在实际应用中,CHILDES-Aligned数据集可用于开发面向儿童的教育交互系统,如智能语音辅导工具、儿童阅读能力评估软件以及面向语言障碍儿童的辅助沟通设备。由于该数据集提供了经过质量控制的ASR就绪子集(约283小时),企业研究机构可直接利用其训练和优化儿童语音识别引擎,提升在嘈杂家庭环境、非流利发音及低龄儿童语音场景下的鲁棒性。此外,该数据集还可服务于亲子互动分析、语言习得里程碑自动检测以及基于语音的情感计算等交叉领域,为儿童发展与教育科技提供可扩展的语料基础设施。
数据集最近研究
最新研究方向
CHILDES-Aligned数据集的最新研究聚焦于利用多模型集成与共识投票机制,系统性地解决儿童长时自然交互录音中话语级时间戳不准确、不完整或与音频失配的长期难题。研究前沿围绕BEACON框架展开,通过汇聚多个架构各异的现成自动语音识别(ASR)模型(如Parakeet、Canary、WhisperX与Qwen3-ASR)的逐词时间戳预测,经对齐与多数合并策略,精准恢复每个话语的起止边界,并发布超过400小时的通用儿童语音数据及283小时的高质量ASR训练子集。该工作紧密关联儿童语音识别领域长期受困于数据稀缺与领域迁移的热点事件——由于声学与语言特征随年龄剧烈变化,现有ASR系统在儿童语音上性能显著下降。CHILDES-Aligned通过保留原始人工标注与说话人结构,不仅大幅提升了时间戳精度(在ASR代理指标上取得最优的准确率与数据保留权衡),更在下游微调实验中使多个模型在四个域外儿童语音基准上平均实现19.5%的相对词错误率降低,为儿童语音研究提供了可规模化利用的高品质资源,深刻推动了弱时间戳语音语料库在真实教育场景中的落地应用。
相关研究论文
  • 1
    CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling伊利诺伊大学厄巴纳: 香槟分校; 香港中文大学·深圳; IBM研究院; 布法罗大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务