遇见数据集

kana-sounds

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

Kana Sounds 是一个用于日语假名发音学习的音频数据集,包含104个短语音剪辑,覆盖所有平假名和片假名字符的发音。数据集由46个清音(seion)、20个浊音(dakuon)、5个半浊音(handakuon)和33个拗音(yoon)组成,每个剪辑对应一个罗马音标注的发音。所有音频经过修剪、音高修正(向330 Hz调整)和响度归一化(-20 dBFS RMS),以单声道44.1 kHz采样率、128 kbps比特率的MP3格式存储,总时长约81秒,总大小1.6 MB。平假名和片假名共享同一音频文件,因为二者发音相同。数据集适用于音频分类、自动语音识别和文本转语音等任务,尤其适合日语语言学习场景。数据来源于Learn Japanese Adventure网站,采用CC BY 4.0许可。

Kana Sounds is an audio dataset for learning Japanese kana pronunciation, containing 104 short audio clips covering all hiragana and katakana characters. The dataset consists of 46 seion (plain sounds), 20 dakuon (voiced sounds), 5 handakuon (semi-voiced sounds), and 33 yoon (contracted sounds). Each clip is labeled with its romaji pronunciation. All audio clips have been trimmed, pitch-corrected (to 330 Hz), and loudness-normalized (-20 dBFS RMS). They are stored as mono MP3 files at 44.1 kHz sample rate and 128 kbps bitrate, with a total duration of approximately 81 seconds and a total size of 1.6 MB. Hiragana and katakana share the same audio files because they have the same pronunciation. The dataset is suitable for tasks such as audio classification, automatic speech recognition, and text-to-speech, especially for Japanese language learning scenarios. The data is sourced from the Learn Japanese Adventure website and is licensed under CC BY 4.0.

创建时间:
2026-08-26
原始信息汇总

Kana Sounds 数据集详情

基本信息

  • 数据集名称:Kana Sounds
  • 许可协议:CC BY 4.0
  • 语言:日语
  • 数据集规模:少于1000条样本(具体为104条)
  • 任务类别:音频分类、自动语音识别、文本转语音
  • 标签:日语、假名、平假名、片假名、发音、语言学习

数据集内容

该数据集包含104个简短的日语假名发音音频片段,覆盖全部平假名和片假名的发音。具体包括:

  • 清音(Seion):46个片段
  • 浊音(Dakuon):20个片段
  • 半浊音(Handakuon):5个片段
  • 拗音(Yoon):33个片段

每个音频文件使用罗马字命名,平假名与片假名共用同一个音频片段。所有片段经过修剪、音高校正和响度归一化处理,确保播放时音量一致。

音频格式

属性 说明
格式 MP3 (LAME),128 kbps
声道 单声道
采样率 44.1 kHz
片段数量 104个
时长 0.39秒至1.54秒,中位数0.77秒,总计81秒
响度 -20 dBFS RMS,峰值低于-1 dBFS
音高 调整为约330 Hz
总大小 1.6 MB

数据处理流程

  1. 修剪:去除首尾静音,保留30ms头填充和60ms尾填充,两端应用8ms淡入淡出。
  2. 音高调整:通过自相关估计基频,使用 sox 将其移至330 Hz,最大偏移限制在6个半音内。
  3. 电平校准:缩放至-20 dBFS RMS,若峰值超过-1 dBFS则整体降低。
  4. 编码:使用 ffmpeg 将音频编码为单声道128 kbps MP3。

命名规则

文件命名遵循罗马字拼写,但有四个例外情况,文件使用源录音的训令式风格命名:

假名 显示名 文件名
ぢ/ヂ dji audio/dakuon/di.mp3
づ/ヅ dzu audio/dakuon/du.mp3
しゃしゅしょ sha shu sho audio/yoon/sya.mp3syusyo
ちゃちゅちょ cha chu cho audio/yoon/cya.mp3cyucyo
じゃじゅじょ ja ju jo audio/yoon/zya.mp3zyuzyo

使用方式

可通过 load_dataset 函数加载整个数据集,或使用 hf_hub_download 下载单个音频文件。

引用信息

如需引用该数据集,可使用提供的 BibTeX 格式引用。数据集的原始录音来源于 Learn Japanese Adventure,遵循 CC BY 4.0 许可协议。

搜集汇总
数据集介绍
kana-sounds 数据集图片
构建方式
该数据集为日语假名发音学习精心打造,收录了日语平假名与片假名全部104个基础音节,涵盖清音、浊音、半浊音及拗音四大类别。每个音节均以独立音频文件呈现,源自Learn Japanese Adventure平台,并依据CC BY 4.0许可协议进行再分发。原始录音经过精细的后期处理,包括静音裁剪、基频校正至330赫兹附近、响度统一至-20 dBFS RMS,并辅以峰值限制,确保所有音频在连贯播放时音量一致,无突兀跳跃。音频统一编码为单声道、44.1 kHz采样率、128 kbps比特率的MP3格式,总时长约81秒,体积紧凑,便于快速加载与集成。
特点
该数据集的核心特色在于其系统性与规范性。它依照日语五十音图的结构,将104个假名发音分门别类存储于seion、dakuon、handakuon、yoon四个子目录中,命名简洁明晰,直接采用罗马字或对应假名,便于程序化定位与访问。尤为巧妙的是,平假名与片假名共享同一音频文件,因二者读音一致,既精简了数据量,又避免了冗余。所有音频均经过标准化处理,音质纯净、响度均衡,且已校正音高偏差,为语音识别、文本转语音及语言学习应用提供了高质量、一致性强的训练与测试素材。
使用方法
该数据集可通过Hugging Face Datasets库便捷加载,利用`load_dataset`函数配合`audiofolder`特性,即可一键获取全部音频文件。亦可通过`hf_hub_download`按需下载单个音频,灵活满足不同场景需求。数据集的目录结构天然支持按假名类别进行筛选,开发者可轻松构建发音词典或集成至Kana Trainer等语言学习工具中。此外,数据集附带完整的字符-文件映射表,便于快速查阅每个假名对应的音频路径,极大地简化了集成流程。对于语音合成、发音评估等任务,该数据集亦可作为基准语料,助力模型训练与效果验证。
背景与挑战
背景概述
Kana Sounds数据集由Arsalan Anwari于近期创建,旨在为日语假名学习提供标准化的音频资源。该数据集包含104个短音频片段,覆盖了平假名和片假名的全部清音、浊音、半浊音及拗音,每个片段均经过修剪、音高校正和响度归一化处理,确保了发音的清晰与一致性。数据集依托Kana Trainer应用,其核心研究问题在于如何通过高质量、标准化的发音数据辅助日语初学者准确掌握假名读音。该数据集采用CC BY 4.0许可,基于Learn Japanese Adventure的录音进行再处理,为语言学习、语音识别及语音合成等领域提供了宝贵的基准资源,对日语教育技术及语音处理研究具有积极的推动作用。
当前挑战
Kana Sounds数据集所解决的领域问题主要集中于日语假名发音的标准化与一致性。原始录音的频率范围从149Hz到367Hz,响度差异约15dB,这给数据集构建带来了显著挑战。为克服这些障碍,数据集构建过程中采用了自动化的音频处理流程,包括基于自相关的基频估计与音高偏移(限制在6个半音以内)、响度归一化至-20dBFS RMS并限制峰值不超过-1dBFS,以及精准的静音修剪与淡入淡出处理。此外,平假名与片假名读音一致性的处理、清浊音及拗音的分类命名等细节问题,也要求构建者具备深入的语音学知识,确保最终数据既满足技术规范,又符合语言学准确性,从而为语言学习提供可靠支持。
常用场景
经典使用场景
作为日语假名发音的典范性音频语料,该数据集在语音识别与语言教学领域占据独特地位。它涵盖了平假名与片假名全部104个基础音节,包括清音、浊音、半浊音及拗音,每个音频片段均经过精确的静音裁剪、基频校正与响度归一化处理,确保了音质的高度一致性与可辨识度。这一设计使其成为日语语音识别系统训练的理想基准数据,尤其在区分发音相近的假名(如‘し’与‘ち’)时具有重要价值。同时,该数据集的简洁结构与明确命名规则,使其能够无缝集成至音频分类任务中,支持对假名发音的自动判别与验证,为日语发音教学提供可靠的参考标准。
解决学术问题
该数据集有效解决了日语假名发音研究中长期存在的音频样本不统一、质量参差不齐的痛点。通过严格的标准化处理,消除了原始录音在音高、音量和时长上的差异,为对比实验提供了纯净的语音材料。这一特性使得研究者能够聚焦于声学特征与音系规则的分析,而不受噪声干扰。在学术层面,它推动了对日语清浊音对立、拗音连读以及音节时长等课题的量化研究,并为计算语言学中的假名-音素映射提供了实证基础。其开源许可与详尽文档,进一步促进了跨机构研究结果的复现与比较,提升了该领域研究的科学性与可信度。
衍生相关工作
该数据集的发布催生了多项衍生研究与应用。基于其高度规范化的音频,研究者构建了日语假名发音检测模型,用于自动评估学习者的发音准确性。同时,其结构化的命名与分组方式,为建立假名-罗马字-音素的多层级映射词典提供了直接素材,促进了跨语言语音对比研究。在语音合成领域,该数据集的短小、清晰片段被用作单元选择合成的基础单元,提升了合成语音的自然度。此外,Kana Trainer项目本身已成为开源社区中日语学习工具的重要参考,推动了同类教育应用在音频处理与用户交互设计上的创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务