Elite35P-Server/EliteVoiceProject|声音识别数据集|虚拟偶像数据集
收藏数据集概述
数据集名称
- Elite Voice Project
数据集目的
- 旨在将hololive所属Vtuberさくらみこ的声音数据集化,以便用于语音识别等领域。
语言信息
- 语言: 日语 (ja)
- 语言创建者: さくらみこ, hololive production
- 注释创建方式: 众包
- 多语言性: 单语种
许可信息
- 许可证: 其他
- 版权声明: 数据集内的音频数据版权由カバー株式会社等持有,仓库所有者和贡献者不拥有任何权利。所有数据使用遵循hololive production的二次创作指南。
数据集结构
-
音频数据:
- 存储于
audio_raw
目录,根据来源平台分为youtube
,twitch
,twitter
。 - 每个平台下分为
train
和test
两个子目录,用于不同的数据集训练和测试。 - 每个子目录下按ID存储音频文件,文件格式为mp3,长度不超过30秒,且应避免包含背景音乐、音效或噪音。
- 存储于
-
文本数据:
- 存储于
transcript_raw
目录,同样根据来源平台分为youtube
,twitch
,twitter
。 - 每个平台下分为
train
和test
两个子目录,存储对应音频的文本转录数据。 - 文本数据以CSV格式存储,文件名为
<ID>.csv
,内容包括音频文件路径和对应的转录文本。
- 存储于
数据集贡献指南
- 贡献者需遵循hololive production的二次创作指南。
- 音频和文本数据的添加应按照指定目录结构进行,确保数据的一致性和准确性。
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
Materials Project
材料项目是一组标有不同属性的化合物。数据集链接: MP 2018.6.1(69,239 个材料) MP 2019.4.1(133,420 个材料)
OpenDataLab 收录
FER2013
FER2013数据集是一个广泛用于面部表情识别领域的数据集,包含28,709个训练样本和7,178个测试样本。图像属性为48x48像素,标签包括愤怒、厌恶、恐惧、快乐、悲伤、惊讶和中性。
github 收录
糖尿病预测数据集
糖尿病相关的医学研究或者健康数据
AI_Studio 收录
ChineseSafe
ChineseSafe是由南方科技大学统计与数据科学系创建的一个中文安全评估基准数据集,旨在评估大型语言模型在识别中文不安全内容方面的能力。该数据集包含205,034个样本,涵盖4个类别和10个子类别的安全问题,特别关注政治敏感性、色情内容和变体/同音词等新型安全问题。数据集通过从开源数据集和互联网资源中收集数据,经过数据清洗和去重处理,确保了数据集的高质量和多样性。ChineseSafe的应用领域主要集中在大型语言模型的安全评估,旨在帮助开发者和研究者提升模型在实际应用中的安全性。
arXiv 收录