遇见数据集

krishnAbadikelA/pair_tamil_malayalam_ipa

收藏
Hugging Face2025-08-28 更新2025-10-25 收录
官方服务:

资源简介:

该数据集名为pair_tamil_malayalam_ipa,包含泰米尔语和马拉雅拉姆语的成对数据,以及它们的国际音标(IPA)表示。数据集分为训练集和验证集,其中训练集包含大约885万条样本,验证集包含约11万条样本。

The dataset named pair_tamil_malayalam_ipa contains paired data in Tamil and Malayalam languages, along with their International Phonetic Alphabet (IPA) representations. The dataset is split into training and validation sets, with the training set containing approximately 8.85 million samples and the validation set containing about 110,000 samples.

提供机构:
krishnAbadikelA
二维码
社区交流群
二维码
科研交流群
商业服务