StephanAkkerman/frequency-words-2018
收藏资源简介:
该数据集是hermitdaves FrequencyWords的克隆,原始数据集可以在OpenSubtitles2018网站上找到。数据集中包含了多种语言的单词频率信息,支持的语言包括阿尔巴尼亚语、南非荷兰语、阿姆哈拉语、阿拉伯语、亚美尼亚语、阿塞拜疆语、孟加拉语、波斯尼亚语、布列塔尼语、保加利亚语、加泰罗尼亚语、简体中文、繁体中文、克罗地亚语、捷克语、丹麦语、荷兰语、英语、世界语、爱沙尼亚语、芬兰语、法语、加利西亚语、格鲁吉亚语、德语、希腊语、古吉拉特语、印地语、匈牙利语、印度尼西亚语、冰岛语、意大利语、日语、卡纳达语、韩语、哈萨克语、拉脱维亚语、立陶宛语、马拉雅拉姆语、马来语、马其顿语、马拉地语、挪威语、波兰语、葡萄牙语、巴西葡萄牙语、罗马尼亚语、俄语、僧伽罗语、斯洛伐克语、斯洛文尼亚语、泰米尔语、泰卢固语、泰语、他加禄语、土耳其语、乌克兰语、乌尔都语、越南语以及双语中文/英语。
The Frequency Words 2018 dataset is a clone of the data provided by hermitdaves FrequencyWords project, with the original data sourced from OpenSubtitles2018. This dataset contains word frequency information for multiple languages, including Albanian, Afrikaans, Amharic, Arabic, Armenian, Azerbaijani, Bengali, Bosnian, Breton, Bulgarian, Catalan, Simplified Chinese, Traditional Chinese, Croatian, Czech, Danish, Dutch, English, Esperanto, Estonian, Finnish, French, Galician, Georgian, German, Greek, Gujarati, Hindi, Hungarian, Indonesian, Icelandic, Italian, Japanese, Kannada, Korean, Kazakh, Latvian, Lithuanian, Malayalam, Malay, Macedonian, Marathi, Norwegian, Polish, Portuguese, Brazilian Portuguese, Romanian, Russian, Sinhala, Slovak, Slovenian, Tamil, Telugu, Thai, Tagalog, Turkish, Ukrainian, Urdu, Vietnamese, and Bilingual Chinese/English.




