wannaphong/korean-vocabulary-5000
收藏资源简介:
Koko Korean 5K — 多语言词汇数据集是一个包含5000个精心挑选的韩语词汇条目的数据集,每个条目都配有英语翻译、罗马化、上下文使用说明和例句。此外,每个条目还被翻译成其他9种语言,形成了一个包含50,000个对齐词汇记录的高质量平行语料库。数据集反映了来自韩剧、韩流和日常韩语的真实对话模式,适用于训练针对现代、休闲韩语的语言模型和应用程序。数据集支持多种语言,包括韩语、英语、西班牙语、葡萄牙语、日语、中文(繁体)、印尼语、越南语、德语、法语和泰语。适用于多种用例,如训练韩语语言模型、构建词汇应用程序和闪卡工具、进行韩语敬语、罗马化和词汇分类的语言学研究、跨10种目标语言的翻译质量评估以及跨语言检索和嵌入基准测试。
The Koko Korean 5K — Multilingual Vocabulary Dataset is a dataset containing 5,000 carefully curated Korean vocabulary entries, each with English translations, romanization, contextual usage notes, and example sentences. Each entry is also translated into 9 additional languages, forming a high-quality parallel corpus of 50,000 aligned vocabulary records. The dataset reflects real conversation patterns from K-dramas, K-pop, and everyday Korean, making it particularly useful for training language models and applications targeting modern, casual Korean. The dataset supports multiple languages, including Korean, English, Spanish, Portuguese, Japanese, Chinese (Traditional), Indonesian, Vietnamese, German, French, and Thai. It is suitable for various use cases such as training Korean language models, building vocabulary apps and flashcard tools, conducting linguistic research on Korean honorifics, romanization, and word categorization, evaluating translation quality across 10 target languages, and benchmarking cross-lingual retrieval and embeddings.



