jaylee8864/korean-vocabulary-5000
收藏资源简介:
Koko Korean 5K多语言词汇数据集是一个高质量的平行语料库,包含5,000个精心挑选的韩语词汇条目,每个条目提供英语翻译、罗马化拼写、上下文使用说明和例句。此外,每个条目还被翻译成9种其他语言(包括西班牙语、葡萄牙语、日语、中文等),总计形成50,000条对齐的词汇记录,以韩语为基础锚定。数据集内容基于K-drama、K-pop和日常韩语的真实对话模式,而非仅限于教科书材料,因此特别适用于训练针对现代、非正式韩语的语言模型和应用程序。数据集支持多种用例,如韩语语言模型训练、词汇应用开发、语言学研究以及跨语言评估。
许可证:知识共享署名4.0(CC BY 4.0) 覆盖语言:韩语、英语、西班牙语、葡萄牙语、日语、中文、印尼语、越南语、德语、法语、泰语 样本量范围:10000 < 样本量 < 100000 任务类别:翻译、文本分类、特征提取 标签:韩语、词汇、语言学习、K-pop(韩国流行音乐)、K-drama(韩剧)、多语言、平行语料库 数据集名称:Koko Korean 5K — 多语言词汇数据集 配置项: - 配置名称:en,数据文件:words.en.jsonl - 配置名称:es,数据文件:words.es.jsonl - 配置名称:pt-BR,数据文件:words.pt-BR.jsonl - 配置名称:ja,数据文件:words.ja.jsonl - 配置名称:zh-TW,数据文件:words.zh-TW.jsonl - 配置名称:id,数据文件:words.id.jsonl - 配置名称:vi,数据文件:words.vi.jsonl - 配置名称:de,数据文件:words.de.jsonl - 配置名称:fr,数据文件:words.fr.jsonl - 配置名称:th,数据文件:words.th.jsonl # Koko Korean 5K — 多语言词汇数据集 本数据集包含5000条精心甄选的韩语词汇条目,附带英语译文、罗马音标注、语境使用说明及例句。每条词汇同时被翻译成**额外9种语言**,为研究者与开发者提供了以韩语为锚点的高质量平行语料库,共计**50000条对齐词汇记录**。 该数据集取材自韩剧(K-drama)、K-pop(韩国流行音乐)及日常韩语中的真实对话场景,而非仅局限于教科书内容,尤其适用于训练面向现代非正式韩语的语言模型与应用程序。 ## 语言覆盖 | 语言代码 | 语言名称 | |---|---| | `en` | 英语(源语言) | | `es` | 西班牙语 | | `pt-BR` | 巴西葡萄牙语 | | `ja` | 日语 | | `zh-TW` | 中国台湾地区繁体中文 | | `id` | 印尼语 | | `vi` | 越南语 | | `de` | 德语 | | `fr` | 法语 | | `th` | 泰语 | 韩语(`ko`)在每条记录中以`korean_term`(韩语谚文原文)、`romanization`(修正式罗马音标注)和`example_sentence_korean`(韩语例句)的形式存在。 ## 应用场景 - 训练韩语语言模型(词汇习得、掩码语言模型、翻译任务) - 构建词汇学习应用与抽认卡工具 - 开展韩语敬语、罗马音标注及词汇分类相关的语言学研究 - 开展10种目标语言间的翻译质量评估 - 跨语言检索与嵌入基准测试 ## 数据字段 所有语言版本的数据集均采用统一的字段规范,具体如下: | 字段名 | 数据类型 | 字段说明 | |---|---|---| | `slug` | 字符串 | 与URL兼容的唯一标识符(在所有语言版本中保持稳定) | | `english_term` | 字符串 | 英语释义(非英语版本文件中为对应语言的译文) | | `korean_term` | 字符串 | 韩语谚文文本 | | `romanization` | 字符串 | 修正式罗马音标注 | | `context_description` | 字符串 | 文化背景与使用语境说明 | | `example_sentence_korean` | 字符串 | 韩语例句 | | `example_sentence_english` | 字符串 | 例句的英语(或对应语言)译释 | | `difficulty` | 字符串 | 难度等级:`入门` / `中级` / `高级` | | `category` | 字符串 | 主题分类(如情感、问候、饮食、K-pop等) | 所有10种语言版本的数据集均共享统一的`slug`字段,可通过该字段快速对齐得到多语言平行条目。 ## 快速上手 python from datasets import load_dataset # 仅加载英语源数据集 ds = load_dataset("jaylee8864/korean-vocabulary-5000", "en") print(ds["train"][0]) # 加载日语版本数据集 ds_ja = load_dataset("jaylee8864/korean-vocabulary-5000", "ja") 或直接加载原始JSONL文件: python import json with open("words.en.jsonl") as f: rows = [json.loads(line) for line in f] ## 主题分类 数据集覆盖约80个主题分类,包括问候、情感、饮食、K-pop、韩剧表达、出行、购物、工作、家庭、俚语、习语、数字、身体部位、天气、敬语等。 ## 来源与在线演示 本数据集由**Koko AI**(https://kokoai.im)——一款AI驱动的韩语会话辅导工具——精心编纂并搭配音频资源。每条词汇条目均附带母语者发音的语音合成(TTS)音频,且在平台上配有专属学习页面。 可前往 https://kokoai.im/word 浏览完整带音频的数据集。 ## 许可证 **知识共享署名4.0(CC BY 4.0)**:可自由用于商业或非商业用途,但需注明出处至 ["kokoai.im"](https://kokoai.im)。 ## 引用格式 bibtex @dataset{koko_korean_5k_2026, author = {Koko AI}, title = {Koko Korean 5K — Multilingual Vocabulary Dataset}, year = {2026}, url = {https://huggingface.co/datasets/jaylee8864/korean-vocabulary-5000}, homepage = {https://kokoai.im} }



