wiktionary
收藏资源简介:
Wiktionary Structured 是一个从维基词典(Wiktionary)提取的大规模、多语言、结构化词典数据集。该数据集涵盖了数百种语言,数据量在1000万到1亿之间。数据集以 Parquet 格式组织,包含多个配置,主要分为:词义(senses,按语言分区,如中文 senses_zh、英文 senses_en、德文 senses_de 等)、词条(entries)、例句(examples)、词形(forms)、关联(linkages)、发音(sounds)和翻译(translations)。所有数据仅包含训练集(train split)。数据集适用于多种自然语言处理任务,包括机器翻译、文本检索和文本生成。数据内容涉及词典学、词源、国际音标(IPA)、语音学和跨语言翻译。数据集采用知识创造署名-相同方式共享 4.0 许可证(CC-BY-SA-4.0)发布。
Wiktionary Structured is a large-scale, multilingual, structured lexicon dataset extracted from Wiktionary. It covers hundreds of languages with data volume ranging from 10 million to 100 million. The dataset is organized in Parquet format and includes multiple configurations, primarily divided into: senses (partitioned by language, such as senses_zh for Chinese, senses_en for English, senses_de for German, etc.), entries, examples, forms, linkages, sounds, and translations. All data only includes the training split. The dataset is suitable for various natural language processing tasks, including machine translation, text retrieval, and text generation. The content involves lexicography, etymology, International Phonetic Alphabet (IPA), phonetics, and cross-lingual translation. The dataset is released under the Creative Commons Attribution-ShareAlike 4.0 License (CC-BY-SA-4.0).
数据集概述:Wiktionary Structured
基本信息
- 数据集名称:Wiktionary Structured
- 许可证:cc-by-sa-4.0
- 数据集规模:10M < n < 100M
- 任务类别:翻译、文本检索、文本生成
标签
该数据集涉及词汇学、词典编纂、词源学、国际音标(IPA)、语音学、翻译等多个领域,标签包括:wiktionary, lexicography, dictionary, etymology, ipa, phonetics, translation。
数据集配置
数据集包含多个配置(configs),主要分为两大类:
1. 按语言划分的义项(senses)子集
每个子集对应一种特定语言的义项数据,均为训练集(split: train),数据格式为 Parquet:
- senses_it(意大利语)
- senses_ja(日语)
- senses_la(拉丁语)
- senses_pl(波兰语)
- senses_pt(葡萄牙语)
- senses_ru(俄语)
- senses_sv(瑞典语)
- senses_zh(中文)
- senses_ca(加泰罗尼亚语)
- senses_de(德语)
- senses_en(英语)
- senses_es(西班牙语)
- senses_fi(芬兰语)
- senses_fr(法语)
- senses_gl(加利西亚语)
2. 通用数据集配置
以下配置包含所有语言的综合数据,均为训练集(split: train),数据格式为 Parquet:
- entries:词条数据
- examples:示例数据
- forms:词形数据
- linkages:链接关系数据
- senses:义项数据
- sounds:发音数据
- translations:翻译数据
数据格式
所有数据文件均以 Parquet 格式存储。
支持的语言
该数据集涵盖极其广泛的语言种类,包括但不限于:英语、法语、德语、西班牙语、中文、日语、俄语、葡萄牙语、意大利语、拉丁语、波兰语、瑞典语、芬兰语、加泰罗尼亚语、加利西亚语等数千种语言及方言。具体语言代码列表如上所示。




