遇见数据集

wiktionary

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

Wiktionary Structured 是一个从维基词典(Wiktionary)提取的大规模、多语言、结构化词典数据集。该数据集涵盖了数百种语言,数据量在1000万到1亿之间。数据集以 Parquet 格式组织,包含多个配置,主要分为:词义(senses,按语言分区,如中文 senses_zh、英文 senses_en、德文 senses_de 等)、词条(entries)、例句(examples)、词形(forms)、关联(linkages)、发音(sounds)和翻译(translations)。所有数据仅包含训练集(train split)。数据集适用于多种自然语言处理任务,包括机器翻译、文本检索和文本生成。数据内容涉及词典学、词源、国际音标(IPA)、语音学和跨语言翻译。数据集采用知识创造署名-相同方式共享 4.0 许可证(CC-BY-SA-4.0)发布。

Wiktionary Structured is a large-scale, multilingual, structured lexicon dataset extracted from Wiktionary. It covers hundreds of languages with data volume ranging from 10 million to 100 million. The dataset is organized in Parquet format and includes multiple configurations, primarily divided into: senses (partitioned by language, such as senses_zh for Chinese, senses_en for English, senses_de for German, etc.), entries, examples, forms, linkages, sounds, and translations. All data only includes the training split. The dataset is suitable for various natural language processing tasks, including machine translation, text retrieval, and text generation. The content involves lexicography, etymology, International Phonetic Alphabet (IPA), phonetics, and cross-lingual translation. The dataset is released under the Creative Commons Attribution-ShareAlike 4.0 License (CC-BY-SA-4.0).

创建时间:
2026-07-27
原始信息汇总

数据集概述:Wiktionary Structured

基本信息

  • 数据集名称:Wiktionary Structured
  • 许可证:cc-by-sa-4.0
  • 数据集规模:10M < n < 100M
  • 任务类别:翻译、文本检索、文本生成

标签

该数据集涉及词汇学、词典编纂、词源学、国际音标(IPA)、语音学、翻译等多个领域,标签包括:wiktionary, lexicography, dictionary, etymology, ipa, phonetics, translation。

数据集配置

数据集包含多个配置(configs),主要分为两大类:

1. 按语言划分的义项(senses)子集

每个子集对应一种特定语言的义项数据,均为训练集(split: train),数据格式为 Parquet:

  • senses_it(意大利语)
  • senses_ja(日语)
  • senses_la(拉丁语)
  • senses_pl(波兰语)
  • senses_pt(葡萄牙语)
  • senses_ru(俄语)
  • senses_sv(瑞典语)
  • senses_zh(中文)
  • senses_ca(加泰罗尼亚语)
  • senses_de(德语)
  • senses_en(英语)
  • senses_es(西班牙语)
  • senses_fi(芬兰语)
  • senses_fr(法语)
  • senses_gl(加利西亚语)

2. 通用数据集配置

以下配置包含所有语言的综合数据,均为训练集(split: train),数据格式为 Parquet:

  • entries:词条数据
  • examples:示例数据
  • forms:词形数据
  • linkages:链接关系数据
  • senses:义项数据
  • sounds:发音数据
  • translations:翻译数据

数据格式

所有数据文件均以 Parquet 格式存储。

支持的语言

该数据集涵盖极其广泛的语言种类,包括但不限于:英语、法语、德语、西班牙语、中文、日语、俄语、葡萄牙语、意大利语、拉丁语、波兰语、瑞典语、芬兰语、加泰罗尼亚语、加利西亚语等数千种语言及方言。具体语言代码列表如上所示。

搜集汇总
数据集介绍
wiktionary 数据集图片
构建方式
Wiktionary数据集源自维基词典的多语言词汇资源,通过系统化结构化处理构建而成。其构建过程涵盖对词汇条目的深度解析,包括词义、例句、词形变化、词源关联及语音标注等多维信息。数据以Parquet格式存储,按语言和内容类型分片组织,设有senses、entries、examples等核心配置,支持按语言或全局粒度加载,从而实现对复杂词汇语义网络的高效系统性整合。
使用方法
使用者可通过HuggingFace数据集加载工具按配置名称提取所需子集,如选取特定语言词义数据(senses_en)或全局内容。支持以训练集分片直接读取,适用于构建词义标注任务、训练多语种词嵌入模型以及开发词汇关联检索系统。建议结合自定义预处理流水线对Parquet格式数据进行高效解析与批处理,以适配下游深度学习框架。
背景与挑战
背景概述
维基词典(Wiktionary)结构化数据集由全球志愿者社区与自然语言处理研究者共同构建,首次发布于2020年前后,旨在系统性地整合多语种词汇的语义、词源、发音及翻译信息。该数据集涵盖数千种语言,包括古代语言与濒危语言,为计算语言学和跨语言信息检索提供了宝贵的语料资源。其核心研究聚焦于如何利用众包词典数据提升多语种词义消歧、机器翻译及词典自动生成等任务的性能,对低资源语言处理的进步具有重要推动作用。
当前挑战
维基词典数据集面临的核心挑战包括:1)多语种数据的极不均衡分布,部分语言条目稀疏导致模型泛化困难;2)众包数据中的语义标注噪声与格式不一致性问题,需设计鲁棒的清洗与对齐策略;3)数据构建过程中,缺乏统一的结构化标准,不同语言词条的定义、示例、翻译等字段完整性差异显著,增加了跨语言学习任务的难度。
常用场景
经典使用场景
Wiktionary结构化数据集在自然语言处理领域扮演着基石角色,尤其在多语言词汇语义分析中熠熠生辉。研究者常借助该数据集的词条、释义、例句及发音等结构化信息,训练和评估词义消歧模型。通过利用其多语言词义标注,可有效区分一词多义现象,提升机器对上下文语义的精准理解。此外,该数据集还广泛应用于构建多语言词汇知识库,为跨语言信息检索、机器翻译等任务提供丰富的语义资源,支撑着从单词语义表征到深层语言理解的科研探索。
解决学术问题
该数据集巧妙回应了多语言词汇资源稀缺的学术困境,为低资源语言的词汇语义研究注入了活力。它解决了词典级数据难以大规模、结构化获取的挑战,使得研究者能够在数十种语言上开展词义归纳、语义关系抽取等任务。由此,Wiktionary数据集促进了跨语言语义模型的公平性评估,打破了某些语种在自然语言处理研究中的边缘化格局,为构建真正全球化的语言理解系统奠定了坚实基础,推动了语言多样性在人工智能时代的传承与发扬。
实际应用
在实际应用中,Wiktionary数据集支撑着教育科技产品的智能化蜕变。语言学习应用利用其丰富的释义、例句和音标数据,开发出个性化词汇学习模块,帮助学习者通过生动语境掌握单词用法。此外,智能输入法与拼写检查工具借助其词形变化表,实现了对复杂词形屈折的准确预测与纠错。翻译服务和语音合成系统也从中汲取养分,利用多语言词义对应关系和发音标注,显著提升了译文精准度与语音的自然流畅感,惠及全球亿万用户。
数据集最近研究
最新研究方向
wiktionary数据集作为多语言词汇与语义知识的宝库,近期研究焦点集中于利用其结构化词条、释义及翻译数据,推动跨语言自然语言处理的前沿探索。在机器翻译领域,研究者借助其丰富的平行词汇资源,优化低资源语言的翻译模型;在文本检索与生成方面,该数据集被用于构建细粒度语义表征,增强多语言对话系统的理解能力。同时,其涵盖的IPA音标、词源及变体信息,为计算词典学与语音合成提供了关键支撑,成为连接语言多样性与人工智能应用的桥梁,深刻影响全球语言技术的民主化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务