遇见数据集

cstr/grundwortschatz-voc-en

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

WortUniversum英语词汇数据库是一个包含11,539个词元的英国英语词汇数据库,覆盖了小学阶段词汇(对应CEFR-J A1–B2级别、剑桥少儿英语Starters/Movers/Flyers考试、英国国家课程1-6年级拼写列表),并为每个单词提供了多源增强信息。增强内容包括:Wiktionary的定义、国际音标发音、词形变化和例句;开放英语词网(OEWN)的词义记录,如近义词、反义词、上位词和下位词;wordfreq的Zipf分数、每百万词出现频率和频率带(1-5级);CEFR-J v1.5级别标签(A1–B2),覆盖6,879个条目;剑桥少儿英语Starters/Movers/Flyers词汇标签,覆盖833个条目;英国教育部法定拼写列表(1-2年级、3-4年级、5-6年级),覆盖318个条目;所有条目的课程衍生年级估计(1-6级);针对4,653个条目的27,363个常见学习者错误对(来自Norvig和Wikipedia);针对150个条目的264个英式与美式方言拼写变体(基于SCOWL);分级例句(由LLM生成,覆盖所有6个年级);来自72本公有领域英语书籍的Project Gutenberg例句;以及与应用程序运行时兼容的SQLite FTS5搜索索引。该词汇库是课程目标的超集,标签控制应用程序根据用户级别展示的子集。数据集以SQLite数据库(grundwortschatz_en.db.gz)形式提供,并包含Parquet格式的辅助文件(words.parquet、translations.parquet、examples.parquet等),支持通过pandas或DuckDB加载。数据集主要用于教育应用、词汇学习和自然语言处理研究。

A UK-English lexical database of 11,539 lemmas covering primary-school vocabulary (CEFR-J A1–B2, YLE Starters/Movers/Flyers, UK Year 1–6 statutory lists), with multi-source enrichment per word: Wiktionary definitions, IPA pronunciation, inflections, examples; Open English WordNet (OEWN) sense records: synonyms, antonyms, hypernyms, hyponyms; wordfreq Zipf score, occurrences-per-million, frequency band (1–5); CEFR-J v1.5 level tags (A1–B2) for 6,879 entries; Cambridge YLE Starters / Movers / Flyers vocabulary tags (833 entries); UK DfE statutory spelling lists: Year 1–2, 3–4, 5–6 (318 entries); Curriculum-derived gradeLevelEstimate (1–6) for all entries; 27,363 common learner error pairs on 4,653 entries (Norvig + Wikipedia); 264 UK ↔ US dialect spelling variants across 150 entries (SCOWL); Grade-differentiated example sentences (LLM-generated, all 6 grades); Project Gutenberg example sentences from 72 public-domain EN books; SQLite FTS5 search index compatible with the app runtime. The vocabulary is a superset of curriculum targets; tags control which subset the app surfaces per user level. The dataset ships as a SQLite database (grundwortschatz_en.db.gz) with Parquet companion files (words.parquet, translations.parquet, examples.parquet, etc.), loadable via pandas or DuckDB. It is intended for educational applications, vocabulary learning, and NLP research.

提供机构:
cstr
搜集汇总
数据集介绍
cstr/grundwortschatz-voc-en 数据集图片
构建方式
该数据集以英国小学课程词汇为核心,整合了来自Wiktionary、Open English WordNet、wordfreq、CEFR-J、剑桥YLE词表及英国教育部法定拼写列表等多源数据。通过自动化流水线对约11539个词条进行清洗、归一化与融合,并利用决策树算法基于课程来源、CEFR等级与词频带综合估算年级水平。最终以SQLite数据库形式存储,并辅以Parquet格式文件便于分布式处理。
特点
数据集涵盖丰富的语言学与教学属性,包括IPA音标、词形变化、同反义词、上下位词、常见学习者拼写错误及英美拼写变体。特别设计了按年级分层的LLM生成例句与Project Gutenberg例句,并包含400个短语动词条目及配套游戏化干扰项。所有元数据以JSON结构化存储,支持灵活的查询与教学场景适配。
使用方法
用户可通过Python的pandas或DuckDB直接加载Parquet文件进行数据分析,也可将SQLite数据库集成至Flutter等应用程序中。数据集内置FTS5全文搜索索引,支持快速查询单词释义、例句及等级信息。面向教育场景,提供CEFR-J与YLE标签及年级预估字段,便于智能课程推荐与自适应学习系统调用。
背景与挑战
背景概述
词汇习得是语言教育的基石,尤其是在基础教育阶段,精准且结构化的词汇数据库对教学设计、语言评估以及教育技术工具的研发至关重要。由英国研究团队于2023年创建的grundwortschatz-voc-en数据集,隶属于WortUniversum项目,专注于构建面向英国小学课程的英语词汇资源。该数据集包含11,539个词元,覆盖CEFR-J A1至B2等级、剑桥YLE考试词汇以及英国国家课程法定拼写列表。通过整合Wiktionary、Open English WordNet、wordfreq、CEFR-J等多个权威来源,数据提供了词义、发音、例句、同反义词、频率信息及学习者常见错误等丰富标注。这一资源的发布,为计算语言学、教育数据挖掘及自适应学习系统提供了高质量的基础数据支撑,推动了词汇教育数据标准化的发展。
当前挑战
该数据集面临的核心挑战在于处理多源异构数据的融合与一致性维护。来自Wiktionary、WordNet、词频库等不同来源的数据格式、许可协议与粒度存在显著差异,需设计复杂的ETL流程实现规范化整合。决策树的构建涉及六个维度的优先级计算(课程标签、CEFR等级、频率带等),等级估算的准确性依赖规则的合理性与数据完整性。此外,面向K-6受众的内容过滤(如例句的适宜性审查)及针对381个词元的频谱词块扩展,增加了数据加工与质量控制的难度。最终,数据集的CC-BY-SA 4.0许可兼容性测试及与Flutter应用代码的许可分离管理,也构成了法律与工程层面的双重挑战。
常用场景
经典使用场景
grundwortschatz-voc-en数据集作为一份精心编纂的英国小学词汇知识库,最经典的应用场景在于服务于英语基础教育研究与教学材料的智能化构建。该数据集涵盖了11,539个词元,并依据CEFR-J等级、剑桥YLE考试及英国国家课程大纲进行了系统化标注,使得研究人员能够精准定位各年级阶段学生的词汇习得目标。在自然语言处理领域,它常被用作词汇难度分级、拼写纠错以及多义词消歧等任务的基准语料,通过其丰富的词频、发音、近反义词及典型错误对等维度,为构建细粒度的英语学习模型提供了高质量的数据支撑。
实际应用
在实际应用层面,该数据集最直接地赋能了智能英语学习平台的开发与优化。凭借其内置的年级分级估计、例句库(包含项目古腾堡经典文学句子与AI生成的分级例句)以及用户常见拼写错误对,教育科技公司可快速构建个性化单词学习、听写练习和语法纠错等互动功能。此外,400个短语动词条目及其年级适龄例句直接支撑了针对儿童用户的动词短语游戏设计。数据集亦可用于开发面向非母语学习者的词典应用,提供IPA发音、词频热度及英美拼写变体,从而在移动端和网页端实现随学随查的知识服务。
衍生相关工作
围绕grundwortschatz-voc-en数据集已衍生出多项具有启发性与实用性的研究工作。其多源融合的架构设计启发了词汇资源整合领域的方法论革新,例如基于优先规则的年级分级决策树(gradeLevelEstimate decision tree)被后续研究采纳为词汇难度图谱构建的基准策略。基于该数据集的27,363对常见学习者错误,研究者开发了面向儿童场景的拼写校正算法,并对比了Norvig统计模型与维基百科错误列表的互补效能。此外,数据集中的Open English WordNet语义关系激发了对小学词汇语义网络演化的纵向分析,而CEFR-J标签与YLE等级的对应关系则为跨测试体系的词汇覆盖度比较提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务