遇见数据集

ryanjosephkamp/english-openlist

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

English OpenList是一个全面的、持续更新的有效英语单词词典,专为自然语言处理(NLP)和游戏设计。它提供超过378,666个经过验证的英语单词,遵循Scrabble兼容规则,并包含丰富的元数据,如词性、定义和发音。数据集每周从权威词典源更新,并带有每次更新的版本历史记录。它适用于拼写检查、单词游戏(如Scrabble/Wordle)、NLP训练和研究,具有高精度单词验证、透明的方法论和完整的来源追溯。数据集结构包括完整的单词列表、每日发布、最新更新参考以及Brrrdle兼容的工件。验证规则基于Merriam-Webster大学词典,排除专有名词、缩写和首字母缩略词。

English OpenList is a comprehensive, continuously updated dictionary of valid English words. It provides over 378,666 validated English words following Scrabble-compatible rules, with rich metadata including part of speech, definitions, and pronunciation. The dataset is updated weekly from authoritative dictionary sources and includes version history with changelogs for every update. It is designed for use cases such as spell checking, word games (e.g., Scrabble/Wordle), NLP training, and research, offering high-precision word validation, transparent methodology, and full provenance. The dataset structure includes full word lists, daily releases, latest update references, and Brrrdle-compatible artifacts. Validation rules are based on the Merriam-Webster Collegiate Dictionary, excluding proper nouns, abbreviations, and acronyms.

提供机构:
ryanjosephkamp
搜集汇总
数据集介绍
ryanjosephkamp/english-openlist 数据集图片
构建方式
English OpenList的构建经历了一套严谨的多阶段流程。在语料获取阶段,项目团队从Wiktionary、WordNet、SCOWL、Google Books Ngrams及Collins等15余个开源资源中汇聚了约980万候选词汇。随后,依托Gemini 2.0与2.5 Flash大语言模型,构建了涵盖模式筛选、迭代收敛分类与统计抽样的多级验证流水线,并辅以合成词生成与人工质检,以确保词典的精确性与一致性。自2026年1月起,项目进入持续更新阶段,每日通过自动化管道从Merriam-Webster RSS订阅及人工提交中发现新词,重新验证历史无效词条,将合格者提升至有效词表,并同步生成更新日志与统计报告。
特点
该数据集的核心特色在于其规模庞大且经过严谨验证的词汇集合,收录了超过37.8万条有效英语单词,并遵循Scrabble兼容的严格筛选规则——仅接受由小写字母构成、被Merriam-Webster Collegiate Dictionary认可的词汇,同时排除专有名词与缩写。每条有效词条均附有丰富的元数据,包括词性、释义、发音及来源信息,无效词条亦记录被拒原因。此外,数据集提供每日更新与版本历史追踪,确保语料始终与权威词典同步。针对Brrrdle等文字游戏,项目还专门生成了按长度组织的词库文件,兼具学术研究的严谨性与游戏应用的实用性。
使用方法
使用者可通过Hugging Face Datasets库以`load_dataset`接口直接加载有效词表,便捷地访问单词及元数据。对于偏好本地操作的用户,项目提供直接下载链接,支持获取纯文本格式的完整有效词列表与JSON格式的字典文件,既可执行简单的单词有效性判断,也能查阅每条词汇的详细语义信息。每日更新版的分发目录同样可供下载,便于追踪词汇的动态变化。此外,项目还提供了针对Brrrdle游戏优化的按长度分组词汇文件,以及适用于拼写检查与NLP研究的标准化词典,满足多样化的应用场景。
背景与挑战
背景概述
English OpenList是由English OpenList项目团队于2025年底发起并持续更新的开源英语词汇数据集,旨在为自然语言处理、拼写检测及文字游戏等领域提供一套经过严格验证的高质量英语词典资源。该数据集依托于Hugging Face平台发布,核心研究问题在于构建一个兼具规模与精度的权威英语词汇库,以弥合商业词典与开源词表之间的鸿沟。通过整合来自Wiktionary、WordNet、SCOWL及Google Books Ngrams等15个以上来源的超过980万个候选词条,并采用多阶段AI验证流水线,最终筛选出超过37.8万个符合Scrabble规则的合法英语单词。该数据集的发布对于提升词法分析任务的基准一致性、词表构建的透明性及其可复现性具有重要推动作用,同时为拼写校正、词源研究及教育应用提供了可靠的基础设施。
当前挑战
English OpenList所应对的领域核心挑战在于如何自动化、精确且可扩展地区分英语词汇中的合法和非法条目,尤其是在缺乏统一权威标准的情况下。传统词表常因来源混杂、更新滞后或受版权限制而难以满足现代NLP及游戏应用对高频、全面和规范化词典的需求。在数据构建过程中,团队面临的主要障碍包括:整合异构语料带来的格式与编码不一致问题,需要通过模式筛选与LLM分类以消解推理歧义;对约900万个潜在非法词条进行逐条验证以降低误判率,依赖迭代收敛策略与抽检机制保证质量;以及建立一套自动化的日常更新流程,以持续追踪权威词典(如Merriam-Webster Collegiate Dictionary)的新增条目并维护词汇的时效性与完备性。此外,确保数据集在复刻与再分布过程中的许可合规性也是一项重要的挑战。
常用场景
经典使用场景
English OpenList在自然语言处理领域扮演着基石性角色,最为经典的使用场景便是作为高质量、权威的英语词汇验证工具。研究人员与开发者可依托其超过37.8万个经过Scrabble兼容规则严格验证的有效词汇,快速判定任意输入是否为标准英语单词。该数据集不仅提供了纯词表,还附带丰富的元数据,涵盖词性、定义及发音,极大便利了文本预处理、拼写检查与词典编纂等任务。其透明化的方法论与每日更新的机制,确保了词汇库的时效性与可靠性,成为构建稳健NLP系统的首选词汇资源。
解决学术问题
该数据集精准回应了学术界长期面临的一个关键问题:缺乏一个经过系统验证、来源清晰且持续更新的开源英语词库。以往的研究工作常需依赖碎片化、不完整或版权受限的词汇集合,导致实验结果难以复现且存在偏差。English OpenList通过严谨的多阶段AI验证流水线,整合了来自Wiktionary、WordNet等15个以上开放源的近千万候选词,并建立了清晰的无效词拒斥理由。它有效支撑了拼写校正、语言模型词汇降噪、词义消歧以及字符级序列建模等研究方向,显著提升了自然语言处理实验的可重复性和基准测试的公正性。
衍生相关工作
围绕English OpenList已衍生出一系列引人瞩目的研究工作与工具链。基于其结构化元数据,研究者们构建了词性标注评估基准与词汇难度分级模型,推动了教育科技领域自适应学习系统的进步。其持续的版本更新日志为词汇演化规律分析提供了宝贵语料,催生了关于新词涌现模式与语言变迁的计量语言学探索。此外,该数据集所采用的AI验证流水线本身成为一项可复用的方法论贡献,被后续研究借鉴用于构建其他语种的开放词库。通过提供权威的无效词列表,它还促成了一项关于语言模型对拼写对抗样本鲁棒性的系统评估工作,揭示了现代NLP系统在词汇边界认知上的薄弱环节。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务