遇见数据集

egyptian-names

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集是埃及名字与专名学智能数据集,旨在提供一个全面、多阶段的统计与语言学数据集,用于支撑当代埃及命名传统的生产级专名学引擎。埃及名字遵循连续的父系命名链结构(个人名+父亲名+祖父名+祖先名+家族/部落名)。数据集完整呈现了从超过1587万条原始国家考试记录(约30M+行)到最终规范词典的完整转换管道,包括:阶段0(1587万+原始全名链,含154万+唯一全名字符串)、阶段1(6350万+分割后的父系标记及位置)、阶段2(43,333个唯一原始词频)、阶段3(23,457条拼写与正字法纠正规则)以及阶段4(44,626个带注释的规范名字主词典)。每个规范名字包含14维丰富标注:阿拉伯语规范形式、英语转写、经验性别(男/女/中性)、宗教文化标记(穆斯林/基督教/中性)、专名角色(名/姓/尊称/部落)、标准阿拉伯语元音标注、埃及口语元音标注、标准阿拉伯语IPA转写、埃及口语IPA转写、阿拉伯语词源释义、英语释义、埃及昵称(含元音标注和IPA转写)、三辅音词根、历史词源层次、埃及公众人物示例、代际流行趋势分类、8个世代位置分布百分比(slot1-8)及整体语料占比。数据集提供多个Hugging Face配置(default/final_canonical, phase0_raw, phase1_segmented, phase2_frequencies, phase3_corrections, slot_distributions),适用于文本分类、命名实体识别、特征提取、表格到文本、文本评分、语言学分析等任务。采用MIT许可,可自由用于学术、商业和研究用途。

This dataset is an Egyptian names and onomastics intelligent dataset, designed to provide a comprehensive, multi-stage statistical and linguistic dataset for a production-grade onomastics engine supporting contemporary Egyptian naming traditions. Egyptian names follow a continuous patronymic chain structure (given name + fathers name + grandfathers name + ancestors name + family/tribe name). The dataset presents the complete transformation pipeline from over 15.87 million original national exam records (approximately 30 million+ rows) to the final canonical dictionary, including: Phase 0 (15.87 million+ raw full name chains, with 1.54 million+ unique full name strings), Phase 1 (63.5 million+ segmented patronymic tokens and positions), Phase 2 (43,333 unique raw word frequencies), Phase 3 (23,457 spelling and orthographic correction rules), and Phase 4 (44,626 annotated canonical name master dictionary). Each canonical name includes 14-dimensional rich annotations: Arabic canonical form, English transliteration, empirical gender (male/female/neuter), religious-cultural marker (Muslim/Christian/neutral), onomastic role (given name/surname/honorific/tribe), Standard Arabic vowelization, Egyptian Arabic vowelization, Standard Arabic IPA transcription, Egyptian Arabic IPA transcription, Arabic etymological gloss, English gloss, Egyptian nicknames (with vowelization and IPA transcription), triliteral root, historical etymological stratum, Egyptian public figure examples, generational popularity trend classification, 8 generation slot distribution percentages (slot1-8), and overall corpus proportion. The dataset provides multiple Hugging Face configurations (default/final_canonical, phase0_raw, phase1_segmented, phase2_frequencies, phase3_corrections, slot_distributions), suitable for tasks such as text classification, named entity recognition, feature extraction, table-to-text, text scoring, and linguistic analysis. Licensed under MIT, freely usable for academic, commercial, and research purposes.

创建时间:
2026-08-19
原始信息汇总

Egyptian Names & Onomastic Intelligence Dataset 数据集详情

数据集概览

该数据集是一个关于埃及姓名(人名)的多阶段统计与语言学数据集,旨在构建现代埃及命名传统的专名智能引擎。数据集基于超过1587万条原始国家记录,经过多阶段处理,最终形成包含44,626个规范姓名词条的完整词典。

数据规模与统计

指标 数量 说明
原始考试记录总数 ~15,875,535 覆盖494个数据文件的个人记录
全名链出现次数 ~1,588万 完整的父系姓名链(如"محمد أحمد علي حسن الشرقاوي")
唯一全名字符串 1,545,970+ 不同的3至5部分姓名组合
单个名字出现次数 ~6,350万 所有槽位中的单个名字出现次数
原始独立标记 43,333 清理前的原始词元
拼写与错别字修正 23,457 错拼及未空格复合名的映射
最终规范主词典 44,626 完整的埃及唯一姓名清洁词典

数据集处理流程

[ 阶段0: 1587万+ 原始全名链(3000万+条记录) ] │ ▼ [ 阶段1: 6350万+ 分段父系标记及位置 ] │ ▼ [ 阶段2: 43,333 唯一原始词元频率 ] │ ▼ [ 阶段3: 23,457+ 正字法与拼写修正 ] │ ▼ [ 阶段4: 44,626 主标注规范姓名 ] (性别 + 宗教 + 世代槽位概率 + 音标 + 含义 + 转写)

数据配置与访问

数据集提供以下配置,可通过Hugging Face datasets库加载:

  1. final_canonical(默认):包含44,626条注释规范姓名,每条记录包含14个维度字段,涵盖阿拉伯语/英语名称、性别、宗教、角色、标准/埃及方言音标(Tashkeel)、IPA音标、含义、埃及昵称、词根、来源类型、著名人物、趋势类别及世代槽位分布百分比等。
  2. phase0_raw:包含约154万条未处理的原始全名样本(完整语料库为1587万条)。
  3. phase1_segmented:分段父系链,可按词元检查系谱位置。
  4. phase2_frequencies:唯一词元频率分析,可查看全国语料库中的高频姓名。
  5. phase3_corrections:23,457条拼写与错别字修正规则,将错误拼写映射到规范形式。

主要字段说明

final_canonical配置为例,核心字段包括:

  • name_ar / name_en:阿拉伯语规范形式与英语转写
  • gender:经验性别标记(男性/女性/中性)
  • religion:文化/宗教标记(穆斯林/基督徒/中性)
  • role:专名角色(名字/家族名/称号/部落名)
  • tashkeel_standard / tashkeel_eg:标准阿拉伯语与埃及方言的音标
  • ipa_standard / ipa_eg:标准与埃及方言的IPA音标
  • meaning_ar / meaning_en:阿拉伯语与英语的词根与词源释义
  • dallaa_*:埃及昵称及其音标和转写
  • root:闪米特/科普特形态词根
  • origin_type:历史词源层
  • famous_figures_ar / famous_figures_en:相关埃及公众人物及简介
  • slot1_pct ~ slot8_pct:世代槽位分布百分比
  • corpus_share_pct:在埃及全部词元中的总体占比

许可与引用

该数据集基于 MIT License 发布,可自由用于学术、商业和研究用途。

搜集汇总
数据集介绍
egyptian-names 数据集图片
构建方式
本数据集构建于对埃及全国范围内逾1587万条真实人口记录的系统性挖掘与多阶段处理之上。原始数据涵盖超过3000万条完整姓名链,经分词、频次统计与拼写校正等流程,最终提炼出包含44,626个规范姓名的权威词库。每个词条均标注了性别、宗教、角色、标准及埃及口语变体的发音、词根、含义与昵称等多维信息,并辅以世系槽位分布概率,形成了对当代埃及命名传统的全面实证刻画。
特点
该数据集的一大特色在于其多层级、多维度的精细标注体系。它不仅提供了规范的阿拉伯语书写形式及英语音译,还涵盖了现代标准阿拉伯语与埃及口语两套元音化及国际音标转写,深度反映了语言的地域变体。此外,数据集中融入了丰富的社会文化信息,如性别倾向、宗教归属、历史名人关联及时代趋势分类,使得该资源超越简单的姓名清单,成为研究埃及社会、历史与语言演变的宝贵窗口。
使用方法
使用者可通过Hugging Face datasets库便捷加载该资源。默认配置(final_canonical)提供可直接用于命名实体识别、文本分类等任务的44,626条规范词条。同时,数据集开放了多个中间阶段配置,如phase0_raw原始全名链、phase1_segmented分词结果及phase3_corrections拼写纠错规则,以满足不同研究需求。凭借丰富的字段设计,该数据集亦可用于特征提取、语言学分析及文本生成等下游任务。
背景与挑战
背景概述
该数据集由Abdullah Afify于2026年创建,旨在系统化研究埃及姓名传统,其核心问题在于揭示当代埃及命名体系中父名链的统计规律与语言学特征。基于超过1580万条国家考试记录,数据集通过多阶段流水线构建了包含44,626个规范姓名的综合词典,涵盖了性别、宗教、代际槽位概率、塔什基尔、国际音标、词源及昵称等14维标注信息。这一资源不仅为阿拉伯语自然语言处理中的命名实体识别、文本分类及语言学分析提供了关键支撑,还开创了人名词典与人口统计学、社会语言学交叉研究的新范式,对理解埃及社会结构、文化传承及姓名演变具有重要参考价值。
当前挑战
该数据集面临多重挑战。在领域层面,阿拉伯语姓名的形态复杂性、拼写变体及方言差异对标准化处理构成显著障碍,同时缺乏大规模标注资源使得命名实体识别和文本分类任务难以获得高质量训练数据。在构建过程中,处理1580万条原始记录需应对数据噪声、重复项、非标准拼写及未分隔复合词(如'عبدالرحمن')等问题,这要求开发精细的清洗与校正算法;此外,姓名链中代际槽位分布的不均衡性及多义词根的语义歧义,对统计建模和语义标注提出更高要求。最终,跨语言音译、发音标注及文化特有名(如昵称、部落名)的保留,进一步增加了数据集构建的复杂性与精细度。
常用场景
经典使用场景
在自然语言处理(NLP)领域,埃及人名数据集作为一项独特的语言资源,其主要应用场景集中于命名实体识别(NER)、文本分类及特征提取等核心任务。该数据集依托超过1580万条原始全名链记录,通过多阶段流水线处理,最终形成一个包含44626个规范姓名的富标注词典。研究者可借助其精细的字段设计,如阿拉伯语与英语拼写、性别、宗教、谱系位置及方言变体,训练和评估面向阿拉伯语的NER系统,揭示现代埃及命名传统中的结构规律。此外,该数据集的多元配置(如原始、分段、频率及纠错版本)为语言建模、拼写校正和语音合成等任务提供了丰富的实验基准,有力地推动了低资源语言场景下的NLP技术演进。
衍生相关工作
此数据集的发布催生了一系列衍生研究与应用工作。一方面,其多层命名模式(如父名链、派生昵称)为姓名生成模型提供了训练语料,推动了基于深度学习的阿拉伯语姓名生成器研究,在游戏角色设计、虚拟助手命名等创意产业中有所应用。另一方面,基于该数据集衍生的拼写纠错与规范化模块,已被整合进多家阿拉伯语NLP工具库(如Farasa、MADAMIRA)的增强版本中,提升了其处理真实世界文本的能力。此外,数据集中丰富的音韵学与词根信息,促进了比较语言学与历史方言学的研究,催生了如埃及人名音系演变、借词影响等专题论文。在开源社区,其配置化的数据格式也成为了构建多语言姓名知识库(如扩展到其他阿拉伯国家)的参考蓝本,推动了更广泛的区域语言基础设施建设。
数据集最近研究
最新研究方向
该数据集聚焦于构建一个以埃及命名传统为对象的经验性人名学与语言智能引擎,通过处理超过1580万条国家级记录,形成包含44626个规范词条的多元标注词库。其前沿研究方向在于将人名视为社会文化密码,利用多阶段流水线(从原始链式记录到拼写纠正、频率统计及性别、宗教、世代槽位概率等14维标注)深度挖掘人名中的谱系、族群与历史变迁信息。该工作不仅为阿拉伯语自然语言处理中的命名实体识别、消歧及文本分类提供高精度基础资源,更通过融合现代标准阿拉伯语与埃及口语的发音、变体及绰号,推动了计算人类学与计算社会语言学的交叉探索,为理解当代埃及社会结构、人口流动及文化认同提供了量化视角,并对数字人文领域的人名知识图谱构建具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务