遇见数据集

Amazigh-Facebook-Data-Export

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

Amazigh Facebook Dataset (Filtered) 是一个经过筛选的、由阿马齐格语使用者撰写的个人Facebook帖子和评论集合。该数据集捕捉了提非纳文字中阿马齐格语在现实世界通信中的使用情况,主要包含南摩洛哥阿马齐格语(Tashelhit),并尽可能倾向于使用阿马齐格文字(提非纳文字)的标准摩洛哥阿马齐格语。部分帖子和评论独特地包含了平行的多文字和多语言内容(某些文本块中嵌入的音译和翻译),以及分组的迭代编辑历史记录(草稿)。数据集包含四个主要文件:posts.json和comments.json存储清洁的单一文本条目,每个条目包含唯一的id和text字段;posts_drafts.json和comments_drafts.json存储修订历史,采用分层结构,包含id、draft_final(最终状态)和draft_X(历史编辑)字段。数据规模为1K到10K样本之间。数据集适用于语言建模、文字对齐与机器翻译(利用内部平行块将提非纳文字映射到拉丁文字音译和翻译)以及语法错误纠正(通过分析草稿序列学习真实用户的修订模式)。数据来源于Facebook标准导出数据,经过匿名化处理(移除用户提及但可能保留嵌入式名称)、草稿对齐(基于55%相似度阈值)和语言过滤(丢弃阿拉伯字符比例≥75%的文本块)。数据集主要反映摩洛哥阿马齐格语变体和区域性表达,语法呈现非正式的数字消息风格,包含较短的句子长度、平台缩写和感叹习惯。

创建时间:
2026-06-07
原始信息汇总

数据集概述

数据集名称:Amazigh Facebook Dataset (Filtered)

数据集地址:https://huggingface.co/datasets/abdelhaqueidali/Amazigh-Facebook-Data-Export

数据集描述:一个经过筛选的个人Facebook帖子和评论的语料库,由一名阿马齐格语使用者以提菲纳格文字(Tifinagh)撰写。数据主要反映南摩洛哥阿马齐格语(塔谢尔希特语)和标准摩洛哥阿马齐格语的数字通信使用情况,部分条目包含多文字和多语言(拉丁转写、英语和阿拉伯语翻译)的平行文本,以及分组的迭代编辑历史记录(草稿)。

策划者:Abdelhaque Id Ali(Facebook资料所有者)

语言

  • 阿马齐格语(ber)
  • 标准摩洛哥阿马齐格语(zgh)
  • 塔谢尔希特语(shi)
  • 英语(en)
  • 阿拉伯语(ar)

许可证:CC-BY-4.0

标签:amazigh, berber, tifinagh, facebook, social-media, parallel-text, drafts, edit-history

数据集规模:1K < n < 10K


数据用途

直接用途

  • 语言建模:用于训练和微调大语言模型,学习有机的、数字原生的阿马齐格语文本结构。
  • 文字对齐与机器翻译:利用内部的平行文本块,将提菲纳格文字映射到拉丁转写和翻译。
  • 语法错误纠正:通过分析草稿序列文件,学习用户如何修改、调整和纠正拼写或句法错误。

超出范围的使用:不适用于脱离上下文的语言规范化研究,因为数据包含口语化的数字语言,而非严格的正式标准散文。也不应用于识别或去匿名化任何参与的个人实体。


数据集结构

数据集包含四个配置文件,每个对应一个JSON文件:

配置名称 数据文件 拆分
posts posts.json train
posts_drafts posts_drafts.json train
comments comments.json train
comments_drafts comments_drafts.json train
comment_drafts comment_drafts.json train

目录结构

📁 dataset_root/ ├── comments.json ├── comments_drafts.json ├── posts.json └── posts_drafts.json


数据模式

1. 干净文件(comments.json, posts.json)

每条记录包含唯一ID和其对应的文本内容。

示例: json [ { "id": 847291043, "text": "ⵜⵉⴼⴰⵡⵉⵏ! ⵉⵙ ⵣⴰ ⵖⵓⵔⵓⵏ ⵔⵖⴰⵏ ⵡⵓⵙⵙⴰⵏ ⴰⴷ?" } ]

2. 草稿文件(posts_drafts.json, comments_drafts.json)

每条记录包含唯一ID及其编辑历史版本。draft_final 代表最终发布版本,draft_1 代表最早记录的修改版本。

示例: json [ { "id": 921504888, "draft_final": "ⴰⵣⵓⵍ ⵏⵏⵓⵏ ⴰⵢⵜⵎⴰ.", "draft_2": "ⴰⵣⵓⵍ ⵏⵏⵓⵏ ⴰⵢⵜⵍⴰ.", "draft_1": "ⴰⵣⵓⵍ ⴼⵍⵍⴰⵡⵏ ⴰⵢⵜⵍⴰ." } ]

字段说明

字段名 数据类型 描述
id Integer 唯一、随机分配的9位数字序列键,用于追踪文本条目。
text String 仅存在于posts.json和comments.json中;代表原始的、经过净化的文本字符串。
draft_final String 仅存在于_drafts.json配置中;代表编辑序列的最终状态。
draft_X String 仅存在于_drafts.json配置中;代表先前的历史编辑版本,通向最终版本。

数据创建

策划动机:阿马齐格语(尤其是提菲纳格文字)的数字数据集仍然稀缺。该数据集提供了真实的、非合成的会话记录,反映了现代互联网使用、文字适应和自然的在线编辑习惯。

数据来源与处理

  • 提取:从标准的Facebook数据导出(.json文件)中提取原始文本数据。
  • 匿名化:自定义解析引擎扫描所有评论层,移除显式用户引用(提及),并替换为隐私占位符[@removed_name]。但嵌入的字符串名称因技术限制无法移除。
  • 草稿对齐:对于编辑文件,通过序列匹配器处理字符串,将相似度达到55%的文本变体分组到同一个ID下,构建修订历史记录。
  • 语言过滤:对每条记录进行文字密度分析,如果阿拉伯语字符块(u0600-u06ff)占文本块总字母数的75%或以上,则丢弃该条目。

数据生产者:由一名阿马齐格语内容创作者和语言爱好者(Abdelhaque Id Ali)在社交媒体上有机生成。

个人与敏感信息:所有评论数据集中的平台用户名、标签和跟踪指标均被剥离并随机化。但嵌入的姓名提及因技术限制未能移除,其他元数据已被移除。


偏见、风险与限制

  • 方言聚焦:词汇和措辞主要反映标准摩洛哥阿马齐格语变体和当地区域性表达。
  • 对话语气:句法代表随意的数字消息,包含较短的句子长度、平台缩写和感叹表达,与教材文本不同。

术语表

  • 提菲纳格(Tifinagh):阿马齐格人用来书写阿马齐格语的文字。
  • 草稿聚类(Drafts Clustering):将单个帖子的每次修改按顺序捕获,而不是作为不相关的数据记录进行分组的结构映射。

数据集卡片作者

Abdelhaque Id Ali: abdelhaque.idal@gmail.com

搜集汇总
数据集介绍
Amazigh-Facebook-Data-Export 数据集图片
构建方式
该数据集源自一位母语为阿马齐格语的Facebook用户个人数据导出,经系统化处理构建而成。原始文本从Facebook标准的JSON导出文件中提取,通过定制解析引擎扫描所有评论层,移除用户提及标签并替换为隐私占位符。针对编辑历史,采用序列匹配器将相似度达55%以上的文本变体归并至同一ID,形成修订轨迹档案。为保障语言纯度,严格应用文字密度分析,丢弃阿拉伯字符占比超过75%或提非纳字符不足10%的条目。最终生成四组配置文件,分别存储清洁文本与草稿序列,涵盖帖子、评论及其编辑历史。
特点
该语料库体现了数字原生环境下阿马齐格语的动态使用特征,兼具多文字系统与多语言并行特性。文本主体以提非纳文字书写南部摩洛哥阿马齐格语并趋近标准语,但大量条目内嵌拉丁转写、英语及阿拉伯语翻译,构成天然对齐文本。尤为独特的是,编辑草稿文件按时间序列记录了用户修改过程,从早期版本到最终定稿一目了然,为语言修订研究提供了不可多得的微观数据。整体规模控制在数千条以内,聚焦于日常社交互动中的真实语料。
使用方法
数据集加载极为便捷,可通过HuggingFace的datasets库直接调用,指定相应配置项即可获取不同子集。posts和comments配置适用于语言建模、文本生成等单句任务;而_drafts后缀的草稿配置则专为序列修订分析设计,可支撑语法纠错模型训练。研究者亦可利用内嵌的多文字对齐块进行文字转换与机器翻译实验。使用时需注意,该语料反映的是口语化社交语言而非规范文本,且包含个别嵌入的人名,不适合用于去匿名化或标准化语言学研究。
背景与挑战
背景概述
Amazigh语言(又称柏柏尔语)作为北非地区古老而重要的语言体系,其数字资源长期匮乏,尤其是采用提菲纳格(Tifinagh)书写系统的语料库更是稀缺。在此背景下,Amazigh-Facebook-Data-Export数据集于近年由研究者Abdelhaque Id Ali基于其个人社交媒体数据创建,旨在为低资源语言的自然语言处理(NLP)研究提供真实、非合成的语料。该数据集聚焦于摩洛哥南部塔舍尔希特语(Tashelhit)及标准摩洛哥阿马齐格语,其中包含平行多文字(提菲纳格、拉丁转写、阿拉伯语)与多语言(英语、阿拉伯语)的文本块,并收录了编辑历史草稿序列。这一独特的结构为语言建模、文字对齐、机器翻译以及语法错误修正等任务开辟了新的可能性,对提升提菲纳格文字的数字存在感及相关NLP工具的发展具有里程碑意义。
当前挑战
该数据集所应对的领域挑战首先在于Amazigh语言资源的极度匮乏与数字生态的碎片化问题。当前主流NLP模型在处理提菲纳格文字时面临训练数据不足、文本表征稀疏等困境,而本研究通过有机社交媒体语料部分缓解了这一瓶颈。其次,构建过程中遭遇多重技术难题,包括:1)多文字混合文本的清洗与筛选,需通过脚本密度扫描将阿拉伯字符占比超过75%的记录剔除,以确保语料的语言纯度;2)用户隐私保护与文本保真性的平衡,如对提及(mention)进行替换遮蔽,但无法完全移除内嵌人名;3)草稿对齐策略的制定,以55%的相似性阈值对编辑历史进行序列聚类,这要求算法在保留修订痕迹的同时避免过度归并。这些挑战凸显了低资源语言语料库建设在数据稀疏性、噪声处理与隐私合规之间的复杂博弈。
常用场景
经典使用场景
在低资源语言自然语言处理领域,Amazigh-Facebook-Data-Export数据集最为经典的使用场景是语言建模。该语料库捕捉了以提非纳文字书写的南部摩洛哥阿马齐格语及标准摩洛哥阿马齐格语在社交媒体平台上的真实使用样貌,为训练和微调大语言模型提供了难得的高质量有机文本数据。研究者可借助其中丰富的并行多语片段,开展脚本对齐与机器翻译任务,探索提非纳文字与其拉丁转写及英文或阿拉伯文翻译之间的映射关系。此外,借助数据集收录的编辑历史序列,从业者可构建语法纠错模型,通过分析用户修订拼写与句法的自然过程来提升模型对非规范书面形式的适应能力。
衍生相关工作
该数据集的发布催生了一系列围绕低资源语言与社交媒体语料的代表性后续研究。在方法论层面,其编辑历史聚类算法(基于55%相似度的序列匹配)启发了后续学者在构建修订历史导向语料库时采用更精细的文本差异度量策略。在语言资源建设领域,该数据集常与Hausa、Tuareg等其他非洲语言社交媒体语料联合分析,推动跨语言脚本对齐模型的迁移学习研究。此外,基于其多语并行片段,研究者已开发出针对提非纳文字-拉丁文字转写的特定语义对齐模型,为后续构造更大规模的摩洛哥阿马齐格语平行语料库奠定了重要基础。
数据集最近研究
最新研究方向
该数据集聚焦于濒危语言数字生态的前沿探索,为摩洛哥阿马齐格语(提非纳文)在社交媒体场景下的自然语言处理开辟了全新路径。研究热点集中体现在三个层面:其一,利用多语种混杂文本(提非纳文与拉丁转写、阿拉伯语共现)训练跨脚本对齐模型,破解低资源语言机器翻译的语料匮乏困境;其二,通过编辑历史草稿序列(drafts)构建动态修订语料库,为语法纠错(GEC)与用户写作行为建模提供时间维度的黄金标准;其三,推动社交网络语料去伪性研究——数据采集直接源于Facebook个人导出文件,规避了合成数据失真风险,同时严格过滤高阿拉伯语占比文本,确保提非纳文核心纯度。这一开源资源(CC-BY-4.0)填补了北非柏柏尔语系在数字人文领域的空白,其蕴含的‘非正式数字方言’特性对理解当代濒危语言演化具有里程碑式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务