Amazigh-Facebook-Data-Export
收藏资源简介:
Amazigh Facebook Dataset (Filtered) 是一个经过筛选的、由阿马齐格语使用者撰写的个人Facebook帖子和评论集合。该数据集捕捉了提非纳文字中阿马齐格语在现实世界通信中的使用情况,主要包含南摩洛哥阿马齐格语(Tashelhit),并尽可能倾向于使用阿马齐格文字(提非纳文字)的标准摩洛哥阿马齐格语。部分帖子和评论独特地包含了平行的多文字和多语言内容(某些文本块中嵌入的音译和翻译),以及分组的迭代编辑历史记录(草稿)。数据集包含四个主要文件:posts.json和comments.json存储清洁的单一文本条目,每个条目包含唯一的id和text字段;posts_drafts.json和comments_drafts.json存储修订历史,采用分层结构,包含id、draft_final(最终状态)和draft_X(历史编辑)字段。数据规模为1K到10K样本之间。数据集适用于语言建模、文字对齐与机器翻译(利用内部平行块将提非纳文字映射到拉丁文字音译和翻译)以及语法错误纠正(通过分析草稿序列学习真实用户的修订模式)。数据来源于Facebook标准导出数据,经过匿名化处理(移除用户提及但可能保留嵌入式名称)、草稿对齐(基于55%相似度阈值)和语言过滤(丢弃阿拉伯字符比例≥75%的文本块)。数据集主要反映摩洛哥阿马齐格语变体和区域性表达,语法呈现非正式的数字消息风格,包含较短的句子长度、平台缩写和感叹习惯。
数据集概述
数据集名称:Amazigh Facebook Dataset (Filtered)
数据集地址:https://huggingface.co/datasets/abdelhaqueidali/Amazigh-Facebook-Data-Export
数据集描述:一个经过筛选的个人Facebook帖子和评论的语料库,由一名阿马齐格语使用者以提菲纳格文字(Tifinagh)撰写。数据主要反映南摩洛哥阿马齐格语(塔谢尔希特语)和标准摩洛哥阿马齐格语的数字通信使用情况,部分条目包含多文字和多语言(拉丁转写、英语和阿拉伯语翻译)的平行文本,以及分组的迭代编辑历史记录(草稿)。
策划者:Abdelhaque Id Ali(Facebook资料所有者)
语言:
- 阿马齐格语(ber)
- 标准摩洛哥阿马齐格语(zgh)
- 塔谢尔希特语(shi)
- 英语(en)
- 阿拉伯语(ar)
许可证:CC-BY-4.0
标签:amazigh, berber, tifinagh, facebook, social-media, parallel-text, drafts, edit-history
数据集规模:1K < n < 10K
数据用途
直接用途:
- 语言建模:用于训练和微调大语言模型,学习有机的、数字原生的阿马齐格语文本结构。
- 文字对齐与机器翻译:利用内部的平行文本块,将提菲纳格文字映射到拉丁转写和翻译。
- 语法错误纠正:通过分析草稿序列文件,学习用户如何修改、调整和纠正拼写或句法错误。
超出范围的使用:不适用于脱离上下文的语言规范化研究,因为数据包含口语化的数字语言,而非严格的正式标准散文。也不应用于识别或去匿名化任何参与的个人实体。
数据集结构
数据集包含四个配置文件,每个对应一个JSON文件:
| 配置名称 | 数据文件 | 拆分 |
|---|---|---|
| posts | posts.json | train |
| posts_drafts | posts_drafts.json | train |
| comments | comments.json | train |
| comments_drafts | comments_drafts.json | train |
| comment_drafts | comment_drafts.json | train |
目录结构:
📁 dataset_root/ ├── comments.json ├── comments_drafts.json ├── posts.json └── posts_drafts.json
数据模式
1. 干净文件(comments.json, posts.json)
每条记录包含唯一ID和其对应的文本内容。
示例: json [ { "id": 847291043, "text": "ⵜⵉⴼⴰⵡⵉⵏ! ⵉⵙ ⵣⴰ ⵖⵓⵔⵓⵏ ⵔⵖⴰⵏ ⵡⵓⵙⵙⴰⵏ ⴰⴷ?" } ]
2. 草稿文件(posts_drafts.json, comments_drafts.json)
每条记录包含唯一ID及其编辑历史版本。draft_final 代表最终发布版本,draft_1 代表最早记录的修改版本。
示例: json [ { "id": 921504888, "draft_final": "ⴰⵣⵓⵍ ⵏⵏⵓⵏ ⴰⵢⵜⵎⴰ.", "draft_2": "ⴰⵣⵓⵍ ⵏⵏⵓⵏ ⴰⵢⵜⵍⴰ.", "draft_1": "ⴰⵣⵓⵍ ⴼⵍⵍⴰⵡⵏ ⴰⵢⵜⵍⴰ." } ]
字段说明:
| 字段名 | 数据类型 | 描述 |
|---|---|---|
| id | Integer | 唯一、随机分配的9位数字序列键,用于追踪文本条目。 |
| text | String | 仅存在于posts.json和comments.json中;代表原始的、经过净化的文本字符串。 |
| draft_final | String | 仅存在于_drafts.json配置中;代表编辑序列的最终状态。 |
| draft_X | String | 仅存在于_drafts.json配置中;代表先前的历史编辑版本,通向最终版本。 |
数据创建
策划动机:阿马齐格语(尤其是提菲纳格文字)的数字数据集仍然稀缺。该数据集提供了真实的、非合成的会话记录,反映了现代互联网使用、文字适应和自然的在线编辑习惯。
数据来源与处理:
- 提取:从标准的Facebook数据导出(.json文件)中提取原始文本数据。
- 匿名化:自定义解析引擎扫描所有评论层,移除显式用户引用(提及),并替换为隐私占位符
[@removed_name]。但嵌入的字符串名称因技术限制无法移除。 - 草稿对齐:对于编辑文件,通过序列匹配器处理字符串,将相似度达到55%的文本变体分组到同一个ID下,构建修订历史记录。
- 语言过滤:对每条记录进行文字密度分析,如果阿拉伯语字符块(
u0600-u06ff)占文本块总字母数的75%或以上,则丢弃该条目。
数据生产者:由一名阿马齐格语内容创作者和语言爱好者(Abdelhaque Id Ali)在社交媒体上有机生成。
个人与敏感信息:所有评论数据集中的平台用户名、标签和跟踪指标均被剥离并随机化。但嵌入的姓名提及因技术限制未能移除,其他元数据已被移除。
偏见、风险与限制
- 方言聚焦:词汇和措辞主要反映标准摩洛哥阿马齐格语变体和当地区域性表达。
- 对话语气:句法代表随意的数字消息,包含较短的句子长度、平台缩写和感叹表达,与教材文本不同。
术语表
- 提菲纳格(Tifinagh):阿马齐格人用来书写阿马齐格语的文字。
- 草稿聚类(Drafts Clustering):将单个帖子的每次修改按顺序捕获,而不是作为不相关的数据记录进行分组的结构映射。
数据集卡片作者
Abdelhaque Id Ali: abdelhaque.idal@gmail.com




