遇见数据集

SHAT (الشَّت)

收藏
github2026-06-04 更新2026-06-10 收录
数据链接:
官方服务:

资源简介:

SHAT是一个开源数据集和工具链,专注于哈桑尼亚阿拉伯语(毛里塔尼亚及撒哈拉部分地区使用的方言)。它包括一个不断增长的词典(约700+英语↔哈桑尼亚词条)、基于网络的编辑器、语法感知翻译器以及用于构建哈桑尼亚聊天模型的训练数据。

SHAT is an open-source dataset and toolchain dedicated to Hassaniya Arabic, a dialect used in Mauritania and parts of the Sahara. It includes a growing dictionary with approximately 700+ English↔Hassaniya lexical entries, a web-based editor, a grammar-aware translator, and training data for developing Hassaniya chat models.

创建时间:
2026-06-02
原始信息汇总

数据集概述

SHAT (الشَّت) 是一个面向 哈桑尼亚阿拉伯语(Hassaniya Arabic,毛里塔尼亚及撒哈拉部分地区方言)的开源数据集与工具链。

核心组成

  • 词典:包含约 700+ 条英语↔哈桑尼亚语对照词条,涵盖问候、日常生活、情感、食物、旅行、技术、紧急情况等多种类别。
  • 翻译器:一个基于语法的翻译工具,支持最长短语优先匹配、形容词-名词词序调整、定冠词规则(太阳字母与太阴字母)、疑问句处理、惯用语替换及缺失词检测。
  • 训练数据:包括用于微调聊天模型的提示/答案对,以及用于语言建模的故事语料库。所有数据以纯 JSON 或文本文件存储。
  • 网页编辑器:提供完整的增删改查界面,用于管理翻译、提示/答案对及故事语料。

哈桑尼亚语简介

哈桑尼亚语是毛里塔尼亚、西撒哈拉、阿尔及利亚西南部、马里北部、尼日尔西部及塞内加尔北部等地区数百万人使用的阿拉伯方言。它保留了古典阿拉伯语的许多特征,包括完整的辅音词根系统和性/数一致。

英语 哈桑尼亚语(拉丁转写)
Hello Slm
How are you? Ch7alak / Chmassy
Good night Leyle zeine
I dont know Ane man3rav
See you later Nchovak ba3din

语法规则要点

翻译器自动应用以下哈桑尼亚语/阿拉伯语语法规则:

规则 说明 示例
1 主谓宾语序 (SVO) Ane nvakar 7oulm = “I think a dream”
2 后置形容词 wete zeine (car beautiful),非 zeine wete
3 定冠词:太阳字母 → e- + 双写 chemsechems (the sun)
4 定冠词:太阴字母 → l- 9amarl9amar (the moon)
5 过去时 -t 后缀 kalkelt (I ate)
6 将来时 ndor- 前缀 ndor nmchi (I will go)
7 第一人称 n- 前缀 n3rav (I know), nged (I can)
8 否定式 ma...4i man3rav (I dont know)
9 破碎复数 ktabktoub (books)
10 阴性 -e 后缀 mu3alimmu3alima (teacher f.)

项目结构

shat/ ├── server.js # Node.js HTTP 服务器 (端口 3000) ├── index.html # 网页编辑器界面 ├── translations_shat.json # 英语↔哈桑尼亚语词典 ├── prompts_answers.json # 训练提示/答案对 ├── shat_story.txt # 故事语料库 ├── README.md # 本文件 └── start_server.bat # Windows 启动脚本

使用方式

  1. 环境准备:安装 Node.js。
  2. 启动服务:在项目目录下运行 node server.js
  3. 访问界面:在浏览器中打开 http://localhost:3000
  4. 主要功能
    • 通过“Add Translation”视图添加英-哈桑尼亚语词条。
    • 通过“Translator”视图输入英语文本,实时查看哈桑尼亚语翻译。
    • 通过“Edit Translations”等视图编辑或删除词典条目及训练数据。

计划功能

  • 词典导出为 CSV / Anki 格式
  • 音频发音录制
  • 反向翻译(哈桑尼亚语 → 英语)
  • 词典中的词性标注
  • 动词变位表
  • 移动端友好的用户界面
  • 机器学习训练管道的导入/导出
搜集汇总
数据集介绍
SHAT (الشَّت) 数据集图片
构建方式
SHAT数据集以Hassaniya阿拉伯语为核心,通过整合700余条英-哈对照词条、语法感知翻译规则及提示-答案训练对构建而成。数据来源于毛里塔尼亚及撒哈拉地区日常用语,涵盖问候、情感、科技等十余个语义类别,并辅以连续叙事文本作为语言模型语料。所有条目通过Node.js驱动的Web编辑器实时录入,以纯JSON及文本文件存储,确保数据结构清晰且便于扩展,最终形成一套兼具词典、翻译工具与机器学习训练功能的开源资源。
特点
该数据集最显著的特性在于其融入阿拉伯语经典语法规则的翻译引擎,包括定冠词依太阳/太阴字母变体、宾格语序调整及否定式前缀合并等20项自动规则。同时,采用最长短语优先匹配策略与习语替换机制,显著提升翻译准确性。词典支持双向模糊搜索,缺失词条可一键跳转补充;提示-答案对与故事语料库为对话模型微调提供原生数据,突破传统平行语料库的静态局限,凸显语言保存与技术融合的独创价值。
使用方法
用户可通过本地服务器快速部署:克隆仓库后运行`node server.js`,浏览器访问`http://localhost:3000`即可启动全功能Web编辑器。在翻译视图中输入英文,系统即依据语法规则实时生成Hassaniya译文,缺失词汇以红色高亮并支持点击跳转添加。词典与训练数据均支持增删改查,所有变更直接保存至JSON及文本文件,便于导出至机器学习流水线或CSV/Anki格式。无需数据库或第三方依赖,仅需Node.js环境,显著降低低资源语言工具的使用门槛。
背景与挑战
背景概述
SHAT(الشَّت)数据集诞生于对濒危方言——哈桑尼亚阿拉伯语(Hassaniya Arabic)进行数字化保存与自然语言处理研究的迫切需求之中。该方言广泛通行于毛里塔尼亚、西撒哈拉及撒哈拉沙漠周边地区,承载着古典阿拉伯语诸多已失传的语法特征,如完整的辅音词根系统与性数一致规则。然而,作为口语占绝对主导的方言,哈桑尼亚语缺乏系统性的书面语料库与计算语言学研究资源。该数据集由匿名开源社区开发者创建,旨在通过构建包含700余条英-哈词汇对、语法感知翻译规则及聊天模型训练语料的工具链,弥合高资源语言与低资源方言之间的数字鸿沟。其核心研究问题聚焦于如何利用有限数据实现精准的方言机器翻译与对话系统,为西非阿拉伯语地区的语言技术发展奠定基础。
当前挑战
该数据集面临的首要挑战源于哈桑尼亚语作为低资源方言的固有限制——缺乏标准化正字法、标注语料稀缺,且现有语音识别与翻译模型几乎完全空白,这使得构建大规模高质量平行语料库极具难度。在数据构建过程中,创作者需应对口语词汇的变体多样性与语法规则的特殊性(如太阳字母前缀‘e-’与各类复数的非规则形态),仅凭手工录入的700余条词汇难以覆盖日常表达的丰富性。同时,方言中嵌入的法语、柏柏尔语及西非本土语言借词进一步增加了歧义解析的复杂度。此外,由于毛里塔尼亚等地区数字化基础设施薄弱,招募标注人员与验证语料真实性亦成为持续性瓶颈,最终影响模型泛化能力与跨领域迁移效果。
常用场景
经典使用场景
SHAT数据集最经典的使用场景在于构建和训练面向哈桑尼亚阿拉伯语的机器翻译系统与对话模型。作为该方言稀缺语言资源的集中体现,研究者可将词典中收录的数百条英语-哈桑尼亚语对照词条与短语,以及精心编排的提示-回答配对数据和故事语料,直接用于微调基于Transformer架构的序列到序列模型或大型语言模型。该数据集内置的语法感知翻译器实现了基于最长短语匹配、冠词规则与形容词-名词语序调整等机制,为开发低资源语言的自然语言理解系统提供了宝贵的基准测试平台。
解决学术问题
该数据集有效缓解了哈桑尼亚阿拉伯语在自然语言处理领域面临的严重数据匮乏问题。在学术研究中,它填补了该方言缺乏标准化语料库和数字化语法规则的空白,使研究者得以探索低资源语言翻译模型、方言形态学分析与跨方言迁移学习的算法边界。SHAT所解决的不仅是一个语言技术难点,更记录了哈桑尼亚语作为毛里塔尼亚、西撒哈拉及萨赫勒地区数百万人口日常交际载体的语言特征,其规则集完整保存了古典阿拉伯语的辅音词根系统与性数一致机制,对语言学研究本身亦具有深远的文献学意义。
衍生相关工作
围绕SHAT数据集已衍生出一系列富有启发性的姊妹工作。其语法规则体系的系统梳理催生了一种基于符号规则的哈桑尼亚语形态分析器原型,能够自动识别动词时态标记(如过去时后缀-t与将来时前缀ndor-)和否定结构ma...4i。部分研究者借鉴该数据集的冠词处理策略,针对马格里布地区其他方言的定冠词变体现象构建了对比语言学语料库。在机器学习方向,该数据集的提示-回答配对被用于训练面向毛里塔尼亚语境的文化问答系统,而故事语料库则被用作低资源语言预训练语言模型领域自适应实验中的微调集,展现出从英语到哈桑尼亚语的零样本迁移能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务