遇见数据集

Amazigh-English-Tatoeba-Extended

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

该数据集为阿马齐格语-英语分层复述数据集,旨在通过扩展目标端(英语)的句子多样性,加速阿马齐格语的自然语言处理、文本对齐和机器翻译任务。数据源自Tatoeba项目的标准摩洛哥阿马齐格语(使用阿马齐格文字)句子及其英语翻译平行语料。核心特征是为每个英语句子利用`gemini-3.1-flash-lite`模型生成了两组(rephrasings1和rephrasings2)共六个合成英语变体,其中rephrasings1组优先保持原句结构,rephrasings2组则更具创造性地选择其他表达方式,从而为下游任务提供了在严格结构遵从与灵活语境多样性之间的选择。数据集以JSON字典格式组织,以唯一的Tatoeba英语句子ID为索引,每个条目包含阿马齐格语句子ID、阿马齐格语文本、原始英语文本以及两个重述列表。该数据集适用于微调翻译模型以增强短语灵活性、训练大语言模型进行结构化文本复述,以及评估需要区分语法结构保留与自由形式创造性重写的NLP对齐策略。

This dataset is a Tamazight-English hierarchical paraphrasing dataset designed to accelerate natural language processing, text alignment, and machine translation tasks for Tamazight by expanding sentence diversity on the target side (English). The data originates from standard Moroccan Tamazight (using the Tifinagh script) sentences and their English translation parallel corpora from the Tatoeba project. A key feature is the generation of two sets (rephrasings1 and rephrasings2) totaling six synthetic English variants for each English sentence using the `gemini-3.1-flash-lite` model, where the rephrasings1 group prioritizes maintaining the original sentence structure, while the rephrasings2 group more creatively selects alternative expressions, thus providing a choice between strict structural adherence and flexible contextual diversity for downstream tasks. The dataset is organized in JSON dictionary format, indexed by unique Tatoeba English sentence IDs, with each entry containing Tamazight sentence ID, Tamazight text, original English text, and two rephrasing lists. It is suitable for fine-tuning translation models to enhance phrase flexibility, training large language models for structured text paraphrasing, and evaluating NLP alignment strategies that require distinguishing between grammatical structure preservation and free-form creative rewriting.

创建时间:
2026-06-04
原始信息汇总

数据集卡片:Amazigh-English Tiered Rephrasing Dataset

数据集名称:Amazigh-English Tiered Rephrasing Dataset
主页:https://huggingface.co/datasets/abdelhaqueidali/Amazigh-English-Tatoeba-Extended
许可证:CC-BY-2.0

数据集描述

该数据集旨在通过扩展目标端英语多样性,加速阿马齐格语的自然语言处理、文本对齐和机器翻译任务。利用 gemini-3.1-flash-lite 进行高通量自动化处理,每条英语句子被扩展为两组(rephrasings1rephrasings2),使下游训练流程能够在严格结构遵从性与灵活语境多样性之间进行选择。

数据集详情

  • 策划者:Abdelhaque id ali
  • 语言(NLP):标准摩洛哥阿马齐格语(阿马齐格文字)、英语
  • 许可证:CC-BY-2.0(继承自底层 Tatoeba 源语料库)
  • 数据集来源
    • 存储库:Tatoeba 项目(句子对的原始来源)
  • 标签:对齐、微调、句子改写、文本生成、amazigh、tamazight、tifinagh

用途

  • 直接使用
    • 使用增强目标端微调翻译模型,提升短语灵活性。
    • 在结构化文本释义和规则遵从性上训练大语言模型。
    • 评估语法结构保持与自由创意改写分离的 NLP 对齐策略。
  • 非预期用途:不适用于没有人工验证的高风险法律、医疗或安全关键翻译部署。

数据结构

数据集包含两个改写组,english_text 是来自 Tatoeba 的原始翻译。rephrasings1 优先保持句子结构尽可能不变,rephrasings2 在句子含义上有更多创意选择。

数据集以 JSON 字典结构存储,索引为唯一的 Tatoeba 英语句子 ID,示例: json { "6666152": { "amazigh_id": "9732314", "amazigh_text": "ⵓⵔ ⴰ ⴱⴰⵀⵔⴰ ⵜⴳⴳⴰⵖ ⴰⵎⴰⴽⵢⴰⵊ", "english_text": "I dont often wear makeup.", "rephrasings1": [ "I do not frequently put on makeup.", "It is not often that I wear makeup.", "I seldom wear cosmetics." ], "rephrasings2": [ "I usually go without any makeup.", "Wearing makeup isnt a regular thing for me.", "I tend to keep my face natural most of the time." ] } }

另有 CSV 版本,字段 phrasing1/01/11/2 表示优先级改写。

特征列表

  • _key(int64):唯一键
  • english_id(string):英语句子 ID
  • amazigh_id(string):阿马齐格语句子 ID
  • amazigh_text(string):阿马齐格语文本
  • english_text(string):英语原始翻译
  • rephrasings1/0rephrasings1/3(string):第一组改写(结构保持优先)
  • rephrasings2/0rephrasings2/2(string):第二组改写(创意变化)
搜集汇总
数据集介绍
Amazigh-English-Tatoeba-Extended 数据集图片
构建方式
该数据集基于Tatoeba项目中的标准摩洛哥阿马齐格语与英语平行句对,通过利用`gemini-3.1-flash-lite`自动化工具对每句英语译文进行多层级扩展。每条英文句子被系统性地生成两组变体:第一组`rephrasings1`尽可能保持原句语法结构,第二组`rephrasings2`则注重语义的创造性与语境多样性。最终数据以统一JSON格式存储,以Tatoeba英语句子ID为索引,整合了阿马齐格语原文、原始英语译文及两组共六条改写句,同时提供CSV版本供便捷访问。
特点
该数据集的显著特点在于其多层级改写机制,为下游任务提供了精细化的语言多样性选择。第一组改写严格遵循原句结构,适合训练需要语法保真度的对齐模型;第二组改写则引入自由表达,增强模型对语义变化的鲁棒性。数据集覆盖阿马齐格语、英语及标准摩洛哥阿马齐格语三种语言标签,并明确区分为对齐、微调、句子改写和文本生成等应用场景,结构清晰且实用性强。
使用方法
该数据集可直接用于微调机器翻译模型,通过扩展目标端英语多样性提升翻译的短语灵活性。同时适用于训练大语言模型进行结构化文本改写与规则遵从任务,亦可用于基准测试自然语言对齐策略,独立评估语法结构保持与自由创造性改写两种能力。使用时可按需选择第一组改写以训练结构敏感模型,或结合第二组变体增强表达丰富度,但不建议直接用于医疗、法律等高危翻译场景,须辅以人工校验。
背景与挑战
背景概述
在自然语言处理领域,低资源语言的机器翻译与文本对齐研究长期面临平行语料匮乏的困境,柏柏尔语族的阿马齐格语(Amazigh)作为北非地区的重要语言,其数字化资源尤为稀缺。Amazigh-English-Tatoeba-Extended数据集由Abdelhaque id ali于近期创建,基于Tatoeba项目中的标准摩洛哥阿马齐格语(采用提菲纳文字)与英语平行句对,通过Gemini 3.1 Flash Lite自动化工具为每条英语译文生成两组共计6个合成变体,构建了包含结构保持型与创意改写型多层次改写数据的资源。该数据集旨在扩充英语端多样性,支撑阿马齐格语的神经机器翻译、文本对齐及大语言模型微调任务,为低资源语言研究提供了高质量、可复用的基准资源。
当前挑战
该数据集面临的挑战体现在两个层面。在领域问题层面,阿马齐格语作为低资源语言,缺乏大规模高质量平行语料,现有双语对齐数据有限且英语端表达单一,限制了翻译模型的泛化能力;同时,阿马齐格语的提菲纳文字编码与形态丰富性增加了文本处理的复杂度。在构建过程中,为确保合成改写质量,需平衡结构保真度与语义多样性,避免生成不符合英语习惯或偏离原意的变体;此外,自动化生成依赖大语言模型,可能引入偏见或噪声,且缺乏人工审核机制,数据一致性验证与错误过滤成为关键难点,如何有效筛选并利用多层次改写信息以优化模型训练仍需深入探索。
常用场景
经典使用场景
该数据集最为经典的使用场景,是服务于低资源语言——阿马齐格语(Amazigh)与英语之间的机器翻译与文本对齐任务。通过提供带有精细化结构保留与创造性重述的多层级英文改写句子,研究者能够利用这些平行语料对神经机器翻译模型进行微调,从而提升模型对于同一源语言句子的目标端表达的多样性与鲁棒性。特别是对于阿马齐格语这种语料稀缺且书写系统独特的语言,该数据集填补了高质量并行数据空白,使得翻译系统在忠实原文与丰富表达之间取得更优平衡。
解决学术问题
本数据集有效解决了低资源语言翻译研究中长期存在的目标端多样性匮乏与模型泛化能力不足的学术难题。传统平行语料往往仅提供单一翻译对应,导致模型容易陷入过拟合,难以处理真实场景中表达方式的千变万化。该数据集通过结构化改写策略,将每种英文翻译扩展为六种语义等价但句式相异的变体,服务于自然语言处理领域关于数据增强、句子改写评估、以及对齐策略中结构保留与创造性改写解耦分析等方向的探究,为验证不同训练策略对翻译质量的影响提供了标准化的测试基准。
衍生相关工作
围绕该数据集可衍生出一系列具有学术价值的研究工作。基于其结构保留与创造性重述的分层设计,学者可以开展针对翻译模型的可控性生成研究,对比不同层级改写数据对模型忠实度与流畅度的差异化影响。同时,该数据集也可用于构建跨语言的释义检测基准,评估翻译系统对于语义等价但句法相异句子的鉴别与生成能力。此外,该数据集还可与Tatoeba原始语料配合,推动针对阿马齐格语的语法结构解析、序列标注以及语言多样性分析等自然语言处理子任务的研究进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务