English–Tigrinya evaluation dataset
收藏资源简介:
本研究构建了一个高质量的英语-提格雷语评估数据集,涵盖四个领域,包括宗教、新闻、健康和教育。数据集由1200个宗教领域句子、1500个新闻领域句子、800个健康领域句子和500个教育领域句子组成,总共有4000个句子。数据集已进行人工对齐和预处理,以支持严格的评估。
This study constructs a high-quality English-Tigrinya evaluation dataset covering four domains: religion, news, health, and education. The dataset comprises 1200 sentences from the religious domain, 1500 from the news domain, 800 from the health domain, and 500 from the education domain, totaling 4000 sentences. The dataset has undergone manual alignment and preprocessing to support rigorous evaluation.
Machine Translation Model: English ↔ Tigrinya 数据集概述
模型基本信息
- 模型类型: MarianMT(多语言Transformer模型)
- 语言支持: 英语 ↔ 提格里尼亚语
- 模型架构: MarianMT,针对英语 ↔ 提格里尼亚语翻译进行微调
- 训练框架: Hugging Face Transformers,PyTorch
训练详情
- 训练数据集: NLLB平行语料库(英语 ↔ 提格里尼亚语)
- 训练轮次: 3
- 批次大小: 8
- 最大长度: 128个标记
- 学习率: 从
1.44e-07开始,训练过程中衰减 - 训练损失:
- 最终训练损失: 0.4756
- 每轮损失进展:
- 第1轮: 0.443
- 第2轮: 0.4077
- 第3轮: 0.4379
- 梯度范数:
- 第1轮: 1.14
- 第2轮: 1.11
- 第3轮: 1.06
- 训练时间: 43376.7秒(约12小时)
- 训练速度:
- 每秒训练样本数: 96.7
- 每秒训练步数: 12.08
模型用途
该模型可用于英语句子与提格里尼亚语之间的互译。
使用示例(Python)
python from transformers import MarianMTModel, MarianTokenizer
加载模型和分词器
model_name = "Hailay/MachineT_TigEng"
model = MarianMTModel.from_pretrained(model_name)
tokenizer = MarianTokenizer.from_pretrained(model_name)
将英语句子翻译为提格里尼亚语
english_text = "We must obey the Lord and leave them alone" encoded_input = tokenizer(english_text, return_tensors="pt", padding=True, truncation=True) translated = model.generate(**encoded_input) translated_text = tokenizer.decode(translated[0], skip_special_tokens=True)
print(f"Translated text: {translated_text}")
模型能力
该模型训练用于处理一般英语到提格里尼亚语的翻译任务,适用于广泛的文本,但在领域特定语言或专业术语上可能表现不佳,除非进一步微调。
模型架构
该模型基于MarianMT架构,这是一种为多语言机器翻译设计的Transformer模型,已在英语 ↔ 提格里尼亚语数据上进行了微调。
致谢
- 语料库名称: NLLB
- 包: NLLB.am-en(Moses格式)
- 网站: NLLB Corpus




