translator-rules-dataset
收藏资源简介:
该数据集是一个英语-阿拉伯语双语平行语料库,包含18,228个训练样本和2,022个评估样本,总数据量约1.13GB。每个样本由英语原文和阿拉伯语译文的文本对组成,并附有丰富的元数据,包括来源、翻译信息、翻译规则、系统提示、翻译方向、文本领域、代码标识以及分类标签。数据集适用于机器翻译模型训练、跨语言自然语言处理研究、翻译质量评估以及多领域文本分析等任务,其结构化特征支持对翻译过程、领域适应性和分类体系的深入分析。
This dataset is an English-Arabic bilingual parallel corpus, comprising 18,228 training samples and 2,022 evaluation samples, with a total data volume of approximately 1.13 GB. Each sample consists of a text pair of an English source text and an Arabic translated text, and is accompanied by rich metadata including source, translation information, translation rules, system prompts, translation direction, text domain, code identifiers, and classification labels. This dataset is applicable to tasks such as machine translation model training, cross-lingual natural language processing research, translation quality assessment, and multi-domain text analysis. Its structured features support in-depth analysis of translation processes, domain adaptability and classification systems.
- 数据集名称:translator-rules-dataset
- 数据集链接:https://huggingface.co/datasets/sevka-k1/translator-rules-dataset
- 数据集大小:总大小约1.26 GB,下载大小约60.78 MB。
- 数据划分:
- 训练集:18,228 个样本,约1.13 GB。
- 验证集:2,022 个样本,约125.72 MB。
- 特征字段:
- english(字符串):英文原文。
- arabic(字符串):阿拉伯语内容。
- source(字符串):来源。
- translation(字符串):翻译结果。
- rules(字符串):翻译规则。
- system_prompt(字符串):系统提示。
- direction(字符串):翻译方向。
- field(字符串):领域。
- code(字符串):代码。
- classifications(字符串):分类。
- messages(列表,包含子字段 content、reasoning_content、role):消息结构,用于对话或推理。
- 数据格式:数据集包含训练集和验证集,数据文件位于
data/train-*和data/validation-*路径下。





