SomNLP-Translate
收藏资源简介:
SomNLP-Translate是一个公开的、高质量的英语-索马里语平行数据集,旨在支持索马里语的机器翻译、自然语言处理(NLP)、大语言模型(LLMs)和其他人工智能应用的研究与开发。它采用可复现、质量可控的数据管道,存储每个对齐的英语-索马里语对,并计划通过一系列处理阶段(如下载、合并、清理、语言识别、过滤、去重、防泄漏分割等)生成最终数据集。
SomNLP-Translate is a public, high-quality English-Somali parallel dataset aimed at supporting research and development of machine translation, natural language processing (NLP), large language models (LLMs), and other artificial intelligence applications related to the Somali language. It adopts a reproducible, quality-controlled data pipeline that stores each aligned English-Somali sentence pair, and plans to generate the final dataset through a series of processing stages including downloading, merging, cleaning, language identification, filtering, deduplication, leakage-proof splitting, and so on.
数据集名称
SomNLP-Translate
数据集简介
一个面向机器翻译的、可复现、质量可控的英语–索马里语平行语料库。数据以Rust优先的数据管道进行流式处理,支持配置驱动,并提供完整的数据来源追溯。
数据集状态
已完成M1(基础阶段),定义了数据合约与架构,后续阶段包括下载、清洗、去重、分割和发布等。
数据范围
- 每条记录存储一对对齐的英语–索马里语文本,语言标签确保记录方向中立,支持导出为英语→索马里语或索马里语→英语的训练视图,无需重复存储源数据。
- 与SomNLP-Corpus互补:前者专注索马里语单语文档(语言建模与索马里语NLP),后者专注对齐的英语–索马里语平行句对(翻译训练与评估)。
数据处理流程(计划)
- 下载
- 合并+精确去重
- 双语清洗
- 双重语言识别
- 质量过滤
- 近似去重+泄漏控制
- 训练/开发/测试集分割
- 最终输出
所有阶段流式输出JSONL,生成统计信息,并保留被拒绝的记录及其机器可读原因。
记录格式
每条记录包含以下字段:
id:唯一标识符,例如mt560:sha256-prefixsource:源语言文本与语言标签(如英语)target:目标语言文本与语言标签(如索马里语)provenance:来源信息(数据源、采集时间)license:许可协议(如CC-BY-4.0)hashes:源文本、目标文本及句对的SHA256哈希值quality:质量状态(保留/拒绝)及标记列表schema_version:架构版本号
项目结构
SomNLP-Translate/ ├── configs/ # 管道配置 ├── crates/ │ ├── common/ # 句对模式与共享合约 │ ├── translate-tools/ # 下载与合并工具 │ └── translate-pipeline/ # 处理与分割阶段 ├── docs/ # 架构与数据规范 ├── reports/ # 阶段报告(git忽略) └── data/ # 生成的数据集工件(git忽略)
开发要求
- Rust 1.75+
- 运行测试:
cargo test - 代码检查:
cargo clippy --all-targets -- -D warnings - 格式化:
cargo fmt --check
文档索引




