遇见数据集

qor-af-soomaali

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

Qor Af-Soomaali (Unkad索马里语语料库,v0.2.0) 是一个由社区贡献、同行验证、语言学家审核的索马里语文本数据集,由非营利AI研究实验室Unkad Labs通过qor.unkad.com平台构建。每个样本均由同意的索马里语使用者撰写,经过至少两名社区成员验证,并由资深语言学家最终确认。每条数据均携带来源信息:模式(写/翻译/转录)、语域(会话/叙述/指导/正式/技术)、领域、以及贡献者提供的方言信息。当前版本包含2040个句子、34414个单词、235个文档,其中111个文档为新增。数据覆盖9个领域:通用(60.7%)、宗教(11.0%)、技术(9.2%)、文化(6.2%)、媒体(5.4%)、教育(3.4%)、农业(2.5%)、健康(1.1%)、法律(0.4%)。文本经过规范化处理(如统一标点、合并空格),但原始文本可恢复。数据集提供两种格式:sentences.jsonl和train.jsonl。字段包括:text_so(索马里语文本)、text_en(英语来源,仅翻译模式)、mode(模式)、register(语域,仅部分样本有)、sector(领域)、topic(主题)、dialect(方言,如maxaa_tiri或maay)、verified(是否已验证)、license(许可)、created_at(创建时间)。该数据集旨在解决低资源语言索马里语中网络爬取语料存在的作者不明、许可未知、机器翻译污染等问题,强调人工编写和明确授权。所有贡献者均同意CC BY-SA 4.0许可,并选择署名方式。局限性包括:规模较小、贡献者集中、缺少Maay方言、句子分割为自动处理、验证粒度不完全一致、英文平行对保留用于未来评估集。适合用于索马里语文本生成、语言模型训练、方言研究、低资源语言NLP等任务。

Qor Af-Soomaali (Unkad Somali Corpus, v0.2.0) is a community-contributed, peer-verified, linguist-audited Somali text dataset developed by the non-profit AI research lab Unkad Labs via the qor.unkad.com platform. Each sample is authored by consenting Somali language speakers, verified by at least two community members, and finally validated by senior linguists. Every data entry includes source metadata: mode (writing/translation/transcription), register (conversational/narrative/instructional/formal/technical), sector, and dialect information provided by contributors. The current release contains 2,040 sentences, 34,414 words, and 235 documents, of which 111 are newly added. The corpus covers 9 sectors: General (60.7%), Religious (11.0%), Technical (9.2%), Cultural (6.2%), Media (5.4%), Educational (3.4%), Agricultural (2.5%), Health (1.1%), and Legal (0.4%). All texts have been normalized (e.g., unified punctuation, merged whitespace), while the original raw text remains recoverable. This corpus is available in two formats: sentences.jsonl (each line contains a single sentence, with "document_id" and "position" fields to enable paragraph reconstruction) and train.jsonl (each line contains a complete document, preserving paragraph structure). The core data fields include: "text_so" (Somali text), "text_en" (English source, only available for translation-mode samples), "mode", "register" (available for partial samples only), "sector", "topic", "dialect" (e.g., maxaa_tiri or maay), "verified" (validation status), "license", and "created_at". This corpus was developed to address critical issues in web-crawled Somali language corpora, including unknown authorship, unconfirmed licensing, and machine translation contamination, prioritizing human-authored content and clearly documented consent. All contributors have agreed to the CC BY-SA 4.0 license and opted for standard attribution requirements. Limitations of this corpus include: relatively small scale, concentrated contributor base, lack of Maay dialect coverage, automatic sentence segmentation, inconsistent validation granularity, and English parallel pairs reserved for future evaluation sets. It is suitable for tasks such as Somali text generation, language model training, dialect research, and low-resource language NLP.

创建时间:
2026-07-30
原始信息汇总

Qor Af-Soomaali — Unkad 索马里语语料库 (v0.2.0)

数据集概览

  • 许可证: CC BY-SA 4.0
  • 语言: 索马里语 (so) 和英语 (en)
  • 规模: 1K < n < 10K 条
  • 标签: 索马里语、低资源语言、社区贡献、Unkad
  • 构建方: Unkad Labs(非营利AI研究实验室),平台为 qor.unkad.com

数据集规模

指标 数值
句子数 2,040
词数 34,414
文档数 235
本版本新增文档 111
英-索平行句对 0
领域数 9
质量等级 语言学家验证
内容类型 单语索马里语

领域分布(9个领域)

领域 句子数 占比
通用 1,239 60.7%
宗教 225 11.0%
技术 187 9.2%
文化 127 6.2%
媒体 110 5.4%
教育 69 3.4%
农业 51 2.5%
健康 23 1.1%
法律 9 0.4%

文本规范说明

  • 对标点符号进行了标准化处理(如弯引号、不间断连字符/空格、零宽字符等),防止评分时出现伪错误
  • 省略号统一为三个点,多余空格被合并
  • 本版本中235篇文档中有152篇受影响
  • 字母、元音和表示索马里语喉塞音的撇号均未改动;en/em破折号保留
  • 平台保存原始未修改文本,原始内容可恢复

文件结构

  • data/sentences.jsonl:每行一条句子,包含 document_idposition 字段,可重组上下文
  • data/train.jsonl:每行一篇完整文档,保留段落结构
  • 两个文件内容相同,可按任务选择使用

数据字段

  • text_so:索马里语文本
  • text_en:英语文本(仅翻译模式)
  • mode:写作/翻译/转写
  • register:会话/叙事/指令/正式/技术(仅提示式条目有,共265句,自由写作无)
  • sector:领域
  • topic:主题
  • dialect:方言(maxaa_tiri/maay/其他,如共享)
  • verified:验证状态
  • license:许可证
  • created_at:创建时间

同意与署名

  • 所有贡献者在注册时明确同意在CC BY-SA 4.0下开放发布
  • 贡献者可选择以姓名、化名或匿名方式署名(见 CREDITS.md

构建理念

  • 语料为人工撰写而非网络抓取
  • 每条句子均有明确作者、明确许可、明确来源
  • 无机器翻译内容,无未经授权的文本
  • 已执行质量管控:曾移除约150条从Telegram转发的内容,并对粘贴长文本的贡献者进行了调查和记录

已知局限

  • 规模较小:早期版本,非完整语料库
  • 贡献集中:少数贡献者撰写了大部分文本
  • 缺少Maay方言:目前所有条目均为Maxaa-tiri或未指明
  • 句子分割为自动处理:基于终止标点和换行分割,已移除96条非索马里语句子(阿拉伯语引文等)
  • 验证粒度不一:长段落整体验证,而非逐句验证;句子级审阅计划中
  • 英语平行句对暂未发布:保留用于未来的评估集,防止被训练后失去基准价值

引用与联系

  • 联系邮箱:research@unkad.com
  • 平台地址:https://qor.unkad.com
搜集汇总
数据集介绍
qor-af-soomaali 数据集图片
构建方式
该数据集由非营利人工智能研究实验室Unkad Labs发起,依托qor.unkad.com平台,由索马里语母语者自愿撰写并贡献。每一条文本均经过至少两位社区成员验证及一位资深语言学家的终审,确保内容与语言质量的可靠性。数据采集遵循严谨的许可与出处追踪机制,每一文本条目均记录其模式(撰写、翻译或转录)、语域(对话、叙述、指令、正式或技术)、领域(共九类,如通用、宗教、技术等)、方言(如Maxaa-tiri或Maay)及贡献者署名偏好。数据构建过程中严格排除任何未经授权或机器翻译的内容,并建立了去除重复及不当文本的审查流程,确保语料的原创性与合法性。
特点
该数据集的核心特色在于其源自母语者手写而非网络爬取,规避了低资源语言语料中常见的机器翻译污染与版权不明问题。语料覆盖九个领域,但分布不均,其中通用领域占比超过六成,宗教与科技次之,而法律与健康领域样本稀缺,如实反映了现实语用生态。文本经过标准化处理,统一了标点符号与特殊字符,但保留了字母、元音及喉塞音标记等语言关键特征,同时原始文本可追溯还原。数据集虽规模较小(2040句,约3.4万词),但每句均具备完整的元数据标注,包括语境、语域、主题及方言信息,且所有贡献者均明确同意以CC BY-SA 4.0许可开放,确保了数据的伦理合规与可复用性。
使用方法
数据集以JSONL格式提供两种粒度的文件:句子级(sentences.jsonl)与文档级(train.jsonl),用户可根据任务需求灵活选用。句子级文件支持逐句处理,适用于训练语言模型或进行句子级分类;文档级则保留完整段落结构,适合需要上下文理解的任务,如篇章生成或主题建模。由于语料为纯索马里语单语内容,且英索平行句对尚未发布,当前版本主要用于单语建模、语言资源建设及低资源场景下的预训练。用户须遵循CC BY-SA 4.0许可,使用时应引用数据集并致谢贡献者社区,同时注意其局限性,如规模较小、方言覆盖不均(缺少Maay方言),以及自动分句可能带来的误差。
背景与挑战
背景概述
索马里语作为非洲之角的重要语言,长期面临资源匮乏的困境,现有语料库多依赖网络抓取,存在来源不明、许可不清及机器翻译污染等问题。为此,非营利研究机构Unkad Labs于近期推出了Qor Af-Soomaali数据集,旨在通过社区贡献与人工审核构建高质量、合规的索马里语文本资源。该数据集包含2040条句子、235篇文档,覆盖9个领域,每一条文本均由作者明确同意开放许可,并经至少两位社区成员及语言学专家验证,确保来源可靠与版权清晰。这一创举不仅为低资源语言研究提供了珍贵语料,也树立了伦理化数据采集的新范式,对索马里语自然语言处理及语言技术发展具有重要意义。
当前挑战
该数据集面临多重挑战。领域层面,索马里语作为低资源语言,缺乏大规模、高质量的标准语料,网络文本普遍存在机器翻译痕迹与版权隐患,制约了语言模型的性能提升。构建层面,数据集规模尚小(2040句),且贡献分布不均,少数作者占据多数文本;方言覆盖不足,Maay方言完全缺失;句子切分依赖自动工具,可能引入误差;验证粒度不一,长文未逐句审查。此外,英文平行语料被刻意保留以作评测,限制了当前版本的多语应用。这些挑战亟待通过持续收集、方言扩展及精细化标注来逐步解决。
常用场景
经典使用场景
Qor Af-Soomaali数据集作为低资源语言索马里语的首个社区贡献、同行验证、语言学家审核的文本语料库,其经典使用场景集中于自然语言处理(NLP)领域的语言模型预训练与微调、机器翻译的质量评估基准、以及语言资源匮乏条件下的文本分类与信息检索研究。鉴于索马里语网络文本多为机器翻译产物,该数据集以其纯净、可溯源、经人工验证的特性,为构建鲁棒的索马里语语言模型提供了可靠的训练与评估基础,尤其适合用于领域自适应的语言建模、跨领域文本理解的零样本与少样本学习,以及语言学层面的方言变体(如Maxaa-tiri与Maay)对比分析。
衍生相关工作
该数据集的发布激发了多项衍生研究工作,包括将其作为索马里语语言模型评估基准,对比不同预训练架构在低资源语言上的性能;利用其领域与语域标注进行多任务学习研究,探索跨领域知识迁移;以及基于其社区验证流程,开发自动化数据质量评估工具与语料库构建平台。此外,该数据集为低资源语言的方言识别与标准语料建设提供了参考,推动了后续针对索马里语方言(如Maay)的扩充项目,并引发了关于数据伦理、社区参与及文化保护的学术讨论,促进了'参与式NLP'研究方向的兴起。
数据集最近研究
最新研究方向
Qor Af-Soomaali数据集代表了低资源语言自然语言处理领域的前沿探索,其核心创新在于构建一个完全由社区贡献、同行验证与语言学家审核的索马里语语料库,以此对抗传统网络爬取语料中普遍存在的版权不明、来源混杂及机器翻译污染问题。该数据集通过精细的文本规范化处理确保数据纯净度,并明确标注方言覆盖短板(如Maay方言缺失)和规模限制,体现了对数据质量与伦理合规的高度重视。当前研究聚焦于利用此类高质量、可溯源的语料推动低资源语言模型训练与评估,尤其在索马里语的词法分析、句法解析及跨领域语义理解方面,同时为未来英文-索马里语平行语料库的构建奠定基础,其社区驱动与透明审核机制为全球低资源语言数据基建树立了新的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务