遇见数据集

LocalDoc/community_oscar_azerbaijani_scored

收藏
Hugging Face2026-05-30 更新2026-06-14 收录
官方服务:

资源简介:

该数据集是完整的阿塞拜疆语网络语料库(LocalDoc/community_oscar_azerbaijani),为每个文档附加了连续质量分数。它旨在作为构建清洁阿塞拜疆语预训练语料库的过滤层:每个文档都带有一个分数,允许您根据自己的阈值保留、清理或丢弃文档。

This dataset is the full Azerbaijani web corpus (LocalDoc/community_oscar_azerbaijani) with a continuous quality score attached to every document. It is intended as the filtering layer for building a clean Azerbaijani pretraining corpus: each document carries a score that lets you keep, clean, or drop it according to your own thresholds.

提供机构:
LocalDoc
搜集汇总
数据集介绍
LocalDoc/community_oscar_azerbaijani_scored 数据集图片
构建方式
该数据集基于阿塞拜疆语网络语料库LocalDoc/community_oscar_azerbaijani构建,其中包含约2400万篇源自Common Crawl的文档。通过部署LocalDoc/azerbaijani-text-quality-classifier回归模型(基于mmBERT-base架构),对每篇文档的文本质量进行连续评分,评分过程中最大序列长度为4096个token,超出部分被截断。整个评分计算在一张RTX 6000 Ada显卡上耗时约4天完成。数据集保留了原始语料的文档内容以及唯一稳定的索引标识符,并新增了质量评分字段。
特点
该数据集的核心特点是每篇文档被赋予一个连续的回归质量分数(范围约-2.5至3.75),而非离散类别标签,分数越高代表文本越纯净、语句越通顺。评分分布的统计显示,文档的平均分为1.83,中位数为1.86,呈现双峰分布:一个峰值位于1.8-2.0区间(混合型文档),另一个峰值位于2.8-3.0区间(纯净文档)。约87%的文档评分不低于1.0,仅4%的文档评分达到3.0以上。这一连续评分机制为用户提供了灵活的过滤阈值调整空间,无需重新执行计算密集型评分流程。
使用方法
推荐采用三路路由策略而非单一阈值筛选:对于低分文档直接丢弃,中等评分文档(约0.5-1.5区间)需结合行级规则清理其混杂的网站模板内容,高分文档则可保留原样。使用时需注意,模型生成的分数未经人工标注验证,且纯净百科文章若被大量导航或页脚包裹可能获得偏低分数(如维基百科文章仅得1.2分),因此不宜简单设定单一阈值。此外,中等评分区间噪声较大,相近文档分数差异可达0.5,应作为近似参考值处理。
背景与挑战
背景概述
在低资源语言的自然语言处理领域,高质量预训练语料的匮乏始终是制约模型性能提升的关键瓶颈。阿塞拜疆语作为突厥语系的重要成员,其网络文本资源虽规模可观,但质量参差不齐,充斥着导航栏、广告、机器翻译片段等噪声内容。为此,LocalDoc团队于近期构建了community_oscar_azerbaijani_scored数据集,基于OSCAR项目从Common Crawl中提取的约2400万篇阿塞拜疆语文档,通过微调mmBERT-base回归模型为每篇文档赋予连续质量分数。该工作由LocalDoc研究机构主导,旨在为阿塞拜疆语预训练语料提供可灵活调整的过滤层,解决了传统二元分类或固定阈值筛选难以适应语料异构性的问题,对推动低资源语言的大规模语言模型训练具有重要参考价值。
当前挑战
本数据集面临的核心挑战首先来自领域问题层面:阿塞拜疆语网络文本的异构性使得简单丢弃低分文档会误伤高质量内容。例如,一篇被导航栏和页脚包裹的维基百科文章仅获得约1.2分,若以单一阈值'≥2'过滤,大量优质百科文本将被舍弃;同时,中分段(0.5-1.5)的评分噪声可达0.5,导致近似的文档被不同处理。在构建过程中,挑战同样显著:评分模型基于大语言模型生成的标签训练,未经人工标注测试集验证,其与人类判断的一致性未知;长达4天的单卡RTX 6000 Ada推理虽可行,但长文本截断至4096个token可能丢失尾部关键信息;此外,原始网络爬取语料未做个人身份信息脱敏,带来隐私风险。这些挑战要求后续使用必须采用三分段路由策略,而非简单的阈值切割。
常用场景
经典使用场景
该数据集为阿塞拜疆语文本质量评估与过滤研究提供了坚实的基石。其核心应用在于构建高质量预训练语料库,研究者可借助每个文档附带的连续质量分数,灵活设定阈值以保留、清洗或丢弃文本。典型流程包括:丢弃低分噪声文档(如垃圾信息、机器翻译内容),对中等分数文档执行行级净化以剥离网页模板残余,并直接保留高分段纯净散文。这种多级路由策略有效避免了单一阈值导致的优质内容误删,尤其适用于处理混合型网页文本,为低资源语言的预训练数据筛选树立了可复用的方法论标杆。
解决学术问题
该数据集直面低资源语言自然语言处理中的核心困境——网络爬取语料的高噪声与优质数据稀缺的矛盾。通过提供大规模、带连续质量评分的阿塞拜疆语文档,它使研究者能够系统性地量化文本纯净度,从而将预训练数据构建从经验性手工筛选提升至可度量、可复现的学术范式。其重要意义在于,揭示了网页文本中高质量散文与模板垃圾的复杂共现模式(如维基百科条目因导航栏被低分),推动了针对混合文档的精细化解耦清洗策略研究,为其他低资源语言的语料治理提供了理论依据与实验基准。
衍生相关工作
该数据集的发布催生了围绕低资源语言语料质量控制的系列探索。其上附着的连续分数直接来自专为阿塞拜疆语训练的回归模型,这一模型本身可作为后续研究的基础——例如被微调以适配其他突厥语族语言,或作为弱监督标签生成器以降低人工标注成本。更为重要的是,数据集所揭示的双峰分数分布与中段噪声特性,激励了学者设计更鲁棒的阈值选择算法及领域自适应清洗策略。此外,它作为‘社区OSCAR’系列的关键组件,推动了跨语言语料库标准化质量标注体系的构建,为多语言预训练中的不平衡数据治理贡献了重要实践参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务