遇见数据集

azmx-6t-data

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

AZMX One 6.6T 预训练语料库是一个大规模、高质量、经过清洗、去重和过滤的预训练数据集,专为 AZMX One(一个拥有 1.87B 参数的开放印度语言大模型)而构建。该数据集规模约为 6.6 万亿 token,以 uint32 v2-tokenizer 分片格式存储。数据集的构建部分基于 Modal 平台。该语料库主要用于训练多语言印度语言模型,适用于自然语言处理领域的预训练任务。

The AZMX One 6.6T pre-training corpus is a large-scale, high-quality, cleaned, deduplicated and filtered pre-training dataset built specifically for AZMX One, an open-source Indian language large language model (LLM) with 1.87 billion parameters. This dataset has a scale of approximately 6.6 trillion tokens, and is stored in the sharded format using the uint32 v2-tokenizer. Part of the development of this dataset was based on the Modal platform. This corpus is primarily intended for training multilingual Indian language models, and is applicable to pre-training tasks in the field of natural language processing.

创建时间:
2026-07-24
原始信息汇总

数据集概述

AZMX One 6.6T 预训练语料库 是一个面向印地语(Indic)大型语言模型训练的预处理数据集,专为 AZMX One(一个 1.87B 参数的开源 Indic LLM)设计。

核心特性

  • 规模:6.6T tokens 的预训练数据
  • 处理流程:已完成清洗(clean)、去重(deduped)和过滤(filtered)
  • 构建工具:部分基于 Modal 平台构建
  • 数据格式:uint32 格式的 v2-tokenizer 分片(shards)

适用场景

该数据集主要用于 AZMX One 模型的预训练阶段,面向印地语(Indic)语言处理任务,可作为开源 Indic 大语言模型的训练语料来源。

搜集汇总
数据集介绍
azmx-6t-data 数据集图片
构建方式
该数据集为AZMX One 6.6T预训练语料库,专为训练1.87B参数的开放印度语言大语言模型而构建。构建过程在Modal平台上分阶段进行,通过严格的清洗、去重与过滤流程,确保语料质量。数据以uint32格式的v2-tokenizer分片存储,便于高效加载与处理。整个构建流程融合了自动化工具与人工审核,旨在保留语言多样性的同时剔除冗余与噪声信息。
特点
该数据集的核心特点在于其规模与针对性,6.6T的token量级为大规模预训练提供了坚实基础。作为面向印度语言的开放语料,其内容覆盖多种语言与领域,具有显著的多样性。经过清洗与去重后,数据冗余度低,噪声控制出色,能够有效提升模型的训练效率与最终性能。分片存储格式则保证了数据处理的灵活性与可扩展性。
使用方法
使用时,研究者可基于uint32格式的v2-tokenizer分片,直接接入兼容的预训练框架中进行模型训练。该数据集设计用于自监督学习任务,尤其适合需要大规模多语言语料的场景。用户需具备相应的数据处理管道以解析分片格式,并可根据需求进一步自定义过滤或采样策略。数据集的公开性使其成为印度语言NLP研究的重要资源。
背景与挑战
背景概述
AZMX One 6.6T预训练语料库(azmx-6t-data)由致力于开发开放印度语言大模型的团队于近期构建,其核心目标是为AZMX One这一1.87B参数的开源印度语言模型提供高质量的训练数据。该数据集在Modal平台上分部分构建,采用uint32格式的v2分词器分片,经过清洗、去重和过滤处理,以确保语料的纯净性与多样性。作为印度语言模型预训练的重要基础设施,该数据集填补了多语种低资源语言预训练语料稀缺的空白,对推动印度语言人工智能研究具有里程碑意义,其规模与质量直接影响AZMX One在多种印度语言上的理解与生成能力,为后续相关研究提供了坚实的数据支撑。
当前挑战
该数据集面临的挑战错综复杂。在领域层面,印度次大陆涵盖数十种主要语言及上千种方言,语料资源分布极不均衡,构建一个能覆盖广泛语言且保持语义连贯性的预训练语料库,需克服数据稀缺、跨语言噪音及文化上下文缺失等难题。在构建过程中,团队需应对海量原始数据的清洗与去重,确保数据质量与隐私合规;同时,在Modal平台上分布式处理6.6T规模数据,需优化存储与计算效率,设计高效的分片与分词策略,以兼顾预处理速度与后续模型训练的兼容性,这些技术瓶颈对数据规模、处理能力及资源调度提出了极高要求。
常用场景
经典使用场景
AZMX One 6.6T预训练语料库,作为大规模印度语言模型的基石,其经典使用场景在于为多语种自然语言处理提供海量、清洁、去重的高质量文本数据。研究者利用该语料库进行自监督预训练,通过掩码语言建模或因果语言建模等任务,使模型习得印地语及多种印度语言的词汇、语法和语义知识,从而构建出具备跨语言理解与生成能力的基座模型。
衍生相关工作
该数据集的发布催生了一系列衍生研究,包括基于其训练模型的指令微调版本以适配下游任务,开发针对印度语言的评估基准如多语种理解测试集,以及探索模型可解释性与对抗鲁棒性的工作。此外,其预处理流程和清洗方法亦被其他低资源语言数据集构建项目借鉴,带动了多语种语料库建设标准化的学术对话,并启发了对数据质量与模型性能量化关系的深入探讨。
数据集最近研究
最新研究方向
该数据集聚焦于构建高质量、大规模的多语种预训练语料库,特别针对印度语言(Indic LLM)领域。最新研究趋势强调数据的清洗、去重与过滤,以提升模型训练效率与性能。AZMX One 6.6T语料库的发布,反映了当前对开源多语种模型数据基础设施的重视,其基于Modal平台构建并采用uint32 v2-tokenizer分片,代表了在数据工程与分词技术上的前沿实践,对推动低资源语言的智能处理具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务