Atlasdata
收藏资源简介:
Atlasdata是一个结构化数据集,其核心数据来源于Hugging Face的FineWeb项目。FineWeb是一个经过清洗和去重处理的大规模网络文本集合,原始数据来自Common Crawl,专为训练大型语言模型(LLM)而优化。该数据集旨在提供FineWeb的高质量数据子集或特定格式版本,便于访问和使用。它包含多个字段,完整刻画了每个文本样本的元信息:主要包括文本内容本身(`text`),以及标识符(`id`)、数据来源批次(`dump`)、原始URL(`url`)、抓取日期(`date`)、存储路径(`file_path`)、检测出的语言(`language`)、语言检测置信度分数(`language_score`)和文本的词元数量(`token_count`)。该数据集适用于需要大规模、高质量网络文本进行预训练或继续训练的语言模型研发任务,并支持通过Hugging Face `datasets`库以流式(streaming)方式加载。
Atlasdata is a structured dataset whose core data originates from the FineWeb project by Hugging Face. FineWeb is a large-scale web text corpus that has been cleaned and deduplicated, with raw data sourced from Common Crawl and specifically optimized for training large language models (LLMs). This dataset aims to provide high-quality subsets or format-specific versions of FineWeb for easier access and utilization. It includes multiple fields that fully characterize the metadata of each text sample, mainly comprising the text content itself (`text`), along with the identifier (`id`), data source batch (`dump`), original URL (`url`), crawl date (`date`), storage path (`file_path`), detected language (`language`), language detection confidence score (`language_score`), and the token count of the text (`token_count`). This dataset is suitable for language model development and training tasks that require large-scale, high-quality web text for pre-training or continued training, and supports streaming loading via the Hugging Face `datasets` library.
数据集概述:Atlasdata
- 数据集名称:Atlasdata
- 许可证:openrail
- 基础来源:基于 Hugging Face 的 FineWeb 项目构建,FineWeb 是从 Common Crawl 中提取并经过清洗、去重的大规模网络数据,专为训练大型语言模型(LLM)设计。
数据配置
- 配置名称:
default - 数据文件:训练集(split:
train),路径为"data/*"
数据特征
每条记录包含以下字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
text |
string | 文本内容 |
id |
string | 唯一标识 |
dump |
string | 数据转储标识 |
url |
string | 来源 URL |
date |
string | 日期 |
file_path |
string | 文件路径 |
language |
string | 语言 |
language_score |
float64 | 语言置信度分数 |
token_count |
int64 | Token 数量 |
使用方法
通过 Hugging Face datasets 库加载,支持流式读取:
python from datasets import load_dataset
dataset = load_dataset("Vincelil/Atlasdata", split="train", streaming=True) for example in dataset.take(1000): print(example["text"])




