emozilla/dolma-v1_7-30B-tokenized-llama2-nanoset
收藏资源简介:
Dolma数据集是一个经过Llama 2模型分词处理的版本,源自emozilla/dolma-v1_7-30B数据集。该数据集被分割成10 GB的块,便于下载和处理。提供了下载和重新组合这些数据块的命令行指令,以及如何使用numpy直接处理这些数据的示例代码。
The Dolma dataset is a Tokenized version of emozilla/dolma-v1_7-30B, processed with Llama 2 and split into 10 GB chunks. It is primarily used for language modeling tasks, especially large language models (LLM) and casual language models (casual-lm). The dataset size ranges from 100B to 1T, and it supports downloading via Hugging Face CLI and direct processing with numpy.
数据集概述
基本信息
- 许可证: odc-by
- 任务类别:
- 文本生成
- 语言:
- 英语
- 标签:
- 语言建模
- 休闲语言模型
- 大型语言模型
- 名称: Dolma
- 大小类别:
- 100B < n < 1T
数据集描述
- 版本: 基于 emozilla/dolma-v1_7-30B 的 Llama 2 分词版本。
- 格式: 使用 Nanotron 分割成 10 GB 的块。
下载与使用
-
下载命令: shell huggingface-cli download --repo-type dataset --local-dir dolma-v1_7-30B-tokenized-llama2-nanoset --local-dir-use-symlinks False emozilla/dolma-v1_7-30B-tokenized-llama2-nanoset
-
重组命令: shell cat dolma-v1_7-30B-tokenized-llama2-nanoset/dolma-v1_7-30B-tokenized-llama2-nanoset_input_ids.npy.* > dolma-v1_7-30B-tokenized-llama2-nanoset.npy rm -rf dolma-v1_7-30B-tokenized-llama2-nanoset
-
直接使用: python import numpy as np
dataset_buffer_mmap = np.memmap("dolma-v1_7-30B-tokenized-llama2-nanoset.npy", mode="r", order="C", dtype=np.int16) dataset_buffer = memoryview(dataset_buffer_mmap) dataset_number_of_tokens = int(len(dataset_buffer))




