5m-terminal-lm-dataset
收藏资源简介:
该数据集为 50M Token 终端与多语言语料库,包含 51,609,269 个 token,原始文本大小 100.54 MB(压缩后 32.46 MB)。数据集用于训练 5M 参数规模的终端语言模型(如 kipasyangin5/5m-terminal-lm-chinchilla 和 kipasyangin5/5m-terminal-lm-saturated)。内容构成如下:20% 为 Linux 终端与 CLI 命令(包括导航、搜索、权限管理、Git 操作、网络命令、包管理器、Docker 及问答对);24% 为英语通用语言(来自 wikitext-2-raw-v1 和 wikitext-103 的文章与技术文本);56% 为多语言文本(涵盖印尼语、西班牙语、法语、德语)。提供两个文件:dataset_50m.txt.gz(完整压缩数据流)和 dataset_sample.txt(1000 行样本用于预览)。可通过 gzip 库在 Python 中读取。许可证为 MIT。
This dataset is a 50M Token Terminal and Multilingual Corpus, containing 51,609,269 tokens, with a raw text size of 100.54 MB (32.46 MB compressed). It is used to train terminal language models with 5M parameters (e.g., kipasyangin5/5m-terminal-lm-chinchilla and kipasyangin5/5m-terminal-lm-saturated). The content consists of: 20% Linux terminal and CLI commands (including navigation, search, permission management, Git operations, network commands, package managers, Docker, and QA pairs); 24% English general language (articles and technical texts from wikitext-2-raw-v1 and wikitext-103); 56% multilingual text (covering Indonesian, Spanish, French, German). Two files are provided: dataset_50m.txt.gz (full compressed data stream) and dataset_sample.txt (1000-line sample for preview). It can be read using the gzip library in Python. License: MIT.
数据集概述
该数据集是一个用于训练 5M Terminal 与多语言语言模型的原始文本语料库,包含 51,609,269 个 Token,原始未压缩大小为 100.54 MB,Gzip 压缩后大小为 32.46 MB。
数据构成
数据集的混合比例分布如下:
| 类别 | 比例 | 内容说明 |
|---|---|---|
| Linux 终端与 CLI 命令 | 20% | 包括 Linux 导航命令(cd ..、pwd、ls -la)、搜索(grep、find)、权限管理(chmod)、Git 操作、网络命令(curl)、包管理器、Docker 以及问答对 |
| 英语通用语言 | 24% | 来自 wikitext-2-raw-v1 和 wikitext-103 的文章与技术文本 |
| 多语言文本 | 56% | 涵盖印度尼西亚语、西班牙语、法语和德语的多语言文本 |
文件内容
- dataset_50m.txt.gz:完整的 50M Token 压缩原始文本流。
- dataset_sample.txt:包含 1,000 行的原始文本样本,用于浏览器即时预览。
使用方式
数据集提供 Python 示例代码,用于解压并读取数据:
python import gzip
解压并读取数据集
with gzip.open("dataset_50m.txt.gz", "rt", encoding="utf-8") as f: for line in f: print(line.strip())
关联模型
该数据集用于训练以下两个模型:





