ammarnasr/the-stack-java-clean
收藏资源简介:
--- license: openrail dataset_info: features: - name: hexsha dtype: string - name: size dtype: int64 - name: content dtype: string - name: avg_line_length dtype: float64 - name: max_line_length dtype: int64 - name: alphanum_fraction dtype: float64 splits: - name: train num_bytes: 3582248477.9086223 num_examples: 806789 - name: test num_bytes: 394048264.9973618 num_examples: 88747 - name: valid num_bytes: 3982797.09401595 num_examples: 897 download_size: 1323156008 dataset_size: 3980279540 task_categories: - text-generation language: - code tags: - code pretty_name: TheStack-Java size_categories: - 1M<n<10M --- ## Dataset 1: TheStack - Java - Cleaned **Description**: This dataset is drawn from TheStack Corpus, an open-source code dataset with over 3TB of GitHub data covering 48 programming languages. We selected a small portion of this dataset to optimize smaller language models for Java, a popular statically typed language. **Target Language**: Java **Dataset Size**: - Training: 900,000 files - Validation: 50,000 files - Test: 50,000 files **Preprocessing**: 1. Selected Java as the target language due to its popularity on GitHub. 2. Filtered out files with average line length > 100 characters, maximum line length > 1000 characters, and alphabet ratio < 25%. 3. Split files into 90% training, 5% validation, and 5% test sets. **Tokenizer**: Byte Pair Encoding (BPE) tokenizer with tab and whitespace tokens. GPT-2 vocabulary extended with special tokens. **Training Sequences**: Sequences constructed by joining training data text to reach a context length of 2048 tokens (1024 tokens for full fine-tuning).
许可证:openrail 数据集信息: 特征: - 名称:hexsha,数据类型:字符串(string) - 名称:size,数据类型:64位整数(int64) - 名称:content,数据类型:字符串(string) - 名称:avg_line_length,数据类型:64位浮点数(float64) - 名称:max_line_length,数据类型:64位整数(int64) - 名称:alphanum_fraction,数据类型:64位浮点数(float64) 划分集: - 名称:训练集(train):字节数:3582248477.9086223,样本数:806789 - 名称:测试集(test):字节数:394048264.9973618,样本数:88747 - 名称:验证集(valid):字节数:3982797.09401595,样本数:897 下载大小:1323156008 数据集总大小:3980279540 任务类别: - 文本生成(text-generation) 语言: - 代码(code) 标签: - 代码(code) 友好名称:TheStack-Java 规模类别: - 100万<n<1000万(1M<n<10M) **数据集1:TheStack-Java(清洗版)** **描述**:本数据集源自TheStack语料库——该语料库是一款涵盖48种编程语言、存储超3TB GitHub开源代码数据的开源代码数据集。我们从中选取子集,用于优化面向Java(一种主流静态类型编程语言)的小型大语言模型(Large Language Model)。 **目标语言**:Java **数据集规模**: - 训练集:90万个文件 - 验证集:5万个文件 - 测试集:5万个文件 **预处理流程**: 1. 因Java在GitHub生态中拥有极高普及度,故将其选为目标语言。 2. 过滤掉同时满足以下条件的文件:平均行长度超过100字符、最大行长度超过1000字符,且字母数字占比低于25%。 3. 将数据集按90%训练集、5%验证集、5%测试集的比例进行划分。 **分词器**:采用字节对编码(Byte Pair Encoding, BPE)分词器,支持制表符与空白符Token,并基于GPT-2词表扩展了专用Token。 **训练序列构造**:将训练数据文本拼接为上下文长度为2048个Token的序列(全量微调时上下文长度设为1024个Token)。
数据集概述
数据集名称
- TheStack-Java
数据集描述
- 该数据集从TheStack Corpus中提取,该Corpus包含超过3TB的GitHub数据,涵盖48种编程语言。本数据集专注于优化Java语言的小型语言模型,Java是一种流行的静态类型语言。
目标语言
- Java
数据集大小
- 训练集: 900,000文件
- 验证集: 50,000文件
- 测试集: 50,000文件
预处理步骤
- 选择Java作为目标语言,因其GitHub上的流行度。
- 过滤掉平均行长度超过100个字符、最大行长度超过1000个字符以及字母比率低于25%的文件。
- 将文件分为90%训练集、5%验证集和5%测试集。
分词器
- Byte Pair Encoding (BPE) 分词器,包含制表符和空格标记。GPT-2词汇表扩展了特殊标记。
训练序列
- 通过连接训练数据文本构建序列,以达到2048个标记的上下文长度(全精细调整为1024个标记)。




