Filtered-StarCoder-Dataset-Mini
收藏资源简介:
Filtered StarCoder Dataset Mini是一个包含12种流行编程语言(C、C++、C#、Go、Java、JavaScript、Kotlin、Python、Ruby、Rust、Scala和TypeScript)代码样本的数据集。该数据集通过筛选高质量代码、去除异常值和标准化格式化处理而创建。每个样本都包含有关平均行长度和行数的元数据。数据集采用Parquet格式存储,便于机器学习和代码分析应用。
Filtered StarCoder Dataset Mini is a dataset containing code samples across 12 prevalent programming languages: C, C++, C#, Go, Java, JavaScript, Kotlin, Python, Ruby, Rust, Scala, and TypeScript. This dataset is constructed by filtering high-quality code, removing outliers, and applying standardized formatting. Each sample includes metadata associated with average line length and line count. The dataset is stored in Parquet format to facilitate machine learning and code analysis applications.
Filtered StarCoder Dataset Mini 数据集概述
数据集描述
- 包含12种流行编程语言的过滤和处理后的代码样本:C、C++、C#、Go、Java、JavaScript、Kotlin、Python、Ruby、Rust、Scala和TypeScript
- 基于质量指标过滤源代码,移除异常值并标准化格式,适用于机器学习和代码分析应用
关键特性
- 清理和过滤的代码:移除行长度和代码大小的异常值
- 质量指标:每个样本包含平均行长度和行数的元数据
- 多语言支持:12种编程语言分别存储
- 一致格式:所有样本采用相同的Parquet结构
数据集规模
- 完整数据集约14GB
- 各语言文件大小:
- 最大:C++(2GB)
- 最小:Scala(700MB)
数据集统计
| 语言 | 样本数量 | 平均行长度 | 平均行数 |
|---|---|---|---|
| C | 1,751,894 | 22.55 | 74.48 |
| C++ | 1,769,514 | 23.50 | 103.59 |
| C# | 1,762,960 | 25.76 | 51.50 |
| Go | 1,750,873 | 20.68 | 81.76 |
| Java | 1,778,689 | 25.48 | 64.56 |
| JavaScript | 1,719,140 | 23.31 | 51.29 |
| Kotlin | 1,589,735 | 27.39 | 42.31 |
| Python | 1,764,481 | 26.52 | 66.15 |
| Ruby | 1,758,558 | 22.31 | 33.95 |
| Rust | 1,341,806 | 27.36 | 190.37 |
| Scala | 1,322,906 | 31.48 | 94.89 |
| TypeScript | 1,738,950 | 24.15 | 43.46 |
数据结构
- 每种编程语言单独存储为Parquet文件
- 文件命名示例:
c.parquet、cpp.parquet等 - 数据模式:
language:字符串(编程语言)code:字符串(完整代码内容)avg_line_length:浮点数(每行平均字符数)line_count:整数(代码总行数)
访问方式
使用Hugging Face datasets库
python from datasets import load_dataset
加载完整数据集
dataset = load_dataset("jugalgajjar/Filtered-StarCoder-Dataset-Mini")
加载特定语言
dataset = load_dataset( "jugalgajjar/Filtered-StarCoder-Dataset-Mini", data_files="scala.parquet" )
流式传输数据
dataset = load_dataset( "jugalgajjar/Filtered-StarCoder-Dataset-Mini", data_files="scala.parquet", streaming=True )
手动下载
- 访问数据集页面
- 导航至"Files"选项卡
- 点击要下载的语言文件(如
python.parquet) - 使用下载按钮保存到本地
数据集创建过程
- 从StarCoder数据集收集原始代码样本
- 执行统计分析以识别质量指标
- 使用IQR方法移除异常值
- 过滤过长或过短的代码示例
- 跨语言标准化数据
- 计算每个样本的元数据
- 最终数据序列化为Parquet格式
引用
bibtex @misc{fscdmini2025, author = {Jugal Gajjar, Kamalasankari Subramaniakuppusamy, Kaustik Ranaware}, title = {Filtered CodeStar Dataset Mini}, year = {2025}, publisher = {HuggingFace}, howpublished = {https://huggingface.co/datasets/jugalgajjar/Filtered-StarCoder-Dataset-Mini} }
许可证
- MIT License




