The Heap
收藏资源简介:
The Heap 是一个由代尔夫特理工大学创建的多语言代码数据集,旨在为大型语言模型的评估提供无污染的数据。该数据集涵盖了57种编程语言,包含733,663个代码仓库,总计96,990,250个原始文件和38,681,609个去重后的文件。数据来源于GitHub,通过非宽松许可证筛选和去重处理,确保与其他公开数据集无重叠。数据集的应用领域主要集中在大型语言模型的评估,旨在解决数据污染问题,确保模型评估的公平性和准确性。
The Heap is a multilingual code dataset created by Delft University of Technology, aiming to provide contamination-free data for the evaluation of large language models (LLMs). This dataset covers 57 programming languages, contains 733,663 code repositories, and totals 96,990,250 raw files and 38,681,609 deduplicated files. Sourced from GitHub, the data has undergone filtering based on non-permissive licenses and deduplication to ensure no overlap with other publicly available datasets. The primary application scenario of this dataset focuses on the evaluation of large language models, with the goal of addressing data contamination issues and ensuring the fairness and accuracy of model evaluations.
数据集概述
数据集名称
The Heap
数据集描述
The Heap 是一个多语言代码数据集,包含57种编程语言,旨在为大语言模型(LLM)评估提供无污染的数据集。该数据集通过GitHub API收集了多达50,000个公共仓库,并进行了严格的清理和去重处理。
数据集结构
数据集包含多个配置文件,每个配置文件对应一种编程语言。每个配置文件包含以下特征:
- id: 文件的唯一标识符
- file_name: 文件名
- file_path: 文件路径
- content: 文件内容
- size: 文件大小
- language: 文件所属的编程语言
- extension: 文件扩展名
- total_lines: 文件总行数
- avg_line_length: 平均行长度
- max_line_length: 最大行长度
- alphanum_fraction: 字母数字字符的比例
- repo_name: 仓库名称
- repo_stars: 仓库的星标数
- repo_forks: 仓库的fork数
- repo_open_issues: 仓库的开放问题数
- repo_license: 仓库的许可证类型
- repo_extraction_date: 仓库的提取日期
- exact_duplicates_stackv2: 是否与The Stack V2数据集中的文件完全重复
- exact_duplicates_stackv1: 是否与The Stack V1数据集中的文件完全重复
- exact_duplicates_redpajama: 是否与Red Pajama数据集中的文件完全重复
- exact_duplicates_githubcode: 是否与GitHub Code数据集中的文件完全重复
- near_duplicates_stackv2: 是否与The Stack V2数据集中的文件近似重复
- near_duplicates_stackv1: 是否与The Stack V1数据集中的文件近似重复
- near_duplicates_redpajama: 是否与Red Pajama数据集中的文件近似重复
- near_duplicates_githubcode: 是否与GitHub Code数据集中的文件近似重复
数据集配置
数据集包含以下编程语言的配置:
- C#: 3,257,456个样本,22.81 GB
- C++: 4,811,620个样本,58.16 GB
- Go: 2,328,529个样本,25.71 GB
- JavaScript: 3,393,747个样本,88.09 GB
- Mathematica: 21,208个样本,1.73 GB
- PHP: 3,310,243个样本,24.82 GB
- Python: 1,595,919个样本,22.62 GB
数据收集
数据集通过GitHub API收集,优先选择非宽松许可证的仓库,以减少污染。收集的仓库创建日期早于2024年8月,并按星标数降序排列。
数据清理
清理过程中排除了大于10 MB的文件和少于10个单词的文件。
数据去重
数据集进行了精确和近似去重处理,去重对象包括The Stack V2、The Stack、Red Pajama、GitHub Code和CodeParrot等公开代码数据集。
数据集字段
数据集中的每个文件包含以下字段:
- file_name: 文件名
- file_path: 文件路径
- content: 文件内容
- file_size: 文件大小
- language: 文件所属的编程语言
- extension: 文件扩展名
- repo_name: 仓库名称
- repo_stars: 仓库的星标数
- repo_forks: 仓库的fork数
- repo_open_issues: 仓库的开放问题数
- repo_created_at: 仓库的创建日期
- repo_pushed_at: 仓库的最后推送日期
- sha: 文件内容的SHA值
- exact_duplicates_pubdataset: 是否与其他公开数据集中的文件完全重复
- near_duplicates_pubdataset: 是否与其他公开数据集中的文件近似重复




