遇见数据集

Towards Supporting Open Source Library Maintainers with Community-Based Analytics

收藏
Zenodo2025-05-29 更新2026-05-26 收录
官方服务:

资源简介:

Overview This replication package contains data and scripts used in our study. The package is structured into four main components. Folder Structure 1. Data ProcessedData: Contains refined datasets that guide our research questions. RawData: Contains raw scraped data about dependents from GitHub, selected for analysis. 2. RepoClonerDataAnalyser The starting repository for the study. Select the top 10 libraries and their dependents. Clones repositories and analyzes all research questions. Implemented in Python. 3. methodTypeResolutionJavaParser A Java project used for method resolution. This tool is used for parsing and resolving method types after cloning repositories and filtering potential Java files using the RepoClonerDataAnalyzer project. 4. JacocoCoverageReporter Converts raw JaCoCo HTML coverage reports into CSV format. Implemented in Python 5. Survey Forms Contains pdf version of survey forms that was shared to maintainers. Usage Instructions Each project within this package has its own README file with detailed setup and execution instructions. Below is a high-level guide: Data Collection: Use RepoClonerDataAnalyser to select, clone, and filter dependents. Method Resolution: Run methodTypeResolutionJavaParser on filtered Java files. Coverage Analysis: Use JacocoCoverageReporter to convert JaCoCo HTML reports into CSV format and then Use RepoClonerDataAnalyser for further analysis. Data Analysis: Utilize the processed data in the Data folder for research insights. Requirements Python 3.x Java 8+ Required dependencies (listed in individual project README files. In version 1, you might notice a random GitHub repository URL provided in individual README. It is intended solely for context and clarity. It does not lead to an accessible resource and results in a 404 error. We have removed it in version 2 to avoid any confusion.)

概述 本复现包包含本研究所用的数据集与脚本文件,整体分为五大核心模块。 文件夹结构 1. 数据集 处理后数据集(ProcessedData):存放支撑本研究问题的精炼数据集。 原始数据集(RawData):存放从GitHub抓取的、经筛选用于本研究分析的依赖项原始爬取数据。 2. 仓库克隆与数据分析工具(RepoClonerDataAnalyser) 本研究的初始核心仓库。 可筛选前十大开源库及其依赖项,实现仓库克隆并完成所有研究问题的分析,基于Python语言开发。 3. Java方法类型解析工具(methodTypeResolutionJavaParser) 用于方法类型解析的Java项目。 本工具可在通过RepoClonerDataAnalyzer项目完成仓库克隆、筛选潜在Java文件后,对方法类型进行解析与校验。 4. JaCoCo覆盖率报告转换器(JacocoCoverageReporter) 可将原始JaCoCo HTML格式覆盖率报告转换为CSV格式,基于Python语言开发。 5. 调研问卷(Survey Forms) 存放向项目维护者发放的调研问卷PDF版本。 使用说明 本包内每个项目均配有独立的README文件,详述了环境搭建与运行流程,以下为整体操作指引: 1. 数据采集:通过RepoClonerDataAnalyser工具完成依赖项的筛选、仓库克隆与数据过滤。 2. 方法类型解析:将methodTypeResolutionJavaParser工具应用于筛选后的Java文件,完成方法类型解析。 3. 覆盖率分析:先通过JacocoCoverageReporter将JaCoCo HTML格式覆盖率报告转换为CSV格式,再借助RepoClonerDataAnalyser开展后续分析。 4. 数据分析:利用Data文件夹中的处理后数据集开展研究分析,挖掘相关结论。 环境依赖 - Python 3.x 及以上版本 - Java 8 及以上版本 - 所需依赖库详见各项目的README文件。注:在v1版本的各项目README中曾包含一条随机GitHub仓库链接,该链接仅用于辅助说明场景,无法正常访问且会返回404错误。为避免混淆,我们已在v2版本中移除该链接。

提供机构:
Zenodo
创建时间:
2025-05-29
二维码
社区交流群
二维码
科研交流群
商业服务