遇见数据集

GHAW-H

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

GHAW-H(GitHub Agentic Workflow Histories)是一个记录GitHub Agentic Workflows(GH-AW)在早期采用开源仓库中涌现情况的数据集。该版本包含262个仓库,共记录2820个GH-AW源Markdown文件快照、2820个源版本记录(跨越604个文件历史),以及2820个关联的锁文件快照。数据集涵盖五个配置:lock_file_snapshot(锁文件快照)、repository(仓库信息)、source_markdown_file_history(源Markdown文件历史)、source_markdown_file_snapshot(源Markdown文件快照)和source_markdown_file_version(源Markdown文件版本)。数据以Parquet格式存储,采用CC-BY-4.0许可协议。该数据集主要面向自然语言软件工程研究,可用于研究自然语言规范、指令和工作流描述如何在实际开源仓库中定义、执行和演化GitHub Agentic Workflows,支持可重复的实证研究、工具演示、复现研究和负面结果报告等。

GHAW-H (GitHub Agentic Workflow Histories) is a dataset recording the emergence of GitHub Agentic Workflows (GH-AW) in early-adopting open-source repositories. This version includes 262 repositories, with 2,820 GH-AW source markdown file snapshots, 2,820 source version records (spanning 604 file histories), and 2,820 associated lock file snapshots. The dataset covers five configurations: lock_file_snapshot, repository, source_markdown_file_history, source_markdown_file_snapshot, and source_markdown_file_version. Data is stored in Parquet format under CC-BY-4.0 license. The dataset is primarily oriented towards natural language software engineering research, enabling studies on how natural language specifications, instructions, and workflow descriptions define, execute, and evolve GitHub Agentic Workflows in real-world repositories, supporting reproducible empirical studies, tool demonstrations, replication studies, and negative result reports.

创建时间:
2026-07-30
原始信息汇总

GHAW-H: GitHub Agentic Workflow Histories 数据集概述

基本信息

  • 许可证: cc-by-4.0
  • 数据集类型: 捕获早期采用者开源仓库中 GitHub Agentic Workflows (GH-AW) 的出现情况
  • 规模概况: 262个仓库, 604个源文件历史, 2,820个源版本记录, 2,820个锁文件快照

数据配置

数据集包含五个配置子集:

配置名 文件格式 内容
lock_file_snapshot parquet 锁文件快照数据
repository parquet 仓库数据
source_markdown_file_history parquet 源Markdown文件历史
source_markdown_file_snapshot parquet 源Markdown文件快照
source_markdown_file_version parquet 源Markdown文件版本

数据集重点

  • 研究自然语言规格、指令和工作流描述如何用于定义、执行和演化真实开源仓库中的 GitHub Agentic Workflows
  • 覆盖262个仓库中的2,820个GH-AW源Markdown文件快照、2820个跨604个文件历史的源版本记录,以及2820个关联的锁文件快照
  • 支持可复现的实证研究、工具演示、复现研究、负面结果以及与NLBSE 2027研讨会相关的立场论文
  • 研讨会议题涵盖NLP方法、数据集、工具及软件工程新兴挑战

架构与文档

示例笔记本

说明 笔记本链接 Colab打开
基础数据加载 load_GAWD.ipynb Open In Colab
数据集概览 dataset_overview.ipynb Open In Colab
仓库语言使用分析 language_usage.ipynb Open In Colab
文件版本历史分析 history_data.ipynb Open In Colab

许可与引用

  • 数据集聚合了GitHub仓库内容,各源仓库保留其原始版权和许可证(如MIT、Apache-2.0、GPL系列、知识共享变体等)
  • 用户必须自行核实并遵守所使用源仓库或文件的特定许可证
  • 引用元数据待定,建议引用发布版本和数据集URL
搜集汇总
数据集介绍
GHAW-H 数据集图片
构建方式
GHAW-H数据集面向GitHub上早期采用Agentic Workflows(GH-AW)的开源仓库,系统性捕捉了这些工作流的历史演化轨迹。该数据集覆盖262个仓库,包含604条源文件历史记录、2820个源文件版本快照及对应的2820个锁文件快照。数据以Parquet格式存储,分为五个配置子集,分别记录锁文件快照、仓库元数据、源文件历史、源文件快照及版本信息,构建了一套多维度、可追溯的档案体系。
使用方法
该数据集的使用方法灵活多样,内置的示例笔记本提供了从基础加载到深度分析的全链路支持。研究者可通过加载数据集快速入门,利用概览笔记本掌握全局特征,结合语言使用分析探究不同编程语言的采纳差异,并借助版本历史分析深挖工作流的具体演化细节。所有笔记本均可直接在Colab中运行,降低了使用门槛,便于复现实验与扩展研究。
背景与挑战
背景概述
随着人工智能与软件工程的深度融合,基于自然语言的软件工程(NLBSE)成为研究热点。2024年左右,GitHub上涌现出以自然语言规范驱动的工作流,即GitHub Agentic Workflows(GH-AW),其通过Markdown文件定义任务,实现开发流程的智能化与自动化。为系统研究这一新兴范式,Pavt等研究人员构建了GHAW-H数据集,该数据集覆盖262个早期采用者开源仓库,包含2820个源文件快照、604条文件历史及2820个锁定文件快照,提供了GH-AW采纳过程的纵深感。该数据集不仅填补了Agentic工作流实证数据的空白,还为NLBSE领域的复现研究、工具开发及基准测试奠定了坚实基础,对推动智能软件工程的发展具有重要意义。
当前挑战
GHAW-H数据集所面临的挑战包括:领域层面,GH-AW作为新兴范式,其定义与边界尚不统一,如何从海量开源项目中精准识别并提取此类工作流是首要难题,同时工作流的动态演化及多语言、多许可证环境的复杂性也增加了数据处理的难度。构建层面,数据集需聚合分散在不同仓库的异构文件,并维护版本历史与快照的一致性,这要求高效的数据采集与去重机制;此外,应对原始仓库许可证的多样性,确保合规使用与数据共享的安全边界亦是一大挑战。这些挑战不仅影响了数据的完整性与代表性,也对后续研究的普适性和可复现性提出了更高要求。
常用场景
经典使用场景
在自然语言驱动的软件工程研究领域,GHAW-H数据集作为首个系统记录GitHub Agentic Workflows(GH-AW)兴起的数据资源,其经典使用场景聚焦于追踪早期采用者开源仓库中GH-AW的演化轨迹。研究者可借助该数据集分析2820个源Markdown文件快照及对应的锁文件快照,深入探究基于自然语言的工作流指令如何被定义、执行及迭代优化。该数据集尤其适用于进行大规模实证研究,如量化GH-AW的普及速度、解析工作流语言选择偏好,以及评估工作流版本更新模式,从而为自然语言软件工程领域提供坚实的数据支撑。
解决学术问题
该数据集解决了学术界在自然语言软件工程领域缺乏真实世界GH-AW实例的瓶颈问题。以往研究受限于零散案例或合成数据,难以系统刻画基于自然语言的工作流在开源生态中的实际形态与演进规律。GHAW-H通过提供跨262个仓库、604条文件历史及2820个版本记录的结构化数据,使研究者能够开展可复现的实证分析,探索自然语言指令在软件自动化中的角色与效能。其意义在于填补了该领域数据空白,促进了对工作流语义、版本兼容性及仓库级采纳模式的深入理解,为构建与验证相关理论模型奠定了基础。
实际应用
在实际应用层面,GHAW-H数据集可直接服务于软件开发工具链的优化与智能化升级。例如,基于该数据集的历史版本信息,可训练用于自动生成或推荐GH-AW配置的机器学习模型,辅助开发者高效构建基于自然语言的工作流。此外,锁文件快照可用于审计供应链依赖的安全性与稳定性,识别潜在风险。数据所涵盖的多语言仓库信息,亦可用于构建跨语言的工作流模式识别系统,提升自动化脚本的通用性与可移植性,从而在DevOps实践中实现从人工编写到智能辅助的转变。
数据集最近研究
最新研究方向
GHAW-H数据集聚焦于开源社区中GitHub代理工作流(GH-AW)的涌现现象,为自然语言驱动的软件工程研究提供了宝贵的实证基础。当前研究前沿主要围绕如何利用该数据集剖析代理工作流的演化轨迹、跨语言采纳模式及其与锁文件快照的关联,进而揭示自然语言规格说明在真实世界仓库中定义与执行工作流的机制。该数据集的发布与NLBSE 2027研讨会的征稿活动紧密相连,旨在推动基于自然语言的软件工程方法论创新,鼓励研究者通过可复现的实证研究、工具演示及复制性实验,深入探索代理工作流对软件开发生命周期的影响,为下一代智能化软件工程实践奠定数据驱动的理论支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务