遇见数据集

CodeXHug

收藏
arXiv2026-06-22 更新2026-06-24 收录
数据链接:
官方服务:

资源简介:

CodeXHug是由拉奎拉大学研究团队构建的一个精心策划的数据集,旨在系统化地关联Hugging Face平台上的预训练模型与其在GitHub生态系统中的实际代码使用模式。该数据集涵盖了7,325个不同的预训练模型,并收集了来自71,748个代码仓库的372,063个Python文件,数据源整合了Hugging Face模型元数据(如模型卡、管道标签)和GitHub仓库的源代码及项目元数据。其创建过程首先对Hugging Face数据进行了清洗和基于下载量的流行度采样,随后通过GitHub API映射并筛选出实际使用这些模型的Python代码文件。该数据集主要应用于软件工程领域,旨在解决预训练模型在实际项目集成中因缺乏具体代码示例而导致的采用障碍,支持模型卡增强、代码助手开发和模型使用模式分析等任务。

CodeXHug is a carefully curated dataset constructed by the research team from the University of L'Aquila, aiming to systematically correlate pre-trained models on the Hugging Face platform with their actual code usage patterns in the GitHub ecosystem. This dataset covers 7,325 distinct pre-trained models, and collects 372,063 Python files from 71,748 code repositories. The data sources integrate Hugging Face model metadata (such as model cards and pipeline tags) as well as source code and project metadata from GitHub repositories. Its creation process first cleans the Hugging Face data and performs popularity sampling based on download counts, then maps and filters Python code files that actually use these models via the GitHub API. This dataset is primarily applied in the field of software engineering, aiming to address the adoption barriers of pre-trained models in actual project integration caused by the lack of specific code examples, and supports tasks such as model card enhancement, code assistant development, and model usage pattern analysis.

提供机构:
拉奎拉大学
创建时间:
2026-06-22
搜集汇总
数据集介绍
CodeXHug 数据集图片
构建方式
CodeXHug数据集的构建始于对Hugging Face平台最新数据转储的清洗与筛选。研究者剔除了缺失标签或模型卡的预训练模型(PTM),并以下载量为代理指标,筛选出前10%最受欢迎的模型。随后,通过PyGithub库在GitHub平台上检索这些PTM的实际使用情况,限定于Python语言编写的仓库,并利用README中的管道标签信息过滤噪声。最终,从71,748个GitHub仓库中收集了7,325个不同的PTM及其对应的372,063个Python源文件,形成了一套结构化映射数据集。
特点
该数据集的核心特色在于其首次系统性地建立了Hugging Face PTM与GitHub实际使用代码之间的直接关联。数据涵盖了13种不同的管道标签类别,虽呈现长尾分布(如文本生成、掩码填充等类别占据主导),但也包含了较小众的类别以保证多样性。约43.7%的仓库使用了超过一个PTM,揭示了开发者组合应用模型的实践。此外,数据集还存储了仓库的元数据(如提交数、星标数)和文件URL,为后续分析提供了丰富上下文。
使用方法
CodeXHug支持多种下游任务:研究者可基于其提供的高质量代码片段,通过K-means聚类和Llama 3等大语言模型,自动生成或增强模型卡片中的代码使用示例。数据集的原始数据以MongoDB集合形式存储,包含模型集合(名称、标签)和文件集合(UTF-8编码内容),便于快速查询。开发者可通过提供的Python函数直接获取文件内容,进行API调用推荐、代码模式挖掘或PTM使用质量评估等研究,推动基于PTM的下一代解决方案开发。
背景与挑战
背景概述
在预训练模型(PTM)蓬勃发展的时代,模型仓库如Hugging Face已成为软件工程社区不可或缺的基础设施,极大降低了尖端模型的获取与复用门槛。然而,这些模型在实际项目中的真实采纳情况仍如雾里看花,许多模型仅停留在玩具项目或作为仓库镜像,其潜力远未释放。更关键的是,承载模型使用精髓的模型卡片普遍缺失具象的代码使用示例,这对新手开发者而言构成了难以逾越的壁垒。2026年,由意大利拉奎拉大学Stefano Palombo及其团队倾力打造的CodeXHug数据集应运而生,它首次系统性地构建了Hugging Face预训练模型在GitHub生态中的真实使用映射。该数据集基于2024年6月的Hugging Face快照,经过严格的数据清洗、流行度采样与标签过滤,最终锁定7,325个模型及其在71,748个仓库中的372,063个Python文件,为理解PTM的落地实践提供了前所未有的全景视角,成为连接模型卡片与真实代码实践的关键桥梁。
当前挑战
CodeXHug数据集所应对的领域挑战直指预训练模型采纳中的核心痛点:模型卡片普遍缺失可复现的代码使用示例,导致开发者特别是初涉该领域的用户难以将模型有效集成至实际项目中,严重阻碍了PTM从理论走向实践的价值转化。在数据集构建过程中,技术路线面临多重挑战:首先,初始的Hugging Face快照虽包含681,682个模型,但大量条目存在标签或模型卡片缺失的空值问题,需经过精确的数据清洗才能保留262,670个有效模型;其次,为平衡数据集的代表性与多样性,需在基于下载量的10%流行度采样后,进一步从13个标签类别中确保长尾模型的合理纳入,最终提炼出17,760个PTM;最后,通过GitHub API映射真实使用场景时,需精心设计查询策略以避免误报,如限定Python仓库、利用README文件中的标签元素进行二次验证,并严格控制每个仓库的代码文件采样上限,最终从海量噪声中萃取出7,325个模型与372,063个代码文件的高质量对应关系。
常用场景
经典使用场景
CodeXHug数据集最经典的使用场景在于弥合预训练模型(PTM)与真实世界代码实践之间的鸿沟。通过系统性地将Hugging Face平台上广泛使用的模型与GitHub仓库中的实际Python实现相关联,该数据集为开发者提供了一个宝贵的桥梁。研究人员可以借助CodeXHug,针对特定的PTM(如gpt-2、roberta-large)检索其在实际项目中的调用模式、参数配置及数据预处理流程,从而深入理解这些模型如何被集成到复杂的软件系统中。这种用例尤其适用于那些希望将前沿模型应用于自身项目,却因缺乏直观代码示例而踟蹰不前的初学者或从业者。
实际应用
在实际应用层面,CodeXHug最显著的价值在于驱动智能代码助手与模型卡片增强工具的演进。开发者可以利用该数据集训练或微调大型语言模型,使其能根据用户指定的PTM名称自动生成具有代表性的代码使用片段,从而简化模型集成流程。例如,当开发者选择'kakaobrain/karlo-v1-alpha-image-variations'模型时,系统可基于CodeXHug中挖掘出的聚类模式,自动输出包含数据加载、预处理、模型构建与训练在内的完整代码模板。这种能力显著降低了将高级AI模型融入软件项目的技术门槛,尤其对非专业AI开发者而言意义非凡。
衍生相关工作
CodeXHug的诞生催生了多个方向的前沿研究工作。其一,在模型卡片自动生成领域,它促使研究者探索如何从海量开源代码中提炼出精炼且准确的用法模式,以丰富模型文档的内容质量。其二,在API推荐与代码模式挖掘方面,CodeXHug为构建面向PTM的专用推荐系统提供了训练与评估基准,推动了诸如FACER、api2vec等传统方法的迁移与优化。其三,该数据集还启发了对AI系统中技术债务、代码异味及反模式的实证研究,使得学者能够借助真实代码库评估PTM集成对软件质量产生的具体影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务