遇见数据集

luck-spark-1b-code-dataset

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

Luck Spark 1B 高质量代码数据集(Luck Spark 1B - High Quality Code Dataset)是首个基于内容质量评分(而非星标数)进行过滤的代码数据集,专为训练1B参数级别的MoE(混合专家)代码模型而设计。与传统的依赖星标过滤(如The Stack/CodeParrot)不同,该数据集对每个文件进行0-10分的质量评分,即使星标数较低的仓库,只要代码质量高(如文档完善的库)也能被保留。数据集由自动机器人持续更新,仅包含MIT、Apache-2.0、BSD、Unlicense等宽松许可证的代码,确保商业使用安全。

Luck Spark 1B - High Quality Code Dataset is the first code dataset filtered based on content quality score (rather than star count), designed for training 1B parameter MoE (Mixture of Experts) code models. Unlike traditional star-based filtering (e.g., The Stack/CodeParrot), this dataset assigns a quality score of 0-10 to each file, allowing repositories with low stars but high code quality (e.g., well-documented libraries) to be retained. The dataset is continuously updated by an automated bot and only includes code under permissive licenses such as MIT, Apache-2.0, BSD, Unlicense, ensuring commercial use safety.

创建时间:
2026-08-26
原始信息汇总

Luck Spark 1B - 高质量代码数据集

数据集概述

这是一个专为训练 1B 参数 MoE(混合专家)代码模型而设计的高质量代码数据集。其核心理念在于**基于内容质量评分(0-10分)**而非星标数来筛选代码文件,突破了传统数据集(如 The Stack、CodeParrot)仅依赖 GitHub stars 的局限性——一个仅有 2 星但文档完善的库,其评分可以高于拥有 10k 星的压缩混淆文件。

核心特点

  • 内容质量评分:每个文件均附带 score 字段(0-10分),评分标准包括 AST 解析成功、函数/类存在、注释比例、文件大小、代码行多样性及弱星标加成
  • 筛选策略score < 5 直接丢弃,5-7 本地保留不上传,7+ 推送至 Hugging Face(仅保留高质量文件)
  • 实时更新:由自主机器人(github_to_hf_bot.py)每日持续更新,非静态快照
  • 许可合规:仅收录 MIT / Apache-2.0 / BSD / Unlicense 等宽松许可代码,商业化安全

数据集结构

每个样本包含 7 个字段:

  • text:原始代码内容
  • repo:来源仓库
  • path:文件路径
  • language:文件扩展名(支持 .py/.js/.rs/.go/.java/.cpp/.ts)
  • hash:SHA256 去重哈希
  • score:0-10 质量评分
  • stars:抓取时仓库星标数

规模:训练集包含 8,911 个样本,总大小约 50MB(下载大小约 19.8MB),覆盖 7 种编程语言,已扫描 616+ 个仓库。

使用方式

该数据集支持直接通过 Hugging Face datasets 库加载,并可根据需求进行二次过滤(如只保留 score >= 8 的精英子集)或按语言分类使用。原始 text 字段可直接用于预训练,后续计划推出指令对(instruction pairs)和执行验证子集。

局限性与伦理声明

  • 仅包含宽松许可代码,无 GPL/copyleft;商业使用前需检查 repo 字段
  • 代码可能携带 GitHub 的固有偏差,建议根据使用场景调整 score 阈值
  • 未对 GitHub 公开数据之外的个人信息进行清洗,相关问题可通过 Discussions 反馈
搜集汇总
数据集介绍
luck-spark-1b-code-dataset 数据集图片
构建方式
该数据集由自主运行的机器人通过GitHub Search API系统化采集,不依赖星标过滤,而是依据多维度内容质量评分体系(包含AST解析、注释比例、文件大小、代码多样性与弱星标加成)对每个文件进行0-10分动态评估,仅将评分7分以上的高质量代码推送至Hugging Face平台。数据采集流程覆盖七种主流编程语言,通过Tree API限制仓库规模,运用SHA256哈希去重并执行AST结构校验,采用宽松许可证(MIT/Apache-2.0/BSD)以确保商用安全,最终以Arrow/Parquet格式存储并定期更新。
使用方法
用户可通过Hugging Face的datasets库便捷加载数据集,并根据质量评分进行二次筛选,例如仅保留评分8以上的‘精英’子集。支持按编程语言过滤,便于针对特定语言进行模型微调。对于预训练任务,可直接使用原始的text字段;对于指令微调,未来将提供自动生成的指令对;强化学习场景则可利用执行验证的子集。此外,数据集还提供了与Luck Spark 1B模型配套的Tokenization示例,简化了研究者的使用流程。
背景与挑战
背景概述
该数据集由ahmetggg于2026年创建,旨在为训练1B参数规模的MoE(混合专家)代码模型提供高质量、无星级偏见的代码语料。其核心研究问题在于突破传统数据集(如The Stack、CodeParrot)依赖GitHub星标进行过滤的局限,转而依据代码内容质量进行综合评分(0-10分),从而保留低星但文档完善、结构清晰的代码库。这一创新性方法不仅提升了数据筛选的精准度,还通过持续更新的自动化机器人(github_to_hf_bot.py)保证数据的时效性。该数据集对代码生成、预训练及指令微调领域具有重要影响力,为构建更鲁棒、更高效的代码大模型奠定了数据基础。
当前挑战
该数据集面临的挑战主要涵盖两个层面。其一,领域问题层面,传统代码数据集如The Stack等过度依赖星标筛选,导致大量高质量但低星级的代码被忽略,且缺乏对代码内容质量的可量化评估,难以支撑对代码语义理解与生成能力的深度优化。其二,构建过程中,需要设计多维度评分机制(涵盖AST解析、注释比例、代码规模、多样性及星标弱加成),并解决数据去重(SHA256)、许可证合规(仅限MIT/Apache-2.0/BSD等宽松许可)、持续自动化更新及均衡多语言覆盖(如Python、JavaScript、Rust等7种语言)等工程挑战,同时需确保评分模型的可解释性与可复现性,以维护数据集的长期可用性和可信度。
常用场景
经典使用场景
该数据集专为训练规模约十亿参数级别的代码语言模型而设计,尤其适用于混合专家(MoE)架构的预训练任务。其核心价值在于提供了一份经过内容质量评分(0-10分)筛选的高质量代码语料,颠覆了传统依赖星标数量的粗粒度过滤方式。研究者可直接加载该数据集,利用其‘text’字段进行自回归语言建模,或依据‘score’、‘language’等元数据进行精细化的子集划分,以适配不同的训练目标,如领域自适应预训练或代码理解任务的特征分析。
解决学术问题
该数据集针对代码智能领域长期存在的‘低星优质代码被忽略’与‘高星冗余代码干扰训练’两大痛点,提出了基于内容质量的系统性解决方案。通过引入多维度的可解释性评分机制,有效解决了数据筛选中的‘信号丢失’与‘噪声过载’问题,使得训练语料的信噪比显著提升。它的问世为构建更纯净、更高效的代码预训练语料库提供了新范式,推动了代码生成、代码摘要等下游任务模型性能的潜在提升,并促进了关于代码质量量化评估的学术探讨。
实际应用
在实际应用中,该数据集为工业界与学术界的代码智能模型研发提供了可靠的数据基础设施。开发者可直接利用其高质量子集进行代码补全、程序合成等模型的微调,或结合执行验证策略构建基于强化学习的代码生成智能体。其‘stars’与‘score’字段的并存,亦为分析仓库流行度与代码内在质量之间的关联提供了实证数据,助力代码质量评估工具的开发与开源生态的研究。
数据集最近研究
最新研究方向
该数据集聚焦于为小型混合专家(MoE)代码模型提供高质量、内容驱动的预训练语料,其核心创新在于摒弃了传统基于星标的筛选机制,转而采用细粒度的内容质量评分体系(0-10分),从而发掘并保留了大量低星但文档完善、结构清晰的优质代码片段。这一研究方向紧跟当前代码生成领域对数据质量与多样性日益增长的重视,通过引入AST解析、注释比例、代码独特性等多元评估维度,有效缓解了模型在训练中因数据偏差导致的性能瓶颈。该数据集的持续自主更新机制与严格的许可证筛选策略,为构建安全、合规且高效的大规模代码预训练数据集树立了新的范式,对推动代码智能模型在真实世界场景下的泛化能力与实用性具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务