luck-spark-1b-code-dataset
收藏资源简介:
Luck Spark 1B 高质量代码数据集(Luck Spark 1B - High Quality Code Dataset)是首个基于内容质量评分(而非星标数)进行过滤的代码数据集,专为训练1B参数级别的MoE(混合专家)代码模型而设计。与传统的依赖星标过滤(如The Stack/CodeParrot)不同,该数据集对每个文件进行0-10分的质量评分,即使星标数较低的仓库,只要代码质量高(如文档完善的库)也能被保留。数据集由自动机器人持续更新,仅包含MIT、Apache-2.0、BSD、Unlicense等宽松许可证的代码,确保商业使用安全。
Luck Spark 1B - High Quality Code Dataset is the first code dataset filtered based on content quality score (rather than star count), designed for training 1B parameter MoE (Mixture of Experts) code models. Unlike traditional star-based filtering (e.g., The Stack/CodeParrot), this dataset assigns a quality score of 0-10 to each file, allowing repositories with low stars but high code quality (e.g., well-documented libraries) to be retained. The dataset is continuously updated by an automated bot and only includes code under permissive licenses such as MIT, Apache-2.0, BSD, Unlicense, ensuring commercial use safety.
Luck Spark 1B - 高质量代码数据集
数据集概述
这是一个专为训练 1B 参数 MoE(混合专家)代码模型而设计的高质量代码数据集。其核心理念在于**基于内容质量评分(0-10分)**而非星标数来筛选代码文件,突破了传统数据集(如 The Stack、CodeParrot)仅依赖 GitHub stars 的局限性——一个仅有 2 星但文档完善的库,其评分可以高于拥有 10k 星的压缩混淆文件。
核心特点
- 内容质量评分:每个文件均附带
score字段(0-10分),评分标准包括 AST 解析成功、函数/类存在、注释比例、文件大小、代码行多样性及弱星标加成 - 筛选策略:
score < 5直接丢弃,5-7本地保留不上传,7+推送至 Hugging Face(仅保留高质量文件) - 实时更新:由自主机器人(
github_to_hf_bot.py)每日持续更新,非静态快照 - 许可合规:仅收录 MIT / Apache-2.0 / BSD / Unlicense 等宽松许可代码,商业化安全
数据集结构
每个样本包含 7 个字段:
text:原始代码内容repo:来源仓库path:文件路径language:文件扩展名(支持 .py/.js/.rs/.go/.java/.cpp/.ts)hash:SHA256 去重哈希score:0-10 质量评分stars:抓取时仓库星标数
规模:训练集包含 8,911 个样本,总大小约 50MB(下载大小约 19.8MB),覆盖 7 种编程语言,已扫描 616+ 个仓库。
使用方式
该数据集支持直接通过 Hugging Face datasets 库加载,并可根据需求进行二次过滤(如只保留 score >= 8 的精英子集)或按语言分类使用。原始 text 字段可直接用于预训练,后续计划推出指令对(instruction pairs)和执行验证子集。
局限性与伦理声明
- 仅包含宽松许可代码,无 GPL/copyleft;商业使用前需检查
repo字段 - 代码可能携带 GitHub 的固有偏差,建议根据使用场景调整
score阈值 - 未对 GitHub 公开数据之外的个人信息进行清洗,相关问题可通过 Discussions 反馈




