遇见数据集

kd13/stack-v2-mini

收藏
Hugging Face2026-04-28 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是为了支持如ModernBERT、Llama、Qwen等模型在编程语言数据上的微调而组装的。它提供了一个平衡、去重和过滤的真实世界源代码文件集合,这些文件来自由Software Heritage索引并由BigCode项目策划的公共仓库。数据集包含Python、JavaScript、Java、C++和Go五种语言,每种语言40,001个文件,总计200,005个文件。数据集是Stack v2语料库的一个相对较小的样本,不适用于从头开始训练大型代码生成模型。文件保留了其原始许可证,用户需自行验证许可证与下游用例的兼容性。未应用超出上游Stack v2版本的个人可识别信息移除步骤,用户在重新分发衍生作品时应考虑运行如`bigcode-pii`的PII清理步骤。未应用近重复检测(如基于MinHash的方法),这可能对某些训练场景有益。

license: bigcode-openrail-m task_categories: - 文本生成 - 掩码填充 language: - 英语 pretty_name: mini-multicode size_categories: - 10万<样本量<100万 # Stack v2 清洗版——20万条多语言代码子集 本数据集为[bigcode/the-stack-v2](https://huggingface.co/datasets/bigcode/the-stack-v2)的清洗过滤子集。 ## 数据集概述 本数据集专为支撑ModernBERT、Llama、Qwen等模型在编程语言数据上的微调任务而构建,收录了由软件遗产(Software Heritage)索引的公共代码仓库中提取、经BigCode项目整理的、经过去重与过滤且分布均衡的真实源代码文件集合。 | 编程语言 | 文件数量 | |-------------|-----------| | Python | 40,001 | | JavaScript | 40,001 | | Java | 40,001 | | C++ | 40,001 | | Go | 40,001 | | **总计** | **200,005** | ## 局限性与注意事项 本数据集仅为完整Stack v2语料库的小型样本,不适用于从零开始训练大型代码生成模型。所有文件保留上游分类的原始许可证,使用者需自行验证其下游应用与许可证的兼容性。除上游Stack v2发布版已完成的处理外,本数据集未执行任何个人可识别信息 (Personally Identifiable Information, PII) 的清除操作;重新分发衍生制品的使用者应考虑在发布前使用`bigcode-pii`等工具开展PII清洗流程。本数据集未应用近似重复检测(例如基于MinHash的方法),该操作可能对部分训练场景有所裨益。 ## 来源与许可证 本数据集的基础数据源自`bigcode/the-stack-v2`,该数据集受BigCode项目使用条款及各源文件的原始仓库许可证约束。使用本衍生数据集的用户必须遵守上游Stack v2的使用条款,相关条款可在[原始数据集页面](https://huggingface.co/datasets/bigcode/the-stack-v2)查阅。本数据集保留了上游数据集的`license_type`(许可证类型)字段,以支持基于许可证的过滤操作。 ## 引用说明 若使用本数据集,请引用原始Stack v2发布版本: @article{lozhkov2024starcoder, title={StarCoder 2 and The Stack v2: The Next Generation}, author={Lozhkov, Anton and others}, journal={arXiv preprint arXiv:2402.19173}, year={2024} }

提供机构:
kd13
二维码
社区交流群
二维码
科研交流群
商业服务