Accuknoxtechnologies/CodeLanguage
收藏资源简介:
该数据集是一个用于微调基于Qwen的防护模型的数据集,专门用于检测用户提示中出现的编程语言。每个数据行包含一个自然语言和代码提示对,以及一个JSON格式的target字段,用于枚举检测到的编程语言。数据集合并了之前分开的训练和测试CSV文件,形成单一的train分割。它支持25种编程语言的识别,包括AWK、Bash、Batch、C、C#、C++、Dockerfile、Go、Java、JavaScript、Kotlin、Lua、Makefile、Perl、PowerShell、Python、R、Ruby、Rust、SQL、Scala、Swift、Terraform、YAML和jq。总记录数为10,500行,分为single、multi、benign和invalid类别。数据集的提示主要基于英语构建,并包含令牌分桶统计信息,以帮助模型训练。
--- 许可证:Apache-2.0 任务类别: - 文本分类 标签: - 代码 - 语言识别 - 通义千问(Qwen) 美观名称:Qwen代码语言识别监督微调(Supervised Fine-Tuning, SFT)数据集 --- # Accuknoxtechnologies/CodeLanguage 本数据集用于微调基于通义千问(Qwen)的防护模型,以检测用户提示文本中出现的编程语言种类。每一行数据均将一段包含自然语言与代码的提示文本,与一份枚举了检测到的编程语言的JSON格式`target`字段进行配对。 本次发布将此前分离的训练集与测试集CSV文件合并为单一的`train`划分,源文件为`code_langid.csv`与`test_dataset_langid.csv`。 ## 数据结构(Schema) | 列名 | 描述 | |---|---| | `prompt` | 用户消息,可包含一个或多个代码片段 | | `target` | JSON格式:`{"is_valid": bool, "category": {"<Lang>": true, ...}}` | | `kind` | 取值为`single`、`multi`或`benign`之一 | ## 总数据量 | 总行数 | 单语种样本 | 多语种样本 | 良性样本 | 无效样本(`is_valid=false`) | |---:|---:|---:|---:|---:| | 10500 | 7349 | 2101 | 1050 | 1050 | ## 支持的标签 共25种编程语言: `AWK`, `Bash`, `Batch`, `C`, `C#`, `C++`, `Dockerfile`, `Go`, `Java`, `JavaScript`, `Kotlin`, `Lua`, `Makefile`, `Perl`, `PowerShell`, `Python`, `R`, `Ruby`, `Rust`, `SQL`, `Scala`, `Swift`, `Terraform`, `YAML`, `jq` | 标签 | 包含该标签的行数 | |---|---:| | `Go` | 508 | | `PowerShell` | 505 | | `Lua` | 504 | | `Terraform` | 502 | | `Rust` | 498 | | `AWK` | 496 | | `Kotlin` | 496 | | `JavaScript` | 495 | | `Batch` | 495 | | `C` | 492 | | `C++` | 491 | | `Scala` | 486 | | `Ruby` | 486 | | `jq` | 480 | | `R` | 479 | | `Dockerfile` | 475 | | `Swift` | 472 | | `C#` | 469 | | `Makefile` | 467 | | `Bash` | 466 | | `Perl` | 466 | | `SQL` | 465 | | `Python` | 462 | | `Java` | 460 | | `YAML` | 448 | ## Token 分桶划分 使用`Qwen/Qwen2.5-0.5B`(通义千问2.5-0.5B)进行分词,与训练所用分词器保持一致。 | 0-128 | 129-256 | 257-512 | 513-1024 | 1025-2048 | 2049+ | 最小值 | 平均值 | 中位数(p50) | 95分位数(p95) | 最大值 | |---|---|---|---|---|---|---|---|---|---|---| | 1529 | 1725 | 2398 | 2759 | 2060 | 29 | 23 | 581.8 | 449 | 1361 | 3035 | ## 提示文本自然语言语种 本版本数据集未计算每条提示的自然语言语种(如英语、韩语等)。从数据集构建规则来看,提示文本以英语为主(详见`build_dataset.py`)。 ## 数据集复现 本数据集由`gpu-vm-training-langid/build_dataset.py`生成,并由`gpu-vm-training-langid/hf_dataset_push/push_dataset.py`完成上传。



