SecCodePLT
收藏资源简介:
SecCodePLT是一个统一且全面的代码生成AI风险评估平台。该数据集包含多个特征,如CWE_ID、任务描述、真实数据、单元测试等,用于评估大型语言模型生成不安全代码的风险。数据集的创建过程包括两阶段的数据生成和验证,确保数据的质量和安全性。数据集主要用于评估和改进代码生成模型的安全性,不适合用于训练恶意模型或进行网络攻击。
SecCodePLT is a unified and comprehensive AI risk assessment platform for code generation. The dataset associated with this platform includes multiple attributes such as CWE_ID, task descriptions, ground-truth data, unit tests, etc., and is used to evaluate the risk of unsafe code generated by large language models. The dataset is developed through a two-stage data generation and validation process to ensure its quality and security. This dataset is primarily intended for evaluating and improving the security of code generation models, and is not suitable for training malicious models or conducting cyberattacks.
SecCodePLT 数据集概述
1. 数据集描述
1.1 数据集基本信息
- 语言(NLP): 英语
- 许可证: MIT
1.2 数据集来源
- 论文: https://arxiv.org/pdf/2410.11096
- 演示: https://seccodeplt.github.io/
2. 数据集用途
2.1 直接使用
该数据集可用于评估大型语言模型生成不安全代码的风险,使大型语言模型生成更安全的代码等。
2.2 超出范围的使用
该数据集不应用于训练恶意的大型语言模型,或用于对软件系统发起网络攻击等。
3. 数据集创建
3.1 动机
- 现有基准测试方法依赖于静态指标规则或LLM判断,这些方法不如动态测试精确,容易产生误报和漏报。
- 现有基准测试在可扩展性或质量方面存在不足。
3.2 数据收集与处理
- 采用两阶段数据创建流程,确保数据的可扩展性和质量。
- 首先生成每种漏洞类型的种子样本,然后使用LLM驱动的变异器从这些种子生成更多数据。
- 包含验证步骤以过滤不正确的数据,平衡正确性和可扩展性。
- 每个任务生成易受攻击和已修复的代码版本,以及功能和安全测试用例。
3.3 标注者
- Yu Yang, Yuzhou Nie 和 Zhun Wang
4. 引用
BibTeX: BibTeX @article{yang2024seccodeplt, title={SecCodePLT: A Unified Platform for Evaluating the Security of Code GenAI}, author={Yu Yang and Yuzhou Nie and Zhun Wang and Yuheng Tang and Wenbo Guo and Bo Li and Dawn Song}, year={2024}, journal={arXiv preprint arXiv:2410.11096}, }




