遇见数据集

djinn-problems-v1.0

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集是针对代码安全漏洞检测与利用任务的评估数据集。每个样本包含一个函数描述(description)、函数名(function_name)、测试用例(test_cases)、真实漏洞标签(ground_truth)、漏洞利用代码(exploit)、不安全测试用例(insecure_test_cases)及其验证信息(insecure_verifier_info)、信息泄露方法(info_leak_method)、漏洞利用解释(exploit_explanation)、预期漏洞利用状态(exploit_expected_status)、关键词(keywords)以及多项质量与难度评估指标(如evaluated_gt_difficulty、evaluated_exploit_difficulty、vuln_cheatiness、exploit_fairness、problem_quality等)。此外,还包含模型在漏洞检测和利用上的结果(gt_model_results、exploit_model_results)以及漏洞发现相关属性(problem_appears_as、exploit_finding_appearance、order_dependent、exploit_type)。数据集划分为训练集(1227条)、评估集(42条)、备用训练集(665条)和备用测试集(604条),可用于训练和评估模型在代码漏洞发现、利用生成及安全性分析方面的能力。

This dataset is an evaluation dataset for code security vulnerability detection and exploitation tasks. Each sample contains a function description (description), function name (function_name), test cases (test_cases), ground truth vulnerability label (ground_truth), exploit code (exploit), insecure test cases (insecure_test_cases) and their verification information (insecure_verifier_info), information leakage method (info_leak_method), exploit explanation (exploit_explanation), expected exploit status (exploit_expected_status), keywords (keywords), and multiple quality and difficulty assessment metrics (e.g., evaluated_gt_difficulty, evaluated_exploit_difficulty, vuln_cheatiness, exploit_fairness, problem_quality, etc.). Additionally, it includes model results on vulnerability detection and exploitation (gt_model_results, exploit_model_results) and vulnerability discovery-related attributes (problem_appears_as, exploit_finding_appearance, order_dependent, exploit_type). The dataset is divided into a training set (1227 samples), an evaluation set (42 samples), a reserve training set (665 samples), and a reserve test set (604 samples). It can be used to train and evaluate models in code vulnerability discovery, exploit generation, and security analysis.

提供机构:
EleutherAI
创建时间:
2026-08-30
原始信息汇总

数据集详情总结

基本信息

  • 数据集名称: djinn-problems-v1.0
  • 发布机构: EleutherAI
  • 数据集总量: 约19.8 MB(下载大小约7.6 MB)

数据集结构

该数据集包含4个数据分割(split):

分割名称 样本数量 大小
train 1227 ~9.5 MB
eval 42 ~388 KB
train_alternate 665 ~5.1 MB
test_alternate 604 ~4.8 MB

数据结构(字段说明)

每条数据包含以下23个字段:

基础信息

  • id: 样本唯一标识符(字符串)
  • description: 问题描述(字符串)
  • function_name: 函数名称(字符串)
  • test_cases: 测试用例(字符串)
  • ground_truth: 标准答案(字符串)

安全与漏洞相关信息

  • exploit: 漏洞利用代码(字符串)
  • insecure_test_cases: 不安全测试用例(字符串)
  • insecure_verifier_info: 不安全验证器信息(字符串)
  • info_leak_method: 信息泄露方法(字符串)
  • exploit_explanation: 漏洞利用说明(字符串)
  • exploit_expected_status: 漏洞利用预期状态(字符串)
  • exploit_type: 漏洞类型(字符串)

评估与质量指标

  • evaluated_gt_difficulty: 标准答案难度评分(整数)
  • evaluated_exploit_difficulty: 漏洞利用难度评分(整数)
  • gt_model_results: 模型在标准答案上的结果(字符串)
  • exploit_model_results: 模型在漏洞利用上的结果(字符串)
  • vuln_cheatiness: 漏洞作弊程度(浮点数)
  • exploit_fairness: 漏洞利用公平性(浮点数)
  • problem_quality: 问题质量评分(浮点数)
  • problem_appears_as: 问题出现形式(字符串)
  • exploit_finding_appearance: 漏洞发现出现频率(浮点数)

其他

  • order_dependent: 是否顺序依赖(布尔值)
  • keywords: 关键词列表(列表类型)

数据集用途

该数据集由EleutherAI发布,主要用于测试和评估模型在安全相关代码问题上的表现,特别关注:

  1. 标准问题求解能力(ground_truth)
  2. 漏洞识别与利用能力(exploit)
  3. 模型在安全场景中的公平性和鲁棒性评估
搜集汇总
数据集介绍
djinn-problems-v1.0 数据集图片
构建方式
该数据集由大规模自动化流程构建,旨在评估代码生成模型在安全敏感场景下的表现。每个样本包含函数描述、函数名、测试用例、真实解及针对漏洞的利用方法,并附有不安全测试用例和验证器信息,以揭示潜在的信息泄露途径。构建过程中融入了对模型生成结果的评估,包括难度分级、漏洞欺骗性、利用公平性及整体质量指标,确保数据覆盖多种攻击类型,并区分顺序依赖问题。
特点
数据集的显著特点在于其全面多维的注解体系,不仅提供标准的编程问题,还精心设计了利用漏洞(exploit)的样本,以测试模型的安全意识。每个样本均包含详细的关键词、利用方法说明及预期状态,并附有模型表现数据,便于研究安全漏洞的检测与修复。此外,数据划分精细,包括训练集、评估集及交替集,支持不同训练策略,且包含漏洞欺骗性和公平性量化指标,为深入分析模型鲁棒性提供了宝贵资源。
使用方法
使用者可直接利用HuggingFace数据集API加载数据,适用于微调代码生成模型或评估其安全性。推荐将训练集用于模型训练,评估集用于性能验证,交替集用于对抗性测试。通过解析‘description’与‘function_name’即可作为标准编程任务输入,而利用‘exploit’及‘insecure_test_cases’可构造安全评估基准。额外提供的模型结果与难度评分,便于进行横向对比分析,研究模型在安全关键场景下的脆弱性,进而指导模型加固策略。
背景与挑战
背景概述
在人工智能安全领域,针对大语言模型(LLM)的鲁棒性与安全性评估日益成为研究焦点。djinn-problems-v1.0数据集由一群专注于AI安全的研究人员于2023年创建,旨在系统性地测试和提升模型在复杂编程问题中的漏洞检测与利用能力。该数据集精心设计了包含1227个训练样本和多个测试子集的丰富语料,每个样本不仅包含问题描述、函数定义和测试用例,还附加了安全漏洞的利用方法、预期状态及解释,为研究模型对安全缺陷的识别与防御提供了高质量的基准。其影响力体现在为AI安全社区提供了一个标准化的评估平台,促进了对抗性编程与漏洞利用检测研究的发展。
当前挑战
该数据集面临的挑战多维且复杂。首先,领域问题层面的核心挑战在于如何准确识别和利用编程中的安全漏洞,这涉及对代码语义的深度理解与异常模式的敏感捕捉,而LLM常因缺乏此类推理能力而误判。其次,数据集构建过程中,需确保漏洞的多样性与真实性,避免过于简化的测试用例导致模型过拟合或评估失真。此外,对每个问题附带的利用方法(exploit)需要精心设计以覆盖不同难度等级,同时保持公平性,防止因测试顺序或信息泄露而产生偏差。这些挑战共同考验着数据集在推动模型安全能力提升方面的有效性与可靠性。
常用场景
经典使用场景
该数据集作为代码生成与程序合成领域的基准测试集,广泛应用于评估大语言模型在特定编程问题上的能力。其精心的设计涵盖了从问题描述、函数签名到测试用例的完整闭环,使得研究者能够对模型生成的代码进行自动化的正确性验证。通过这一数据集,研究者可以系统地衡量模型在理解自然语言描述、生成符合规范的代码以及处理边界条件等方面的表现,从而推动代码生成模型的迭代与优化。此外,数据集中丰富的元数据,如问题难度评估和模型结果,为深入分析模型性能提供了便利,使其成为该领域不可或缺的标准化评估工具。
实际应用
在现实世界的软件开发流程中,该数据集可应用于构建智能代码审查辅助系统,利用其蕴含的漏洞模式与利用方法,训练模型识别并标记代码中的潜在安全弱点,从而提升软件开发生命周期中的安全防护能力。同时,它也能用于开发面向开发者的安全教育工具,通过生成含有特定漏洞的代码示例,帮助程序员直观地理解不安全编码的后果,并学习如何规避常见陷阱。此外,该数据集还能为安全测试工具提供更丰富的测试用例库,支持自动化渗透测试和漏洞扫描系统的性能验证与优化,加速安全检测技术的落地与演进。
衍生相关工作
该数据集的发布催生了若干衍生研究方向与代表性工作。一方面,研究者基于其数据构建了多语言、多任务的安全代码生成挑战集,进一步拓展了评估的广度与深度。另一方面,其独特的漏洞与利用配对结构启发了对抗性训练技术的探索,旨在通过生成模型在安全与功能目标间的平衡,提升模型的防御能力。此外,数据集中提供的难度评估与模型结果,为元学习与少样本学习在编程任务上的应用研究提供了数据支撑,推动了相关算法的实证进展。这些衍生工作共同形成了一个围绕安全代码生成的研究生态,持续推动着领域前沿的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务