遇见数据集

HuggingFaceH4/code_evaluation_prompts

收藏
Hugging Face2023-05-09 更新2024-03-04 收录
官方服务:

资源简介:

这是一个用于评估代码指令模型的提示数据集,包含多种语言和任务类型。数据集由ChatGPT生成,建议仅用于定性评估而非模型训练。数据集中包含Python、C++、HTML等多种语言的代码指令,以及代码补全、错误修复等任务类型。具体分布如下:Python 81条,C++ 21条,HTML 10条,以及其他语言的少量指令。数据集旨在提供更具挑战性和更精选的任务,以进行有意义的评估,但数据量不足以训练整个模型。

This is a prompt dataset dedicated to evaluating code instruction models, encompassing diverse languages and task categories. Generated by ChatGPT, it is recommended exclusively for qualitative evaluation rather than model training. The dataset comprises code instructions in multiple languages including Python, C++, HTML, and covers task types such as code completion and bug fixing. The specific distribution is as follows: 81 entries for Python, 21 for C++, 10 for HTML, plus a small number of instructions in other languages. This dataset intends to offer more challenging and meticulously curated tasks for meaningful model evaluation, yet its scale is inadequate for training a full-scale model.

提供机构:
HuggingFaceH4
原始信息汇总

数据集概述

数据集信息

  • 特征:
    • prompt: 字符串类型
    • type: 字符串类型
    • bug: 字符串类型
    • language: 字符串类型
    • meta: 结构体类型
      • id: 64位整数类型
      • source: 字符串类型
  • 分割:
    • train: 30363字节,115个样本
  • 下载大小: 15622字节
  • 数据集大小: 30363字节
  • 语言: 英语
  • 标签: 代码, rlhf
  • 大小类别: n<1K

数据内容

  • 语言分布:
    • Python: 81
    • C++: 21
    • html: 10
    • Ruby: 1
    • Bash: 1
    • MATLAB: 1
    • React: 1
    • Scala: 1
    • JavaScript: 1
    • Java: 1
    • PHP: 1
  • 指令类型分布:
    • 代码完成/指令跟随: 95
    • 错误修复: 20
搜集汇总
数据集介绍
构建方式
该数据集由HuggingFaceH4团队精心构建,旨在为代码指令模型的评估提供高质量基准。其生成过程借鉴了CodeAlpaca的数据生成范式,但进一步提升了任务的挑战性与内容的精选程度。数据通过调用ChatGPT(GPT-3.5-turbo)生成原始指令,随后经过人工筛选与过滤,确保每个样本均具备明确的评估价值。数据集涵盖多种编程语言与任务类型,包括Python、C++、HTML等,并细分为代码补全、指令遵循与Bug修复等类别。构建者特别强调,该数据集规模较小(仅115个样本),仅适用于定性评估,而非模型训练。
特点
该数据集的核心特点在于其多样性与针对性。从语言分布来看,Python样本占据主导地位(81个),同时涵盖C++、HTML、Ruby、Bash、MATLAB、React、Scala、JavaScript、Java及PHP等语言,展现了跨语言的评估广度。从任务类型来看,数据集包含95个代码补全/指令遵循样本与20个Bug修复样本,其中Bug修复任务要求模型识别并纠正代码错误,极具挑战性。此外,Python指令按难度分为简单(20个)、中级(20个)、高级(10个)及机器学习相关(15个)四类,为评估模型在不同复杂度下的表现提供了精细化维度。
使用方法
使用该数据集进行模型评估时,可通过HuggingFace的datasets库轻松加载。用户只需执行`from datasets import load_dataset`并调用`load_dataset("HuggingFaceH4/code_evaluation_prompts")`即可获取数据。加载后,可通过遍历`train`分片中的`prompt`字段生成评估输入,并利用`type`、`bug`及`language`等字段进行细粒度分析。例如,统计语言分布或任务类型占比的代码片段已集成在数据集中,便于快速复现。值得注意的是,由于数据量有限,建议将其作为定性评估工具,结合人工判断模型输出的质量与合理性。
背景与挑战
背景概述
在大型语言模型(LLM)快速发展的浪潮中,代码生成与理解能力成为评估模型智能水平的关键维度。HuggingFaceH4/code_evaluation_prompts数据集由Hugging Face团队于2023年5月创建,旨在为代码指令模型提供一套经过精筛选的评估提示集。该数据集的核心研究问题在于如何构建一个兼具挑战性与多样性的基准,以更准确地衡量模型在真实编程任务上的表现。通过涵盖Python、C++、HTML等多种语言及代码补全、Bug修复等任务类型,该数据集弥补了现有基准如CodeAlpaca在难度和精细化方面的不足。尽管数据规模较小(仅115条样本),但其在RLHF(基于人类反馈的强化学习)领域的探索性价值不可忽视,为后续更高质量代码评估数据集的设计提供了重要参考。
当前挑战
当前数据集面临多重挑战。首先,在领域问题层面,代码评估的核心难点在于如何设计出能真实反映模型编程能力的任务,现有提示集中在基础语法与中等难度任务,缺乏对复杂算法设计、系统架构等高阶能力的覆盖。其次,在构建过程中,数据全部由ChatGPT(GPT-3.5-turbo)生成,这引入了模型偏见与潜在错误,使得评估结果可能偏离真实人类编程场景。此外,样本数量极为有限(仅115条),且语言分布极不均衡(Python占81条,而Ruby、Bash等仅各1条),难以支撑统计显著的评估结论。最后,缺乏对模型生成代码的可执行性、效率及安全性的自动化验证机制,限制了其在严谨学术研究中的应用深度。
常用场景
经典使用场景
在代码智能与程序语言处理领域,HuggingFaceH4/code_evaluation_prompts数据集被广泛用于评估代码指令模型的生成质量与鲁棒性。该数据集精心筛选了涵盖Python、C++、HTML等多种编程语言的指令样本,包含代码补全、错误修复等任务类型,尤其适用于对经过指令微调或强化学习训练的大语言模型进行定性评估。研究者通常利用该数据集测试模型在代码生成、代码理解及程序修复等核心能力上的表现,从而判断模型在真实编程场景中的实用性与可靠性。
实际应用
在实际应用层面,该数据集可被集成至代码辅助工具与智能编程助手的开发流程中。开发者可利用其指令样本对模型进行快速验证,确保所训练的代码生成模型能够准确理解用户意图并生成可执行代码。此外,该数据集中的错误修复任务可用于训练自动化调试系统,提升代码审查与缺陷定位的效率。在工业界,该数据集为构建更可靠的代码补全插件、智能问答系统及交互式编程教育平台提供了关键的测试基准。
衍生相关工作
该数据集催生了多项经典研究工作,主要集中在代码指令模型的评估框架设计与性能优化方面。受其启发,研究者开发了更系统的代码评估基准,如结合人类偏好与自动指标的混合评估方法。同时,该数据集被用作强化学习从人类反馈(RLHF)流程中的奖励模型评估数据,推动了代码领域对齐研究的发展。此外,基于该数据集的筛选与生成策略,衍生出针对特定语言或任务类型的高质量微调数据集,进一步丰富了代码智能领域的数据生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务