multilingual-code-comments-fixed-7
收藏资源简介:
该数据集是一个用于评估代码生成模型在多语言代码注释生成任务上性能的基准数据集。数据集包含五个语言配置:中文、荷兰语、英语、希腊语和波兰语,每个配置包含500个样本。每个样本包含原始代码文件的基础信息(文件ID、代码内容、代码仓库、文件路径、原始注释)以及五个主流代码生成模型(Qwen/CodeQwen1.5-7B、bigcode/starcoder2-7b、ibm-granite/granite-8b-code-base、meta-llama/CodeLlama-7b-hf、google/codegemma-7b)的预测结果。对于每个模型,数据集提供了掩码后的代码数据、模型生成的代码预测、模型生成的注释预测、专家评估的准确性以及错误代码信息。该数据集适用于代码生成模型评估、多语言代码注释生成研究、模型性能比较等任务。
This dataset is a benchmark for evaluating the performance of code generation models on multilingual code comment generation tasks. It includes five language configurations: Chinese, Dutch, English, Greek, and Polish, with 500 samples per configuration. Each sample contains basic information of the original code file (file ID, code content, code repository, file path, original comment) and the prediction results from five mainstream code generation models (Qwen/CodeQwen1.5-7B, bigcode/starcoder2-7b, ibm-granite/granite-8b-code-base, meta-llama/CodeLlama-7b-hf, google/codegemma-7b). For each model, the dataset provides masked code data, model-generated code predictions, model-generated comment predictions, expert-evaluated accuracy, and error code information. The dataset is suitable for tasks such as code generation model evaluation, multilingual code comment generation research, and model performance comparison.
数据集概述:multilingual-code-comments-fixed-7
基本信息
- 数据集名称:multilingual-code-comments-fixed-7
- 发布机构:AISE-TUDelft
- 数据集地址:https://huggingface.co/datasets/AISE-TUDelft/multilingual-code-comments-fixed-7
- 语言覆盖:包含5种语言子集,分别为中文(Chinese)、荷兰语(Dutch)、英语(English)、希腊语(Greek)、波兰语(Polish)
数据集结构
该数据集包含5个配置(config),每个配置对应一种语言,每个配置仅包含一个训练集(train)拆分。
各配置规模
| 配置名称 | 样本数量 | 数据集大小 | 下载大小 |
|---|---|---|---|
| Chinese | 500 | 21,795,233 bytes | 8,998,671 bytes |
| Dutch | 500 | 24,649,260 bytes | 9,132,990 bytes |
| English | 500 | 20,650,722 bytes | 8,170,649 bytes |
| Greek | 500 | 25,313,377 bytes | 9,103,953 bytes |
| Polish | 500 | 17,931,795 bytes | 7,295,966 bytes |
特征字段说明
所有配置包含以下共同的基础字段:
- file_id(string):文件标识符
- content(string):代码内容
- repo(string):源代码仓库
- path(string):文件路径
- original_comment(string):原始注释
此外,数据集中包含对5个代码生成模型进行掩码预测实验的相关字段,每个模型的字段包括:
- masked_data_[模型名](string):掩码后的数据
- predict_[模型名](string):模型预测结果
- predicted_comment_[模型名](string):模型预测的注释
- expert_accuracy_[模型名](string):专家评估的准确率
- error_codes_[模型名](string):错误代码
涉及的模型
数据集评估的5个模型为:
Qwen/CodeQwen1.5-7Bbigcode/starcoder2-7bibm-granite/granite-8b-code-basemeta-llama/CodeLlama-7b-hfgoogle/codegemma-7b
注意:不同语言配置下,各模型对应的字段完整性可能有所不同。




