multilingual-code-comments-fixed
收藏资源简介:
该数据集包含多种语言的配置,包括中文、荷兰语、英语、希腊语和波兰语。每个配置包含文件ID、内容、仓库、路径、原始评论以及来自不同模型(如Qwen/CodeQwen1.5-7B、bigcode/starcoder2-7b、ibm-granite/granite-8b-code-base、meta-llama/CodeLlama-7b-hf和google/codegemma-7b)的掩码数据和预测结果。此外,还包括这些模型的专家准确性和错误代码。数据集为每种语言提供了训练集,并指定了字节数和示例数。
This dataset comprises configurations spanning multiple languages, namely Chinese, Dutch, English, Greek, and Polish. Each configuration includes file ID, content, repository, path, raw comments, as well as masked data and prediction results from various models such as Qwen/CodeQwen1.5-7B, bigcode/starcoder2-7b, ibm-granite/granite-8b-code-base, meta-llama/CodeLlama-7b-hf, and google/codegemma-7b. Additionally, it encompasses the expert accuracy and error codes of these models. The dataset provides training splits for each language, with specified byte counts and example numbers.
数据集概述
基本信息
- 数据集名称: multilingual-code-comments-fixed
- 托管地址: https://huggingface.co/datasets/AISE-TUDelft/multilingual-code-comments-fixed
- 配置数量: 5
- 总体数据量: 5个配置,每个配置包含500个训练样本
配置详情
1. Chinese(中文)
- 样本数量: 500
- 数据集大小: 21,631,801 字节
- 下载大小: 8,927,665 字节
- 数据文件路径: Chinese/train-*
2. Dutch(荷兰语)
- 样本数量: 500
- 数据集大小: 24,073,258 字节
- 下载大小: 9,180,742 字节
- 数据文件路径: Dutch/train-*
3. English(英语)
- 样本数量: 500
- 数据集大小: 20,540,810 字节
- 下载大小: 8,130,598 字节
- 数据文件路径: English/train-*
4. Greek(希腊语)
- 样本数量: 500
- 数据集大小: 25,626,813 字节
- 下载大小: 9,167,871 字节
- 数据文件路径: Greek/train-*
5. Polish(波兰语)
- 样本数量: 500
- 数据集大小: 17,775,627 字节
- 下载大小: 7,233,103 字节
- 数据文件路径: Polish/train-*
数据结构
所有配置共享以下核心特征:
file_id: 文件标识符content: 内容repo: 代码仓库path: 文件路径original_comment: 原始注释
模型评估特征
数据集包含针对以下五个代码生成模型的评估数据:
- Qwen/CodeQwen1.5-7B
- bigcode/starcoder2-7b
- ibm-granite/granite-8b-code-base
- meta-llama/CodeLlama-7b-hf
- google/codegemma-7b
每个模型对应以下三类特征:
masked_data_[模型名]: 掩码后数据predict_[模型名]: 模型预测predicted_comment_[模型名]: 预测的注释expert_accuracy_[模型名]: 专家评估准确率error_codes_[模型名]: 错误代码
数据划分
- 所有配置仅包含一个划分:train
- 每个配置的训练集均包含500个样本




