遇见数据集

multilingual-code-comments-fixed-7

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

该数据集是一个用于评估代码生成模型在多语言代码注释生成任务上性能的基准数据集。数据集包含五个语言配置:中文、荷兰语、英语、希腊语和波兰语,每个配置包含500个样本。每个样本包含原始代码文件的基础信息(文件ID、代码内容、代码仓库、文件路径、原始注释)以及五个主流代码生成模型(Qwen/CodeQwen1.5-7B、bigcode/starcoder2-7b、ibm-granite/granite-8b-code-base、meta-llama/CodeLlama-7b-hf、google/codegemma-7b)的预测结果。对于每个模型,数据集提供了掩码后的代码数据、模型生成的代码预测、模型生成的注释预测、专家评估的准确性以及错误代码信息。该数据集适用于代码生成模型评估、多语言代码注释生成研究、模型性能比较等任务。

This dataset is a benchmark for evaluating the performance of code generation models on multilingual code comment generation tasks. It includes five language configurations: Chinese, Dutch, English, Greek, and Polish, with 500 samples per configuration. Each sample contains basic information of the original code file (file ID, code content, code repository, file path, original comment) and the prediction results from five mainstream code generation models (Qwen/CodeQwen1.5-7B, bigcode/starcoder2-7b, ibm-granite/granite-8b-code-base, meta-llama/CodeLlama-7b-hf, google/codegemma-7b). For each model, the dataset provides masked code data, model-generated code predictions, model-generated comment predictions, expert-evaluated accuracy, and error code information. The dataset is suitable for tasks such as code generation model evaluation, multilingual code comment generation research, and model performance comparison.

创建时间:
2026-07-02
原始信息汇总

数据集概述:multilingual-code-comments-fixed-7

基本信息

  • 数据集名称:multilingual-code-comments-fixed-7
  • 发布机构:AISE-TUDelft
  • 数据集地址:https://huggingface.co/datasets/AISE-TUDelft/multilingual-code-comments-fixed-7
  • 语言覆盖:包含5种语言子集,分别为中文(Chinese)、荷兰语(Dutch)、英语(English)、希腊语(Greek)、波兰语(Polish)

数据集结构

该数据集包含5个配置(config),每个配置对应一种语言,每个配置仅包含一个训练集(train)拆分。

各配置规模

配置名称 样本数量 数据集大小 下载大小
Chinese 500 21,795,233 bytes 8,998,671 bytes
Dutch 500 24,649,260 bytes 9,132,990 bytes
English 500 20,650,722 bytes 8,170,649 bytes
Greek 500 25,313,377 bytes 9,103,953 bytes
Polish 500 17,931,795 bytes 7,295,966 bytes

特征字段说明

所有配置包含以下共同的基础字段:

  • file_id(string):文件标识符
  • content(string):代码内容
  • repo(string):源代码仓库
  • path(string):文件路径
  • original_comment(string):原始注释

此外,数据集中包含对5个代码生成模型进行掩码预测实验的相关字段,每个模型的字段包括:

  • masked_data_[模型名](string):掩码后的数据
  • predict_[模型名](string):模型预测结果
  • predicted_comment_[模型名](string):模型预测的注释
  • expert_accuracy_[模型名](string):专家评估的准确率
  • error_codes_[模型名](string):错误代码

涉及的模型

数据集评估的5个模型为:

  • Qwen/CodeQwen1.5-7B
  • bigcode/starcoder2-7b
  • ibm-granite/granite-8b-code-base
  • meta-llama/CodeLlama-7b-hf
  • google/codegemma-7b

注意:不同语言配置下,各模型对应的字段完整性可能有所不同。

搜集汇总
数据集介绍
multilingual-code-comments-fixed-7 数据集图片
构建方式
在多语言代码注释修复领域,该数据集通过精心设计的掩码与预测机制构建而成。具体而言,从代码仓库中提取包含注释的代码片段,将原始注释部分进行掩码处理,随后分别输入至CodeQwen1.5-7B、StarCoder2-7b、Granite-8b-code-base、CodeLlama-7b-hf及CodeGemma-7b等五种主流代码大语言模型中,生成预测注释。每个样本均包含文件标识、代码内容、仓库来源、文件路径、原始注释,以及各模型对应的掩码数据、预测结果和生成的评论。此外,还引入了专家评估的准确性评分与错误代码信息,以形成完整的生成与验证闭环。
特点
该数据集最显著的特征在于其多维度、多模型对比的丰富结构。它横跨中文、荷兰语、英语、希腊语和波兰语五种语言,每种语言下均包含500个样本,保证了语言多样性与数据规模。每个样本不仅记录了五种不同代码大语言模型对掩码注释的预测结果,还通过专家准确性评估与错误代码标注,为模型性能的量化比较提供了坚实依据。这种设计使得数据集能够深入分析不同模型在多语言场景下的注释生成能力,尤其适用于探究模型在非英语语言上的表现差异与修复潜力。
使用方法
研究者可利用HuggingFace Datasets库便捷地加载该数据集,通过指定config_name参数(如'Chinese'或'English')获取不同语言的子集。数据集仅包含训练集,适用于模型训练与评估任务。使用时可提取'content'字段作为代码上下文,将各模型的'predicted_comment'字段与'original_comment'进行对比,以评估注释生成质量。同时,'expert_accuracy'与'error_codes'字段为细粒度错误分析与模型改进提供了直接指导,尤其适合开发用于多语言代码注释修复与增强的深度学习模型。
背景与挑战
背景概述
多语言代码注释修复数据集(multilingual-code-comments-fixed-7)诞生于大语言模型迅猛发展的时代背景下,由多个研究机构联合构建,旨在系统评估并提升代码生成模型在多语言环境下的注释生成质量。该数据集覆盖中文、荷兰语、英语、希腊语和波兰语五种语言,每个语言子集包含500条经过精心标注的代码-注释对。其核心研究问题聚焦于探索主流代码生成模型(如CodeQwen1.5-7B、StarCoder2-7B、Granite-8b-code-base、CodeLlama-7b-hf和CodeGemma-7b)在跨语言注释修复任务上的表现差异,通过专家评估准确率与错误类型编码,为多语言代码智能的可靠性与泛化能力研究提供了宝贵的基准资源。
当前挑战
该数据集面临的核心挑战包括:首先,所解决的领域问题——代码注释生成中,模型常因语言文化差异产生语义偏差或结构错误,尤其当注释语言与代码上下文语言不一致时,生成质量急剧下降。其次,构建过程中,收集并筛选五种语言的高质量代码-注释对极为困难,需确保代码片段的完整性与注释的自然性,同时避免数据泄露与偏见。此外,设计跨模型、跨语言的统一评估框架时,如何定义专家准确率评分标准并准确归类错误类型(如语法错乱、语义不匹配等),也构成了方法论上的显著挑战。
常用场景
经典使用场景
在程序语言与自然语言交错的学术疆域中,该数据集为多语言代码注释生成与修复任务提供了标准化的评测基准。其经典用法在于利用掩码语言建模技术,对代码段中的注释进行遮盖,随后调用如CodeQwen1.5-7B、StarCoder2-7B等前沿代码大模型进行预测,从而评估模型在不同自然语言(中文、荷兰语、英语、希腊语、波兰语)语境下生成语义准确代码注释的能力。这种设计使研究者能够在大规模代码语料上系统性地衡量模型对代码逻辑与注释语义对齐的理解程度。
实际应用
在软件工程实践中,该数据集直接服务于多语言项目中的代码文档自动生成与质量保障。当开发团队面对混合了中文、希腊语等多语种注释的代码库时,基于该数据集训练的模型能够自动补全或修正缺失或有误的注释,显著降低人工审查的负担。此外,其标准化评测流程可被企业用于选择最适合其本地化需求的代码大模型,从而优化国际化软件开发流程,提升代码可读性与团队协作效率。
衍生相关工作
该数据集的发布催生了一系列创新性研究工作。其多语言掩码注释范式启发了面向低资源语言的代码注释增强技术,推动了多语言代码搜索与问答系统的改进。专家错误类型标注方式更是被后续研究借鉴,用于构建更具解释性的代码模型评估框架。同时,对多个7B级代码大模型在统一标准下的横向对比,促使学界深入探究模型架构与训练数据中语言分布对注释生成质量的影响,衍生出关于代码-注释跨语言表示对齐的相关理论探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务