AISE-TUDelft/multilingual-code-comments-fixed-7
收藏官方服务:
资源简介:
该数据集包含多种语言(中文、荷兰语、英语、希腊语、波兰语)的代码文件及其原始注释,并提供了来自五个代码模型(CodeQwen1.5-7B、StarCoder2-7b、Granite-8b-code-base、CodeLlama-7b-hf、CodeGemma-7b)的掩码输入、预测输出和预测注释。还包括每个模型的专家准确性评分和错误代码,用于评估代码注释生成的质量。
This dataset contains code files with original comments in multiple languages (Chinese, Dutch, English, Greek, Polish), along with masked inputs and predictions from five code models (CodeQwen1.5-7B, StarCoder2-7b, Granite-8b-code-base, CodeLlama-7b-hf, CodeGemma-7b). It includes predicted comments and expert accuracy scores for each model, allowing evaluation of code comment generation quality.
提供机构:
AISE-TUDelft搜集汇总
数据集介绍

构建方式
在多语言代码注释修复的研究背景下,本数据集精选自五种自然语言(中文、荷兰语、英语、希腊语、波兰语)的源代码文件,每个语种各收录500条样本。构建过程中,首先提取原始代码及其注释,继而利用Qwen/CodeQwen1.5-7B、bigcode/starcoder2-7b等五款主流代码大模型对被掩码的注释进行预测,生成修复后的注释文本。同时,通过人类专家对模型生成的注释进行准确性评估,并记录对应的错误类型编码,从而形成包含原始代码、模型输入输出及专家评判的完整数据链。
特点
该数据集的核心特色在于其多维度、跨模型的对照设计。每条样本不仅保留了代码文件元信息与原始注释,还囊括了五款7B参数级别代码模型的掩码输入、预测结果及生成的注释文本,支持模型间横向对比。专家准确率评分与错误编码的引入,为量化分析模型修复注释的能力提供了可靠标尺。此外,覆盖五种自然语言,使研究者能够探究不同语种对代码注释生成质量的影响,提升了数据集的生态多样性。
使用方法
本数据集可通过HuggingFace Datasets库便捷加载,使用时需指定配置名称,如'Chinese'或'English'以获取对应语种子集。加载后的数据以训练集形式呈现,每条记录包含文件ID、代码内容、仓库路径、原始注释等基础字段,以及各模型对应的预测掩码、生成注释和专家评估指标。研究者可借助专家准确率字段进行模型性能评估,亦可直接利用注释预测结果微调代码生成模型,或开展面向多语种代码理解的实证分析。
背景与挑战
背景概述
随着大规模代码生成模型的蓬勃发展,评估模型在非英语编程注释生成任务上的性能已成为一个新兴的研究焦点。multilingual-code-comments-fixed-7数据集由研究团队于近期构建,旨在系统性地评估包括CodeQwen1.5-7B、StarCoder2-7b、Granite-8b-code-base、CodeLlama-7b-hf和CodeGemma-7b在内的主流代码模型在中文、荷兰语、英语、希腊语和波兰语五种语言上的注释生成能力。该数据集通过掩码原始注释、让模型预测缺失部分、再由专家评估其准确度的范式,为多语言代码理解与生成研究提供了标准化评测基准。其对推动代码大模型在多语言场景下的鲁棒性和实用性评估具有重要意义。
当前挑战
该数据集面临的核心挑战在于,代码注释生成本身是一个高度依赖语义理解的任务,模型需同时理解代码逻辑与自然语言语境,尤其在荷兰语、希腊语等低资源语言上,训练数据的稀疏性导致模型性能显著下降。构建过程中,确保掩码策略不影响代码语义的完整性、协调多位专家在不同语言上的标注一致性,以及处理模型预测结果中因误解代码逻辑而生成的语义错误注释,构成了构建过程中的主要技术难点。此外,跨模型间专家评估标准的统一也增加了数据质量控制的复杂性。
常用场景
经典使用场景
在程序语言理解与生成的研究领域中,代码注释作为沟通人类意图与机器逻辑的桥梁,其质量直接影响软件的可维护性与协作效率。multilingual-code-comments-fixed-7数据集汇聚了中文、荷兰语、英语、希腊语和波兰语五种语言的代码片段,每一条样本均保留了原始注释,并通过多种先进代码大模型(如CodeQwen1.5-7B、StarCoder2-7b、Granite-8b-code-base、CodeLlama-7b-hf及CodeGemma-7b)生成了预测注释及相应的掩码数据。该数据集最经典的应用场景是评估与比较不同语言模型在多语言环境下自动生成代码注释的能力,研究者可借此分析模型在跨语言上下文中的语义理解与表达精准度。
实际应用
在工业级软件开发中,多语言团队的协作日益频繁,自动注释生成工具若只擅长英语将严重限制其应用范围。该数据集可支撑企业级代码质量保障系统的研发,帮助团队识别当前模型在特定语言场景中生成误导性注释的薄弱环节。例如,面向中文或希腊语开源项目的持续集成流程,可利用该数据集中的掩码与预测结果训练更鲁棒的注释修复模块。此外,针对教育领域,该数据集可辅助编程教学平台自动为学生的非英语代码生成清晰的解释性注释,降低新手理解门槛,提升跨语言编程学习体验。
衍生相关工作
基于该数据集的详细字段设计,研究者已衍生出多个经典工作方向。其一,利用专家标注的准确性分数与错误代码标签,可构建自动注释质量评分模型,推动无监督或半监督质量评估技术的发展。其二,通过对比不同模型在同一掩码数据上的预测差异,催生了面向模型能力差异分析与集成学习的研究,探索多模型互补共生的注释生成策略。其三,数据集中的错误代码字段激励了针对注释与代码语义一致性的深度分析工作,相关成果已用于改进模型在罕见语言结构上的推理能力。此外,数据集中跨语言结构与注释模式的对应关系,也为探索代码迁移学习与多任务联合训练提供了宝贵的实验素材。
以上内容由遇见数据集搜集并总结生成



