CodeClarity-Bench
收藏资源简介:
CodeClarity Bench是一个多语言代码摘要的基准测试数据集,支持跨六种编程语言(Python, Java, JavaScript, PHP, Go, Ruby)和七种自然语言(西班牙语,法语,印地语,阿拉伯语,普通话,葡萄牙语)的代码理解任务模型评估。
CodeClarity Bench: A Multilingual Code Summarization Benchmark
概述
CodeClarity Bench是CodeClarity Framework的基准组件,用于在多编程语言和自然语言环境下对代码摘要模型进行严格评估。该数据集支持对代码理解任务中训练或微调的模型摘要能力进行标准化、可复现的比较。
动机
现有摘要基准主要局限于英语自然语言和一两种编程语言。CodeClarity Bench通过提供跨越六种编程语言和七种自然语言的统一测试平台来解决这一差距,促进代码理解领域的跨语言分析和多语言评估。
数据集构成
CodeClarity-Bench包含约7,344个多语言摘要(51个不同代码样本 × 6种编程语言 × 4个模型 × 6种自然语言)。
| 维度 | 详情 |
|---|---|
| 编程语言 | Python, Java, JavaScript, PHP, Go, Ruby |
| 自然语言 | 西班牙语(ES), 法语(FR), 印地语(HI), 阿拉伯语(AR), 中文(ZH), 葡萄牙语(PT) |
| 函数长度分组 | 短(≤10行), 中(11–30行), 长(>30行) |
| 评估模型 | CodeGemma-7B-IT, Gemma-2-9B-IT, Qwen2.5-Coder-7B-Instruct, DeepSeek-Coder-6.7B-Instruct |
每个条目对应一个代码样本,标注有一个模型生成的特定自然语言摘要,并包含模型和编程语言的元数据注释。
数据模式
| 字段 | 类型 | 描述 |
|---|---|---|
id |
string | 代码样本的唯一标识符 |
programming_language |
string | 代码片段的编程语言 |
length_bucket |
string | 分类的代码长度(short, medium, long) |
code |
string | 源代码片段 |
docstring |
string | 可选包含的文档字符串 |
model |
string | 生成摘要的模型 |
summary_chinese … summary_hindi |
string | 指定自然语言的模型摘要 |
引用
如果使用CodeClarity-Bench,请引用:
@misc{madhurima2025codeclarity, title={CodeClarity: A Framework and Benchmark for Evaluating Multilingual Code Summarization}, author={Madhurima Chakraborty, Drishti Sharma, Maryam Sikander and Eman Nisar}, journal={arXiv preprint arXiv:XXXX.XXXXX}, year={2025} }




