SwiftEval
收藏资源简介:
SwiftEval是一个专门针对Swift编程语言的基准测试数据集,包含28个精心设计的编程问题。它旨在评估大型语言模型在Swift代码生成方面的能力,填补了现有以Python为中心的基准测试在Swift语言评估方面的不足。SwiftEval的创建是为了确保多语言代码生成模型的质量,它关注于Swift语言特有的静态类型、协议、泛型、枚举、闭包等特性。通过这个数据集,研究人员可以更准确地评估模型在不同编程语言上的性能,并为未来模型的发展提供指导。
SwiftEval is a benchmark dataset specifically tailored for the Swift programming language, which includes 28 carefully curated programming problems. Its primary goal is to evaluate the code generation capabilities of large language models (LLMs) for Swift, filling the critical gap in existing Python-centric benchmark datasets for Swift language assessment. Developed to ensure the quality of multilingual code generation models, SwiftEval focuses on Swift-unique language features such as static typing, protocols, generics, enumerations, closures and other distinctive characteristics. With this dataset, researchers can more accurately evaluate the performance of models across diverse programming languages and provide valuable guidance for the future advancement of code generation models.
数据集概述
基本信息
- 标题: Experiment data for the SwiftEval benchmark
- DOI: 10.5281/zenodo.14445601
- 发布日期: 2024年12月13日
- 版本: v1
- 资源类型: Dataset
- 出版商: Zenodo
- 许可证: Creative Commons Attribution 4.0 International
创建者
- Petrukha, Ivan (Researcher)
- Kurliak, Yana (Researcher)
- Stulova, Nataliia (Researcher)
- 所属机构: MacPaw
描述
该数据集包含28个手工制作的SwiftEval基准测试问题以及44个使用不同LLM运行的实验结果。数据集结构如下:
problems.json: 包含28个问题experiments文件夹: 包含44个实验数据{experiment_name}completions.jsonl: 包含原始LLM文本生成evaluations.jsonl: 包含提取的代码和评估结果metadata.jsonl: 包含LLM模型检查点和生成参数
文件信息
- 文件名: swifteval-paper-data.zip
- 大小: 2.3 MB
- MD5校验值: a7e1719e30df45effc598e884c8dbfe3
统计信息
- 总浏览量: 64
- 总下载量: 9
- 总数据量: 20.5 MB
引用格式
Petrukha, I., Kurliak, Y., & Stulova, N. (2024). Experiment data for the SwiftEval benchmark [Data set]. Zenodo. https://doi.org/10.5281/zenodo.14445601
外部资源
- 索引于: OpenAIRE

- 1SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code EvaluationMacPaw Kyiv, Ukraine · 2025年



