SciReplicate-Bench
收藏资源简介:
SciReplicate-Bench是一个专为评估大型语言模型在从学术文章中生成代码的能力而设计的基准数据集。该数据集由36篇顶级自然语言处理会议论文中的100个代码复现任务组成,涵盖了算法理解与代码实现两个关键步骤。数据集基于最新发表的论文和开源代码仓库构建,旨在评估语言模型在理解算法描述、实现细节以及处理代码依赖等方面的能力。
SciReplicate-Bench is a benchmark dataset specifically designed to evaluate the code generation capabilities of large language models when generating code from academic articles. This dataset consists of 100 code replication tasks extracted from 36 top-tier natural language processing conference papers, covering two critical steps: algorithm comprehension and code implementation. Built upon recently published academic papers and open-source code repositories, this benchmark aims to assess language models' abilities to understand algorithm descriptions, grasp implementation details, and handle code dependencies.

- 1SciReplicate-Bench: Benchmarking LLMs in Agent-driven Algorithmic Reproduction from Research Papers伦敦国王学院,艾伦·图灵研究所 · 2025年



