CoCoNUT
收藏资源简介:
CoCoNUT数据集用于研究大型语言模型在理解结构化代码执行方面的能力。该数据集包含从Java和Python程序中生成的执行轨迹,涵盖了高级代码概念如面向对象编程、并发和递归。数据集还包含了用于生成这些轨迹的脚本和代码。
The CoCoNUT dataset is developed to investigate the capabilities of large language models in comprehending structured code execution. It includes execution traces generated from Java and Python programs, covering advanced code concepts such as object-oriented programming, concurrency and recursion. Additionally, the dataset provides the scripts and source code used to generate these execution traces.
CoCoNUT: 结构化代码理解数据集
数据集描述
CoCoNUT 数据集旨在研究大型语言模型在结构化代码执行理解方面的能力。该任务涉及重现给定函数或一组函数在特定输入参数集上执行的代码行。此任务具有挑战性,因为它需要考虑多个因素,如回忆相关参数值、评估表达式、解析方法调用以及跟踪堆叠执行。
数据集包含用于生成和引出 Java 和 Python 程序跟踪的不同脚本。跟踪数据集也在 HuggingFace 上共享。
数据集结构
- Dataset:包含按功能分类的短程序,以及大部分跟踪和生成它们的代码。
- Results:包含不同模型生成的跟踪,分为 HumanEval 和复杂(例如高级概念)。
- Models:包含不同语言模型的具体配置文件以供本地运行。
- Visualizations:包含各种发现的基本可视化。
性能指标
性能指标分为两种评估设置:COT(Chain-of-Thought 推理)和直接提示。
COT 评估
- Acc Hard (%):所有测试完全正确跟踪的准确率。
- Acc Mean (%):所有示例的所有测试的平均准确率。
- Sim:预测和真实跟踪之间的平均相似度分数。
- False Sim:仅基于错误预测的相似度分数。
任务性能(高级概念)
- 面向对象:40 个程序,200 个跟踪。
- 递归:66 个程序,330 个跟踪。
- 并发:20 个程序,100 个跟踪。
引用
bibtex @misc{beger2025coconutstructuralcodeunderstanding, title={CoCoNUT: Structural Code Understanding does not fall out of a tree}, author={Claas Beger and Saikat Dutta}, year={2025}, eprint={2501.16456}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2501.16456}, }




