Multi-SWE-bench_trajs
收藏资源简介:
该数据集包含了在Multi-SWE-bench排行榜上评估的代理生成的所有轨迹和日志。这些轨迹和日志用于多语言问题解决任务的基准测试。
This dataset contains all trajectories and logs generated by agents evaluated on the Multi-SWE-bench leaderboard. These trajectories and logs are utilized as benchmarks for multilingual problem-solving tasks.
Multi-SWE-bench Trajectories 数据集概述
基本信息
- 许可证: other
- 任务类别: 文本生成(text-generation)
- 标签: 代码(code)
数据集描述
- 该数据集存储了在Multi-SWE-bench排行榜上评估的代理生成的所有轨迹和日志。
引用信息
bibtex @misc{zan2025multiswebench, title={Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving}, author={Daoguang Zan and Zhirong Huang and Wei Liu and Hanwu Chen and Linhao Zhang and Shulin Xin and Lu Chen and Qi Liu and Xiaojian Zhong and Aoyan Li and Siyao Liu and Yongsheng Xiao and Liangqiang Chen and Yuyu Zhang and Jing Su and Tianyu Liu and Rui Long and Kai Shen and Liang Xiang}, year={2025}, eprint={2504.02605}, archivePrefix={arXiv}, primaryClass={cs.SE}, url={https://arxiv.org/abs/2504.02605}, }




