登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
OpenHands/Devin-SWE-bench-output
OpenHands/Devin-SWE-bench-output
收藏
Hugging Face
2024-03-21 更新
2025-04-12 收录
AI软件工程
代码生成评估
数据链接:
https://hf-mirror.com/datasets/OpenHands/Devin-SWE-bench-output
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: mit ---
应用场景:
提供机构:
OpenHands
相关数据集
HumanEval
软件工程
代码生成评估
HumanEval是由代尔夫特理工大学的研究团队创建的软件工程领域AI基准数据集。该数据集主要用于评估大型语言模型在代码生成任务上的性能,包含多个子任务,如代码修复和代码解释。尽管有多个版本尝试扩展语言支持或改善测试覆盖范围,但原始数据集中的错误和不足仍未得到彻底解决。该数据集在AI和软件工程社区中广受欢迎,但存在测试不正确、测试覆盖不足、解决方案错误和问题描述不明确等问题。
arXiv
2025-03-08 更新
489
0
SWE Bench Verified
AI软件工程
学生问题解决能力评估
Evaluates AI model's ability to solve real-world software issues
kaggle
2024-08-20 更新
12
0
DCAgent2/swebench_verified_random_100_folders_exp_rpt_stack_rust_10k_glm_4_7_traces_jupic84bfdfe
代码生成评估
软件工程智能体
--- dataset_info: features: - name: conversations list: - name: content dtype: string - name: role dtype: string - name: agent dtype: string - name: model dtype
Hugging Face
2026-03-22 更新
6
0
ioi-leaderboard/ioi-eval-openrouter_openai_o1
代码生成评估
多语言代码
该数据集包含了文本生成的相关信息,包括生成文本、代码、语言等信息。每个样本都有一些元数据,如时间戳、使用情况(包括完成令牌数、成本、提示令牌数和总令牌数)。数据集分为训练集,并提供了相关的字节数和示例数。数据集的总下载大小和存储大小也已给出。
Hugging Face
2025-03-03 更新
15
0
nuprl/agnostics-codeforces-cots
编程竞赛题目
代码生成评估
--- dataset_info: features: - name: idx dtype: int64 - name: source_id dtype: string - name: prompt dtype: string - name: response dtype: string - name: problem_statement
Hugging Face
2026-03-13 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广