登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Evaluation data for LLM comparison, generated code and scripts for execution
Evaluation data for LLM comparison, generated code and scripts for execution
收藏
Figshare
2026-01-16 更新
2026-04-28 收录
代码生成评估
语言模型评测
数据链接:
https://figshare.com/articles/dataset/Evaluation_data_for_LLM_comparison_generated_code_and_scripts_for_execution/30428884
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
the evaluated data of the MBPP dataset across multiple LLMs
应用场景:
创建时间:
2026-01-16
相关数据集
nuprl/agnostics-codeforces-cots
编程竞赛题目
代码生成评估
--- dataset_info: features: - name: idx dtype: int64 - name: source_id dtype: string - name: prompt dtype: string - name: response dtype: string - name: problem_statement
Hugging Face
2026-03-13 更新
11
0
math-extraction-comp/OpenBuddy__openbuddy-qwen2.5llamaify-14b-v23.3-200k
语言模型评测
答案质量评估
这是一个包含问题、答案和相关评分的数据集,适用于机器学习模型训练。数据集包含训练集,可用于模型对问题回答的预测和评估。
Hugging Face
2025-01-25 更新
8
0
ioi-leaderboard/ioi-eval-sglang_open-r1_Qwen2.5-Coder-32B-Instruct-SFT-v03.00-step-000002296-prompt-mem-limit
代码生成评估
编程解决方案
该数据集包含了问题ID、子任务、提示信息、生成内容、代码、编程语言、解决方案数量、唯一标识符、模型参数以及元数据等字段。元数据中又包含了使用情况(如完成的token数、提示的token数、总token数和成本)、时间戳和停止原因。数据集分为训练集,共有2050个示例,大小为148242889字节。
Hugging Face
2025-03-11 更新
5
0
CoffeeGitta/difficulty-aime_1983-2024-generations
数学研究
语言模型评测
该数据集是一个针对AIME(美国数学邀请赛,1983-2024年)问题的LLM生成解决方案集合。它包含多个模型(如Qwen2.5-Math、DeepSeek-R1、GPT-OSS-20B等)在不同配置下生成的数学问题解答,覆盖训练、验证和测试分割。数据集中每个条目包括问题陈述、生成的解决方案列表(带分数和成本信息)、成功率、多数投票正确性等字段,旨在用于研究LLM的失败预测,即通过生成前的激活来预
Hugging Face
2026-05-25 更新
10
0
DCAgent2/swebench_verified_random_100_folders_exp_rpt_stack_rust_10k_glm_4_7_traces_jupic84bfdfe
代码生成评估
软件工程智能体
--- dataset_info: features: - name: conversations list: - name: content dtype: string - name: role dtype: string - name: agent dtype: string - name: model dtype
Hugging Face
2026-03-22 更新
6
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广