登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Failure incidence in language model agents 2025
Failure incidence in language model agents 2025
收藏
Statista
2026-04-11 收录
语言模型智能体评估
智能体失败率分析
数据链接:
https://www.statista.com/statistics/1612843/language-model-failure-rate/
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Performance gaps among language models (LM) agents in 2025, by failure incidence
应用场景:
相关数据集
PRM-agent-rl-artifacts
强化学习训练轨迹
语言模型智能体评估
该数据集包含了多个强化学习智能体训练过程中的rollouts(轨迹)和评估输出。具体包括:基于Search-R1 / Qwen3-8B模型使用outcome-GRPO和Process-GRPO(per-turn-norm)方法的训练rollouts;基于ALFWorld和WebShop任务,使用Qwen3-8B和OLMo3-7B模型在不同强化学习算法(GiGPO、outcome-GRPO、Proc
Hugging Face
2026-08-13 更新
1
0
Harbor-Index
语言模型智能体评估
高难度基准测试
Harbor-Index是由Harbor项目团队精心策划的元数据集,专为大规模语言模型智能体评估设计,旨在提供经济高效的挑战性基准。该数据集从80余个适配基准测试中,经难度过滤、AI与人工审计及修复循环,精选出82个高难度、多样化的任务,覆盖软件工程、数学推理、科学研究和工具使用等29个领域。创建过程强调任务质量的严格把控,确保失败反映模型局限而非任务缺陷。当前最强模型配置通过率仅28%,避免了快
arXiv
2026-09-09 更新
1
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广