数据链接:
官方服务:
资源简介:
The official release for SurgBench Dataset
应用场景:
创建时间:
2025-05-16
相关数据集
Agent安全评估数据集
Agent Security Bench (ASB) 是一个面向LLM代理安全性的综合性基准框架,涵盖电子商务、自动驾驶、金融等10个场景,涉及10类代理、400余种工具与任务,集成23种攻击/防御方法及7项评估指标。数据集系统评估代理在多场景下的安全脆弱性与防御效能,支撑对提示注入、越权访问等典型攻击的测试。其主要应用于LLM代理的安全性基准评测,助力研发更鲁棒、可靠的智能代理系统。
库帕思2025-12-22 更新150
4DHydro Benchmark Dataset wflow_sbm - Tugela
This dataset is developed for the 4DHydro project (https://4dhydro.eu/) working package 2. The 4DHydro working package 2 is dedicated to provided a set of land-surface and hydrological model community
DataCite Commons2023-10-23 更新80
RL Unplugged
RL Unplugged是由DeepMind创建的一套用于离线强化学习方法评估的基准套件。该数据集涵盖了从Atari游戏到模拟运动控制问题等多个领域的数据,包括部分或完全可观察的领域、连续或离散的动作空间以及随机与确定性的动态。数据集旨在通过详细的评估协议,促进离线RL方法的研究和比较,提高实验的可重复性,并使RL研究对更广泛的社区更加系统和可访问。
arXiv2021-02-13 更新220
open-llm-leaderboard/details_chlee10__T3Q-Platypus-Mistral7B
该数据集是在评估模型chlee10/T3Q-Platypus-Mistral7B时自动生成的,包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,用于计算和展示在Open LLM Leaderboard上的聚合指标。
Hugging Face2024-03-12 更新90



