官方服务:
资源简介:
The source data of paper UQABench
UQABench论文的源数据
应用场景:
创建时间:
2025-02-22
相关数据集
GSLB
GSLB是由中国科学院自动化研究所开发的综合性图结构学习基准,包含16种先进的图结构学习算法和20个多样的图数据集,覆盖了同质节点级、异质节点级和图级任务。该数据集旨在通过三个维度:有效性、鲁棒性和复杂性,系统地研究图结构学习的特性。GSLB不仅为图结构学习领域提供了标准化的实验设置,还通过广泛的实验揭示了图结构学习在异质性、鲁棒性等方面的潜在优势,为未来的研究提供了深入的见解和机会。
arXiv2023-10-08 更新260
karakuri-ai/OSWorld-JP-task-resources
This repository provides resource files used in [OSWorld-JP](https://github.com/karakuri-ai/OSWorld-JP), a computer-using agent benchmark.
Hugging Face2025-12-14 更新130
The Artifacts for Program Feature-based Benchmarking for Fuzz Testing
This artifact contains the FeatureBench, code, and data for the paper titled "Program Feature-based Benchmarking for Fuzz Testing". The FeatureBench directory contains the benchmark programs generate
Zenodo2025-04-12 更新00
Agent安全评估数据集
Agent Security Bench (ASB) 是一个面向LLM代理安全性的综合性基准框架,涵盖电子商务、自动驾驶、金融等10个场景,涉及10类代理、400余种工具与任务,集成23种攻击/防御方法及7项评估指标。数据集系统评估代理在多场景下的安全脆弱性与防御效能,支撑对提示注入、越权访问等典型攻击的测试。其主要应用于LLM代理的安全性基准评测,助力研发更鲁棒、可靠的智能代理系统。
库帕思2025-12-22 更新150
open-llm-leaderboard/details_chlee10__T3Q-Platypus-Mistral7B
该数据集是在评估模型chlee10/T3Q-Platypus-Mistral7B时自动生成的,包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,用于计算和展示在Open LLM Leaderboard上的聚合指标。
Hugging Face2024-03-12 更新90



