相关数据集
LEM-benchmarks
LEM Benchmarks 是一个用于多模型架构的 LEK-1(Lethean Ethics Kernel)A/B 测试数据集,旨在证明伦理对齐可以通过权重训练或提示签名解锁。数据集包含多个配置,如 Gemma3-27B 和 GPT-OSS-20B 模型的基准与签名响应对比,以及标准基准测试(GSM8K、TruthfulQA、DoNotAnswer、ToxiGen)。数据集展示了不同架构下的伦理
Hugging Face2026-02-13 更新550
aigrant/awesome-taiwan-knowledge
ATK数据集是一个包含台湾相关知识的问题和答案的全面集合,用于评估人工智能模型对台湾特定信息的理解能力。它包括历史、文化、政治、教育和时事等主题,并具有选择题和对话式问题等多种格式。所有答案均由台湾教育工作者和学科专家仔细审核,并提供详细的解释。该数据集不断更新,以反映当前事件和文化的变化。
Hugging Face2025-01-22 更新130
Comprehensive benchmark and architectural analysis of deep learning models for Nanopore sequencing basecalling
Lambda phage nanopore sequenced (R9.4.1) data for the purpose of benchmarking and analysis of neural network architectures in basecalling.
NIAID Data Ecosystem60
open-llm-leaderboard/details_OptimalScale__robin-7b-v2-delta
该数据集是在Open LLM Leaderboard上对模型OptimalScale/robin-7b-v2-delta进行评估时自动创建的。数据集包含61个配置,每个配置对应一个评估任务。数据集由1次运行创建,每次运行可以在每个配置的特定分割中找到,分割以运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,并用于计算和显示Open
Hugging Face2023-08-27 更新140
scArchon: a scalable benchmarking framework for assessing single-cell perturbation models
Pre-print: https://www.biorxiv.org/content/10.1101/2025.06.23.661046v1 GitHub: https://github.com/hdsu-bioquant/scArchon Here, you will find the datasets used in the scArchon work. scArchon is a m
Zenodo2026-05-04 更新80



