官方服务:
资源简介:
The data and code for the paper .
应用场景:
创建时间:
2024-05-15
相关数据集
LongJudgeBench
LongJudgeBench是由清华大学和北京科技大学联合创建的长文本输出评估基准,旨在系统评估大语言模型作为裁判在长文本生成任务中的可靠性。该数据集包含1944个实例,涵盖深度研究、科学综述、创意写作、长链分析和系统综述五大现实场景,平均输出长度达9249.7个token,数据来源于六个异构数据集并经过专家标注规范化处理。数据集通过整合多语言文档和多样化评估协议,模拟真实世界文档级评估需求,其核
arXiv2026-06-01 更新230
AUEB-NLP/greek-bar-bench
GreekBarBench 是一个用于评估大型语言模型(LLM)在五个不同法律领域内进行复杂法律推理能力的基准数据集。该数据集由希腊律师资格考试(2015-2024年)中的法律问题组成,要求模型在开放书籍格式下,结合案件事实、法律问题以及相关法律条文进行推理,并提供包含明确引用的案件事实和法律条文的自由文本答案。数据集旨在评估复杂的法律推理能力,包括多跳推理和法律条文的准确应用。
Hugging Face2025-06-06 更新130
smalleval/mmlu-nano
# SmallEval: Browser-Friendly LLM Evaluation Datasets 🚀 [](https://cloudcode.ai) SmallEval is a curated
Hugging Face2025-01-20 更新90
CRMArenaPro
# Dataset Card for CRMArena-Pro - [Dataset Description](https://huggingface.co/datasets/Salesforce/CRMArenaPro/blob/main/README.md#dataset-description) - [Paper Information](https://huggingface.co/
魔搭社区2026-04-28 更新220
OMNIX_Benchmarks_Latest
OMNIX Benchmarks 是一个用于评估和基准测试大型语言模型性能的数据集。它旨在通过一套标准化的指标对模型进行综合比较,涵盖格式遵循、逻辑推理、知识回忆、约束遵循、成功率(首次通过和最终)以及推理延迟等多个关键维度。该数据集支持文本生成和问答任务类别,并提供了对多个流行模型(如 Qwen、Gemma、Llama 等系列的不同版本)在上述维度上的量化评分和排名分析,帮助研究人员和开发者了解
Hugging Face2026-07-07 更新100



