Awesome-LLM-Eval
收藏资源简介:
Awesome-LLM-Eval是一个精选的资源列表,主要收录和整理用于大型语言模型评估的数据集和基准,涵盖通用领域、特定领域、RAG评估、代理能力、编码能力、多模态/跨模态、长上下文、推理速度、量化和压缩等多个主题。该合集旨在为生成式AI的评估提供全面的数据集索引和推荐。
Awesome-LLM-Eval is a curated collection of resources dedicated to collecting and organizing datasets and benchmarks for large language model (LLM) evaluation, spanning a diverse range of topics including general domain, specialized domain, RAG evaluation, agent capabilities, coding capabilities, multimodal/cross-modal tasks, long-context scenarios, inference speed, quantization and compression. This collection aims to provide comprehensive dataset indexing and recommendations for the evaluation of generative AI.
数据集详情总结:Awesome-LLM-Eval
该项目是一个精选的资源列表,专注于大语言模型(LLM)的评估,旨在探索生成式AI的边界与限制。它同时是论文 Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap 的官方项目。
核心内容概览
- 资源类型:工具、数据集/基准测试、演示、排行榜、论文、文档与模型。
- 主要分类:
- 工具 (Tools):如 lighteval。
- 数据集/基准测试 (Datasets / Benchmark):按领域和功能细分。
- 通用 (General):MMLU-Pro、AlpacaEval、AGIEval、BigBench、HellaSwag、SuperGLUE 等。
- 领域 (Domain):医疗 (Medbench, PsyEval)、金融 (FinEval)、代码 (CRUXEval, DebugBench) 等。
- RAG 评估 (RAG-Evaluation):包含相关基准。
- 智能体能力 (Agent-Capabilities):包含 SuperCLUE-Agent。
- 编码能力 (Coding-Capabilities):包含 CRUXEval、DebugBench。
- 多模态/跨模态 (Multimodal/Cross-modal):包含相关基准。
- 长上下文 (Long-Context):LV-Eval、BAMBOO。
- 推理速度 (Inference-Speed):包含相关基准。
- 量化与压缩 (Quantization-and-Compression):包含相关基准。
- 拟人化分类 (Anthropomorphic-Taxonomy):采用IQ和PQ框架对评估基准进行分类。
- 典型 IQ (通用智能) 基准:
- 知识:MMLU-Pro、FreshQA、Natural Questions。
- 推理:BigBench Hard、MuSR、PlanBench、PIQA、ARC。
- 数学:MATH、GSM8K、MathBench、AIME、FrontierMath。
- 语言:GLUE、SuperGLUE、BoolQ、DROP、Winogrande。
- 事实性与不确定性:FELM、LLM-Uncertainty-Bench。
- 动态与透明度:DyVal、PertEval、FMTI。
- 典型 PQ (专业能力) 基准:
- 医疗:Medbench、GenMedicalEval、PsyEval、Seismometer。
- 金融:FinEval、Fin-Eva、BLURB。
- 典型 IQ (通用智能) 基准:
- 排行榜 (Leaderboards):包含相关链接。
- 模型列表 (LLM-List):按预训练、指令微调、对齐、开放和流行分类。
- 其他资源:LLMOps、训练框架、课程等。
关键技术特性
- 即时更新:由于 arXiv 论文无法实时更新,本仓库作为最新的更新来源。
- 社区贡献:欢迎提交 Pull Request 或 Issues,贡献者将被致谢。
- 关联论文:Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap (arXiv:2508.18646)。
数据来源与使用
- 许可:遵循 Awesome 相关许可。
- 引用:如需引用,请使用提供的 BibTeX 格式。




