官方服务:
资源简介:
(XLSX)
应用场景:
创建时间:
2023-02-15
相关数据集
Rami/prompts_eval
--- dataset_info: features: - name: prompt_generator dtype: string - name: chat_gpt_response dtype: float64 - name: instructions dtype: string - name: temperature dtype: floa
Hugging Face2023-06-18 更新110
bzantium/MMMLU
MMMLU是一个广泛认可的用于评估AI模型所获得通用知识的基准,包含57个不同类别的话题,从基础知识的水平到像法律、物理、历史和计算机科学这样的高级专业主题。该数据集将MMLU的测试集翻译成了14种语言,使用专业的人工翻译以保证翻译的准确性,特别适用于像约鲁巴语这样的低资源语言。这项工作体现了提高AI模型多语言能力的承诺,确保它们在不同语言中准确执行,尤其是对代表性不足的社区。通过优先考虑高质量的
Hugging Face2025-01-19 更新110
davidberenstein1957/ultra_feedback_dutch_cleaned_helm_instruct_geitje_ultra_vs_gpt4_turbo
--- dataset_info: features: - name: GEITje-7B-ultra dtype: string - name: TowerInstruct-13B-v0.1 dtype: string - name: TowerInstruct-7B-v0.2 dtype: string - name: geitje-7b-chat
Hugging Face2024-03-21 更新100
hkjeqrheqoi/TwinLlama-3.1-8B-results
--- dataset_info: features: - name: instruction dtype: string - name: output dtype: string - name: prompt dtype: string - name: answers dtype: string - name: evaluation
Hugging Face2025-12-11 更新110
Bezzo369/gdpval
GDPval数据集用于评估AI模型在现实世界中有经济价值任务上的性能。它包含220个现实世界知识任务,涵盖44种职业。每个任务由一个文本提示和一组支持性参考文件组成。数据集中包含敏感内容,如性、酒精、粗俗语言和政治内容,这些内容反映了不同职业中处理的真实主题。数据集还包括对第三方品牌和商标的引用,仅用于研究和评估目的。
Hugging Face2025-12-16 更新110



