相关数据集
HiTZ/alpaca_mt
--- annotations_creators: - no-annotation language: - en - pt - es - ca - eu - gl - at language_creators: - machine-generated license: cc-by-nc-4.0 multilinguality: - multilingual - translation pretty
Hugging Face2023-04-07 更新570
HiTZ/bbq
BBQ数据集是一个用于评估英语问答任务中语言模型社会偏见的基准数据集。它包含针对9个人口统计学维度的社会偏见测试问题,每个问题都有模糊和去模糊两种版本。这些维度包括年龄、残疾状况、性别认同、国籍、外貌、种族和民族、宗教、社会经济状况和性取向。数据集分为测试集和训练集,其中测试集是主要的评估数据,训练集包含用于少量样本学习的4个示例(如果可用)。
Hugging Face2025-05-30 更新190
HiTZ/composite_corpus_es_v1.0
这是一个由多个公开西班牙语数据集组成的复合数据集,包括Common Voice、OpenSLR、Multilingual Librispeech、VoxPopuli和Basque Parliament的数据。数据集分为训练集、测试集和验证集,每个集合都经过清理和平衡处理,以用于不同的开发任务。
Hugging Face2025-05-12 更新220
HiTZ/Magpie-Llama-3-70B-Instruct-Filtered
该数据集是通过使用meta-llama/Meta-Llama-3-70B-Instruct模型和MAGPIE代码库生成的。数据集包含多个特征,如对话ID、指令、响应、对话内容、生成模式、生成输入配置、意图、知识、难度、输入质量、质量解释、任务类别等。数据集分为训练集,包含1813186个样本,总大小为9114499669.151295字节。数据集的语言为英语,标签为合成数据。此外,还提供了过滤标准
Hugging Face2024-11-21 更新170



