相关数据集
philschmid/flanv2
这是Flan V2数据集的一个处理版本。Flan V2数据集包含了Flan 2021、P3、Super-Natural Instructions、Chain-of-thought和Dialog等多种任务的数据实例。数据字段包括Few Shot、Zero Shot、Options Provided in context和No Options Provided等格式,每种任务和格式的组合都保存为JSO
Hugging Face2023-02-22 更新1430
philschmid/easyrag-mini-wikipedia
EasyRag评估数据集用于评估RAG(Retrieval-Augmented Generation)管道。该数据集包含约900个来自Wikipedia文章的问题和真实答案。此外,数据集还包含一个用于检索的文档配置。用户可以通过索引文档并使用问题和真实答案来评估其RAG管道的性能。该数据集基于Kaggle上的Question-Answer Dataset进行了修改,并遵循CC BY-SA 3.0许
Hugging Face2024-03-08 更新220
philschmid/zephyr-7b-beta-eval-dolly-15k
--- dataset_info: features: - name: input dtype: string - name: ref_completion dtype: string - name: generations dtype: string splits: - name: train num_bytes: 166673 n
Hugging Face2024-01-12 更新100
philschmid/slimorca-dedup-chatml-100k
SlimOrca Dedup是一个去重且未经过滤的SlimOrca数据集子集,排除了RLHF实例,包含363k个独特示例。该数据集的关键特性包括移除RLHF实例和使用minhash和Jaccard相似性技术进行去重。数据集采用基本的sharegpt格式,包含系统、人类和GPT三种消息角色,分别用于提供指令、提出查询和生成响应。
Hugging Face2024-02-29 更新270
philschmid/emotion
Emotion数据集是一个包含英文Twitter消息的数据集,标注了六种基本情绪:愤怒、恐惧、快乐、爱、悲伤和惊讶。数据集分为两种配置:split和unsplit,分别包含20,000和416,809个样本。数据集主要用于文本分类任务,特别是多类分类任务。
Hugging Face2023-01-20 更新220



