Hatman/PlotPalette-10K
收藏资源简介:
Plot Palette是一个精选的数据集,旨在微调大型语言模型(LLMs)在创意写作任务上的表现。数据来源于各种文学资源,并使用了Mistral 8x7B语言模型生成。数据集中包含多个字段,如id、category、question、answer等,以及三个数据分割:train、test和validation。数据的主要生成来源是mistralai/Mixtral-8x7B-Instruct-v0.1,但也使用了其他模型如CohereForAI/c4ai-command-r-plus和meta-llama/Llama-2-70b-chat-hf。
Plot Palette是一个精选的数据集,旨在微调大型语言模型(LLMs)在创意写作任务上的表现。数据来源于各种文学资源,并使用了Mistral 8x7B语言模型生成。数据集中包含多个字段,如id、category、question、answer等,以及三个数据分割:train、test和validation。数据的主要生成来源是mistralai/Mixtral-8x7B-Instruct-v0.1,但也使用了其他模型如CohereForAI/c4ai-command-r-plus和meta-llama/Llama-2-70b-chat-hf。
Plot Palette 数据集概述
数据集基本信息
- 许可证: MIT
- 语言: 英语
- 名称: Plot Palette
- 大小类别: 1K<n<10K
- 创建者: Hatman
- 来源: 各种创意写作资源
数据集配置
- 配置名称: default
- 特征:
id: 字符串类型,每个提示-响应对的唯一标识符。category: 字符串类型,提示-响应对所属的类别(例如,creative_writing, generation, poem, brainstorm, question_answer)。question: 字符串类型,向语言模型提出的提示或问题。answer: 字符串类型,语言模型生成的响应。question_1: 字符串类型,模型提出的可选跟进问题。answer_1: 字符串类型,模型生成的可选跟进响应。
数据分割
- 训练集: 6068个样本,14870611字节
- 测试集: 1300个样本,3128087字节
- 验证集: 1301个样本,3064666字节
数据文件
- 训练集文件: train.csv
- 测试集文件: test.csv
- 验证集文件: val.csv
- 分隔符: "|"
数据集描述
Plot Palette 是一个为创意写作任务微调大型语言模型(LLMs)而设计的精选数据集。数据来源于各种文学资源,并使用 Mistral 8x7B 语言模型生成。
数据字段
id: 每个提示-响应对的唯一标识符。category: 提示-响应对所属的类别(例如,creative_writing, generation, poem, brainstorm, question_answer)。question: 向语言模型提出的提示或问题。answer: 语言模型生成的响应。question_1: 模型提出的可选跟进问题。answer_1: 模型生成的可选跟进响应。
数据分割
Plot Palette 包含三个分割:训练集、测试集和验证集。每个问题/答案对都是唯一的,不会在不同类别中重复。
| 数据集分割 | 样本数量 |
|---|---|
| 训练集 | 6,068 |
| 测试集 | 1,301 |
| 验证集 | 1,300 |
源数据
源数据主要由 mistralai/Mixtral-8x7B-Instruct-v0.1 生成,但在该模型不可用时,也会使用 CohereForAI/c4ai-command-r-plus 和 meta-llama/Llama-2-70b-chat-hf。




