gsd-teacher-Spanish
收藏资源简介:
该数据集是一个用于语言模型训练或评估的对话式文本数据集,包含4001个样本。每个样本包括以下字段:id(唯一标识符)、seed_prompt(种子提示,用于生成对话的初始输入)、language(指示对话所使用的语言)、model(生成对话的模型名称)、messages(一个消息列表,每条消息包含role(如用户或助手)和content(文本内容)字段)以及source_id(来源标识,可能用于追踪数据出处)。数据集仅提供训练分割,总大小约为11.4 MB,适用于自然语言处理任务,如对话生成、模型微调或语言理解评估。
This dataset is a conversational text dataset for language model training or evaluation. It contains 4001 samples, each consisting of the following fields: id (unique identifier), seed_prompt (seed prompt used as initial input for generating conversations), language (indicating the language used in the conversation), model (name of the model that generated the conversation), messages (a list of messages, each with role (e.g., user or assistant) and content (text content) fields), and source_id (source identifier, possibly for tracking data origin). The dataset only provides a training split, with a total size of approximately 11.4 MB. It is suitable for natural language processing tasks such as dialogue generation, model fine-tuning, or language understanding evaluation.
数据集概述
- 数据集名称:gsd-teacher-Spanish
- 数据集来源:Hugging Face Datasets,地址为 https://huggingface.co/datasets/ljvmiranda921/gsd-teacher-Spanish
- 语言:西班牙语(由特征中的
language字段标识)
数据集结构与内容
该数据集包含 4001 个训练样本,用于训练或评估西班牙语教师相关的对话模型。
特征字段
| 字段名 | 类型 | 描述 |
|---|---|---|
id |
string | 样本唯一标识符 |
seed_prompt |
string | 初始提示或种子文本 |
language |
string | 语言标识(西班牙语) |
model |
string | 生成该样本所使用的模型标识 |
messages |
list of objects | 对话消息列表,每条消息包含 role 和 content |
source_id |
string | 源数据标识 |
对话消息结构
每个 messages 字段是一个列表,其中每个元素包含:
role(string):消息角色(如系统、用户、助手等)content(string):消息内容
数据划分
| 划分 | 样本数 | 字节数 |
|---|---|---|
train |
4001 | 11,386,255 字节(约 10.9 MB) |
- 下载大小:9,810,750 字节(约 9.4 MB)
- 数据集总大小:11,386,255 字节(约 10.9 MB)
数据文件
- 默认配置:
default - 训练数据路径:
data/train-*(所有匹配该模式的文件)
适用场景
该数据集可用于训练或微调西班牙语的对话式教学助手,特别是在教师角色设定下的对话生成任务。




