gsd-teacher-Tagalog
收藏资源简介:
该数据集是一个对话生成数据集,包含4387个训练样本。每条数据记录包含以下字段:唯一标识符(id)、用于生成对话的种子提示(seed_prompt)、对话语言(language)、生成对话所使用的模型名称(model)、对话消息列表(messages)以及数据来源标识(source_id)。消息列表中的每条消息都包含发言者角色(role)和对话内容(content)。数据集总大小约为11.5MB,适用于对话系统训练、对话生成模型评估、多语言对话分析等自然语言处理任务。
This is a dialogue generation dataset containing 4,387 training samples. Each data record includes the following fields: unique identifier (id), seed prompt for dialogue generation (seed_prompt), dialogue language (language), model name used for dialogue generation (model), list of dialogue messages (messages), and data source identifier (source_id). Each message in the message list contains the speaker role (role) and dialogue content (content). The total size of the dataset is approximately 11.5 MB, and it is suitable for natural language processing tasks such as dialogue system training, dialogue generation model evaluation, and multilingual dialogue analysis.
- 数据集名称: GSD Teacher Tagalog
- 数据集地址: https://huggingface.co/datasets/ljvmiranda921/gsd-teacher-Tagalog
- 语言: 他加禄语(Tagalog)
- 任务类型: 对话生成与教学,基于种子提示(seed prompt)生成对话消息序列(messages),可用于教师-学生互动场景的微调或评估。
- 数据规模:
- 总数据集大小: 13,972,776 字节
- 下载大小: 11,637,162 字节
- 训练集样本数: 5,304 条
- 数据划分: 仅包含训练集(train)
- 数据特征:
id: 字符串类型,样本唯一标识符seed_prompt: 字符串类型,初始提示文本,用于触发对话生成language: 字符串类型,语言标注(他加禄语)model: 字符串类型,生成该对话所使用的模型名称messages: 消息列表,每条消息包含role(角色,如用户或助手)和content(对话内容),均为字符串source_id: 字符串类型,来源标识符
- 数据文件格式与配置:
- 配置名称:
default - 训练数据文件路径:
data/train-*(通配符匹配多个文件)
- 配置名称:




