gsd-teacher-Czech
收藏资源简介:
该数据集包含2961个训练样本,总大小约8.5MB,每个样本包括唯一标识符(id)、种子提示(seed_prompt)、语言(language)、模型(model)、消息列表(messages)和源标识符(source_id)。消息列表由角色(role)和内容(content)组成,表明数据集可能用于对话生成、提示工程或语言模型相关任务,但具体背景、目的和应用场景未在README中明确说明。
This dataset contains 2961 training samples with a total size of approximately 8.5MB. Each sample includes the following fields: unique identifier (id), seed prompt (seed_prompt), language (language), model (model), message list (messages), and source identifier (source_id). The message list consists of role and content, suggesting that the dataset may be used for dialogue generation, prompt engineering, or language model-related tasks, but the specific background, purpose, and application scenarios are not clearly stated in the README.
数据集详情:GSD Teacher Czech
基本信息
- 数据集名称:gsd-teacher-Czech
- 许可证:未明确标注
- 语言:捷克语
- 数据规模:
- 训练集(train):3,593 个样本
- 数据大小:约 10.19 MB
- 下载大小:约 8.66 MB
数据特征
该数据集包含以下字段:
| 字段名 | 数据类型 | 描述 |
|---|---|---|
id |
字符串 | 样本唯一标识符 |
seed_prompt |
字符串 | 初始提示内容 |
language |
字符串 | 语言标识(捷克语) |
model |
字符串 | 生成该数据所使用的模型 |
messages |
列表(包含role和content两个字符串字段) |
对话消息序列,包括角色和内容 |
source_id |
字符串 | 来源标识符 |
数据用途
- 该数据集包含捷克语的对话数据,每条记录包含一个初始提示(seed_prompt)、对应的多轮消息对话(messages)以及生成该数据的模型信息。
- 适合用于训练或评估捷克语对话系统、指令微调模型或进行多语言 NLP 研究。
数据来源
- 数据集页面地址:https://huggingface.co/datasets/ljvmiranda921/gsd-teacher-Czech
- 数据文件路径:
data/train-*





