hausa_response_gemma
收藏资源简介:
该数据集是一个对话式数据集,包含多个检查点配置,每个配置对应模型训练过程中的不同阶段。数据集包含四个字段:user(用户输入文本)、response(模型响应文本)、type(类型标签,分为completion和translation两类)、system(系统提示文本)。每个配置下设有两个分割:completion和translation,各包含30个样本。该数据集可能用于训练和评估语言模型在对话补全和翻译任务上的表现。
This dataset is a conversational dataset containing multiple checkpoint configurations, each corresponding to different stages of the model training process. The dataset includes four fields: user (user input text), response (model response text), type (type label, divided into completion and translation categories), and system (system prompt text). Each configuration has two splits: completion and translation, each containing 30 samples. This dataset may be used for training and evaluating language models on dialogue completion and translation tasks.
数据集详情总结
数据集概述
- 名称:hausa_response_gemma
- 来源:Hugging Face 数据集平台(https://huggingface.co/datasets/vaghawan/hausa_response_gemma)
- 语言:豪萨语(Hausa)
数据集结构
该数据集包含多个配置(config),每个配置对应一个训练检查点(checkpoint),均为模型不同训练阶段的输出数据。
数据字段(Features)
每个配置包含以下4个字段:
- user(字符串):用户输入的豪萨语文本
- response(字符串):模型生成的回应文本
- type(分类标签):数据类别,包含两种类型:
completion(完成)translation(翻译)
- system(字符串):系统提示或上下文信息
数据划分(Splits)
每个配置包含两个划分,均为豪萨语:
- completion:完成类任务数据
- translation:翻译类任务数据
数据规模
- 总配置数:45 个检查点(checkpoint-100 至 checkpoint-4639,含部分中间检查点)
- 每个划分的样本量:每个配置中
completion和translation各含 30 个样本(共60个样本/配置) - 数据集大小:单个配置的大小范围约为 18KB 至 32KB(数据集大小),下载大小约 11KB 至 15KB
数据特点
- 该数据集为微调模型(Gemma)在豪萨语上的响应生成和翻译任务输出
- 每个检查点代表模型不同训练步数的生成结果,可用于分析模型训练过程中的性能变化
- 数据规模较小,适合用于评估模型性能或作为示例数据集使用




