遇见数据集

RohithMidigudla/gemma-health-telugu-sft-raw

收藏
Hugging Face2026-05-16 更新2026-05-31 收录
官方服务:

资源简介:

Gemma Health Telugu SFT 是一个用于文本生成任务的监督微调(SFT)数据集,专注于泰卢固语(te)的医疗领域。数据集包含训练集(287958行)和测试集(70002行),每行数据包括messages字段(采用TRL/Unsloth对话SFT格式)、text字段(作为纯文本序列化聊天回退)、以及追踪字段(如source、variant、prompt、response),用于数据来源和变体的可追溯性。该数据集旨在支持医疗相关的泰卢固语对话模型训练。

Gemma Health Telugu SFT is a supervised fine-tuning (SFT) dataset for text-generation tasks, focusing on the medical domain in Telugu (te). The dataset includes a training split (287,958 rows) and a test split (70,002 rows). Each row contains a messages field in TRL/Unsloth conversational SFT format, a text field as a plain serialized chat text fallback, and traceability fields such as source, variant, prompt, and response for data provenance and variant tracking. It is designed to support training conversational models for medical-related interactions in Telugu.

提供机构:
RohithMidigudla
二维码
社区交流群
二维码
科研交流群
商业服务