sinhala-sft-dataset
收藏资源简介:
Sinhala监督微调数据集是一个合并了三个现有Sinhala指令数据集的统一资源,用于Sinhala语言模型的监督微调(SFT)。该数据集遵循标准的Alpaca风格指令-输入-输出格式,涵盖问答、摘要和一般指令跟随等多种任务。数据集包含213,703对样本,其中203,000个用于训练,以Parquet格式存储,大小为167 MB,语言为Sinhala(`si`)。数据集结构包括`instruction`(指令)、`input`(输入)、`output`(输出)和`source`(来源数据集标识)四个字段。适用于Sinhala LLMs的监督微调、Sinhala指令跟随研究以及低资源多语言SFT基准测试。
The Sinhala Supervised Fine-tuning Dataset is a unified resource integrating three existing Sinhala instruction datasets, intended for supervised fine-tuning (SFT) of Sinhala language models. This dataset follows the standard Alpaca-style instruction-input-output format, covering diverse tasks including question answering, summarization, and general instruction following. It contains 213,703 sample pairs, with 203,000 of them allocated for training. The dataset is stored in Parquet format with a size of 167 MB, and the language is Sinhala (`si`). The dataset structure consists of four fields: `instruction`, `input`, `output`, and `source` (source dataset identifier). This resource is applicable for supervised fine-tuning of Sinhala LLMs, research on Sinhala instruction following, and low-resource multilingual SFT benchmarking.
Sinhala Supervised Fine-Tuning 数据集概述
基本信息
- 数据集名称:Sinhala SFT Dataset
- 语言:僧伽罗语 (si)
- 许可证:cc-by-sa-3.0
- 任务类别:文本生成、问答
- 数据规模:100K<n<1M
- 标签:sinhala, low-resource, instruction-tuning, sft, alpaca, dolly
数据集描述
这是一个用于监督微调(SFT)的僧伽罗语指令遵循数据集,包含213,703个指令-输出对。该数据集是为一项以多样性驱动的僧伽罗语语言模型适应研究而构建的,用于对持续预训练的LLaMA 3.2 1B模型变体进行监督微调。
数据集构成
该数据集合并了三个现有的僧伽罗语指令数据集,形成一个统一的SFT资源。它遵循标准的Alpaca风格的指令-输入-输出格式,涵盖了一系列任务,包括问答、摘要和通用指令遵循。
源数据集
来源 (source列中的值) |
原始数据集 |
|---|---|
ihalage_alpaca |
ihalage/sinhala-instruction-finetune-large |
dolly_sinhala |
Suchinthana/databricks-dolly-15k-sinhala |
alpaca_sinhala |
sahanruwantha/alpaca-sinhala |
数据结构
| 列名 | 类型 | 描述 |
|---|---|---|
instruction |
string | 提供给模型的指令 |
input |
string | 指令的可选上下文或输入 |
output |
string | 期望的响应 |
source |
string | 源数据集标识符 (3个值) |
数据划分
| 划分 | 行数 |
|---|---|
| train | 203,000 |
| 总计 | 213,703 |
数据集统计
| 指标 | 值 |
|---|---|
| 总行数 | 213,703 |
| 格式 | Parquet |
| 大小 | 167 MB |
| 语言 | 僧伽罗语 (si) |
| 来源数量 | 3 |
预期用途
- 僧伽罗语大语言模型(LLMs)的监督微调(SFT)
- 僧伽罗语指令遵循研究
- 低资源多语言SFT基准测试
训练详情
该数据集被用于微调三个LLaMA 3.2 1B模型变体(这三个模型在不同的僧伽罗语语料库上进行了持续预训练)。
相关仓库
| 仓库 | 描述 |
|---|---|
Minuri/sinhala-corpus-a-news-1m |
预训练语料库A(仅新闻) |
Minuri/sinhala-corpus-b-random-1m |
预训练语料库B(随机) |
Minuri/sinhala-corpus-c-diverse-1m |
预训练语料库C(多样性优化) |




