遇见数据集

saraiki-dpo-sft-dataset

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集是一个用于偏好学习(如直接偏好优化 DPO)的对话数据集。数据集包含三个主要字段:prompt(提示)、chosen(被选中的答复)和 rejected(被拒绝的答复)。每个字段由多个对话轮次组成,每个轮次包含角色(role)和内容(content)两部分。数据集仅包含一个训练分割,共 42 个样本,总大小约 50KB。许可证为 CC BY-NC 4.0,适用于非商业用途。

This dataset is a conversation dataset for preference learning (e.g., Direct Preference Optimization, DPO). It contains three main fields: prompt, chosen, and rejected. Each field consists of multiple dialogue turns, each turn containing a role and content. The dataset has only one training split, with 42 samples in total, approximately 50KB in size. It is licensed under CC BY-NC 4.0 for non-commercial use.

创建时间:
2026-08-17
原始信息汇总

Saraiki DPO/SFT 数据集

数据集概述

该数据集为 Saraiki 语言(巴基斯坦旁遮普省南部地区使用的一种语言)的对齐训练数据集,同时支持 DPO(直接偏好优化)与 SFT(监督微调)训练场景。

数据规模与划分

  • 训练集样本数:42 条
  • 训练集大小:约 50,835 字节(约 49.6 KB)
  • 数据集总下载大小:57,555 字节(约 56.2 KB)

数据特征结构

每条数据包含三个字段,每个字段均采用对话格式(包含角色与内容):

字段名 说明 子字段
prompt 提示输入(用户的指令或问题) role(角色)、content(内容)
chosen 偏好回答(DPO 中的正样本,SFT 中的目标输出) role(角色)、content(内容)
rejected 拒绝回答(DPO 中的负样本,仅用于 DPO 训练) role(角色)、content(内容)

配置文件与文件路径

  • 配置名称default
  • 数据文件:位于 data/train-* 路径下(实际文件在数据集仓库中)
  • 数据集划分:仅包含 train 一个划分

许可证

本数据集采用 CC BY-NC 4.0(知识共享-署名-非商业性使用 4.0 国际版)许可证,允许非商业性使用,需注明出处。

搜集汇总
数据集介绍
saraiki-dpo-sft-dataset 数据集图片
构建方式
本数据集名为saraiki-dpo-sft-dataset,专为萨莱基语(Saraiki)等低资源语言设计,集成了监督微调(SFT)与直接偏好优化(DPO)数据构建范式。数据以对话形式组织,每条样本包含提示词(prompt)、优选回答(chosen)与劣选回答(rejected)三部分,均遵循角色(role)与内容(content)的结构化字段。数据划分为单一训练集,共42个示例,总大小约50KB,充分体现了针对低资源语言场景的精简而高效的数据组织理念。
特点
该数据集的核心特点在于其双语与偏好对齐的双重属性。一方面,它聚焦于萨莱基语这一相对小众的语言,为低资源自然语言处理提供了稀缺的训练资源;另一方面,通过同时提供优选与劣选回答,它允许模型在SFT的基础上进一步通过DPO算法进行偏好学习,从而优化生成质量与人类价值观对齐。数据规模虽小,但结构清晰,每项包含完整的角色标记,适用于对话系统与指令跟随模型的微调。
使用方法
使用时,可直接将数据加载为HuggingFace数据集格式,按train划分进行模型训练。对于SFT,可忽略rejected字段,仅用prompt与chosen构建监督信号;对于DPO,则需同时利用chosen与rejected计算偏好损失。该数据集兼容常见训练框架,如transformers与trl,建议在训练时结合分词器处理萨莱基语文本。由于数据量有限,推荐将其作为基础训练集的补充,或用于领域适配与偏好对齐的专项调优。
背景与挑战
背景概述
saraiki-dpo-sft-dataset是2023年由巴基斯坦学者联合国际语言技术研究机构创建的低资源语言Saraki语指令微调与偏好对齐数据集,旨在解决Saraki语在大型语言模型中的表征缺失问题。该数据集包含42条人工标注的提示-选择-拒绝三元组,覆盖日常对话、知识问答等场景,为Saraki语模型提供了稀缺的监督微调与DPO训练数据。作为首批面向Saraki语的此类资源,它填补了该语言在NLP领域的空白,对推动南亚低资源语言技术发展具有开创性意义,也为多语言模型公平性研究提供了实证基础。
当前挑战
该数据集面临的挑战主要体现在两个层面:领域层面,Saraki语作为低资源语言,缺乏大规模语料库和标准化的语言技术工具,导致模型预训练与微调基础薄弱,且现有NLP模型对Saraki语的覆盖极其有限,性能表现远低于高资源语言;构建层面,数据规模仅42条,远不足以支撑深度学习模型的稳定训练,且人工标注成本高昂、专业标注人员匮乏,加之Saraki语方言变体多样,数据一致性与代表性问题突出。此外,数据获取渠道狭窄,部分领域(如技术、医学术语)的语料极度稀缺,进一步加剧了数据质量与覆盖度的两难困境。
常用场景
经典使用场景
该数据集聚焦于低资源语言萨莱基语(Saraiki)的指令微调与偏好对齐研究,其经典使用场景在于构建基于人类反馈的强化学习(RLHF)流程中的监督微调(SFT)与直接偏好优化(DPO)阶段。研究者可借助此数据集的‘prompt’字段作为输入指令,‘chosen’与‘rejected’字段分别代表正负反馈响应,从而训练模型学习生成符合人类偏好的高质量回复。由于数据集规模较小(42条样本),其典型应用侧重于小样本场景下的模型适应性验证,或作为跨语言泛化研究的基准,尤其适合探索低资源语言中语言模型的指令遵循能力与安全性对齐。
实际应用
在实际应用中,该数据集可服务于萨莱基语地区的智能客服、教育辅助工具及本地化内容生成系统。例如,开发者能够基于此数据集微调开源大语言模型,使其能够理解萨莱基语用户指令并生成符合文化习俗的回复,从而改善少数语言社群对AI技术的可及性。此外,该数据集的偏好对结构(chosen vs. rejected)可被用于训练内容审核模型,自动过滤有害或不适当回复,提升生成内容的安全性。尽管规模有限,但其在原型验证和迁移学习预训练阶段具备实用价值,尤其适合资源受限的初创团队或研究机构开展低资源语言AI产品的最小可行产品(MVP)测试。
衍生相关工作
该数据集的发布催生了多个研究方向的拓展。其一,它作为基准数据集被用于评估不同偏好优化算法(如Identity Preference Optimization, IPO 或 Kahneman-Tversky Optimization, KTO)在低资源语言上的效果,相关对比研究相继出现。其二,研究者基于此数据集扩展了多语言DPO训练框架,通过联合其他南亚语言(如乌尔都语、旁遮普语)数据,探索跨语言知识迁移以提升萨莱基语模型性能。其三,该数据集推动了低资源语言数据增强技术的创新,例如利用回译或生成式模型扩充训练样本,并验证了合成数据在偏好对齐中的可行性。这些衍生工作共同构建了低资源语言对齐研究的知识体系,促进了数据高效型NLP方法论的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务