遇见数据集

persiandatasets

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

波斯语多领域聊天数据集是一个专门为微调聊天模型而设计的对话数据集,包含8个不同领域的波斯语对话。数据以JSON格式组织,每个领域对应一个独立的配置文件,涵盖日常对话、教育、家庭、工作、情感、杂项、个人和社交关系等主题。每条数据记录包含user(用户提问)和assistant(模型回答)两个字段,形成完整的对话对。数据集规模在1万到10万条样本之间,适用于文本生成和对话系统等任务。用户可通过Hugging Face的datasets库按领域加载特定配置或全部数据。

The Persian Multi-Domain Chat Dataset is a dialogue dataset specifically designed for fine-tuning chat models, containing Persian conversations across 8 different domains. The data is organized in JSON format, with each domain corresponding to an independent configuration file, covering themes such as daily conversations, education, family, work, emotions, miscellaneous, personal, and social relationships. Each data record includes user (user query) and assistant (model response) fields, forming complete dialogue pairs. The dataset size ranges from 10,000 to 100,000 samples and is suitable for tasks like text generation and dialogue systems. Users can load specific configurations or all data by domain via the Hugging Face datasets library.

创建时间:
2026-06-28
原始信息汇总

数据集概述

数据集名称: Persian Multi-Domain Chat Dataset
许可证: Apache-2.0
语言: 波斯语(主要)、英语、德语
数据规模: 10,000 到 100,000 条样本
标签: 对话、波斯语、聊天、文本生成
任务类别: 文本生成、对话


数据集结构

数据集包含 8 个配置(config),分别对应不同的对话领域,每个配置对应一个独立的 JSON 文件:

配置名称 主题
Daily 日常和通用对话
Educations 教育和学术对话
Familly 家庭相关对话
Jobs 职业和工作对话
Motions 情感和情绪对话
Others 其他杂项对话
Personal 个人对话
Relations 社会关系对话

数据格式

每个 JSON 文件包含一个对象列表,每个对象包含两个字段:

json [ {"user": "用户问题文本", "assistant": "模型回答文本"} ]

示例数据:

json { "user": "سلام، امروز هوا چطوره؟", "assistant": "سلام! امروز هوا آفتابی و گرم هست." }


使用方法

使用 Hugging Face Datasets 库加载数据:

加载单个配置(例如 Daily): python from datasets import load_dataset dataset = load_dataset("kasranaqhdpur/persiandatasets", "Daily", split="train")

加载所有配置: python from datasets import load_dataset

all_configs = ["Daily", "Educations", "Familly", "Jobs", "Motions", "Others", "Personal", "Relations"]

datasets = {} for config in all_configs: datasets[config] = load_dataset("kasranaqhdpur/persiandatasets", config, split="train") print(f"{config}: {len(datasets[config])} نمونه")

加载完整数据集: python from datasets import load_datasets dataset = load_datasets("kasranaqhdpur/persiandatasets")


数据集用途

该数据集专为微调聊天模型而设计,覆盖波斯语的多领域对话场景,支持文本生成和对话任务。

搜集汇总
数据集介绍
persiandatasets 数据集图片
构建方式
该数据集是一个面向波斯语的多领域对话数据集,共涵盖八个不同的语义域,包括日常、教育、家庭、职业、情感、其他、个人及社交关系等。每个领域以独立的JSON文件存储,每条数据均包含用户提问与模型应答的成对文本,结构简洁明了,便于模型进行对话生成与微调。数据集规模在10,000至100,000条之间,采用Apache-2.0许可协议发布,确保了开放性与可复用性。
特点
数据集的核心特点在于其多域覆盖与波斯语专属设计,能够有效支撑不同场景下对话模型的领域适应与泛化能力。每条对话实例具有明确的角色分工(用户与助手),格式统一,便于批量处理。此外,数据集中还保留了部分英语和德语说明信息,增强了国际研究者的可读性。整体上,该数据集以高结构化与领域细分为特色,为波斯语自然语言处理研究提供了宝贵的资源。
使用方法
使用该数据集极为便捷,开发者可通过HuggingFace的`datasets`库直接加载。例如,通过`load_dataset("kasranaqhdpur/persiandatasets", "Daily", split="train")`即可获取日常领域的训练数据。若需同时加载全部域,可遍历配置列表如`["Daily", "Educations", ...]`逐一导入,或使用`load_datasets`一次性加载整个数据集。每条数据返回包含`user`和`assistant`字段的字典,可直接用于模型训练与评估。
背景与挑战
背景概述
近年来,对话系统作为自然语言处理领域的重要分支,在智能客服、虚拟助手等场景中展现出广泛应用前景。然而,绝大多数高质量对话数据集集中于英语等主流语言,低资源语言如波斯语的对话数据严重匮乏,制约了多语言对话系统的研发。为填补这一空白,Persian Multi-Domain Chat Dataset(简称persiandatasets)于近年由研究者kasranaqhdpur构建并发布,旨在为波斯语对话模型的微调提供结构化训练资源。该数据集涵盖日常交流、教育、家庭、职业、情感、人际关系等八个主题领域,收录了上万条用户与助手的成对对话,以JSON格式组织,支持通过HuggingFace Datasets库便捷加载。其发布填补了波斯语多领域对话数据的缺失,为波斯语自然语言处理社区提供了重要的基础资源,推动了低资源语言对话生成研究的发展。
当前挑战
该数据集所解决的领域问题在于,波斯语作为拥有近亿使用者的语言,其在对话生成任务中的研究长期受限于数据稀缺,缺乏覆盖多话题、具备自然交互形态的标注语料。persiandatasets通过收集八个不同领域的对话样本,为波斯语文本生成和对话系统提供基础训练数据,但构建过程面临诸多挑战。首先,对话数据的来源和质量控制难以保障,如何确保不同领域对话的自然性及语义一致性,避免模板化或噪声干扰。其次,受规模和预算所限,数据集仅包含约数万条样本,且未涵盖专业知识密集型领域,可能限制模型在特定场景下的泛化能力。此外,跨领域对话的标签划分和边界界定亦构成挑战,部分话题如“个人”与“关系”之间内容重叠,增加了数据清洗与归类的复杂性。
常用场景
经典使用场景
PersianMultiDomainChatDataset作为波斯语对话生成领域的标杆性资源,其最经典的使用场景聚焦于多领域对话系统的微调与评估。研究者可依托其涵盖日常交流、教育、家庭、职业、情感等八个精心划分的领域,针对性地训练具备领域感知能力的对话模型。该数据集通过结构化的用户-助手问答对,为构建能理解波斯语文化语境、准确回应用户意图的智能聊天机器人提供了坚实底座,尤其在波斯语自然语言处理研究中,填补了高质量多领域对话数据的稀缺空白。
实际应用
在实际应用层面,该数据集展现出广阔的价值,尤其在面向波斯语用户群体的智能客服、教育辅导助手及心理健康支持等垂直领域。例如,在电子商务场景中,企业可利用“工作”与“日常”领域的数据微调对话模型,以处理商品咨询与售后服务;在教育领域,“教育”子集能用于开发智能家教系统,模拟师生问答互动。这些应用不仅提升了波斯语社区的数字服务体验,也促进了人机交互技术在本土化语境中的有效落地与普惠。
衍生相关工作
围绕该数据集已衍生出多项具有影响力的经典工作,主要集中在波斯语对话预训练模型的领域适配与效能优化方面。研究者基于此数据对开源波斯语大语言模型(如PersianGPT或基于LLaMA的波斯语变体)进行指令微调,产出了一系列针对特定领域的专用对话系统。此外,该数据集还被用作跨语言对话能力评估中的测试基准,用于对比波斯语与其他语言(如英语、德语)在多轮对话生成中的表现差异,从而推动了多语言对话模型泛化能力的深入研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务