persiandatasets
收藏资源简介:
波斯语多领域聊天数据集是一个专门为微调聊天模型而设计的对话数据集,包含8个不同领域的波斯语对话。数据以JSON格式组织,每个领域对应一个独立的配置文件,涵盖日常对话、教育、家庭、工作、情感、杂项、个人和社交关系等主题。每条数据记录包含user(用户提问)和assistant(模型回答)两个字段,形成完整的对话对。数据集规模在1万到10万条样本之间,适用于文本生成和对话系统等任务。用户可通过Hugging Face的datasets库按领域加载特定配置或全部数据。
The Persian Multi-Domain Chat Dataset is a dialogue dataset specifically designed for fine-tuning chat models, containing Persian conversations across 8 different domains. The data is organized in JSON format, with each domain corresponding to an independent configuration file, covering themes such as daily conversations, education, family, work, emotions, miscellaneous, personal, and social relationships. Each data record includes user (user query) and assistant (model response) fields, forming complete dialogue pairs. The dataset size ranges from 10,000 to 100,000 samples and is suitable for tasks like text generation and dialogue systems. Users can load specific configurations or all data by domain via the Hugging Face datasets library.
数据集概述
数据集名称: Persian Multi-Domain Chat Dataset
许可证: Apache-2.0
语言: 波斯语(主要)、英语、德语
数据规模: 10,000 到 100,000 条样本
标签: 对话、波斯语、聊天、文本生成
任务类别: 文本生成、对话
数据集结构
数据集包含 8 个配置(config),分别对应不同的对话领域,每个配置对应一个独立的 JSON 文件:
| 配置名称 | 主题 |
|---|---|
| Daily | 日常和通用对话 |
| Educations | 教育和学术对话 |
| Familly | 家庭相关对话 |
| Jobs | 职业和工作对话 |
| Motions | 情感和情绪对话 |
| Others | 其他杂项对话 |
| Personal | 个人对话 |
| Relations | 社会关系对话 |
数据格式
每个 JSON 文件包含一个对象列表,每个对象包含两个字段:
json [ {"user": "用户问题文本", "assistant": "模型回答文本"} ]
示例数据:
json { "user": "سلام، امروز هوا چطوره؟", "assistant": "سلام! امروز هوا آفتابی و گرم هست." }
使用方法
使用 Hugging Face Datasets 库加载数据:
加载单个配置(例如 Daily): python from datasets import load_dataset dataset = load_dataset("kasranaqhdpur/persiandatasets", "Daily", split="train")
加载所有配置: python from datasets import load_dataset
all_configs = ["Daily", "Educations", "Familly", "Jobs", "Motions", "Others", "Personal", "Relations"]
datasets = {} for config in all_configs: datasets[config] = load_dataset("kasranaqhdpur/persiandatasets", config, split="train") print(f"{config}: {len(datasets[config])} نمونه")
加载完整数据集: python from datasets import load_datasets dataset = load_datasets("kasranaqhdpur/persiandatasets")
数据集用途
该数据集专为微调聊天模型而设计,覆盖波斯语的多领域对话场景,支持文本生成和对话任务。




