persiandatasets2
收藏资源简介:
PersianDatasets2是一个专门为波斯语(Farsi)设计的大语言模型训练数据集,主要用于指令微调(Instruction Tuning)和监督式微调(Supervised Fine-Tuning, SFT)。该数据集旨在支持开发波斯语AI助手、聊天机器人和文本生成模型。所有数据样本均采用结构化的“指令(Instruction)→输入(Input)→输出(Output)”格式,确保输出内容自然、流畅且贴近真实对话。数据集规模在1万到10万条样本之间,覆盖了人工智能、编程、科技、电影、音乐、饮食、政治、历史、科学、体育、健康、旅行、动物、教育、常识、日常对话、建议、文本生成和问答等多个广泛主题。数据以JSON格式存储,可直接通过Hugging Face的`datasets`库加载。该数据集兼容多种主流开源大语言模型(如Gemma、Llama、Mistral、Qwen等)及微调技术(如LoRA、QLoRA),适用于自然语言处理研究、学术项目及波斯语对话AI应用的开发。
PersianDatasets2 is a large language model training dataset specifically designed for Persian (Farsi), primarily used for Instruction Tuning and Supervised Fine-Tuning (SFT). This dataset aims to support the development of Persian AI assistants, chatbots, and text generation models. All data samples are structured in a Instruction → Input → Output format, ensuring that the output is natural, fluent, and closely resembles real conversations. The dataset size ranges from 10,000 to 100,000 samples, covering a wide range of topics including artificial intelligence, programming, technology, movies, music, food, politics, history, science, sports, health, travel, animals, education, common sense, daily conversations, advice, text generation, and question-answering. The data is stored in JSON format and can be loaded directly via the Hugging Face `datasets` library. It is compatible with various mainstream open-source large language models (such as Gemma, Llama, Mistral, Qwen) and fine-tuning techniques (like LoRA, QLoRA), making it suitable for natural language processing research, academic projects, and the development of Persian dialogue AI applications.
数据集概述:PersianDatasets2
PersianDatasets2 是一个专为大型语言模型(LLMs)的指令微调(Instruction Tuning)和监督式微调(Supervised Fine-Tuning, SFT)而设计的波斯语(波斯语/法尔西语) 综合数据集。
基本信息
- 许可证: Apache-2.0
- 语言: 波斯语 (fa), 英语 (en), 德语 (de)
- 数据规模: 10,000 < n < 100,000 条样本
- 数据格式: JSON
- 发布者: Kasra Naqhdpur (Hugging Face)
- 数据集ID:
kasranaqhdpur/persiandatasets2
数据集结构与内容
- 数据结构: 每个样本都采用结构化的
Instruction → Input → Output格式,包含三个字段:instruction: 模型指令或角色设定。input: 用户的提问或请求。output: 模型应给出的预期回复。
- 回答风格: 回复被设计为自然、流畅、友好,贴近真实人类对话。
- 覆盖主题: 数据集涵盖了广泛的主题,包括但不限于:
- 人工智能
- 编程
- 科技
- 电影与电视剧
- 音乐
- 饮食烹饪
- 政治
- 历史
- 科学
- 体育
- 健康
- 旅行
- 动物
- 教育
- 常识
- 日常对话
- 建议与指导
- 文本生成
- 问答
使用方法与兼容性
-
加载数据集: 可通过 Hugging Face
datasets库直接加载。 python from datasets import load_dataset dataset = load_dataset("kasranaqhdpur/persiandatasets2") -
推荐模型: 适用于 Gemma 2/3、Llama 3、Mistral、Qwen、Phi、Falcon 等 Decoder-Only 架构的模型。
-
兼容框架与工具: 兼容 Hugging Face Transformers、TRL、PEFT、LoRA、QLoRA、Unsloth 等。
-
应用场景: 适用于构建波斯语聊天机器人、智能助手、NLP 项目、学术研究、文本生成、问答系统及对话式 AI 模型。
引用
bibtex @dataset{persiandatasets2, author = {Kasra Naqhdpur}, title = {PersianDatasets2}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/kasranaqhdpur/persiandatasets2} }



