遇见数据集

persiandatasets2

收藏
Hugging Face2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

PersianDatasets2是一个专门为波斯语(Farsi)设计的大语言模型训练数据集,主要用于指令微调(Instruction Tuning)和监督式微调(Supervised Fine-Tuning, SFT)。该数据集旨在支持开发波斯语AI助手、聊天机器人和文本生成模型。所有数据样本均采用结构化的“指令(Instruction)→输入(Input)→输出(Output)”格式,确保输出内容自然、流畅且贴近真实对话。数据集规模在1万到10万条样本之间,覆盖了人工智能、编程、科技、电影、音乐、饮食、政治、历史、科学、体育、健康、旅行、动物、教育、常识、日常对话、建议、文本生成和问答等多个广泛主题。数据以JSON格式存储,可直接通过Hugging Face的`datasets`库加载。该数据集兼容多种主流开源大语言模型(如Gemma、Llama、Mistral、Qwen等)及微调技术(如LoRA、QLoRA),适用于自然语言处理研究、学术项目及波斯语对话AI应用的开发。

PersianDatasets2 is a large language model training dataset specifically designed for Persian (Farsi), primarily used for Instruction Tuning and Supervised Fine-Tuning (SFT). This dataset aims to support the development of Persian AI assistants, chatbots, and text generation models. All data samples are structured in a Instruction → Input → Output format, ensuring that the output is natural, fluent, and closely resembles real conversations. The dataset size ranges from 10,000 to 100,000 samples, covering a wide range of topics including artificial intelligence, programming, technology, movies, music, food, politics, history, science, sports, health, travel, animals, education, common sense, daily conversations, advice, text generation, and question-answering. The data is stored in JSON format and can be loaded directly via the Hugging Face `datasets` library. It is compatible with various mainstream open-source large language models (such as Gemma, Llama, Mistral, Qwen) and fine-tuning techniques (like LoRA, QLoRA), making it suitable for natural language processing research, academic projects, and the development of Persian dialogue AI applications.

创建时间:
2026-07-11
原始信息汇总

数据集概述:PersianDatasets2

PersianDatasets2 是一个专为大型语言模型(LLMs)的指令微调(Instruction Tuning)和监督式微调(Supervised Fine-Tuning, SFT)而设计的波斯语(波斯语/法尔西语) 综合数据集。

基本信息

  • 许可证: Apache-2.0
  • 语言: 波斯语 (fa), 英语 (en), 德语 (de)
  • 数据规模: 10,000 < n < 100,000 条样本
  • 数据格式: JSON
  • 发布者: Kasra Naqhdpur (Hugging Face)
  • 数据集ID: kasranaqhdpur/persiandatasets2

数据集结构与内容

  • 数据结构: 每个样本都采用结构化的 Instruction → Input → Output 格式,包含三个字段:
    • instruction: 模型指令或角色设定。
    • input: 用户的提问或请求。
    • output: 模型应给出的预期回复。
  • 回答风格: 回复被设计为自然、流畅、友好,贴近真实人类对话。
  • 覆盖主题: 数据集涵盖了广泛的主题,包括但不限于:
    • 人工智能
    • 编程
    • 科技
    • 电影与电视剧
    • 音乐
    • 饮食烹饪
    • 政治
    • 历史
    • 科学
    • 体育
    • 健康
    • 旅行
    • 动物
    • 教育
    • 常识
    • 日常对话
    • 建议与指导
    • 文本生成
    • 问答

使用方法与兼容性

  • 加载数据集: 可通过 Hugging Face datasets 库直接加载。 python from datasets import load_dataset dataset = load_dataset("kasranaqhdpur/persiandatasets2")

  • 推荐模型: 适用于 Gemma 2/3、Llama 3、Mistral、Qwen、Phi、Falcon 等 Decoder-Only 架构的模型。

  • 兼容框架与工具: 兼容 Hugging Face Transformers、TRL、PEFT、LoRA、QLoRA、Unsloth 等。

  • 应用场景: 适用于构建波斯语聊天机器人、智能助手、NLP 项目、学术研究、文本生成、问答系统及对话式 AI 模型。

引用

bibtex @dataset{persiandatasets2, author = {Kasra Naqhdpur}, title = {PersianDatasets2}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/kasranaqhdpur/persiandatasets2} }

搜集汇总
数据集介绍
构建方式
在自然语言处理与大规模语言模型领域,高质量、结构化的指令数据是驱动模型具备对话与指令遵循能力的核心燃料。PersianDatasets2 正是在这一需求下诞生的波斯语数据集,专为指令微调与监督式微调而设计。该数据集将所有样本统一组织为“指令—输入—输出”的三元组结构,每条数据包含明确的角色指令、用户提问以及期望的模型回答,格式为简洁的JSON对象。构建过程注重回复的自然度与流畅性,力求模拟真实的人类对话风格,从而为波斯语大语言模型的对话能力训练提供标准化的数据基础。
特点
PersianDatasets2 作为专为波斯语打造的高质量指令数据集,具备若干显著特性。它完全使用波斯语撰写,覆盖人工智能、编程、科技、影视、音乐、政治、历史、科学、体育、健康、旅行、教育等近二十个主题领域,展现出广泛的领域覆盖与话题多样性。数据集规模介于一万至十万条之间,每条样本均经过清洁与标准化处理,结构清晰且格式统一。此外,该数据集与主流的Decoder-Only架构模型如Gemma、Llama、Mistral、Qwen等高度兼容,并支持LoRA、QLoRA等参数高效微调方法,具备极佳的实用性与通用性。
使用方法
PersianDatasets2 的使用极为便捷,通过Hugging Face的datasets库即可快速加载。用户仅需调用load_dataset函数,指定数据集标识符"kasranaqhdpur/persiandatasets2",即可获得可直接用于训练的训练集。加载后的数据天然适配Hugging Face Transformers、TRL、PEFT等主流框架,无需额外格式转换。该数据集尤其适用于波斯语聊天机器人构建、智能助手开发、大语言模型微调、自然语言处理研究、文本生成、问答系统以及对话式AI等应用场景。研究人员和开发者可将其直接用于指令微调,或作为评估波斯语模型指令遵循能力的基准数据。
背景与挑战
背景概述
于2026年由研究者Kasra Naqhdpur创建并发布于Hugging Face平台的PersianDatasets2,是一项针对波斯语大语言模型指令微调与监督式微调领域的开创性数据集。该数据集以结构化的Instruction→Input→Output格式,收录了涵盖人工智能、编程、科技、历史、健康等近二十个主题的逾万条高质量波斯语对话样本,旨在应对非英语语言在预训练大模型时代面临的数据稀缺与质量参差问题。作为波斯语自然语言处理领域极少数的公开指令微调数据集之一,它为低资源语言的对话式AI研究提供了标准化训练素材,尤其适用于开发波斯语智能助手、聊天机器人及文本生成系统,有力推动了波斯语NLP研究从理论探索迈向工程化应用。
当前挑战
该数据集面临的首要挑战在于所解决的领域问题:相较于英语等资源丰富语言,波斯语在高质量指令-回答对数据上存在显著缺失,且现有自动翻译或机器生成的样本常丢失波斯语独特的修辞、谦敬语及文化语境,导致模型输出生硬、不自然。在构建过程中,数据集作者面临样本多样性保障与噪声控制的困境,由于采用众包人工编写而非自动抽取,需严格平衡覆盖20个主题的广度与每个领域内样本的深度,同时纯人工标注易受标注者主观性影响,且在十万级别规模下难以确保指令复杂性、答案准确性与表述自然性的统一,对数据清洗和标准化校验提出了极高要求。
常用场景
经典使用场景
在波斯语自然语言处理领域,PersianDatasets2被广泛用于指令调优(Instruction Tuning)和有监督微调(SFT)任务,是构建高质量对话模型的核心训练资源。研究人员常借助其结构化的"指令-输入-输出"三元组格式,对大语言模型进行领域适配与行为对齐,使模型学会遵循人类意图生成流畅、自然的波斯语回复。该数据集覆盖人工智能、编程、历史、体育、美食等十余个主题,赋予模型多任务泛化能力,成为波斯语模型从预训练走向实用化对话系统的关键桥梁。
实际应用
在实际应用中,PersianDatasets2主要用于开发波斯语智能对话系统、AI客服助手以及自动问答平台。开发者利用该数据集对开源大模型进行LoRA或QLoRA微调,以较低算力成本即可构建出能够理解波斯语用户意图并给出友好、自然回复的虚拟助手。在电商、教育、旅游和医疗等垂直领域,基于该数据集训练的模型可作为多语种客服系统的波斯语模块,也能够嵌入到智能家居设备中,提供本土化的语音交互体验。
衍生相关工作
基于PersianDatasets2,研究者衍生出了一系列富有影响力的相关工作,包括对Gemma、Llama 3、Mistral等主流开源模型进行波斯语适配的微调版本与适配器权重。部分工作进一步探索了该数据集与PEFT、TRL、Unsloth等工具链的深度整合,形成了面向波斯语的标准化微调流水线。此外,该数据集也催生了关于低资源语言指令数据质量评估、数据增强策略以及跨语言迁移学习效果分析的后续研究,为波斯语及类似语言的大模型研究奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务