mauxi-mix-persian
收藏资源简介:
MauxiMix是一个精心策划的波斯语对话数据集,包含1000个高质量的波斯语对话,这些对话是从SmolTalk数据集翻译而来的。该数据集专门设计用于使用监督微调(SFT)技术训练和微调大型语言模型(LLMs),有助于开发开源的波斯语语言模型。数据集的每个对话都包含消息列表、类别和难度级别。类别包括编程、数学、创意写作等,难度级别从非常简单到非常困难不等。数据集目前包含1000个对话,计划扩展到10000个对话。
MauxiMix: High-Quality Persian Conversations Dataset
描述
MauxiMix 是一个精心策划的包含 1,000 个高质量波斯语对话的数据集,这些对话是从 SmolTalk 数据集使用先进的语言模型翻译而来的。该数据集专门设计用于训练和微调大型语言模型(LLMs),采用监督微调(SFT)技术,有助于开发开源波斯语语言模型。
主要特点
- 1,000 个专业翻译的波斯语对话
- 按特定主题和难度级别分类
- 基于角色的对话格式(用户/助手)
- 使用 GPT-4o-mini 进行高质量翻译
- 非常适合 LLM 训练和微调
数据集结构
每个对话遵循以下格式: json { "messages": [ {"role": "user", "content": "波斯语消息"}, {"role": "assistant", "content": "波斯语回复"} ], "category": "波斯语类别", "difficulty": "波斯语难度级别" }
类别与难度级别
类别
- برنامهنویسی (编程)
- ریاضیات (数学)
- نگارش خلاق (创意写作)
- تحلیل داده (数据分析)
- ویرایش (编辑)
- استدلال (推理)
- طوفان فکری (头脑风暴)
- برنامهریزی (规划)
- درخواست مشاوره (寻求建议)
- جستجوی اطلاعات (信息搜索)
难度级别
- خیلی آسان (非常简单)
- آسان (简单)
- متوسط (中等)
- سخت (困难)
- خیلی سخت (非常困难)
使用场景
- 训练波斯语语言模型
- 微调现有 LLMs 用于波斯语
- SFT(监督微调)训练
- 波斯语 NLP 研究
- 创建专门的波斯语 AI 助手
数据集统计
- 总对话数:1,000(扩展至 10,000)
- 按对话长度筛选:108-717 个词元
- 格式:Hugging Face 数据集
- 精心筛选的类别和难度级别
技术细节
- 源数据集:SmolTalk
- 翻译模型:GPT-4o-mini
- 质量保证:自动筛选和一致性检查
- 格式:Hugging Face 数据集
- 特征:
- messages: List[Dict]
- category: string
- difficulty: string
引用
如果您在研究中使用此数据集,请引用: bibtex @dataset{mauxitalk2024, name = {MauxiMix}, author = {Maux AI}, year = {2024}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/xmanii/mauxi-mix-persian} }
目标
MauxiMix 的主要目标是促进高质量开源波斯语语言模型的开发。通过提供这个精心策划的数据集,我们旨在:
- 提高 AI 模型对波斯语的理解
- 支持开源 AI 社区
- 实现更好的 LLMs 波斯语任务微调
- 创建更准确和文化上更敏感的波斯语 AI 助手
许可证
该数据集在 MIT 许可证下发布。




