mauxitalk-persian
收藏资源简介:
MauxiTalk是一个高质量的波斯语对话数据集,包含2000多个对话,这些对话是从SmolTalk数据集精心翻译而来,使用了先进的语言模型。该数据集特别适合用于训练和微调大型语言模型(LLMs),采用监督微调(SFT)技术。数据集的特点包括2000个自然的波斯语对话,涵盖日常生活的多个主题,角色基础的对话格式(用户/助手),以及使用GPT-4o-mini进行的高质量翻译。每个对话都遵循特定的JSON格式,包含消息列表和完整主题。数据集的统计信息显示总共有2000个对话,平均每个对话有4-8条消息,涵盖50多个主题,格式为JSONL,总大小为2.85 MB,下载大小为1.17 MB。数据集的来源是SmolTalk,翻译模型为GPT-4o-mini,并进行了自动一致性检查。该数据集适用于训练波斯语语言模型、微调现有LLMs、开发对话AI系统、波斯语NLP研究以及创建波斯语聊天机器人。
MauxiTalk: High-Quality Persian Conversations Dataset
描述
MauxiTalk 是一个包含 2,000 多个高质量波斯语对话的数据集,这些对话是从 SmolTalk 数据集精心翻译而来的,使用了先进的语言模型。该数据集特别适用于使用监督微调(SFT)技术训练和微调大型语言模型(LLMs)。
关键特性
- 包含 2,000 个自然的波斯语对话
- 多样化的主题,包括日常生活、工作、旅行等
- 基于角色的对话格式(用户/助手)
- 使用 GPT-4o-mini 进行高质量翻译
- 非常适合 LLM 训练和微调
数据集结构
每个对话遵循以下格式: json { "messages": [ {"role": "user", "content": "波斯语消息"}, {"role": "assistant", "content": "波斯语回复"} ], "full_topic": "对话主题" }
使用案例
- 训练波斯语语言模型
- 微调现有的 LLMs 以适应波斯语
- 开发对话式 AI 系统
- 波斯语 NLP 研究
- 创建波斯语聊天机器人
数据集统计
- 总对话数:2,000
- 每对话平均消息数:4-8
- 涵盖的主题数:50+
- 格式:JSONL
- 总大小:2.85 MB
- 下载大小:1.17 MB
技术细节
- 源数据集:SmolTalk
- 翻译模型:GPT-4o-mini
- 质量保证:自动一致性检查
- 格式:Hugging Face 数据集
- 特征:
- messages: List[Dict]
- content: string
- role: string
- full_topic: string
- messages: List[Dict]
引用
如果您在研究中使用此数据集,请引用: bibtex @dataset{mauxitalk2024, name = {MauxiTalk}, author = {Maux AI}, year = {2024}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/xmanii/mauxitalk-persian} }
许可证
该数据集基于 MIT 许可证发布。




