MaxOpen Dataset
收藏资源简介:
MaxOpen是一个开源波斯语对话数据集集合,专为训练、微调和评估AI语言模型而创建。目前包含两个版本:MaxOpen 1.2(10,000个对话样本,适合初学者)和MaxOpen 1.3(500,000个对话样本,大规模数据集,专为AI训练和LLM微调优化)。数据格式为JSONL,适用于大型语言模型、NLP研究、AI聊天机器人、机器学习和教育项目。
MaxOpen is an open-source Persian conversational dataset collection specifically developed for training, fine-tuning, and evaluating AI language models. It currently includes two versions: MaxOpen 1.2 (10,000 conversation samples, suitable for beginners) and MaxOpen 1.3 (500,000 conversation samples, a large-scale dataset optimized for AI training and LLM fine-tuning). The data format is JSONL, which is applicable to large language models, NLP research, AI chatbots, machine learning, and educational projects.
数据集概述
MaxOpen 是一个开源的波斯语对话数据集集合,专为训练、微调和评估 AI 语言模型(特别是大语言模型)而设计。
版本信息
| 版本 | 样本数量 | 格式 | 特点 |
|---|---|---|---|
| MaxOpen 1.2 | 10,000 条 | JSONL | 日常对话,轻量级,适合初学者 |
| MaxOpen 1.3 | 500,000 条 | JSONL | 大规模数据集,专为 AI 训练和 LLM 微调优化 |
数据结构
每条数据包含三个字段,以 JSONL 格式存储:
- id: 对话的唯一标识符(如 1)
- instruction: 用户的输入指令或问候语(如 "سلام")
- output: 模型应生成的回复(如 "سلام! حالت چطوره؟")
- category: 对话的类别标签(如 "Greeting")
示例: json { "id": 1, "instruction": "سلام", "output": "سلام! حالت چطوره؟", "category": "Greeting" }
项目结构
MaxOpen/ │ ├── MaxOpen-1.2.jsonl ├── MaxOpen-1.3.jsonl ├── README.md └── LICENSE
使用场景
- 大语言模型(LLMs)的预训练与微调
- 自然语言处理(NLP)研究
- AI 聊天机器人的开发
- 机器学习项目
- 教育及学术研究项目
许可证
该项目采用 MIT 许可证 发布。




