Pashto-Online-Conversations
收藏资源简介:
Pashto Online Conversations(普什图语在线对话)数据集是一个专门为AI模型训练设计的大规模、高质量普什图语对话数据集。该数据集包含超过100,000条自然、日常的普什图语在线对话,涵盖了从简单幽默到深度哲学讨论的广泛主题,包括幽默和笑话(25%)、电影和电视(20%)、音乐(15%)、食物和烹饪(10%)、一般对话(10%)、艺术和DIY(10%)、旅行和旅游(5%)、智力讨论(5%)。对话内容模拟了真实人群的日常交流语言,具有高度的自然性和多样性,并充分考虑了普什图文化和价值观的适应性。数据集采用JSONL格式,每条记录包含一个对话列表,每个对话消息由发送者类型(human 或 gpt)和消息文本(value)组成。数据经过严格的去重、清洗和标准化处理,确保了高质量。该数据集基于英语在线对话翻译而成,在翻译过程中保留了对话的自然性、表情符号,并进行了文化适配。数据集采用Apache 2.0许可证发布,适用于商业和研究用途,主要应用于文本生成和对话AI模型的指令微调(SFT)和训练。
The Pashto Online Conversations dataset is a large-scale, high-quality Pashto dialogue dataset specifically designed for AI model training. It contains over 100,000 natural, daily Pashto online conversations covering a wide range of topics from simple humor to deep philosophical discussions, including humor and jokes (25%), movies and TV (20%), music (15%), food and cooking (10%), general conversation (10%), art and DIY (10%), travel and tourism (5%), and intellectual discussions (5%). The dialogue content simulates the everyday language of real people, with high naturalness and diversity, and fully considers adaptation to Pashto culture and values. The dataset is in JSONL format, with each record containing a list of dialogues, where each message consists of a sender type (human or gpt) and message text (value). The data has undergone rigorous deduplication, cleaning, and standardization to ensure high quality. It is translated from English online conversations, preserving the naturalness and emojis of the dialogues while incorporating cultural adaptation. Released under the Apache 2.0 license, the dataset is suitable for commercial and research purposes, primarily used for instruction fine-tuning (SFT) and training of text generation and conversational AI models.
数据集概述:Pashto Online Conversations
- 数据集名称: 普什图语在线对话数据集 (Pashto Online Conversations)
- 数据集页面: https://huggingface.co/datasets/nassimjp/Pashto-Online-Conversations
- 许可协议: Apache 2.0
- 语言: 普什图语 (ps),英语 (en)
- 标签: 对话、聊天、普什图语、监督微调、指令微调、在线聊天、日常对话、表情包、娱乐
数据集规模与结构
- 数据集大小: 约 10万+ 条独特对话
- 训练集: 18,802 个示例,约 158 MB
- 数据格式: JSONL
- 特征:
conversations: 列表,包含对话消息from: 消息发送者类型 (human或gpt)value: 消息的文本内容
- 数据切分: 仅包含
train切分
数据内容与主题
该数据集包含自然、日常的普什图语在线对话,覆盖多种主题:
| 主题类别 | 数量 | 比例 |
|---|---|---|
| 幽默与笑话 | 25,000+ | 25% |
| 电影与电视 | 20,000+ | 20% |
| 音乐 | 15,000+ | 15% |
| 食物与烹饪 | 10,000+ | 10% |
| 一般闲聊 | 10,000+ | 10% |
| 艺术与DIY | 10,000+ | 10% |
| 旅行与观光 | 5,000+ | 5% |
| 思想讨论 | 5,000+ | 5% |
- 对话平均长度: 2-3 条消息
- 对话示例:
- 幽默: 人类分享一个表情包,AI 以幽默方式回应。
- 卡拉OK: 人类询问是否喜欢唱卡拉OK,AI 表达热情并分享喜欢的歌曲。
- DIY项目: 人类询问是否擅长做手工,AI 分享自己的DIY经验。
数据来源与处理
- 来源: 该数据集是英文在线对话的翻译版本,专门为普什图语 AI 模型训练而准备。
- 处理流程:
- 完整英文到普什图语的翻译
- 保持对话的自然性
- 保留表情符号
- 进行文化适应性调整
- 数据清洗:通过 MD5 哈希去除重复记录;过滤不完整和非标准文本;标准化所有对话格式
- 支持处理中断恢复 (Resume-ready pipeline)
用途与使用
- 主要用途: AI 模型训练与微调,特别是对话生成和指令遵循任务。
- 使用示例:
- Python (Hugging Face): 使用
datasets库加载nassimjp/Pashto-Online-Conversations数据集。 - LLaMA-Factory 训练: 提供了使用
llamafactory-cli进行模型训练的示例命令。
- Python (Hugging Face): 使用
附加信息
- 数据集名称 (普什图语): پښتو آنلاین خبرې اترې
- 数据集名称 (英语): Pashto Online Conversations
- 任务类别: 文本生成、对话式




