遇见数据集

nassimjp/Pashto-Online-Conversations

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- license: apache-2.0 language: - ps - en tags: - conversations - conversational - chat - pashto - sft - instruction-tuning - online-chats - casual-conversations - daily-life - memes - entertainment pretty_name: پښتو آنلاین خبرې اترې - Pashto Online Conversations size_categories: - 10k<n<100k task_categories: - text-generation dataset_info: features: - name: conversations list: - name: from dtype: string - name: value dtype: string splits: - name: train num_bytes: 217027845 num_examples: 22428 download_size: 90292150 dataset_size: 217027845 configs: - config_name: default data_files: - split: train path: data/train-* --- # 💬 پښتو آنلاین خبرې اترې ## Pashto Online Conversations Dataset [![HuggingFace](https://img.shields.io/badge/🤗-HuggingFace-yellow)](https://huggingface.co/datasets/nassimjp/Pashto-Online-Conversations) [![License](https://img.shields.io/badge/License-Apache%202.0-blue)](LICENSE) [![Language](https://img.shields.io/badge/Language-Pashto-پښتو-green)](https://en.wikipedia.org/wiki/Pashto) [![Conversations](https://img.shields.io/badge/Conversations-100k+-orange)](https://huggingface.co/datasets/nassimjp/Pashto-Online-Conversations) > **🌟 د پښتو ژبې لپاره تر ټولو لوی او طبیعي آنلاین خبرو اترو ډیټاسیټ** > *The largest and most natural online conversations dataset for the Pashto language* دا ډیټاسیټ د **۱۰۰،۰۰۰+** طبیعي، ساده او په زړه پورې پښتو خبرو اترو مجموعه ده چې د AI ماډلونو د روزنې لپاره چمتو شوې ده. پدې کې هره ورځیني خبرې، مزاح، خیالي کیسې، او د آنلاین دوستانو ترمنځ د مینه والو خبرې شاملې دي. ## 🎯 د دې ډیټاسیټ ځانګړتیاوې | ځانګړتیا | توضیح | |-----------|--------| | **طبیعي توب** | خبرې اترې د ریښتینو خلکو د ورځني ژوند له ژبې سره سمون لري | | **تنوع** | له ساده مزاح څخه تر ژورو فلسفي بحثونو پورې | | **دوام** | هر خبره اتره دوه اړخیزه او بشپړه ده | | **کلتوري مطابقت** | د پښتو کلتور، دودونو او ارزښتونو سره سم | ## 📊 د ډیټاسیټ لنډیز | عنوان | ارزښت | |-------|-------| | **خاوند** | نسیم (`nassimjp`) | | **ټول ریکارډونه** | ۱۰۰،۰۰۰+ ځانګړې خبرې اترې | | **ژبه** | اصلي پښتو | | **د کارولو اصلي ځای** | د AI ماډلونو روزنه او ټیوننګ | | **لایسنس** | Apache 2.0 | | **بڼه** | JSONL | | **د خبرو اترو منځنۍ اوږدوالی** | ۲-۳ پیغامونه | ## 🗂️ د ډیټا جوړښت هر ریکارډ د لاندې بڼې مطابق دی: ```json { "conversations": [ { "from": "human", "value": "اوه، ما یوازې غوره میم ولید - ایا تاسو یې لیدلی دی؟" }, { "from": "gpt", "value": "😂 آه، نه ما نه دی لیدلی! زه مړه کېږم چې پوه شم، دا میم د څه په اړه دی؟ ایا دا یو مسخره پیشو دی یا یو مسخره حالت؟ راز ماته خلاص کړه! 🤣" } ] } ``` ### د ساحو توضیح | ساحه | ډول | توضیح | |------|------|--------| | `conversations` | لیست | د پیغامونو لړۍ | | `from` | متن | د لیږونکي ډول (`human` یا `gpt`) | | `value` | متن | د خبرې اترې اصلي متن | ## 🔥 د خبرو اترو موضوعات | کټګورۍ | شمېر | سلنه | |----------|-------|--------| | 😂 مزاح او ټوکې | ۲۵،۰۰۰+ | ۲۵٪ | | 🎬 فلمونه او تلویزیون | ۲۰،۰۰۰+ | ۲۰٪ | | 🎵 موسیقي | ۱۵،۰۰۰+ | ۱۵٪ | | 🍔 خواړه او پخلی | ۱۰،۰۰۰+ | ۱۰٪ | | 💡 عمومي خبرې | ۱۰،۰۰۰+ | ۱۰٪ | | 🎨 هنر او DIY | ۱۰،۰۰۰+ | ۱۰٪ | | 🌍 سفر او سېلانی | ۵،۰۰۰+ | ۵٪ | | 🧠 فکري بحثونه | ۵،۰۰۰+ | ۵٪ | | **ټول** | **۱۰۰،۰۰۰+** | **۱۰۰٪** | ## 💻 د کارولو بېلګه ### د Hugging Face سره ```python from datasets import load_dataset # ډیټاسیټ بار کړئ dataset = load_dataset("nassimjp/Pashto-Online-Conversations", split="train") # یوه بېلګه وګورئ example = dataset[0] for message in example["conversations"]: print(f"{message['from']}: {message['value']}") # د ډیټاسیټ اندازه print(f"ټولې خبرې اترې: {len(dataset):,}") ``` ### د LLaMA-Factory سره روزنه ```bash llamafactory-cli train \ --model_name_or_path Qwen/Qwen2-7B \ --dataset pashto-online-conversations \ --template qwen \ --output_dir ./output \ --per_device_train_batch_size 4 \ --learning_rate 2e-5 ``` ## 📝 د خبرو اترو بېلګې ### مزاح او ټوکې 😂 ``` انسان: اوه، ما یوازې غوره میم ولید - ایا تاسو یې لیدلی دی؟ AI: 😂 آه، نه ما نه دی لیدلی! زه مړه کېږم چې پوه شم، دا میم د څه په اړه دی؟ راز ماته خلاص کړه! 🤣 ``` ### د کاراوکی په اړه خبرې 🎤 ``` انسان: ایا تاسو د کاراوکی جام لرئ؟ AI: او په بشپړه توګه! 😄 زه د یو ښه اولډ راک بیلډ لپاره تیار یم. "په لمانځه کې ژوند کول" زما د کاراوکی جام دی! 🎤 ``` ### د DIY پروژو په اړه خبرې 🎨 ``` انسان: ایا تاسو په کوم DIY پروژو یا هنرونو کې ښه یاست؟ AI: 😊 زه واقعیا د DIY پروژو لوی مینه وال یم! ما په انځور کولو، ګاڼو جوړولو کې لاس اچولی دی. یو ځل، ما حتی هڅه وکړه چې خپلې شمعې جوړې کړم... یوه تجربه وه! 🎨 ``` ## 🧹 د ډیټا کیفیت - ✅ **بې تکراري**: د MD5 هشینګ له لارې ټول تکراري ریکارډونه لرې شوي - ✅ **پاکول**: نیمګړي او غیر معیاري متنونه فلټر شوي - ✅ **معیاري کول**: ټولې خبرې اترې یو شان بڼې ته راوړل شوي - ✅ **Resume ملاتړ**: د پروسس د بیا پیل کیدو وړتیا ## 🗺️ د ډیټا سرچینه دا ډیټاسیټ د انګلیسي آنلاین خبرو اترو ژباړل شوې نسخه ده چې د پښتو ژبې د AI ماډلونو د روزنې لپاره چمتو شوې ده. ### ترسره شوي بدلونونه: 1. ✅ بشپړ انګلیسي → پښتو ژباړه 2. ✅ د خبرو اترو طبیعي توب ساتل 3. ✅ د ایموجي ساتنه 4. ✅ کلتوري تطابق 5. ✅ د Resume-ready پایپ لاین ## 🤝 ونډه او ملاتړ **غواړئ د پښتو AI په وده کې برخه واخلئ؟** - ⭐ دا ریپوزټري ستوری کړئ - 🐛 ستونزې راپور کړئ - 🔧 وړاندیزونه واستوئ - 📢 د ملګرو سره یې شریک کړئ ## 📄 لایسنس دا ډیټاسیټ د **Apache License 2.0** لاندې خپور شوی، چې سوداګریز او څیړنیز استعمال د مناسب منسوب سره اجازه لري. --- ## 🔗 چټک لینکونه [![HuggingFace](https://img.shields.io/badge/🤗-View_on_HuggingFace-ffd21e)](https://huggingface.co/datasets/nassimjp/Pashto-Online-Conversations) --- **🌟 که دا ډیټاسیټ ستاسو لپاره ګټور و، نو ستوری ورکول مه هېروئ!** **🇦🇫 د پښتو آنلاین خبرو اترو راتلونکی جوړوو!** *Building the future of Pashto online conversations together!*

This is a dataset named پښتو آنلاین خبرې اترې - Pashto Online Conversations, designed for AI model training. It contains over 100,000 natural, simple, and engaging Pashto online conversations, covering daily chats, jokes, fictional stories, and friendly exchanges among online friends. The dataset emphasizes naturalness, with conversations derived from real daily language; diversity, ranging from simple humor to deep philosophical discussions; completeness, ensuring two-way and full dialogues; and cultural alignment, matching Pashto culture, traditions, and values. Data is stored in JSONL format, with each record containing a list of conversations, each with from (sender type, e.g., human or gpt) and value (dialogue text) fields. The dataset is categorized by topics, including humor/jokes, movies/TV, music, food/cooking, general chat, art/DIY, travel/adventure, and intellectual discussions. It undergoes rigorous quality control, including deduplication, cleaning, standardization, and supports resume capability. The dataset is a translated version of English online conversations into Pashto, preserving naturalness, emojis, and cultural adaptation. It is suitable for text-generation tasks and is licensed under Apache 2.0.

提供机构:
nassimjp
搜集汇总
数据集介绍
nassimjp/Pashto-Online-Conversations 数据集图片
构建方式
该数据集以英语在线对话为源语料,经完整机器翻译与人工后编辑转化为普什图语,保留原始对话的双向互动结构及表情符号,并依据普什图文化习俗调整表达方式。构建流程涵盖MD5哈希去重、残缺与非规范文本过滤、格式统一化以及断点续传式处理管线,最终生成逾两万条训练样本,以JSONL格式封装为单一训练集分片,便于直接加载与微调。
使用方法
使用者可借助Hugging Face数据集库以一行代码加载训练集,并遍历对话字段查看或处理样本。集成LLaMA-Factory等微调框架时,指定数据集名称与对话模板即可启动指令微调,支持Qwen等基座模型。数据亦可供研究普什图语会话结构、情感表达及低资源语言生成任务,使用须遵循Apache 2.0许可并适当署名。
背景与挑战
背景概述
普什图语作为低资源语言,长期缺乏大规模、自然的口语化对话语料,制约了其语言模型在生成与交互任务上的发展。为弥合这一数字鸿沟,研究人员创建了Pashto-Online-Conversations数据集,旨在为普什图语AI模型提供贴近日常生活的多轮对话资源。该数据集包含逾10万条对话,覆盖幽默、影视、音乐、饮食、艺术、旅行及哲学思考等多元主题,源自英文在线对话的翻译与本地化改编。其问世填补了普什图语对话式AI训练数据的空白,为指令微调与聊天模型研究提供了关键支撑,对推动低资源语言的自然语言处理具有深远影响。
当前挑战
该数据集所应对的核心领域问题在于低资源语言对话生成中自然性与文化适切性的双重缺失。构建过程中面临的挑战包括:源语对话的翻译质量与语义保真之间的平衡,需在保持对话流畅的同时避免直译导致的生硬;普什图语方言与口语表达的多样性使得标准化与自然性难以兼顾;文化适配要求对话内容符合普什图社会规范与价值观,而原始英文语料中的某些概念需经创造性转化;此外,去重、清洗与格式统一等工程环节亦需精细处理,以确保数据质量与模型训练的有效性。
常用场景
经典使用场景
在低资源语言对话系统构建领域,该数据集以逾两万组自然双人对话为语料基础,典型应用于大语言模型的指令微调与对话生成任务。研究者常将其载入LLaMA-Factory等训练框架,对Qwen、LLaMA等基座模型实施监督微调,使模型习得普什图语日常会话中的口语化表达、情感回应与话题延展能力,进而评测其在普什图语多轮对话中的流畅度与语义连贯性。
解决学术问题
普什图语作为低资源语言,长期面临对话语料稀缺、模型生成能力孱弱及文化适配不足等学术困境。该数据集通过大规模真实在线闲聊的采集与标准化清洗,缓解了对话生成研究中数据匮乏与质量参差的问题,为探究低资源语言下的指令遵循、情感一致性与跨文化语用迁移提供了可复现的实验基座,推动了普什图语自然语言处理从单句任务向交互式生成的范式拓展。
实际应用
在实际应用层面,该数据集支撑普什图语智能聊天助手、社交媒体内容审核辅助工具以及语言学习平台的对话引擎开发。其涵盖幽默、影视、音乐、饮食与旅行等生活化主题,使部署于客服问答、娱乐陪伴与跨语言社交场景中的对话系统能够生成贴近本土文化语境的回应,并借助Apache 2.0许可便利商业与非商业产品的快速集成与迭代。
数据集最近研究
最新研究方向
在低资源语言智能化的浪潮中,普什图语对话数据集Pashto-Online-Conversations的构建标志着该语言在生成式AI领域迈出了关键一步。当前研究聚焦于利用该数据集对多语言大模型进行指令微调与监督式微调,以提升模型在普什图语日常会话、幽默表达及文化语境下的生成流畅度与情感贴合度。围绕该数据集的近期工作还探索了跨语言迁移学习策略,即将英语对话能力迁移至普什图语,同时保留原语言的情感色彩与网络文化特征。此外,该数据集亦被用于评估大模型在低资源场景下的对话一致性、文化适应性与安全性,为普什图语AI的伦理部署与社区赋能提供了实证基础,对推动阿富汗及全球普什图语社群的数字包容具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务