nassimjp/Pashto-Online-Conversations
收藏资源简介:
--- license: apache-2.0 language: - ps - en tags: - conversations - conversational - chat - pashto - sft - instruction-tuning - online-chats - casual-conversations - daily-life - memes - entertainment pretty_name: پښتو آنلاین خبرې اترې - Pashto Online Conversations size_categories: - 10k<n<100k task_categories: - text-generation dataset_info: features: - name: conversations list: - name: from dtype: string - name: value dtype: string splits: - name: train num_bytes: 217027845 num_examples: 22428 download_size: 90292150 dataset_size: 217027845 configs: - config_name: default data_files: - split: train path: data/train-* --- # 💬 پښتو آنلاین خبرې اترې ## Pashto Online Conversations Dataset [](https://huggingface.co/datasets/nassimjp/Pashto-Online-Conversations) [](LICENSE) [](https://en.wikipedia.org/wiki/Pashto) [](https://huggingface.co/datasets/nassimjp/Pashto-Online-Conversations) > **🌟 د پښتو ژبې لپاره تر ټولو لوی او طبیعي آنلاین خبرو اترو ډیټاسیټ** > *The largest and most natural online conversations dataset for the Pashto language* دا ډیټاسیټ د **۱۰۰،۰۰۰+** طبیعي، ساده او په زړه پورې پښتو خبرو اترو مجموعه ده چې د AI ماډلونو د روزنې لپاره چمتو شوې ده. پدې کې هره ورځیني خبرې، مزاح، خیالي کیسې، او د آنلاین دوستانو ترمنځ د مینه والو خبرې شاملې دي. ## 🎯 د دې ډیټاسیټ ځانګړتیاوې | ځانګړتیا | توضیح | |-----------|--------| | **طبیعي توب** | خبرې اترې د ریښتینو خلکو د ورځني ژوند له ژبې سره سمون لري | | **تنوع** | له ساده مزاح څخه تر ژورو فلسفي بحثونو پورې | | **دوام** | هر خبره اتره دوه اړخیزه او بشپړه ده | | **کلتوري مطابقت** | د پښتو کلتور، دودونو او ارزښتونو سره سم | ## 📊 د ډیټاسیټ لنډیز | عنوان | ارزښت | |-------|-------| | **خاوند** | نسیم (`nassimjp`) | | **ټول ریکارډونه** | ۱۰۰،۰۰۰+ ځانګړې خبرې اترې | | **ژبه** | اصلي پښتو | | **د کارولو اصلي ځای** | د AI ماډلونو روزنه او ټیوننګ | | **لایسنس** | Apache 2.0 | | **بڼه** | JSONL | | **د خبرو اترو منځنۍ اوږدوالی** | ۲-۳ پیغامونه | ## 🗂️ د ډیټا جوړښت هر ریکارډ د لاندې بڼې مطابق دی: ```json { "conversations": [ { "from": "human", "value": "اوه، ما یوازې غوره میم ولید - ایا تاسو یې لیدلی دی؟" }, { "from": "gpt", "value": "😂 آه، نه ما نه دی لیدلی! زه مړه کېږم چې پوه شم، دا میم د څه په اړه دی؟ ایا دا یو مسخره پیشو دی یا یو مسخره حالت؟ راز ماته خلاص کړه! 🤣" } ] } ``` ### د ساحو توضیح | ساحه | ډول | توضیح | |------|------|--------| | `conversations` | لیست | د پیغامونو لړۍ | | `from` | متن | د لیږونکي ډول (`human` یا `gpt`) | | `value` | متن | د خبرې اترې اصلي متن | ## 🔥 د خبرو اترو موضوعات | کټګورۍ | شمېر | سلنه | |----------|-------|--------| | 😂 مزاح او ټوکې | ۲۵،۰۰۰+ | ۲۵٪ | | 🎬 فلمونه او تلویزیون | ۲۰،۰۰۰+ | ۲۰٪ | | 🎵 موسیقي | ۱۵،۰۰۰+ | ۱۵٪ | | 🍔 خواړه او پخلی | ۱۰،۰۰۰+ | ۱۰٪ | | 💡 عمومي خبرې | ۱۰،۰۰۰+ | ۱۰٪ | | 🎨 هنر او DIY | ۱۰،۰۰۰+ | ۱۰٪ | | 🌍 سفر او سېلانی | ۵،۰۰۰+ | ۵٪ | | 🧠 فکري بحثونه | ۵،۰۰۰+ | ۵٪ | | **ټول** | **۱۰۰،۰۰۰+** | **۱۰۰٪** | ## 💻 د کارولو بېلګه ### د Hugging Face سره ```python from datasets import load_dataset # ډیټاسیټ بار کړئ dataset = load_dataset("nassimjp/Pashto-Online-Conversations", split="train") # یوه بېلګه وګورئ example = dataset[0] for message in example["conversations"]: print(f"{message['from']}: {message['value']}") # د ډیټاسیټ اندازه print(f"ټولې خبرې اترې: {len(dataset):,}") ``` ### د LLaMA-Factory سره روزنه ```bash llamafactory-cli train \ --model_name_or_path Qwen/Qwen2-7B \ --dataset pashto-online-conversations \ --template qwen \ --output_dir ./output \ --per_device_train_batch_size 4 \ --learning_rate 2e-5 ``` ## 📝 د خبرو اترو بېلګې ### مزاح او ټوکې 😂 ``` انسان: اوه، ما یوازې غوره میم ولید - ایا تاسو یې لیدلی دی؟ AI: 😂 آه، نه ما نه دی لیدلی! زه مړه کېږم چې پوه شم، دا میم د څه په اړه دی؟ راز ماته خلاص کړه! 🤣 ``` ### د کاراوکی په اړه خبرې 🎤 ``` انسان: ایا تاسو د کاراوکی جام لرئ؟ AI: او په بشپړه توګه! 😄 زه د یو ښه اولډ راک بیلډ لپاره تیار یم. "په لمانځه کې ژوند کول" زما د کاراوکی جام دی! 🎤 ``` ### د DIY پروژو په اړه خبرې 🎨 ``` انسان: ایا تاسو په کوم DIY پروژو یا هنرونو کې ښه یاست؟ AI: 😊 زه واقعیا د DIY پروژو لوی مینه وال یم! ما په انځور کولو، ګاڼو جوړولو کې لاس اچولی دی. یو ځل، ما حتی هڅه وکړه چې خپلې شمعې جوړې کړم... یوه تجربه وه! 🎨 ``` ## 🧹 د ډیټا کیفیت - ✅ **بې تکراري**: د MD5 هشینګ له لارې ټول تکراري ریکارډونه لرې شوي - ✅ **پاکول**: نیمګړي او غیر معیاري متنونه فلټر شوي - ✅ **معیاري کول**: ټولې خبرې اترې یو شان بڼې ته راوړل شوي - ✅ **Resume ملاتړ**: د پروسس د بیا پیل کیدو وړتیا ## 🗺️ د ډیټا سرچینه دا ډیټاسیټ د انګلیسي آنلاین خبرو اترو ژباړل شوې نسخه ده چې د پښتو ژبې د AI ماډلونو د روزنې لپاره چمتو شوې ده. ### ترسره شوي بدلونونه: 1. ✅ بشپړ انګلیسي → پښتو ژباړه 2. ✅ د خبرو اترو طبیعي توب ساتل 3. ✅ د ایموجي ساتنه 4. ✅ کلتوري تطابق 5. ✅ د Resume-ready پایپ لاین ## 🤝 ونډه او ملاتړ **غواړئ د پښتو AI په وده کې برخه واخلئ؟** - ⭐ دا ریپوزټري ستوری کړئ - 🐛 ستونزې راپور کړئ - 🔧 وړاندیزونه واستوئ - 📢 د ملګرو سره یې شریک کړئ ## 📄 لایسنس دا ډیټاسیټ د **Apache License 2.0** لاندې خپور شوی، چې سوداګریز او څیړنیز استعمال د مناسب منسوب سره اجازه لري. --- ## 🔗 چټک لینکونه [](https://huggingface.co/datasets/nassimjp/Pashto-Online-Conversations) --- **🌟 که دا ډیټاسیټ ستاسو لپاره ګټور و، نو ستوری ورکول مه هېروئ!** **🇦🇫 د پښتو آنلاین خبرو اترو راتلونکی جوړوو!** *Building the future of Pashto online conversations together!*
This is a dataset named پښتو آنلاین خبرې اترې - Pashto Online Conversations, designed for AI model training. It contains over 100,000 natural, simple, and engaging Pashto online conversations, covering daily chats, jokes, fictional stories, and friendly exchanges among online friends. The dataset emphasizes naturalness, with conversations derived from real daily language; diversity, ranging from simple humor to deep philosophical discussions; completeness, ensuring two-way and full dialogues; and cultural alignment, matching Pashto culture, traditions, and values. Data is stored in JSONL format, with each record containing a list of conversations, each with from (sender type, e.g., human or gpt) and value (dialogue text) fields. The dataset is categorized by topics, including humor/jokes, movies/TV, music, food/cooking, general chat, art/DIY, travel/adventure, and intellectual discussions. It undergoes rigorous quality control, including deduplication, cleaning, standardization, and supports resume capability. The dataset is a translated version of English online conversations into Pashto, preserving naturalness, emojis, and cultural adaptation. It is suitable for text-generation tasks and is licensed under Apache 2.0.




