AraMuST files before normalization old version
收藏资源简介:
AraMuST is a large-scale unified Arabic dataset designed for multi-task learning across text summarization and topic classification tasks.It consolidates and harmonizes three major publicly available resources XL-Sum, SANAD, and NADCG under a single standardized schema. The dataset provides high-quality text–summary pairs and consistent topic labels across 8 major categories (Sports, Politics, Finance, Technology, Medical, Culture, Religion, and Accidents). Rigorous quality filtering and multi-step validation were conducted to ensure reliability and prevent data leakage. Duplicates across datasets were detected and removed using MD5 hashing and embedding-based cosine similarity. Each entry in AraMuST follows a unified JSONL structure:{"task": "classification|summarization|classification+summarization", "text": str, "summary": str|NA, "label": str|NA, "source": str} Composition:Total samples: 2,143,833Tasks: Summarization, Classification, and Joint Summarization + ClassificationCategories: 8 (Sports, Politics, Finance, Medical, Technology, Culture, Religion, Accidents) AraMuST aims to support Arabic Natural Language Processing (NLP) research in areas such as: Abstractive text summarization Topic and news classification Multi-task learning and transfer learning Model evaluation and benchmarking All data sources were pre-existing open-access corpora, reprocessed and aligned for research reproducibility and academic use.



