Farah21/reddit-tunisia-qa
收藏资源简介:
Reddit Tunisia Tech QA数据集是一个多语言指令调优数据集,基于Reddit讨论构建,重点关注突尼斯和中东及北非(MENA)地区的技术社区。该数据集包含4,541个高质量的指令跟随问答对,这些数据收集并过滤自专注于编程、机器学习、自由职业、Web开发和科技讨论的Reddit社区。作为TunisIA-Co-Lab倡议的一部分,该数据集旨在支持突尼斯阿拉伯语和多语言自然语言处理(NLP)研究。数据集经过多阶段过滤和清洗,包括语言规范化、重复去除、质量排名、技术相关性评分以及NSFW和有害内容过滤。最终数据集以Alpaca格式结构化,包含指令、输入、输出、来源、方言、质量分数等列。数据来源包括r/Tunisia、r/learnprogramming、r/cscareerquestions等多个Reddit子社区。
The Reddit Tunisia Tech QA Dataset is a multilingual instruction-tuning dataset built from Reddit discussions with strong Tunisian and MENA tech-community presence. It contains 4,541 high-quality instruction-following QA pairs collected and filtered from Reddit communities focused on programming, machine learning, freelancing, web development, and technology discussions. Built as part of the TunisIA-Co-Lab initiative to support Tunisian Arabic and multilingual NLP research, the dataset underwent multiple filtering and cleaning stages, including language normalization, duplicate removal, quality ranking, technical relevance scoring, and NSFW and toxic-content filtering. The dataset is structured in Alpaca format with columns such as instruction, input, output, source, dialect, quality_score, and more. Sources include subreddits like r/Tunisia, r/learnprogramming, r/cscareerquestions, among others.




