FASSILA
收藏资源简介:
FASSILA数据集是由阿尔及利亚方言(AD)的专家创建的,专门用于假新闻检测和情感分析。该数据集包含10,087个句子,涵盖超过19,497个独特的阿尔及利亚方言词汇,涉及七个不同的领域。数据集的创建过程包括从社交媒体平台(如Facebook和YouTube)收集数据,进行数据清洗和标注。FASSILA数据集的应用领域主要集中在阿尔及利亚方言的计算语言学研究,旨在解决假新闻检测和情感分析的问题,特别是在低资源语言环境中。
The FASSILA dataset was developed by experts in Algerian Dialect (AD), specifically tailored for fake news detection and sentiment analysis. It contains 10,087 sentences, covering over 19,497 unique Algerian Dialect vocabulary terms and spanning seven distinct domains. The dataset construction process involves collecting data from social media platforms such as Facebook and YouTube, followed by data cleaning and annotation. The primary application scenarios of the FASSILA dataset focus on computational linguistics research for Algerian Dialect, aiming to address the challenges of fake news detection and sentiment analysis, particularly in low-resource language environments.
FASSILA 数据集概述
数据集描述
FASSILA 是一个用于阿尔及利亚方言的假新闻和情感分析语料库,包含了从数据分析到训练的所有代码。
数据集内容
- 数据分析脚本:用于对阿拉伯语文本数据进行分析,包括计算现代标准阿拉伯语(MSA)单词、确定词汇量和计算拉丁字符。
使用说明
-
环境设置:
- 确保系统已安装 Python。
- 使用 pip 安装所需的库: bash pip install pandas
-
克隆仓库: bash git clone https://github.com/your_username/arabic-language-analysis.git cd arabic-language-analysis
-
配置文件路径:
- 在脚本中替换数据集文件路径: python path = "path/to/your/msa_dataset.csv" path2 = "path/to/your/latin_dataset.csv"
-
运行代码: bash python analyze_arabic.py
引用
bibtex @article{abdedaiem2023fake, title={Fake News Detection in Low Resource Languages using SetFit Framework}, author={Abdedaiem, Amin and Dahou, Abdelhalim Hafedh and Cheragui, Mohamed Amine}, journal={Inteligencia Artificial}, volume={26}, number={72}, pages={178--201}, year={2023} }

- 1FASSILA: A Corpus for Algerian Dialect Fake News Detection and Sentiment AnalysisGESIS – 莱布尼茨社会科学研究所 · 2024年



