遇见数据集

COVID-19相关推文数据集

收藏
arXiv2023-10-06 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

本研究使用了一个关于COVID-19的推文数据集,该数据集由6420条推文筛选并清洗后得到3049条有效数据,其中2161条标记为‘真实’,888条标记为‘虚假’。数据集主要来源于官方Twitter账号和事实核查网站,如PolitiFact、Poynter和Snopes。创建过程中,研究助理对每条推文进行了手动标记和分类,确保数据准确性。该数据集用于分析假新闻与真实新闻的语义特征,旨在通过语言分析提高社交媒体信息的真实性和可信度。

This study utilizes a COVID-19-focused tweet dataset. Initially consisting of 6,420 tweets, the dataset was filtered and cleaned to yield 3,049 valid entries, with 2,161 labeled as 'real' and 888 as 'fake'. The dataset is primarily sourced from official Twitter accounts and reputable fact-checking websites including PolitiFact, Poynter, and Snopes. During the dataset curation process, research assistants manually labeled and categorized each tweet to ensure data accuracy. This dataset is applied to analyze the semantic features of real and fake news, with the objective of enhancing the authenticity and credibility of social media information through linguistic analysis.

提供机构:
未提及
创建时间:
2023-10-06
搜集汇总
数据集介绍
COVID-19相关推文数据集 数据集图片
构建方式
该数据集以COVID-19疫情期间社交媒体上的虚假与真实信息为研究对象,构建过程涵盖文本与语音两个维度。文本数据源自Patwa等人于2021年整理的6420条推文,经过研究助理的人工标注与清洗,剔除了误分类、重复及非严格虚假内容,最终保留3049条推文,其中2161条标记为‘真实’,888条标记为‘虚假’。语音数据则通过TikTok平台自行采集,聚焦于与COVID-19相关的视频内容,研究助理利用新创建的账号搜索特定话题标签,记录视频元数据并转录语音与字幕,随后依据至少三个可信来源进行事实核查,将200条视频标注为91条‘真实’与109条‘虚假’,共计53,710词。
特点
该数据集的核心特点在于其多模态与精细化标注。文本部分涵盖了来自Twitter、Facebook、WhatsApp、Instagram及图片等多种来源,反映了虚假信息在社交网络中的传播多样性。语音部分则首次将TikTok视频纳入分析,捕捉了口语化表达中的语言特征。数据集的标注体系尤为严谨,不仅区分‘真实’与‘虚假’,还引入了‘无关’、‘非新闻’、‘呼吁’、‘模糊’及‘讽刺’等子类别,有效剔除了歧义内容。此外,研究利用LIWC软件对感知词、认知过程词、情感词、句子长度及可读性等语言特征进行量化分析,揭示了虚假新闻在情感表达、断言性与否定性上的显著差异。
使用方法
该数据集适用于多任务场景下的虚假信息检测与语言特征研究。用户可直接加载清洗后的文本与语音数据,用于训练或评估分类模型,如基于LSTM或Transformer架构的虚假新闻识别系统。语音数据需先进行文本转录与预处理,去除URL、话题标签及提及符号,再结合LIWC词典提取心理语言学特征。研究者可对比不同模态(书面与口语)下的语言模式差异,或利用标注的子类别(如‘讽刺’与‘呼吁’)进行细粒度分析。数据集的元数据(如粉丝数、点赞数)还可用于探究社交影响力与信息可信度之间的关联,为理解语言在信任塑造与虚假信息传播中的作用提供实证基础。
背景与挑战
背景概述
在新冠疫情期间,社交媒体平台成为信息传播的核心渠道,但同时也催生了规模空前的虚假信息泛滥,即所谓的“信息疫情”。为深入探究虚假新闻与真实新闻在语言特征上的本质差异,Ng Bee Chin及其研究团队于2021年构建了COVID-19相关推文数据集。该数据集以Patwa等人(2021)的原始语料为基础,经过严格的人工清洗与重分类,最终包含3049条推文,其中2161条标注为“真实”,888条标注为“虚假”。研究聚焦于通过语言学分析与计算模型揭示虚假新闻在情感表达、认知过程词使用及可读性等方面的独特模式,为理解语言如何塑造信任、影响社交媒体互动及推动虚假信息传播提供了重要实证基础。该数据集在虚假新闻检测、计算语言学及公共卫生传播领域具有广泛影响力,成为跨学科研究的关键资源。
当前挑战
该数据集面临的核心挑战在于虚假新闻检测的领域难题:虚假信息常采用高度情感化、断言式及负面化的语言策略,与真实新闻在风格上存在微妙但关键的区别,然而现有语言学理论对特定文体特征有效性的解释仍显不足,跨研究间的一致性也亟待提升。在构建过程中,数据质量保障是重大挑战——原始语料中约三分之二的虚假推文存在误分类或重复问题,需通过人工逐条审核与重新标注来纠正,涉及“无关”、“非新闻”、“呼出”、“讽刺”等多个细分类别的判别。此外,多模态数据整合(如TikTok视频中的语音转录与字幕)、算法偏差规避(如创建新账号以减少推荐系统影响)以及跨平台来源的一致性标注,均对数据集的规模控制与标注可靠性构成了严峻考验。
常用场景
经典使用场景
在信息疫情肆虐的时代背景下,该数据集为探究虚假新闻的语言学特征提供了宝贵的文本与语音双重语料。其经典使用场景聚焦于利用计算语言学方法,对社交媒体中关于COVID-19的真实与虚假推文进行系统性对比分析。研究者常借助该数据集,通过情感分析、可读性评估及认知过程词频统计等维度,挖掘虚假信息在句式长度、情绪色彩及非正式程度上的独特模式,从而构建基于语言风格的识别框架。
解决学术问题
该数据集有效回应了虚假新闻检测领域中理论解释匮乏与跨研究共识不足的学术困境。通过精细化的数据清洗与多类别标注(如真实、虚假、讽刺、质疑等),它解决了以往研究中样本混杂、分类模糊的问题。研究揭示出虚假新闻更倾向使用情感化、断言性与负面性语言,这一发现深化了对信任机制与信息操纵语言学根源的理解,为虚假信息传播的量化研究奠定了坚实的实证基础。
衍生相关工作
该数据集衍生了一系列开创性工作,例如结合LIWC词典的多维度语言特征分析,推动了从理论驱动到数据驱动的虚假新闻检测模型演进。后续研究在此基础上,进一步探索了跨平台(如Twitter与TikTok)的语言差异,并引入注意力机制与预训练语言模型,以增强对复杂欺骗性话语的捕捉能力。这些工作不仅拓展了计算社会科学的研究边界,也为多模态虚假信息检测提供了方法论启示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务