2024 U.S. Election Multimodal AIGC Dataset
收藏资源简介:
该数据集包括文本和图像两个部分。文本部分包括一个AI文本分类器及其训练集,由四个领先AI模型生成的推文以及来自ChatGPT时代之前的由人类编写的推文组成。图像部分则是一个由GPT-4o分类的图像数据集。
This dataset comprises two components: text and image modalities. The text component includes an AI text classifier and its training corpus, which is constructed from tweets generated by four state-of-the-art AI models and human-written tweets predating the ChatGPT era. The image component is an image dataset classified by GPT-4o.
2024 U.S. Election Multimodal AIGC Dataset 概述
数据集简介
- 数据集名称:2024 U.S. Election Multimodal AIGC Dataset
- 数据集组成:包含文本和图像两个部分
- 文本部分:包括AI文本分类器和其训练集,由四种领先AI模型生成的推文以及ChatGPT之前时代的人类撰写的推文组成
- 图像部分:由GPT-4o分类和标记的图像数据集
文本数据集
- 数据来源:基于Dmonte等人(2024年)的方法论构建,并使用Cinus等人(2025年)建议的提示进行 refined
- 包含内容:
- 人类撰写的推文:从2020年美国总统选举相关数据集中随机抽样
- AI生成的推文:针对每个人类撰写的推文,使用四种不同的AI模型生成对应的推文
- 数据拆分:分为训练集和测试集,适用于二元分类任务
- 数据位置:位于
text_dataset文件夹中,训练和测试数据集分别为train.csv和test.csv,每个LLM的推文对存放在human_ai_tweet_pairs文件夹中
模型训练
- 模型类型:RoBERTa模型
- 训练细节:使用AdamW优化器,学习率为1e-5,训练3个周期,验证集上的F1分数为0.96
- 训练命令:
python train.py
图像数据集
- 数据分类:使用GPT-4o过滤和标记
- 分类结果:分为AI生成的图像和非AI生成的图像
- 数据组织:
- 按月分文件夹:七月、八月、九月
- 每月文件夹内容:多个CSV文件,每个文件存储最多100,000条记录
- CSV文件格式:包含
content(分类结果),image_url(图像链接),tweet_url(原始推文链接)三列
- 数据统计:共包含2,228,462张分类图像,七月、八月、九月分别有1,130,560、519,687、578,215张图像
- 文件结构:数据集按月组织,每月包含多个以
chunk_0.csv开始的CSV文件,按序编号
使用说明
- 过滤图像:使用
content列过滤AI生成与非AI生成图像 - 追踪原始内容:利用
image_url和tweet_url追溯原始图像和推文
引用
- 论文引用:请参考以下Bibtex格式
bibtex @misc{chen2025prevalencesharingpatternsspreaders, title={Prevalence, Sharing Patterns, and Spreaders of Multimodal AI-Generated Content on X during the 2024 U.S. Presidential Election}, author={Zhiyi Chen and Jinyi Ye and Emilio Ferrara and Luca Luceri}, year={2025}, eprint={2502.11248}, archivePrefix={arXiv}, primaryClass={cs.SI}, url={https://arxiv.org/abs/2502.11248}, }




