Trump Campaign Corpus
收藏资源简介:
Trump Campaign Corpus包含了Donald Trump的演讲、访谈、辩论、市政厅会议、新闻发布会、书面声明和推文。该数据集覆盖了从2015年6月16日宣布参选至2016年11月8日选举日的时间段。目前,我们已经收集了超过1千条通信和4.4千条推文的部分或全部内容。这些内容代表了将近3百万个Trump的词汇以及1百万个采访者和辩论对手的词汇。所有转录都是人工制作的,尽管风格和质量有所不同。
The Trump Campaign Corpus encompasses speeches, interviews, debates, town hall meetings, press conferences, written statements, and tweets by Donald Trump. This dataset spans from June 16, 2015, when he announced his candidacy, to November 8, 2016, the election day. To date, we have collected partial or complete content from over 1,000 communications and 4,400 tweets. These contents represent nearly 3 million words from Trump and 1 million words from interviewers and debate opponents. All transcriptions are manually produced, although there are variations in style and quality.
数据集概述
数据集名称
Trump Campaign Corpus
数据集内容
包含Donald Trump在2015年6月16日至2016年11月8日期间的演讲、访谈、辩论、市政厅会议、新闻发布会、书面声明和推文。总计收集了超过1,000次沟通记录和4,400条推文,总计近300万特朗普言论和100万访谈者及辩论对手言论。
数据集格式
- JSON文件:包含所有数据,包括推文。
- 文本文件:按日期命名的单个文件,不包含推文。
数据集结构
- 文本格式:每段对话以说话者全名大写开头,如
DONALD TRUMP: I would have a very, very good relationship with Putin ...。 - 元数据:包括发布日期、类型、参与人物、事件、标题、是否按原话记录、完整性、地点、发布者等信息。
数据集用途
主要用于文本分析和批评,特别关注时间模式。
数据集版权
大部分内容来自媒体网站,主要版权受限,仅限于公共利益研究使用。




