遇见数据集

ICAConfPubs

收藏
arXiv2026-07-16 更新2026-07-17 收录
数据链接:
官方服务:

资源简介:

ICAConfPubs是由多所国际知名高校联合构建的学术会议论文数据集,系统收录了国际传播协会(ICA)2003年至2018年间的年度会议文献。该数据集规模宏大,涵盖27,466篇论文、21,038位作者及4,935场会议单元,数据来源为ICA官方会议网站的在线议程系统。其构建过程通过动态网络爬虫技术采集原始网页数据,并经过清洗整合为结构化CSV与JSON格式。本数据集主要应用于传播学领域的科学计量分析、学术趋势追踪及学科演化研究,旨在为学者提供开放可溯的会议文献基础设施,以弥补传统期刊数据的时空局限性,促进跨学科合作与学术生态的透明化探索。

ICAConfPubs is an academic conference paper dataset jointly constructed by multiple world-renowned universities. It systematically collects the annual conference proceedings of the International Communication Association (ICA) from 2003 to 2018. This large-scale dataset contains 27,466 papers, 21,038 authors, and 4,935 conference sessions, with data sourced from the online agenda system of the official ICA conference website. Its construction workflow involves collecting raw webpage data through dynamic web crawling technology, then cleaning and integrating the data into structured CSV and JSON formats. This dataset is primarily utilized for scientometric analysis, academic trend tracking, and disciplinary evolution research in the field of communication studies. It aims to provide scholars with an open and traceable conference literature infrastructure, so as to offset the temporal and spatial limitations of traditional journal data, and facilitate interdisciplinary cooperation and transparent exploration of the academic ecosystem.

创建时间:
2026-07-16
原始信息汇总

数据集概述:ICA会议论文数据集(2003–2018)

基本统计

  • 时间范围:2003年至2018年
  • 论文数量:27,466篇
  • 作者数量:21,038位
  • 分会场数量:4,935个

内容说明

该数据集收录了国际传播协会(ICA)2003年至2018年间的会议论文,总计27,466篇。系统支持通过语义相似度搜索,用户可以输入关键词、句子或段落来查找最相关的论文。

功能与访问

  • 搜索功能:支持语义相似度搜索,可调整返回结果数量(top 5 / 10 / 15 / 20 / 25)
  • 浏览方式:可按论文、作者、分会场分别浏览
  • API与数据:提供API文档、GitHub仓库、数据下载链接、论文PDF获取方式
搜集汇总
数据集介绍
ICAConfPubs 数据集图片
构建方式
ICAConfPubs数据集的构建源于对国际传播协会(ICA)年会在线项目系统的系统性抓取。研究团队利用Selenium动态爬虫技术,从allacademic.com平台获取了2003年至2018年间共27,466篇论文、21,038位作者及4,935个分会场的元数据。原始数据经历了三个不同阶段的结构变迁:2003-2004年仅包含论文与作者信息而缺失分会场与学组归属;2005-2013年补充了完整的会场组织信息;2014-2018年则引入了互动论文类别。经过数据清洗与整合,最终形成了论文、作者和会场三套CSV格式的核心数据集,并将其进一步聚合为支持嵌套结构的JSON格式文件,以提升数据的可解析性与应用灵活性。
特点
该数据集具有显著的规模性与结构化优势,涵盖了长达十六年的ICA年会学术产出,时间跨度完整且数据粒度丰富。每条论文记录包含标识符、标题、类型、摘要、作者数量、年份、所属分会场及学组等字段;作者数据详列其发表位置与所属机构;分会场数据则记录了主持人与组织形式。数据集的独特价值在于其突破了期刊文献发表周期长与出版偏见的局限,提供了近乎实时反映传播学前沿动态的窗口。此外,研究团队运用BERTopic对论文摘要进行了主题建模,提炼出政治传播、健康传播、新闻学、数字媒体等15个核心研究范畴,并揭示了其历时演变趋势,为领域演化分析奠定了量化基础。
使用方法
用户可通过多种途径灵活利用该数据集。基础方式为直接下载CSV或JSON格式的原始数据,进行定制化的科学计量分析。为方便程序化访问,研究团队构建了基于Next.js的RESTful API,支持通过论文ID、标题关键词、年份、作者姓名、分会场等参数进行精准检索与分页查询。此外,内置的语义搜索引擎采用OpenAI的text-embedding-3-small模型对全部论文进行向量化处理,并借助Pinecone向量数据库实现基于余弦相似度的自然语言查询,用户可输入长段落以寻找语义相关的论文。配套的React前端界面则提供了可视化的浏览体验,支持按年份筛选论文、按作者与分会场导航,从而降低数据探索门槛,服务传播学社群与跨学科研究者。
背景与挑战
背景概述
在传播学领域,国际传播协会年度会议作为全球规模最大、最具影响力的学术盛会,其历届论文资料蕴藏着丰富的学术研究脉络与学科发展轨迹。然而,长期以来,这些宝贵的会议数据——涵盖2003年至2018年间共计27,466篇论文、21,038位作者与4,935个分会场——始终散落在各年度官方网站与PDF格式的会议手册中,缺乏系统性的整合与开放访问渠道。由威斯康星大学麦迪逊分校、北京大学、印第安纳大学布鲁明顿分校、西北大学与密歇根大学的研究人员于近年共同创建的ICAConfPubs数据集,正是为填补这一空白而诞生。该数据集不仅实现了对过往十六年ICA年会论文的全面聚合与结构化处理,更以CSV与JSON双格式开放下载,并配套提供了API接口与交互式用户界面,为传播学领域的科学计量分析、学科演进追踪、研究灵感激发以及开放科学实践奠定了坚实的数据基础设施。
当前挑战
ICAConfPubs数据集所面临的挑战首先体现在其服务的核心领域问题上:长期困扰传播学界的学术研究偏见与出版偏倚,使得仅依赖期刊论文难以全面反映学科的真实面貌,而会议论文作为未正式发表的同行评议作品,其系统性匮乏导致研究者无法规避出版偏见、获取最新研究动向。其次,在数据集构建过程中,数据来源的异构性与结构复杂性构成了显著障碍——2003至2004年的在线程序缺失分会场信息,2005至2013年间虽结构相对规整但格式各异,而2014至2018年则经历了界面架构的重大变革并引入了互动论文类别,迫使研究团队采用Selenium动态爬取技术以应对不同时期网站的差异。此外,作者姓名消歧问题尤为棘手,由于所有作者均属于同一学科领域,且众多学生作者频繁变更所属机构,使得同名作者的区分近乎不可能,而2019年后及2003年以前的数据缺失也进一步限制了数据集的完整性与时序分析潜力。
常用场景
经典使用场景
在国际传播学领域,ICAConfPubs数据集最为经典的使用场景当属大规模的学术文献计量分析与学科演进脉络追踪。研究者可借助该数据集对2003年至2018年间国际传播协会(ICA)年会的27466篇论文、21038位作者及4935个分会场进行系统性审视。通过主题建模、共词分析及引文网络分析等计算方法,学界能够精确刻画传播学研究的主题分布特征与演化轨迹,揭示政治传播、健康传播、数字媒体等核心领域的兴衰变迁,从而为理解传播学科的智识版图提供前所未有的数据基础。
解决学术问题
该数据集有效回应了传播学研究中长期存在的几个关键学术难题。其一,它突破了传统学术发表数据库仅收录期刊论文的局限,通过整合未经期刊发表偏倚过滤的会议论文,为规避出版偏倚(publication bias)提供了宝贵的数据资源,使研究者能够触及那些因未呈现显著效应而难以见刊的学术探索。其二,ICAConfPubs的年度连续性与结构完备性,使得学者得以克服单一期刊或短时段分析的碎片化倾向,系统性地研究学科国际化进程、学术合作模式演变及研究者流动趋势等宏大议题。其三,基于该数据集的BERTopic主题建模工作已成功识别出15个主题类别,揭示了政治传播议题在2016年前后的显著增长,以及性别与身份研究比例的相对下降,为理解学科内部的知识生产动力机制提供了实证依据。
衍生相关工作
自ICAConfPubs数据集发布以来,已催生了一系列具有启发性的衍生研究工作。在主题建模方面,研究者运用BERTopic模型对论文摘要进行聚类分析,成功构建了包含政治传播、健康传播、数字媒体等15个主题类别的分类体系,并追踪了这些主题在2003至2018年间的时间演变趋势,发现政治传播类论文的占比从9.8%上升至18.8%。在作者合作网络分析维度,该数据集支撑了针对ICA年会论文合作模式的大规模考察,揭示了合著者数量的结构性增长——每篇论文的平均作者数在2014年前后突破两人,反映了传播学研究日益增强的跨学科协作趋势。此外,该数据集还服务于对学术会议中性别与种族多样性的系统评估,相关研究通过分析21038位作者的参与记录,为理解传播学界的结构性不平等提供了实证基础,并推动了后续对学术发表系统中边缘群体代表性问题的深入讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务