遇见数据集

EventKG+Click

收藏
arXiv2020-10-23 更新2024-06-21 收录
官方服务:

资源简介:

EventKG+Click是由德国汉诺威莱布尼茨大学的L3S研究中心创建的一个多语言事件中心用户交互痕迹数据集。该数据集基于事件中心知识图谱EventKG和维基百科点击流,涵盖了英语、德语和俄语三种语言,包含超过4000个事件和近10000个事件中心点击对。数据集的创建旨在通过分析用户在跨语言环境下的交互行为,帮助开发和评估新的用户交互模型,以克服语言障碍,特别是在数字人文、媒体研究和新闻等领域。

EventKG+Click is a multilingual event-centric user interaction trace dataset developed by the L3S Research Center of Leibniz University Hannover, Germany. This dataset is built upon the event-centric knowledge graph EventKG and Wikipedia clickstream data, covering three languages including English, German and Russian, and contains more than 4,000 events and nearly 10,000 event-centric click pairs. The dataset was constructed to aid the development and evaluation of novel user interaction models for overcoming language barriers by analyzing user interaction behaviors in cross-lingual environments, particularly in fields such as digital humanities, media studies, and journalism.

提供机构:
L3S 研究中心
创建时间:
2020-10-23
搜集汇总
数据集介绍
EventKG+Click 数据集图片
构建方式
EventKG+Click数据集融合了事件中心知识图谱EventKG与多语言维基百科点击流数据,以构建跨语言用户交互轨迹的基准资源。具体而言,研究团队选取了2019年12月期间英语、德语和俄语三种维基百科语言版本的点击流记录,从中提取了源页面与目标页面均为维基百科文章且被超链接相连的点击对。随后,将这些点击对中的事件与实体映射至EventKG知识图谱,仅保留在三种语言中均出现且目标页面为事件的条目,并过滤掉点击次数少于10次的实体,最终得到超过4000个事件和近10000个事件中心点击对。
特点
该数据集的核心特点在于其跨语言视角与语言特异性得分的引入。通过平衡不同语言版本点击量的差异,并计算事件在特定语言中的点击占比,数据集定义了语言特异性事件相关性和语言特异性关系相关性两项分数,从而量化事件及其关系在不同语言社区中的相对重要性。此外,数据集还纳入了事件地点接近性、语言社区提及次数和事件时效性等影响因素,为分析跨语言用户行为差异提供了多维度的解释框架。
使用方法
EventKG+Click数据集可直接用于训练和评估跨语言事件中心用户交互模型,例如事件检索或推荐系统。用户可利用数据集中提供的语言特异性事件相关性分数,作为模型训练的标签或评估基准,以捕捉不同语言社区对事件的差异化关注。同时,数据集中的事件地点接近性等影响因素可用于分析用户点击行为的潜在驱动因素。数据集以公开的GitHub仓库形式发布,便于研究者直接下载并集成到其工作流中。
背景与挑战
背景概述
在跨语言信息分析需求日益增长的背景下,事件中心型知识图谱如EventKG为多语言事件语义提供了坚实基础,然而反映用户跨语言交互轨迹的数据集却极为匮乏。2020年,德国莱布尼茨大学L3S研究中心的Sara Abdollahi、Simon Gottschalk与Elena Demidova共同构建了EventKG+Click数据集,旨在弥合这一鸿沟。该数据集融合了EventKG知识图谱(涵盖超过120万事件、九种语言)与维基百科点击流数据(覆盖英语、德语、俄语三种语言版本),通过计算语言特定相关性得分,揭示了不同语言社群对事件及其关系的差异化关注。作为首个结合语义知识与真实用户交互痕迹的跨语言事件数据集,它为训练和评估跨语言用户交互模型提供了基准参考,对数字人文、媒体研究与新闻学等领域具有重要推动作用。
当前挑战
该数据集面临的核心挑战在于:第一,跨语言用户交互模型的研究尚处起步阶段,缺乏现成的评估基准与训练数据,导致模型难以捕捉语言社群间的差异化事件偏好。第二,构建过程中需应对多源异构数据的对齐难题——维基百科点击流仅反映用户导航行为,而EventKG知识图谱中的事件语义需与点击流中的实体精确映射,且不同语言版本的数据规模极不均衡(英语点击量是德语的7倍),需设计平衡化算法消除语言版本流行度偏差。第三,语言特定相关性的量化需同时排除全局性事件干扰,确保得分能真实反映某一语言社群独有的兴趣焦点,这对评分函数的鲁棒性提出了严苛要求。
常用场景
经典使用场景
在跨语言事件分析的研究领域中,EventKG+Click数据集为探究用户在不同语言社区中的事件交互行为提供了宝贵的资源。该数据集融合了EventKG知识图谱中的事件语义信息与维基百科点击流数据,涵盖了英语、德语和俄语三种语言版本的用户交互轨迹。研究者常利用该数据集进行语言特异性事件排名任务,通过计算事件在特定语言中的相对点击频率,揭示不同语言社区对同一事件关注度的差异。例如,德语用户对“2016年柏林卡车袭击”事件表现出更高的兴趣,而英语用户则更关注“东南亚运动会”,这生动体现了语言社区视角的多样性。该场景的核心在于利用点击流数据量化事件的语言特异性相关性,从而支持跨语言信息检索与推荐系统的评估。
解决学术问题
EventKG+Click数据集有效解决了跨语言事件分析中缺乏真实用户交互基准的学术难题。在数字人文、媒体研究与新闻学等领域,学者们常面临语言壁垒阻碍事件多样性分析的困境。该数据集通过提供语言特异性事件相关性评分,使得研究者能够量化并比较不同语言社区对同一事件的关注程度,从而深入探究文化偏见、报道差异及信息传播模式。例如,通过分析事件位置邻近性因素,研究发现用户更倾向于点击与自身语言社区地理位置相近的事件,这为理解跨语言信息行为提供了实证依据。该数据集的发布填补了跨语言用户交互模型训练与评估的空白,推动了事件中心知识图谱在跨文化研究中的应用,其影响体现在为后续开发语言感知的推荐算法与个性化检索系统奠定了数据基础。
衍生相关工作
EventKG+Click数据集的发布催生了多项衍生研究工作。例如,Gottschalk等人基于该数据集开发了EventKG+TL系统,利用维基百科链接计数建模事件重要性,生成跨语言事件时间线,从而支持用户从多语言视角探索事件演变。此外,研究者借鉴该数据集中的语言特异性相关性评分方法,进一步提出了考虑事件类型与用户动态兴趣的增强模型,用于改进多语言实体推荐任务。在知识图谱领域,该数据集促进了语言感知的图谱嵌入方法研究,通过融合点击流行为信息提升跨语言实体对齐与关系预测的准确性。这些衍生工作不仅验证了数据集在训练与评估跨语言用户交互模型中的有效性,还推动了事件中心信息检索从单语言向多语言范式的转变,为构建更包容的全球信息生态系统提供了方法论支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务