遇见数据集

冬奥多语言多模态资讯半结构化与非结构化数据库

收藏
官方服务:

资源简介:

"数据集内容:在MongoDB数据库中构建多个数据集合(collection),用于存储冬奥资讯数据与相关微博用户数据。所构建数据集合共10个,分别命名为webnew(新闻资讯)、microblog(微博资讯)、Twitter(推特资讯)、weichat(微信资讯)、enewspaper(电子报纸)、APP(移动软件端资讯)、shortvideo(短视频资讯)、facebook(脸书资讯)、audio(喜马拉雅音频资讯)和weibo_user(微博用户信息集)。 采集方案:入库方法分为两种,一是通过中科闻歌公司提供的API接口,基于Python编写代码自动入库;二是编写Python爬虫代码,从互联网上爬取相关资讯数据。该数据集中,除audio数据采用第二种方式入库,其余集合均采用第一种方式入库。 采集地点:桂林电子科技大学 采集时间:2020.10——2022.10 设备情况:计算机操作系统为windows10,显卡NVIDIA Quadro P2200,内存32G。

搜集汇总
数据集介绍
冬奥多语言多模态资讯半结构化与非结构化数据库 数据集图片
背景与挑战
背景概述
该数据集构建了10个数据集合,存储冬奥相关的多语言多模态资讯,包括新闻、微博、推特等多种类型。数据通过API接口和爬虫方式采集,时间范围为2020年10月至2022年10月,总数据量达206.12GB。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务