遇见数据集

public-dataset

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

这是一个托管在Hugging Face上的大型公共数据集集合,包含八个独立的数据集,涵盖多个领域。具体包括:1) 6.3M-books(14.1 GB):包含来自Goodreads的630万本书籍信息;2) 1.2M-movies(2.1 GB):包含来自TMDB的120万部电影信息;3) 5M-wikipedia(1.39 GB):包含500万篇维基百科标题文章;4) 1.2M-songs(947 MB):包含来自Spotify的120万首歌曲音轨信息;5) 500k-startups(600 MB):包含2013年至2026年间在ProductHunt上发布的50万家初创公司信息;6) 800k-domains(539 MB):包含截至2025年4月24日注册的80万个WHOIS域名信息;7) 500k-actors(84.2 MB):包含50万名演员的电影信息;8) 271k-athletes(75.6 MB):包含1800年至2000年间的27.1万名奥林匹克运动员信息。该数据集集合适用于信息检索、推荐系统、数据挖掘、自然语言处理以及各领域的统计分析等任务,采用Apache-2.0许可证。

This is a large-scale public dataset collection hosted on Hugging Face, comprising eight independent datasets spanning multiple domains. The specific contents are as follows: 1) 6.3M-books (14.1 GB): Contains 6.3 million pieces of book information sourced from Goodreads; 2) 1.2M-movies (2.1 GB): Contains 1.2 million pieces of movie information sourced from TMDB; 3) 5M-wikipedia (1.39 GB): Contains 5 million Wikipedia article titles; 4) 1.2M-songs (947 MB): Contains 1.2 million pieces of song track information sourced from Spotify; 5) 500k-startups (600 MB): Contains 500,000 pieces of startup information released on ProductHunt between 2013 and 2026; 6) 800k-domains (539 MB): Contains 800,000 WHOIS domain records registered as of April 24, 2025; 7) 500k-actors (84.2 MB): Contains film-related information for 500,000 actors; 8) 271k-athletes (75.6 MB): Contains information on 271,000 Olympic athletes active between 1800 and 2000. This dataset collection is applicable to tasks including information retrieval, recommendation systems, data mining, natural language processing and cross-domain statistical analysis, and it is licensed under Apache-2.0.

创建时间:
2026-07-02
原始信息汇总

该数据集页面为 Large Public Datasets (HF),由 Hugging Face 上的 flatseek 组织发布,采用 Apache-2.0 许可证。该数据集是一个公共数据集集合,整合了多个领域的大规模公开数据,并以 Flatlens 格式提供预览加载链接。

数据集包含以下 8 个子数据集:

数据集名称 大小 描述 来源 预览链接
6.3M-books 14.1 GB 来自 Goodreads 的 630 万本书籍信息 Kaggle 原始数据 Load →
1.2M-movies 2.1 GB 来自 TMDB 的 120 万部电影信息 Kaggle 原始数据 Load →
5M-wikipedia 1.39 GB 500 万篇维基百科文章标题 Kaggle 原始数据 Load →
1.2M-songs 947 MB 来自 Spotify 的 120 万首歌曲曲目 Kaggle 原始数据 Load →
500k-startups 600 MB 50 万条 ProductHunt 创业项目数据(2013-2026) Kaggle 原始数据 Load →
800k-domains 539 MB 80 万个 WHOIS 注册域名(2025年4月24日快照) Kaggle 原始数据 Load →
500k-actors 84.2 MB 50 万名演员的电影信息 Kaggle 原始数据 Load →
271k-athletes 75.6 MB 27.1 万名奥林匹克运动员数据(1800-2000 年) Kaggle 原始数据 Load →

该数据集集合涵盖了图书、电影、维基百科、音乐、创业项目、域名、演员、运动员等多个领域,数据总量约 19.7 GB,适合用于大规模数据分析和机器学习任务。每个子数据集均通过 Flatlens 提供直接预览与加载功能。

搜集汇总
数据集介绍
public-dataset 数据集图片
构建方式
该数据集由多个大规模公共数据子集整合而成,涵盖书籍、电影、百科、音乐、创业公司、域名、演员及运动员等领域。各子集数据均源自Kaggle等公开平台,如Goodreads的630万条书籍记录、TMDB的120万条电影信息及Spotify的120万首歌曲元数据。原始数据经清洗与格式化后,以专用.fsk格式封装,并通过HuggingFace仓库统一托管,便于研究者直接调用。
特点
数据集以结构化表格形式呈现,每个子集均包含数万至数百万条记录,总存储量逾20GB,覆盖文化、体育、商业等多维度信息。其显著特点在于规模庞大、领域多元,且元数据字段丰富。例如,1.2M-movies子集收录了TMDB平台电影的完整详情,而6.3M-books子集则整合了Goodreads的书目信息,为大规模信息检索与分析任务提供了坚实的数据基础。
使用方法
用户可通过Flatlens工具直接预览与加载数据集,无需额外下载。每个子集对应的.fsk文件均提供专用加载链接,点击即可在Flatlens界面中浏览数据内容。此外,数据集以Apache-2.0许可证开源,支持自由用于学术研究与商业应用。开发者亦可将数据导入Python环境,利用Pandas等库进行进一步分析与建模。
背景与挑战
背景概述
随着大数据时代的迅猛发展,高质量、大规模、多元化的公开数据集已成为推动机器学习、数据挖掘及知识图谱构建等领域的基石。在此背景下,由Flatseeks团队(来源机构)于2025年4月发布在Hugging Face平台上的public-dataset数据集应运而生。该数据集旨在整合来自全球知名平台的结构化公开数据,涵盖书籍、电影、维基百科、音乐、初创公司、域名、演员及运动员等八大类别,总数据量超过15GB。其核心研究问题是探索跨领域公开数据的统一存储与高效访问范式,为数据科学社区提供一个可直接用于探索分析、模型训练及系统测试的综合性基准资源。该数据集的发布对于降低数据获取门槛、促进跨领域数据融合研究具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于如何系统性地整合来自不同来源、不同语义结构的大规模公开数据,以支持跨领域分析、推荐系统及知识图谱等任务,尤其是解决数据碎片化与异构性问题。在构建过程中,主要面临三方面挑战:首先,数据清洗与格式化,各个原始数据集(如来自Kaggle的众多独立数据集)存在缺失值、类型不一致及噪声数据,需统一处理;其次,数据规模大导致存储与访问效率成为瓶颈,构建团队为此开发了基于FSK格式的预览机制(Flatlens),以支持高效检索;最后,版权归属与许可合规(如Apache-2.0)要求严格,需确保所有子数据集均符合开源协议,避免法律风险。
常用场景
经典使用场景
在信息检索与推荐系统领域,该数据集汇聚了来自Goodreads的630万册图书、TMDB的120万部电影以及Spotify的120万首歌曲等多维度海量信息,为构建跨域推荐模型提供了丰富的训练素材。研究者可借助其中涵盖的图书评分、电影元数据、音频特征等结构化信息,开发基于内容的协同过滤算法或图神经网络推荐框架,从而验证并提升模型在稀疏数据环境下的泛化能力。
实际应用
在工业界,此数据集可直接赋能创业投资领域的标的筛选系统,通过分析ProductHunt平台上50万家初创公司的历史数据,辅助风险资本进行趋势预测与尽职调查。同时,800万条WHOIS域名记录与50万名演员信息亦可服务于网络安全中的域名信誉评估以及娱乐产业中的艺人经纪决策支持。
衍生相关工作
围绕该数据集催生了一系列开拓性研究,包括基于1800年至2000年间27万奥运健儿统计特征构建的竞技表现预测模型,以及利用500万维基百科条目训练出的轻量化语言嵌入表示方法。此外,多源异构数据的联合建模工作推动了可解释推荐与跨领域用户画像生成等领域的前沿探索,相关成果持续发表于信息检索与数据挖掘顶级会议。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务