public-dataset
收藏资源简介:
这是一个托管在Hugging Face上的大型公共数据集集合,包含八个独立的数据集,涵盖多个领域。具体包括:1) 6.3M-books(14.1 GB):包含来自Goodreads的630万本书籍信息;2) 1.2M-movies(2.1 GB):包含来自TMDB的120万部电影信息;3) 5M-wikipedia(1.39 GB):包含500万篇维基百科标题文章;4) 1.2M-songs(947 MB):包含来自Spotify的120万首歌曲音轨信息;5) 500k-startups(600 MB):包含2013年至2026年间在ProductHunt上发布的50万家初创公司信息;6) 800k-domains(539 MB):包含截至2025年4月24日注册的80万个WHOIS域名信息;7) 500k-actors(84.2 MB):包含50万名演员的电影信息;8) 271k-athletes(75.6 MB):包含1800年至2000年间的27.1万名奥林匹克运动员信息。该数据集集合适用于信息检索、推荐系统、数据挖掘、自然语言处理以及各领域的统计分析等任务,采用Apache-2.0许可证。
This is a large-scale public dataset collection hosted on Hugging Face, comprising eight independent datasets spanning multiple domains. The specific contents are as follows: 1) 6.3M-books (14.1 GB): Contains 6.3 million pieces of book information sourced from Goodreads; 2) 1.2M-movies (2.1 GB): Contains 1.2 million pieces of movie information sourced from TMDB; 3) 5M-wikipedia (1.39 GB): Contains 5 million Wikipedia article titles; 4) 1.2M-songs (947 MB): Contains 1.2 million pieces of song track information sourced from Spotify; 5) 500k-startups (600 MB): Contains 500,000 pieces of startup information released on ProductHunt between 2013 and 2026; 6) 800k-domains (539 MB): Contains 800,000 WHOIS domain records registered as of April 24, 2025; 7) 500k-actors (84.2 MB): Contains film-related information for 500,000 actors; 8) 271k-athletes (75.6 MB): Contains information on 271,000 Olympic athletes active between 1800 and 2000. This dataset collection is applicable to tasks including information retrieval, recommendation systems, data mining, natural language processing and cross-domain statistical analysis, and it is licensed under Apache-2.0.
该数据集页面为 Large Public Datasets (HF),由 Hugging Face 上的 flatseek 组织发布,采用 Apache-2.0 许可证。该数据集是一个公共数据集集合,整合了多个领域的大规模公开数据,并以 Flatlens 格式提供预览加载链接。
数据集包含以下 8 个子数据集:
| 数据集名称 | 大小 | 描述 | 来源 | 预览链接 |
|---|---|---|---|---|
| 6.3M-books | 14.1 GB | 来自 Goodreads 的 630 万本书籍信息 | Kaggle 原始数据 | Load → |
| 1.2M-movies | 2.1 GB | 来自 TMDB 的 120 万部电影信息 | Kaggle 原始数据 | Load → |
| 5M-wikipedia | 1.39 GB | 500 万篇维基百科文章标题 | Kaggle 原始数据 | Load → |
| 1.2M-songs | 947 MB | 来自 Spotify 的 120 万首歌曲曲目 | Kaggle 原始数据 | Load → |
| 500k-startups | 600 MB | 50 万条 ProductHunt 创业项目数据(2013-2026) | Kaggle 原始数据 | Load → |
| 800k-domains | 539 MB | 80 万个 WHOIS 注册域名(2025年4月24日快照) | Kaggle 原始数据 | Load → |
| 500k-actors | 84.2 MB | 50 万名演员的电影信息 | Kaggle 原始数据 | Load → |
| 271k-athletes | 75.6 MB | 27.1 万名奥林匹克运动员数据(1800-2000 年) | Kaggle 原始数据 | Load → |
该数据集集合涵盖了图书、电影、维基百科、音乐、创业项目、域名、演员、运动员等多个领域,数据总量约 19.7 GB,适合用于大规模数据分析和机器学习任务。每个子数据集均通过 Flatlens 提供直接预览与加载功能。





