遇见数据集

app-store-apps-charts-reviews-sample

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集是移动应用智能数据的免费样本,包含来自 Apple 官方公开 API(iTunes RSS 图表、搜索和查找)以及 Google Play 公开页面的 6,384 个应用图表数据。数据集提供多种配置:应用元数据样本(apps_sample_500,500 行,包含名称、开发者、类别、评分、评分数量、价格、内购、发布日期、更新日期、大小、内容评级等字段)、高机会应用样本(apps_top_opportunity_sample,100 行,包含需求评分、痛点评分、机会指数等字段)、类别机会数据(category_opportunity,25 行,涵盖所有 25 个美国 App Store 类别,按机会指数排序,包括加权平均评分、低评分占比、类别机会评分等)、图表快照样本(chart_snapshots_sample_500,500 行,包含免费/付费/最高收入榜单排名、按类别和国家划分的快照)、评论指标样本(review_metrics_sample_500,500 行,包含每月语言分布、评分直方图、情感均值/份额、投诉主题标签等派生指标,不含原始评论文本)。数据集中还包含一个独特的“类别机会指数”,用于衡量高需求与低评分的组合,识别最未被充分满足的应用市场。该数据集适用于 ASO 基准测试、移动市场分析、发现未满足的应用细分领域、应用牵引信号尽职调查以及情感模型评估。数据来源为 100% 公开、无需登录的 API,不包含任何评论原文或评论者身份。已知限制包括:Apple 数据占绝大多数,图表快照仅为初始运行样本,情感评分仅覆盖英文评论,投诉主题基于关键词规则。

This dataset is a free sample of mobile app intelligence data, containing 6,384 app chart data from Apples official public APIs (iTunes RSS charts, search, and lookup) as well as Google Play public pages. The dataset offers multiple configurations: app metadata sample (apps_sample_500, 500 rows, including fields such as name, developer, category, rating, rating count, price, in-app purchases, release date, update date, size, content rating, etc.), high-opportunity app sample (apps_top_opportunity_sample, 100 rows, including fields such as demand score, pain point score, opportunity index, etc.), category opportunity data (category_opportunity, 25 rows, covering all 25 US App Store categories, sorted by opportunity index, including weighted average rating, low rating percentage, category opportunity score, etc.), chart snapshot sample (chart_snapshots_sample_500, 500 rows, including free/paid/top-grossing chart rankings, snapshots by category and country), and review metrics sample (review_metrics_sample_500, 500 rows, including derived metrics such as monthly language distribution, rating histogram, sentiment mean/share, complaint topic tags, etc., without original review text). The dataset also includes a unique category opportunity index that measures the combination of high demand and low ratings, identifying the most underserved app markets. It is suitable for ASO benchmarking, mobile market analysis, discovering underserved app niches, app traction signal due diligence, and sentiment model evaluation. Data sources are 100% public and do not require login; no original review text or reviewer identity is included. Known limitations include: Apple data dominates, chart snapshots are only initial run samples, sentiment scores cover only English reviews, and complaint topics are based on keyword rules.

创建时间:
2026-08-02
原始信息汇总

数据集概述:App Store Apps, Charts & Review Sentiment — Free Sample

数据集简介

本数据集是移动应用智能数据集的免费样本,源自 6,384 个图表应用,全部数据通过 Apple 官方公共 API(iTunes RSS 图表、Search 与 Lookup)以及 Google Play 公共页面收集,涵盖应用元数据、图表排名快照、评论情感指标,以及独特的 “类别机会指数”(Category Opportunity Index),该指数按 高需求 × 低评分 对每个美国 App Store 类别进行排序,揭示最未被充分满足的应用市场。

数据规模与配置

  • 总数据量:1K < n < 10K 行
  • 语言:英语
  • 任务类别:文本分类
  • 许可协议:CC BY-NC 4.0(非商业用途评估)

可用配置(Configs)

配置名称 行数 说明
apps_sample_500 500 应用元数据(名称、开发者、类型、评分、评分数量、价格、内购、发布日期/更新日期、大小、内容分级等),按商店 × 国家分层
chart_snapshots_sample_500 500 图表排名快照(免费 / 付费 / 畅销,按类型 × 国家)
review_metrics_sample_500 500 每个应用的月度评论衍生指标:语言混合、评分直方图、情感均值/占比、投诉主题标签——仅含衍生指标,不含评论文本
category_opportunity 25 全部 25 个美国 App Store 类别按机会分数排名(加权平均评分、低评分占比、机会指数)
apps_top_opportunity_sample 100 按机会指数排名前 100 的应用(每个应用的 demandScore / painScore / opportunityIndex)

文件格式与数据字段

所有数据文件均为 Parquet 格式,使用 Hugging Face Datasets 库加载。

主要字段概览

  • 应用元数据:store、appId、bundleId、name、developer、primaryGenre、genres、rating、ratingCount、price、currency、free、hasInAppPurchases、installs、version、released、updated、sizeBytes、contentRating、country、snapshotDate
  • 图表快照:chart、genreId、genre、country、rank、snapshotDate
  • 评论指标:reviewsAnalyzed、primaryLang、ratingCount1-5、ratingShare1-5、sentimentMean、sentimentPosShare、sentimentNeuShare、sentimentNegShare、avgRating30D/90D、reviewCount30D/90D、complaintShare_crash_bug、complaintShare_ads、complaintShare_billing_subscription、complaintShare_login_account、complaintShare_performance、complaintShare_ux_design、complaintShare_support、complaintShare_privacy_permissions、topKeywords
  • 机会指数:demandScore、painScore、opportunityIndex、categoryOpportunityScore、weightedAvgRating、lowRatedShare

典型应用场景

  • ASO 基准测试与移动市场分析
  • 发现未充分满足的应用利基市场(适用于独立开发者、工作室、VC)
  • 尽职调查的应用吸引力信号
  • 基于评分配对聚合数据的情感模型评估

数据来源与合规性

  • 100% 公共、无需登录的来源:Apple iTunes RSS/Search/Lookup API 和 Google Play 公共页面
  • 未使用任何反爬虫规避手段
  • 不重新分发评论文本,仅提供衍生指标;不收集评论者身份信息
  • 每一行都带有商店/国家/快照来源字段,每个应用都可链接回其公开的 App Store 页面

已披露的局限性

  • Apple 数据占大多数,并非 Apple/Google 均衡语料库
  • 图表快照来自初始运行,并非长期每日时间序列
  • 情感评分仅覆盖英语评论;投诉主题使用关键词规则

使用示例

python from datasets import load_dataset

ds = load_dataset("zalizedata/app-store-apps-charts-reviews-sample", "apps_sample_500", split="train") print(ds[0])

引用信息

完整数据集及分片:https://data.zalize.com/datasets/app-store-apps-review-sentiment-dataset

作者:DataForge (Zalize) 产品,完整目录:https://data.zalize.com

搜集汇总
数据集介绍
app-store-apps-charts-reviews-sample 数据集图片
构建方式
该数据集源自对Apple官方公开API(iTunes RSS图表、搜索与查询接口)及Google Play公开页面的系统性爬取,囊括了6,384款图表应用的元数据、榜单排名快照及评论衍生指标。样本集通过分层抽样策略,按商店与国家分布提取500款应用,并辅以机会指数排序的百强应用及25个美国应用商店类别的机会评估数据。每个记录均携带存储库、国家及快照时间戳等溯源字段,确保完整可追溯性。
特点
数据集独树一帜地引入了‘类别机会指数’,用以量化各应用类别中‘高需求×低评分’的市场空白,为开发者与投资者揭示未饱和的细分领域。其评论指标模块仅提供聚合统计,涵盖情感倾向、评分直方图及投诉主题标签,严格规避原始评论文本,既保护用户隐私又满足合规要求。数据的时间快照特性支持对应用表现进行横向与纵向比较,是移动市场动态分析的宝贵资源。
使用方法
用户可通过HuggingFace的datasets库便捷加载不同配置子集,如apps_sample_500、category_opportunity等,以适配多样化分析场景。适用于应用商店优化基准测试、移动市场趋势洞察、利基市场发现、投资尽职调查中的产品牵引力评估,以及基于评分聚合的情感模型验证。数据以parquet格式存储,兼容主流数据处理工具,便于与现有分析流水线无缝集成,实现高效的数据挖掘与建模。
背景与挑战
背景概述
在移动应用市场蓬勃发展的当下,应用商店数据已成为洞察市场动态、用户行为与商业机遇的关键资源。该数据集由DataForge(Zalize旗下产品)于2026年创建,依托Apple官方公共API(iTunes RSS图表、搜索与查找)及Google Play公开页面,系统采集了6,384款图表应用的全维度信息,涵盖应用元数据、榜单排名快照、评论衍生情绪指标,并创新性地提出了'类别机会指数',用以量化各应用类别的供需缺口。该数据集为移动应用市场分析、ASO优化、投资尽职调查及情绪模型评估等研究提供了高价值的数据基础,其公开采样版本以CC BY-NC 4.0许可发布,旨在促进非商业性研究与评估。
当前挑战
该数据集面临多重挑战。领域层面,移动应用市场竞争激烈,开发者与投资者亟需精准识别未被满足的用户需求,而传统榜单仅反映下载量或收入,难以揭示高需求与低评分并存的市场缝隙,这正是'类别机会指数'试图解决的问题。构建过程中,数据采集需兼顾来源多样性与合规性,样本以Apple数据为主,导致Apple与Google数据不均衡;榜单快照仅为初始运行结果,缺乏长期日度序列;情绪评分仅覆盖英文评论,投诉主题依赖关键词规则,存在语言与语义分析的局限性。此外,数据集不包含评论原文,仅提供衍生指标,确保用户隐私与数据合规,但也限制了深度文本分析的可行性。
常用场景
经典使用场景
该数据集为移动应用市场分析提供了丰富的样本资源,涵盖应用元数据、榜单排名快照、评论情感指标及类别机会指数等核心维度。研究者可借此开展应用商店优化(ASO)基准测试,深入剖析不同国家、品类下的应用表现差异,亦可利用评论情感聚合数据评估情感分析模型的鲁棒性,是探索移动应用生态动态变化的理想数据基础。
实际应用
在实际应用中,该数据集可辅助独立开发者、投资机构及市场分析师精准定位高需求低竞争的应用品类,优化产品策略与资源配置。其类别机会指数能够指引团队聚焦于用户痛点集中的领域,如教育、保险等“强制使用”型应用,从而驱动产品改进与差异化创新,提升市场竞争力与用户留存。
衍生相关工作
该数据集催生了多项衍生研究,包括构建应用评论投诉主题基准、开发付费验证的应用利基指数以及高需求低评分类别机会扫描等。这些工作进一步深化了应用市场细分与竞品分析的方法论,推动了移动应用生态中用户反馈挖掘、趋势预测及商业决策支持等方向的进展,形成了较为完整的研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务