遇见数据集

FlyRank/internship-starter

收藏
Hugging Face2026-07-07 更新2026-07-22 收录
官方服务:

资源简介:

--- license: other language: - en tags: - seo - search-console - content-performance - tabular - education - flyrank-internship pretty_name: FlyRank Internship — Starter (Content Refresh, Anonymized) size_categories: - 10K<n<100K --- # FlyRank Internship — Starter Dataset (Anonymized) The public, safe starting point for the FlyRank **Applied Search Intelligence** ML internship. **30,000** anonymized content-performance rows across **32** pseudonymized clients (53 columns). **Public-safe:** hashed `content_id` / `client_id` + numeric/categorical metrics only — **no** titles, URLs, keywords, domains, or client names. ## What it's for Week 1–2 quick wins and the ready-now capstone lanes (ranking-signal analysis, lifecycle / opportunity scoring, content-archetype clustering). ## Verified reference results (this 30k slice) - Rule baseline **Precision@50 = 0.26** → Random Forest **Precision@50 = 0.74** - `search_volume` vs `impressions_90d` correlation ≈ **0.0012** (essentially zero — a real myth-buster) - Weighted CTR by position: `top_3` **0.49%** → `page_1` 0.35% → `deep` **0.04%** - Length is *not* the differentiator: growing vs declining word count ≈ 2,850 vs 2,910 ## Safety rules Anonymized, but still treat row-level outputs as not-for-careless-publishing. Do **not** use product flags (`health_score`, `needs_ctr_fix`, `is_quick_win`, …) as model features — they leak the decline label. Keep all public outputs anonymized/aggregate.

FlyRank Internship — Starter Dataset (Anonymized) is the public, safe starting point for the FlyRank Applied Search Intelligence ML internship. It contains 30,000 anonymized content-performance rows across 32 pseudonymized clients (53 columns). The data is public-safe with hashed content_id/client_id and numeric/categorical metrics only — no titles, URLs, keywords, domains, or client names. It is intended for Week 1–2 quick wins and the ready-now capstone lanes (ranking-signal analysis, lifecycle/opportunity scoring, content-archetype clustering). Verified reference results include: rule baseline Precision@50 = 0.26 → Random Forest Precision@50 = 0.74; search_volume vs impressions_90d correlation ≈ 0.0012 (essentially zero); weighted CTR by position: top_3 0.49% → page_1 0.35% → deep 0.04%; length is not the differentiator: growing vs declining word count ≈ 2,850 vs 2,910. Safety rules: anonymized but treat row-level outputs carefully; do not use product flags (health_score, needs_ctr_fix, is_quick_win, …) as model features to avoid label leakage; keep all public outputs anonymized/aggregate.

提供机构:
FlyRank
搜集汇总
数据集介绍
FlyRank/internship-starter 数据集图片
构建方式
该数据集名为FlyRank Internship — Starter,专为搜索引擎智能领域的机器学习实习项目设计。其构建基于对30,000条内容性能记录的匿名化处理,涵盖了来自32个伪匿名化客户的53个特征维度。所有敏感信息(如内容ID、客户ID)均通过哈希处理,仅保留数值型与类别型指标,彻底移除标题、URL、关键词、域名及客户名称等可识别信息,确保数据集的公开安全性。
特点
数据集的核心特点在于其稳健的匿名化机制与教育导向的实用价值。它提供了丰富的结构化字段,可用于分析排名信号、生命周期评分、机会评分及内容聚类等任务。内嵌的基准结果揭示了有趣现象:搜索量与90天曝光量的相关性趋近于零,而词频长度并非内容表现的关键区分因子——这些发现有助于破除常见误区,为实习生的快速上手与项目验证提供了扎实基础。
使用方法
该数据集专为实习项目第一至第二周的快速上手设计,支持排名信号分析、生命周期与机会评分、内容原型聚类等任务。用户可利用其30k行样本复现基准结果(如随机森林Precision@50达0.74),或开发新的机器学习模型。需注意,产品标志(如health_score)不可用作模型特征以避免标签泄露,且所有输出结果应保持匿名化与聚合形式,符合安全规范。
背景与挑战
背景概述
随着搜索引擎算法的不断演进与用户查询行为的日益复杂,内容性能优化已成为数字营销与搜索引擎优化(SEO)领域的核心挑战。传统上,内容策略的制定依赖于经验法则或单一的指标(如关键词搜索量),却鲜有公开数据集能够系统性地揭示内容生命周期、点击率与搜索排名之间的复杂关系。在此背景下,FlyRank团队于近期发布了名为“internship-starter”的数据集,该数据集由FlyRank研究团队基于其“应用搜索智能”实习项目构建,旨在为机器学习与SEO交叉领域提供一个安全的、匿名的起始基准。数据集包含约30,000条内容性能记录,覆盖32个伪匿名客户端的53个特征列,核心研究问题聚焦于排名信号分析、内容生命周期评分以及内容原型聚类。该数据集的发布填补了业界在公开匿名化内容性能数据方面的空白,尤其为初学者与研究者提供了一个可复现的基准平台,其验证的基线结果(如随机森林Precision@50从0.26提升至0.74)已显著推动了该领域的可量化研究。
当前挑战
数据集当前面临的挑战主要源于其核心研究问题所涉及的领域复杂性。首先,在排名信号分析方面,数据集揭示了搜索量与展示量之间的相关性趋近于零(约0.0012),这打破了许多从业者长期依赖“高搜索量即高表现”的直觉,但同时也带来了如何从低相关特征中提取有效排序信号的难题。其次,在内容生命周期评分中,数据集发现内容长度并非表现分化的关键因素(增长与衰退内容的字数中位数仅相差60词),这挑战了传统的“长内容优先”策略,使得研究者需探索更微妙的特征交互(如加权点击率随位置变化的非线性衰减)。此外,在构建过程中,数据集的匿名化处理(如哈希化内容与客户ID、移除标题与关键词)虽保障了隐私,却也丢失了语义上下文,限制了模型对内容主题与用户意图的深层理解。同时,数据集明确禁止使用产品标记作为模型特征,以防止标签泄露,这进一步增加了从纯数值与类别特征中预测内容衰退标签的难度。这些挑战共同构成了一个富有价值的研究框架,推动从业者超越表面指标,挖掘更鲁棒的内容-性能关联机制。
常用场景
经典使用场景
在搜索智能与内容性能分析领域,internship-starter数据集为研究人员提供了一个现实世界中内容表现数据的匿名化样本。它最经典的使用场景包括排名信号分析、生命周期与机会评分,以及内容原型聚类。通过30,000行涵盖32个伪匿名客户的数据,研究者能够基于53列数值型和类别型特征,训练模型以精准预测内容在搜索引擎中的表现优劣。该数据集尤适用于构建和验证推荐系统或决策支持工具,帮助初学者快速掌握核心分析流程。
实际应用
实际应用中,该数据集驱动的模型能帮助企业精准定位高潜力内容,通过机会评分系统自动识别“快速见效”的优化条目。例如,内容营销团队可依据preranked结果调整策略,无需依赖人工试错。在SEO工具中,基于数据训练的排序模型可将精确率提升至0.74,大幅减少无效投入。此外,数据揭示了页面深度与点击率的衰减规律,从而指导内容组织优化,如合理布局信息层级以提升用户访问深度。
衍生相关工作
该数据集衍生出多项标志性工作:经典的随机森林排序器将规则基线精确率从0.26提升至0.74,成为轻量级基准模型;基于生命周期信号的机会评分工具实现了对衰退内容的早期预警;内容原型聚类研究则揭示了不同文本长度(约2,850 vs 2,910词)并非区分表现优劣的关键因素。这些工作共同拓展了匿名化搜索数据在特征重要性分析和无监督聚类中的应用边界,为后续多模态搜索分析奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务