遇见数据集

media-metadata-podcastindex-podcasts

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

该数据集是一个播客元数据实体数据集,由 metadatarr 项目的 `podcastindex_podcasts` 爬虫从 PodcastIndex 抓取并整理而成。数据集包含 112,717 条记录,每条记录代表一个播客实体,涵盖了丰富的元数据字段,包括播客的 iTunes ID、标题、作者、封面图像链接、所属流派、播客主页 URL、描述文本、语言、剧集数量、是否包含成人内容标记、Feed URL、国家排行榜信息、数据来源以及实体类型。该数据集适用于媒体内容分析、播客推荐系统、自然语言处理(如基于描述的文本分类或摘要)以及跨平台实体链接等任务。数据以结构化形式提供,遵循 CC0 1.0 公共领域贡献许可。

This dataset is a podcast metadata entity dataset, scraped and curated from PodcastIndex by the `podcastindex_podcasts` crawler from the metadatarr project. It contains 112,717 records, where each entry represents a single podcast entity and includes a comprehensive set of metadata fields: the podcast's iTunes ID, title, author, cover image link, genre, podcast homepage URL, description text, language, number of episodes, adult content flag, Feed URL, country ranking information, data source, and entity type. This dataset is suitable for tasks such as media content analysis, podcast recommendation systems, natural language processing (e.g., description-based text classification or summarization), and cross-platform entity linking. The data is provided in a structured format and is licensed under CC0 1.0 Public Domain Dedication.

创建时间:
2026-06-26
搜集汇总
数据集介绍
media-metadata-podcastindex-podcasts 数据集图片
构建方式
该数据集名为media-metadata-podcastindex-podcasts,由开源工具metadatarr中的podcastindex_podcasts爬虫模块从Podcast Index平台抓取生成。数据集构建遵循完整的数据流水线,爬虫脚本scrapers/podcastindex_podcasts.py负责从播客索引中提取元数据,共收录112,717条播客实体记录。每条数据包含itunes_id、标题、作者、封面图片、流派、描述、语言、剧集数、显式内容标记、订阅源链接以及国家排行榜等多个字段,实现了对播客元数据的结构化采集与聚合。
特点
该数据集的重要特点在于其丰富的实体信息维度与广泛的覆盖范围。它不仅包含基础元数据如标题和作者,还囊括了流派分类、多语言标识、剧集统计以及是否显式内容等细粒度属性。此外,数据集引入了国家排行榜字段,可用于分析播客在不同区域的热度分布。所有数据依据cc0-1.0许可协议发布,允许自由使用与再分发,适合学术研究、推荐系统开发及媒体趋势分析等应用场景。
使用方法
用户可通过HuggingFace平台直接加载该数据集,利用数据集字段进行播客内容分析与挖掘。例如,可基于语言字段筛选特定语种的播客,或依据流派字段进行主题聚类。数据集的实体类型字段有助于区分不同媒体类别,从而支持多模态信息检索与知识图谱构建。建议用户参考metadatarr仓库中的爬虫源码以了解数据生成细节,并可根据需要结合其他media-metadata系列数据集进行跨模态的实体链接与元数据增强分析。
背景与挑战
背景概述
随着数字媒体生态的蓬勃发展,播客作为一种重要的音频内容形式,其元数据的高效组织与利用成为信息检索与推荐系统的关键挑战。该数据集由研究者TigreGotico通过metadatarr工具于近期创建,专注于从Podcast Index平台采集播客元数据,涵盖112,717条记录,包含标题、作者、语言、集数及流派等丰富字段。作为面向媒体实体的结构化数据集,它为播客分类、多语言内容分析及个性化推荐等研究提供了标准化基准,填补了高质量播客元数据公共资源领域的空白,对音频内容管理与信息检索领域具有显著推动作用。
当前挑战
该数据集所解决的领域问题在于,播客元数据的碎片化与异构性严重阻碍了内容发现与智能处理;而构建过程中,从Podcast Index等分布式源高效抓取并清洗数据,需应对接口限制、编码差异及重复条目等挑战。具体挑战包括:1) 播客元数据缺乏统一标准,涉及多语言、多流派及不同来源的格式不统一;2) 构建时需处理超过11万条记录的真实性校验,例如去重、字段补全及隐式内容标注(如explicit标签);3) 数据时效性维护困难,需频繁同步以反映播客频道的动态变化,确保数据集在推荐系统中保持有效与可靠。
常用场景
经典使用场景
该数据集收录了来自Podcast Index的逾11万条播客元数据,涵盖标题、作者、类型、语言、剧集数量等关键字段,为播客生态研究提供了结构化的数据基石。在推荐系统与信息检索领域,它常被用于构建播客发现引擎,通过分析类型标签与语言分布来优化个性化推荐算法。同时,研究者可借助其丰富的描述字段开展自然语言处理任务,如主题建模与关键词提取,以深入理解播客内容的语义结构。此外,该数据集还可支撑跨国播客流行趋势对比研究,通过国家榜单数据揭示不同区域的文化消费偏好差异。
解决学术问题
在学术层面,该数据集有效填补了播客领域大规模结构化元数据长期缺失的空白,为计算传播学与媒体研究提供了可复现的实证基础。它解决了播客分类体系不统一导致的分析碎片化问题,通过标准化字段(如显式内容标记与剧集数量)使研究者能够系统量化播客生产的规模特征。更重要的是,该数据集促进了多语言播客生态的跨文化比较研究,此前受限于数据稀疏性而难以开展的跨国受众行为分析,现在可获得可靠的数据支持,从而深化对数字音频媒介全球化传播规律的理解。
衍生相关工作
该数据集催生了一系列衍生产物,其中最富影响力的是由元数据驱动的自动化工具链,例如基于其字段设计的播客质量评估模型,能综合剧集数量与更新频率预测频道存活性。研究者还利用其语言与类型标签构建了多模态推荐框架,将音频转录文本与元数据联合建模。在数据可视化领域,衍生出的播客全球地缘分布图成为数字人文研究的标志性成果。此外,该数据集推动了开放数据运动在音频媒介中的实践,后续有多个工作效仿其爬取架构构建了音乐、有声书等相似领域的元数据集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务