遇见数据集

Data-Gouv-FR/medias-francophones-sur-youtube

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于法语媒体在YouTube上的数据集,由公民Olivier Duprez(又名@oliezekat)发起,旨在研究由法语媒体(包括新闻、电视或广播机构)运营的YouTube频道。该项目与个人网站YMobActus及其实验室相关联,用于分发数据或提供服务和工具。数据集构建方法基于多个标准来识别媒体频道:例如,频道内容大部分为法语、合法注册为公司或协会、被公共或国际机构批准(如拥有新闻社或协会地位、分配广播频率或数字地面电视许可、在CPPAP注册)、加入新闻工会(如SPiiL),或被同行广泛认可为新闻媒体。数据集包含一个配置liste-des-chaines-youtube-des-medias-francophones,存储为parquet文件,用于列出这些法语媒体YouTube频道。数据来源于data.gouv.fr,许可证为cc-by-sa。使用示例可通过Hugging Face的datasets库加载。

Initiative citoyenne de Olivier Duprez (aka @oliezekat) pour étudier les chaînes YouTube opérées par des médias francophones de presse, télévision, ou radiophonie. Projet associé au site web personnel YMobActus et son Labo pour y diffuser les données ou proposer des services et outils. Méthodologie : Lopérateur dune chaîne YouTube est identifié comme étant un média quand il satisfait plusieurs critères tels quavoir une majorité de publications en français, déclaration légale comme une société ou association, approuvé par des institutions publiques ou internationales (statut dagence ou association de presse, attribution fréquence radio ou TNT, inscrit à la CPPAP), adhérer à des syndicats de presse (ex: SPiiL), ou largement reconnus par ses pairs comme média dinformation. Le jeu de données inclut une configuration liste-des-chaines-youtube-des-medias-francophones sous forme de fichier parquet. Source officielle : data.gouv.fr, licence cc-by-sa. Utilisation via Hugging Face datasets.

提供机构:
Data-Gouv-FR
搜集汇总
数据集介绍
Data-Gouv-FR/medias-francophones-sur-youtube 数据集图片
构建方式
该数据集源自一项公民倡议,由Olivier Duprez发起,旨在系统性地研究法语媒体在YouTube平台上的频道生态。构建过程严格遵循多媒体识别准则:频道须以法语内容为主,具备合法的公司或协会注册身份,并经过法国公共或国际机构的认可,如拥有新闻机构资质、无线电或数字地面电视频率分配、CPPAP注册,或隶属于新闻行业工会。此外,频道需被同行广泛认定为信息媒体。数据集通过@YMobActus频道的公开订阅列表,借助YouTube API自动采集并持续更新,确保覆盖范围的动态性与准确性。
使用方法
用户可首先访问data.gouv.fr上的数据集链接,获取完整的频道列表及相关元数据。数据集以JSON或CSV格式发布,适用于编程分析或手动查阅。结合YouTube Data API,用户可以进一步提取每个频道的视频内容、互动数据及订阅者统计,用于媒体影响力分析、内容趋势挖掘或跨平台比较研究。建议参考配套的‘LISEZMOI.markdown.txt’文档,其中详细说明了数据字段定义与更新策略,以提升使用效率与结果的可解释性。
背景与挑战
背景概述
在数字媒体生态与社交媒体平台深度融合的当下,YouTube作为全球最大的视频分享平台,已成为传统媒体与新兴数字媒体传播信息的重要阵地。然而,法语媒体在这一平台上的分布格局、运营特征及其影响力分析长期缺乏系统性的数据集支撑。为此,公民科学家Olivier Duprez(又名@oliezekat)于约2025年发起了“Médias francophones sur YouTube”数据集项目,旨在系统梳理和收录由法语新闻、电视及广播媒体运营的YouTube频道。该数据集通过个人网站YMobActus的Labo平台发布,并关联至法国公共数据平台data.gouv.fr,体现了草根研究力量在媒体监测领域的创新探索。其研究方法严谨,通过订阅甄别与多重标准(如法语内容占比、法律注册状态、公共或行业协会认证等)认定媒体身份,为后续的法语数字媒体研究提供了基础性的数据参考。
当前挑战
该数据集所解决的核心领域问题在于:面对YouTube平台上海量、动态且混杂的法语内容,如何精准识别并界定何谓“媒体”运营的频道,以区分专业新闻生产与个人内容创作或非正规机构,从而为媒体影响力分析、公共舆论研究与法语文化传播研究提供可靠的数据基础。在构建过程中,挑战主要体现在两方面:一是媒体识别标准的制定与执行,需在开放性与严谨性间取得平衡,既要避免过度宽泛导致噪音数据,也要防止标准过严遗漏新兴数字媒体;二是数据采集与维护完全依赖单一公民开发者及其个人开发的YouTube数据采集机器人YTSuBot,面临API调用限制、平台政策变动及频道动态更新等持续性技术挑战,数据集规模与时效性的保障存在显著难度。
常用场景
经典使用场景
在计算社会科学与数字媒体研究领域,medias-francophones-sur-youtube数据集为学者提供了一份精心甄别的法语媒体YouTube频道名录。研究者可借助该数据集,系统性地爬取并分析这些频道的视频元数据、发布规律、受众互动特征及内容主题分布,从而揭示法语媒体在YouTube平台上的信息传播模式与内容策略。该数据集尤其适用于纵向追踪媒体生态演变、比较不同类型媒体(如新闻报刊、广播电视)在短视频平台的行为差异,成为数字化语境下法语媒体研究不可或缺的基准资源。
解决学术问题
该数据集精准回应了法语媒体在YouTube平台研究中长期面临的识别与归因难题。传统上,研究者难以从海量YouTube频道中可靠区分官方媒体与自媒体或非正式账号,从而导致样本偏差与分析结论失真。medias-francophones-sur-youtube通过结合法律声明、官方认证、行业工会资质等多维标准,构建了严谨的媒体频道筛选框架,使得后续研究能够获得高信效度的样本集合,有效支撑了媒体可信度评估、信息源多样性分析和平台治理等学术议题的深入探讨。
实际应用
该数据集的实际应用已超越学术范畴,延伸至数字媒体监测、内容推荐优化与新闻传播效果评估等产业场景。媒体机构可利用其识别竞争情报,追踪同行的内容选题与运营策略;政策制定者与监管机构可借助该数据集监控法语媒体在YouTube上的信息健康度,例如评测假新闻传播风险或内容多样性;此外,基于该数据集开发的YTSuBot工具亦为开发者提供了自动化采集与分析YouTube媒体数据的定制化组件,赋能更广泛的媒体分析应用。
数据集最近研究
最新研究方向
该数据集聚焦于法语媒体在YouTube平台上的频道生态研究,为理解数字时代传统媒体向视听社交平台迁移的转型路径提供了关键数据支持。当前前沿方向包括:基于频道订阅网络与内容发布模式的媒体影响力拓扑分析,以及利用YTSuBot等自动化工具构建的多模态数据采集与行为建模方法。该数据集关联到欧洲视听媒体监管与法语国家数字主权等热点议题,特别是在虚假信息治理与公共媒体公信力评估领域具有突出价值。通过开源社区协作,它推动了对YouTube算法推荐机制下媒体内容可见性差异的量化研究,为跨平台媒体比较分析与政策制定奠定了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务