遇见数据集

Data-Gouv-FR/temps-de-parole-des-hommes-et-des-femmes-a-la-television-et-a-la-radio

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- license: other language: - fr tags: - data-gouv - donnees-publiques-francaises - parquet - csv - open-data pretty_name: "Temps de parole des hommes et des femmes à la télévision et à la radio" configs: - config_name: moyennes-par-annees-et-par-chaines data_files: - split: train path: data/moyennes-par-annees-et-par-chaines.parquet - config_name: temps-de-musique-et-temps-de-parole-des-hommes-et-des-femmes-a-la-tv-et-a-la-radio data_files: - split: train path: data/temps-de-musique-et-temps-de-parole-des-hommes-et-des-femmes-a-la-tv-et-a-la-radio.parquet - config_name: moyennes-par-heure-annee-et-chaine data_files: - split: train path: data/moyennes-par-heure-annee-et-chaine.parquet - config_name: taux-d-expression-des-femmes-annuel-a-la-radio-1995-2019 data_files: - split: train path: data/taux-d-expression-des-femmes-annuel-a-la-radio-1995-2019.parquet - config_name: taux-d-expression-des-femmes-annuel-a-la-television-2010-2019 data_files: - split: train path: data/taux-d-expression-des-femmes-annuel-a-la-television-2010-2019.parquet --- # Temps de parole des hommes et des femmes à la télévision et à la radio ## Source - Source officielle : https://www.data.gouv.fr/datasets/temps-de-parole-des-hommes-et-des-femmes-a-la-television-et-a-la-radio - Identifiant du jeu de données data.gouv.fr : `5c6adbae634f4114a5c41776` - Slug data.gouv.fr : `temps-de-parole-des-hommes-et-des-femmes-a-la-television-et-a-la-radio` - Licence indiquée dans les métadonnées data.gouv.fr : fr-lo ## Structure Hugging Face - Un jeu de données data.gouv.fr = un dépôt Hugging Face - Une ressource tabulaire d’origine = un sous-ensemble/configuration Hugging Face - Chaque sous-ensemble/configuration contient un split nommé `train` ## Sous-ensembles - `moyennes-par-annees-et-par-chaines` → `data/moyennes-par-annees-et-par-chaines.parquet` - `temps-de-musique-et-temps-de-parole-des-hommes-et-des-femmes-a-la-tv-et-a-la-radio` → `data/temps-de-musique-et-temps-de-parole-des-hommes-et-des-femmes-a-la-tv-et-a-la-radio.parquet` - `moyennes-par-heure-annee-et-chaine` → `data/moyennes-par-heure-annee-et-chaine.parquet` - `taux-d-expression-des-femmes-annuel-a-la-radio-1995-2019` → `data/taux-d-expression-des-femmes-annuel-a-la-radio-1995-2019.parquet` - `taux-d-expression-des-femmes-annuel-a-la-television-2010-2019` → `data/taux-d-expression-des-femmes-annuel-a-la-television-2010-2019.parquet` ## Utilisation ```python from datasets import load_dataset # Choisir un sous-ensemble/configuration : ds = load_dataset("Data-Gouv-FR/temps-de-parole-des-hommes-et-des-femmes-a-la-television-et-a-la-radio", "moyennes-par-annees-et-par-chaines") print(ds["train"]) ``` ## Description originale Temps de parole des hommes et des femmes, correspondant à plus d'un million d'heures de programmes diffusés de 1995 au 28 février 2019. Les temps de parole sont obtenus automatiquement à l'aide du logiciel libre [inaSpeechSegmenter](http://github.com/ina-foss/inaSpeechSegmenter), développé à l'INA. Ce logiciel est basé sur des algorithmes d'apprentissage automatique (sous-famille de l'intelligence artificielle) entraînés sur un grand nombre d'exemples de musique, de voix de femme et de voix d'homme, afin de détecter les zones de musique et les zones de parole contenues dans les documents audiovisuels. Les temps de parole sont estimés par tranches d'une heure, de 5h à minuit pour la radio et de 10h à minuit pour la télévision. Les 21 stations de radio analysées sont Chérie FM, Europe 1, France Bleu, France Culture, France Info, France Inter, France Musique, Fun Radio, Mouv’, NRJ, Nostalgie, RFM, RMC, RTL, RTL 2, Radio Classique, Radio France Internationale, Rire et Chansons, Skyrock, Sud Radio et Virgin Radio. Les 34 chaînes de TV analysées sont Arte, Animaux, BFM TV, Canal+, Canal+ Sport, Chasse et pêche, Chérie 25, Comédie+, D8/C8, Euronews, Eurosport France, France 2, France 24, France 3, France 5, France O, Histoire, I-Télé/CNews, L'Equipe 21, LCI, LCP/Public Sénat, La chaîne Météo, M6, Monte Carlo TMC, NRJ 12, Paris Première, Planète+, TF1, TV Breizh, TV5 Monde, Toute l'Histoire, Téva, Voyage, W9 Le fonctionnement du logiciel d’analyse automatique utilisé sur les documents audiovisuels, ainsi que l’estimation de sa fiabilité, sont décrits dans l'article ci-dessous: David Doukhan et Jean Carrive, "[Description automatique du taux d’expression des femmes dans les flux télévisuels français](https://www.isca-archive.org/jep_2018/doukhan18_jep.pdf)", XXXIIe Journées d’Études sur la Parole, Juin 2018 Les relations existant entre le temps de parole, pourcentage de visages, nombre de mentions orales et décomptes manuels sont détaillées dans l'article ci-dessous: David Doukhan, Lena Dodson, Manon Conan, Valentin Pelloin, Aurélien Clamouse, Mélina Lepape, Géraldine Van Hille, Cécile Méadel et Marlène Coulomb-Gully, "[Gender Representation in TV and Radio: Automatic Information Extraction methods versus Manual Analyses ](https://www.isca-archive.org/interspeech_2024/doukhan24_interspeech.pdf)", pages 3060-3064,Interspeech 2024

The dataset involves the speaking time of men and women on television and radio, covering over one million hours of programs broadcast from 1995 to February 28, 2019. Speaking times are obtained automatically using the open-source software inaSpeechSegmenter, developed by INA. This software is based on machine learning algorithms trained on a large number of examples of music, female voices, and male voices to detect music and speech areas in audiovisual documents. Speaking times are estimated in hourly slices, from 5 am to midnight for radio and from 10 am to midnight for television. The 21 radio stations analyzed include Chérie FM, Europe 1, France Bleu, etc., and the 34 TV channels analyzed include Arte, BFM TV, Canal+, etc. The dataset also includes references to research papers describing the operation of the automatic analysis software and its reliability estimation, as well as the relationships between speaking time and gender representation.

提供机构:
Data-Gouv-FR
搜集汇总
数据集介绍
Data-Gouv-FR/temps-de-parole-des-hommes-et-des-femmes-a-la-television-et-a-la-radio 数据集图片
构建方式
该数据集源自法国开放数据平台data.gouv.fr,由法国国家视听研究所(INA)基于其自主研发的开源工具inaSpeechSegmenter构建而成。该工具运用机器学习算法,通过对大量音乐、女性及男性语音样本的训练,实现对音视频文件中音乐与语音片段的自动检测。研究团队对法国21家广播电台和34家电视台自1995年至2019年2月28日累计超过一百万小时的节目内容进行逐小时分析,广播时段覆盖早5点至午夜,电视时段覆盖早10点至午夜,最终自动提取出男女发言时间的结构化记录。数据集以Parquet格式存储,在Hugging Face平台上按资源类型划分为五个子集,每个子集均包含一个名为'train'的分割。
使用方法
用户可通过Hugging Face的datasets库便捷加载数据。使用load_dataset函数,指定仓库名称和所需的子集配置名称即可。例如,加载'按年份和频道平均'子集时,调用load_dataset("Data-Gouv-ML/temps-de-parole-des-hommes-et-des-femmes-a-la-television-et-a-la-radio", "moyennes-par-annees-et-par-chaines"),即可获取包含训练数据的Dataset对象。数据集的五个子集分别为:moyennes-par-annees-et-par-chaines、temps-de-musique-et-temps-de-parole-des-hommes-et-des-femmes-a-la-tv-et-a-la-radio、moyennes-par-heure-annee-et-chaine、taux-d-expression-des-femmes-annuel-a-la-radio-1995-2019、taux-d-expression-des-femmes-annuel-a-la-television-2010-2019,研究者可根据分析目标灵活选择对应子集。
背景与挑战
背景概述
该数据集源自法国国家公共数据平台data.gouv.fr,由法国国家视听研究所(INA)的研究团队于2019年创建,核心研究人员包括David Doukhan、Jean Carrive等。数据集聚焦于电视与广播节目中男性和女性发言时间的量化分析,覆盖1995年至2019年间的超过一百万小时节目内容,涉及21个广播电台和34个电视频道。通过利用开源软件inaSpeechSegmenter基于机器学习算法自动检测音乐、女声与男声区域,该数据集为性别平等研究、媒体内容分析及社会语言学领域提供了大规模、系统化的数据支撑,推动了关于媒体中性别表征的实证研究。
当前挑战
该数据集面临的核心挑战在于解决媒体性别表征这一社会领域问题,即如何从海量音视频中准确量化不同性别的发言时间差异,以揭示隐性性别不平等现象。构建过程中,挑战包括:1) 自动语音性别分类模型的准确性受限,尤其在背景噪声、重叠语音或非典型音色场景下易产生误判;2) 数据时间跨度长、来源多样,对程序的鲁棒性提出高要求;3) 手动标注与自动检测结果之间的偏差需要严格校验,以保证数据的可靠性。此外,跨年份、跨频道的差异增加了数据整合与归一化的难度,且需要不断更新算法以应对新兴媒体格式与内容变化。
常用场景
经典使用场景
在媒介性别研究的学术脉络中,该数据集作为衡量法国广播电视领域男女发言时间配比的权威基准,常被用于量化分析性别平等在视听媒体中的演进趋势。研究者可基于超过百万小时的节目元数据,结合年份、频道、时段等多个维度,精准刻画男性与女性在公共话语空间中的曝光差异。经典应用包括纵向比较不同电视台与广播频率的女性表达率,或揭示特定节目类型中性别失衡的结构性特征,为批判性地评估媒体政策干预效果提供实证基础。
解决学术问题
该数据集系统性地回应了传播学与性别研究中长期存在的量化困境——如何在大规模、长时间跨度的视听档案中,客观评估女性代表的实际占比。通过inaSpeechSegmenter自动语音性别识别技术,它克服了传统人工编码的低效与主观性,为学术共同体提供了透明可复现的性别表征度量标准。由此,研究者得以超越个案报道的局限,从宏观层面论证媒体体制对性别表达的塑造作用,推动议程设置与框架理论在性别平等议题上的深化,显著增强了相关研究结论的统计效力与外部推广性。
实际应用
在实际部署中,该数据集已成为法国媒体监管机构及公共舆论平台评估性别平等成效的核心工具。电视台与广播电台可以依据历年女性表达率的变化曲线,自我审视并调整嘉宾邀约机制或节目编排策略,以回应社会对性别失衡的关切。记者与数据分析师亦能借助其多子集配置,快速制作数据新闻可视化作品,向公众揭示媒体中隐蔽的性别成见。此外,该数据集还辅助政策制定者监测《广播电视性别平等宪章》等法规的实施进展,将抽象的文化治理目标转化为可度量的绩效指标。
数据集最近研究
最新研究方向
基于自动语音识别与性别分类技术,该数据集深入挖掘法国广播电视中男女发言时间的历时性差异,结合1995年至2019年间超过百万小时的节目样本,揭示了媒体性别表征的隐性模式。最新前沿研究聚焦于将自动提取的言语时长与传统人工编码进行交叉验证,并探讨性别失衡与节目类型、时段及频道属性的关联。这一工作不仅赋能了媒体公平性的量化监测,也为人工智能驱动的社会语言学研究提供了可复现的基准,呼应了全球范围内对媒体领域性别平等议题的持续关注。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务