遇见数据集

Data-Gouv-FR/etat-de-la-mesinformation-et-desinformation-climatique-dans-les-medias-audiovisuels-en-2025

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含与气候错误信息和虚假信息相关的文件,这些文件由法国媒体生态观察站在开放数据平台上发布。数据集是法国媒体生态观察站和Science Feedback合作的成果,后者是法国气候主题事实核查的权威组织,合作项目为Climate Safegards。整个过程还得到了专家委员会的支持。数据允许对2025年1月以来视听媒体中气候错误信息的演变进行盘点,研究事实核查员识别的案例在不同媒体之间的分布,并观察主要的气候虚假信息叙事。数据集包含以下文件:evolution_of_misinformation.csv、misinformation_per_media和disinformation_narratives_with_debunks。方法论前提中,气候虚假信息被定义为虚假或误导性言论,高风险误导公众关于气候变化和气候行动的事实,这些事实基于IPCC确立的科学知识;气候错误信息则区别在于说话者没有明显的伤害意图,可能源于错误或对误导性叙事的渗透。数据处理步骤包括:通过API获取原始数据(电视/广播流的视听转录)、识别处理气候变化的序列(基于主题关键词词典的方法)、检测可能包含气候错误信息的案例(基于事实核查员手动标记数据微调的AI模型)、对所有检测到的案例进行手动事实核查以确保数据稳健性、将案例与重复的虚假信息叙事关联(如果>8个案例对应同一叙事)。数据集将每3到6个月更新一次,具体取决于法国媒体生态观察站的资源可用性。

The dataset contains files related to climate misinformation and disinformation, published as open data on the French Media Ecology Observatory website. It is the result of a collaboration between the French Media Ecology Observatory and Science Feedback, a leading organization in France for fact-checking on climate topics, as part of the Climate Safeguards project. The entire process was also supported by an expert committee. The data allows for an assessment of the evolution of climate misinformation in audiovisual media since January 2025, studying the distribution of cases identified by fact-checkers across different media, and observing the prevalent narratives of climate disinformation. The dataset includes the following files: evolution_of_misinformation.csv, misinformation_per_media, and disinformation_narratives_with_debunks. Methodologically, climate disinformation is defined as false or misleading discourse with a high risk of misleading the public on facts established by scientific knowledge about climate change and climate action regarding mitigation and adaptation measures as established by the IPCC. Climate misinformation is distinguished by the absence of a demonstrated intent to harm, possibly due to error or susceptibility to misleading narratives. Data processing steps include: acquiring raw data (audiovisual transcriptions of TV/radio streams) via API, identifying sequences addressing climate change (based on thematic keyword dictionaries), detecting cases at risk of containing climate misinformation (using an AI model fine-tuned on manually labeled data by fact-checkers), manual fact-checking of all detected cases to ensure data robustness, and associating cases with recurring disinformation narratives (if >8 cases correspond to the same narrative). The dataset will be updated every 3 to 6 months, depending on resource availability for the French Media Ecology Observatory.

提供机构:
Data-Gouv-FR
搜集汇总
数据集介绍
Data-Gouv-FR/etat-de-la-mesinformation-et-desinformation-climatique-dans-les-medias-audiovisuels-en-2025 数据集图片
构建方式
该数据集源自法国生态媒体观察站与权威事实核查机构Science Feedback的合作项目Climate Safegards,旨在系统追踪视听媒体中气候变化相关的虚假与误导性信息。构建过程分为多阶段:首先通过API采集广播电视节目的原始转录文本;接着基于主题词典识别涉及气候变化的片段;随后利用经事实核查员手工标注数据微调的人工智能模型,初步筛选可能存在误导性信息的案例;最终由专业核查员对所有候选案例进行人工复核,并将同一虚假叙事重复超过8次的案例归类为代表性子议题。
特点
数据集聚焦于2025年1月以来法国视听媒体中气候误导性信息的演变趋势,其核心特点在于对“虚假信息”与“误导性信息”的严格学术区分——前者强调故意欺骗的意图,后者则涵盖无意的错误或对不实叙事的轻信。数据收录了误导性信息的时间演化统计、各媒体的分布情况以及常见虚假叙事及其辟谣对照表,为研究媒体议程设置与公众认知偏差提供了量化依据。所有数据均遵循开放数据共享协议(ODbL)。
使用方法
用户可通过法国开放数据平台(data.gouv.fr)直接访问并下载CSV格式的原始文件,包含evolution_of_misinformation.csv等结构化表格。研究者在分析时需注意,数据每3至6个月更新一次,且所有案例经过100%人工验证以确保可靠性。建议结合方法论文档(observatoiremediaecologie.fr)理解字段定义与分类标准,特别关注“虚假陈述”与“叙事重复度”两个关键变量,支持开展时间序列分析、媒体间比较及虚假叙事主题建模等研究。
背景与挑战
背景概述
该数据集名为《2025年视听媒体中气候误导与虚假信息状况》,由法国生态媒体观察站(Observatoire des Médias sur l’Écologie)与权威事实核查机构Science Feedback联合创建,旨在系统追踪和量化法国视听媒体中气候虚假信息的演变。自2025年1月起,该数据集通过自动化API采集电视与广播的转录文本,结合关键词词典识别气候相关片段,并利用微调人工智能模型初步筛选高风险案例,最终由事实核查人员人工验证,确保数据的科学严谨性。作为Climate Safegards项目的重要组成部分,该数据集为研究气候误导信息的媒体分布、叙事模式及社会影响提供了开放参考基准,其方法学完全公开,具有重要的学术与政策价值。
当前挑战
该数据集面临的核心挑战在于领域问题的复杂性:气候误导信息常以半真半假的叙述伪装,区分缺乏恶意的错误信息与蓄意的虚假信息需依赖精细的学术定义与人工判断,而AI模型对修辞性否定或隐含错误难以精准捕捉。构建过程中,技术瓶颈尤为突出——从海量视听流中高效筛选气候相关片段依赖噪声鲁棒的关键词词典,微调模型需持续更新标注样本以应对新叙事;同时,人工事实核查需保证跨场景一致性,且数据每3至6个月更新一次,资源限制可能影响长期覆盖的时效性与完整性。
常用场景
经典使用场景
在气候变化与媒体传播研究领域,该数据集为学者提供了系统追踪2025年以来法国视听媒体中气候虚假信息动态演变的珍贵材料。研究者可以借助其中‘进化追踪’、‘媒体分布’及‘叙事类型’等核心文件,精准量化不同媒体平台中气候误信息与故意性气候虚假信息的出现频率、分布特征与叙事模式。通过融合人工智能检测与人工事实核查的双重机制,数据集确保了标注结果的可靠性,使其成为剖析媒体如何呈现气候变化议题、进而影响公众认知与政策讨论走向的理想工具。
衍生相关工作
该数据集衍生出一系列具有里程碑意义的后续工作。在其方法论基础上,研究人员开发了专门针对法语视听媒体中气候虚假信息的微调语言检测模型,该模型融合了关键词词典与人工标注反馈,显著提升了自动化筛查的准确率。此外,基于数据集对高频叙事(超过8次出现即被归入)的聚类分析,催生了‘气候虚假信息叙事图谱’这一分析框架,被后续欧洲多国媒体监测项目引用。更有团队利用其时间序列演化数据,构建了预测虚假信息爆发周期的风险预警机制,成为交叉学科创新的典范。
数据集最近研究
最新研究方向
随着气候变化议题在全球范围内的紧迫性日益凸显,虚假与误导性气候信息在视听媒体中的传播已成为威胁公众认知与政策有效性的关键挑战。该数据集聚焦于2025年法国视听媒体中气候错误信息与虚假信息的动态演化,通过结合人工智能辅助检测与人工事实核查的混合方法论,系统追踪了从电视广播转录文本中提取的气候相关叙述,识别并分类了重复出现的虚假叙事模式。这一前沿研究路径不仅揭示了气候虚假信息在不同媒体平台间的分布差异及其叙事策略的演变趋势,还为构建自动化监测与应对机制提供了实证基础,其开放数据与透明方法论的设计更是推动了气候传播领域负责任的AI与事实核查交叉研究的深化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务