遇见数据集

IA_eleicoes_noticias

收藏
github2026-06-18 更新2026-07-16 收录
官方服务:

资源简介:

该数据集包含321篇巴西新闻文章,涉及2026年巴西选举中人工智能(AI)的使用、风险和监管报道。数据集经过人工和AI辅助分类,涵盖22个字段,包括媒体来源、叙事框架、AI机制、平台、叙事效价、证据水平和监管响应等维度。数据集提供结构化数据文件(如CSV和JSON格式),并附有分类语料、证据文本和可视化分析结果。

This dataset contains 321 Brazilian news articles focusing on coverage of the utilization, risks, and regulatory oversight of artificial intelligence (AI) in the 2026 Brazilian general election. The dataset underwent manual and AI-aided classification, and includes 22 fields covering dimensions such as media source, narrative framework, AI mechanisms, platforms, narrative valence, evidence level, and regulatory responses. It provides structured data files in formats including CSV and JSON, alongside classified corpora, evidence texts, and visual analysis results.

创建时间:
2026-06-16
原始信息汇总

数据集概述

该数据集(IA_eleicoes_noticias)来自研究项目 “Imaginário Eleitoral da Inteligência Artificial nas Eleições Brasileiras de 2026”(2026年巴西选举中人工智能的选举想象),由 AI-COMPADD / LABIIA 实验室开发,旨在研究巴西媒体如何报道2026年选举中的人工智能话题,重点关注叙事框架、技术机制、国家监管回应及政治媒体想象形象。


数据规模与组成

  • 规模:经过筛选和分析后,数据集包含 321篇 新闻报道。
  • 时间范围:覆盖2026年1月至6月,主要是预选期和巴西高等选举法院(TSE)监管期。
  • 采集来源:来自巴西各大新闻媒体,通过 Google News RSS 和 Playwright 等方式采集,部分来源可能涉及付费墙。
  • 筛选标准:原始采集编号从 BR-2026-0001BR-2026-0425,存在空缺编号,对应被排除的无效或内容不合格的材料。

数据内容与分类维度

数据集包含一个专用的编码手册(codebook),涵盖 8个分析维度,共 22个字段,所有文章经过人工及监督式AI代理的共同分类。主要维度包括:

  • 媒体/发布者
  • 文章体裁
  • 主要叙事主体(例如:国家/TSE、平台、候选人等)
  • AI机制/技术(如:深度伪造、机器人等)
  • 数字平台(如:Meta等)
  • 叙事价值倾向
  • 证据级别
  • 监管回应
  • 巴西特有标志

存储结构

corpus/ — 分类语料

  • 321个文件BR-2026-XXXX.md),每篇新闻包含:原始URL、摘要、详细分类字段、文本证据、质量审查备注。

dados/ — 结构化数据库

  • base_classificacao.csv:最终规范分类(321行)。
  • manifesto_corpus.csv:筛选过程记录。
  • dataset/dataset.csv:解析后的标准格式(321行,29列)。
  • dataset/dataset_long.csv:标准化行格式,便于交叉分析。
  • dataset/evidencias.csv3,999条 文本证据,含源文件标记。
  • dataset/parse_report.json:解析诊断报告。
  • dados/indices/quantitativo_resumo.json:关键量化指标索引。

analises/ — 分析结果

  • analises/figuras/:8张高分辨率可视化图表,包括:机制分布、平台分布、叙事价值×证据级别、机制共现、叙事主体分布、媒体类型×价值、时间序列、综合指数。
  • analises/tabelas/:21个CSV表格,含单变量、双变量、共现、时间序列等统计。
  • analises/sintese/:定性综合材料,包括:
    • 9个选举想象形象(如:审判官/警长、诽谤性深度伪造、不负责任的平台、口袋里的神谕、群机器人等)。
    • 词汇词典:按语义场分组。
    • 意外发现:跨批次重复出现的定性发现。
    • 13篇锚定文章:涵盖5种叙事框架。
    • 编码异常报告。
  • analises/notas/:11个批次的定性阅读笔记。

docs/ — 方法文档

  • 编码手册(codebook-agentes-ia-final.mdlivro-codigos-final.md)及JSON Schema。
  • 操作指南与采集经验教训(aprendizados.mdGUIA-OPERACAO-CLASSIFICACAO.md)。
  • 分类AI代理提示模板(prompt-classificador-agente-ia.md)。
  • 报告撰写支持材料(证据矩阵、主题综合等)。

scripts/ — 可复现脚本

  • 采集脚本:PDF下载、批量下载、采集波次审查。
  • 分类/解析脚本:编码管道、验证器、语料解析器(.md → CSV)。
  • 分析脚本:生成量化图表、阅读笔记、定性综合、报告草稿。

qa/ — 最终审计

  • qa-final.md:包含数据审计、解释锚定、确认偏误测试及最终结论的审查报告。

主要发现摘要

  • 国家/制度中心主义:85% 以上文章的主要叙事主体是 国家/TSE;监管中心指数(IR)高达 0.963
  • 高具体性:80% 的文章基于有证据文献的事实;具体性指数(IC)为 0.769
  • 主导AI机制深度伪造(deepfake) 出现在 68.5% 提及AI机制的文章中。
  • 最常提及平台Meta(占提到平台文章的39%)。
  • 主导叙事框架AI可监管,其次是 AI威胁AI神谕
  • 最强选举想象形象:审判官/警长、诽谤性深度伪造、不负责任的平台、口袋里的神谕、群机器人。

使用说明

  • 快速导航:建议从 corpus/BR-2026-0001.md 开始了解格式,然后查看 dados/base_classificacao.csv 获取全貌。
  • 统计分析:主要使用 dados/dataset/dataset.csvdados/dataset/evidencias.csv
  • 复现分析:需要 Python 3.11+ 及 pandasmatplotlibseabornnumpy 库。运行脚本 scripts/analises/gerar_quantitativos.py 等可直接生成结果。
  • 验证分类:可使用 docs/codebooks/schema-codebook-final.json 对分类数据进行校验。

重要局限性

  • 字段覆盖不完整:部分字段如 plataforma(57%)和 marcadores_brasileiros(40%)未完全填充,使用时应参考有效分母。
  • 分析单元:新闻文章本身,而非选举事件,不推断AI与选举结果间的因果关系。
  • 时间窗口:主要集中在2026年3月至6月(预选及TSE监管期),非涵盖整个选举周期。
  • 原始PDF缺失:受版权和文件大小限制,未提供原始新闻PDF,但 .md 文件已保留核心信息。
搜集汇总
数据集介绍
IA_eleicoes_noticias 数据集图片
构建方式
该数据集围绕2026年巴西大选期间人工智能在新闻中的呈现方式构建,研究团队自2026年1月至6月系统收集了巴西主要媒体的相关新闻报道,经过人工与监督式AI代理协同分类,依据包含22个字段、覆盖八项分析维度(如媒体类型、叙事主体、AI机制、平台、情感倾向、证据层级、监管响应及巴西本土标识)的编码手册进行标注。最终形成包含321篇已分类新闻的语料库,每篇均配有原文链接、摘要、分类结论、文本证据及质量审核记录,并以标准化标识符BR-2026-0001至BR-2026-0425进行索引。
特点
数据集以结构化与非结构化数据相结合的方式呈现丰富性,核心特征包括:提供规范化的分类基础表格、长格式数据、证据文本及解析报告等多层次数据文件;包含基于21个CSV表格与8幅高分辨率可视化图表的定量分析结果,以及涵盖11个阅读批次的分析笔记、词汇表、定性发现与锚点新闻的定性综合材料;特别构建了包含9种媒介政治想象角色的‘神兽谱系’,如‘警长法庭’、‘诽谤性深度伪造’等,深刻揭示了叙事框架中的隐喻图景。
使用方法
研究者可首先查阅语料库中标记化文档以理解数据格式,随后使用基础分类表格获取整体分类概览,并通过结构化数据集进行统计分析。复现分析流程需在Python 3.11以上环境中运行提供的脚本,依次执行定量分析、阅读笔记生成及综合报告合成脚本,脚本将自动调用数据集文件。分类验证可通过JSON Schema对中间文件进行校验,而元数据解析报告与质量审计文件为数据可信度评估提供了关键支撑,所有代码与文档均支持研究与审计目的的重现。
背景与挑战
背景概述
IA_eleicoes_noticias数据集创建于2026年,由AI-COMPADD与LABIIA研究机构联合开发,旨在系统探究巴西媒体在2026年大选期间如何报道人工智能议题。该数据集核心研究问题聚焦于叙事框架、技术机制、国家监管回应以及政治媒体想象中呈现的AI形象。通过对321篇新闻文章进行人工与监督式AI代理相结合的多元分析,该数据集为理解AI在选举语境中的媒体建构提供了开创性资源,显著推动了计算社会科学与政治传播领域的交叉研究。
当前挑战
该数据集面临的挑战首先在于解决领域核心问题:如何精准捕捉媒体报道中AI的叙事框架与隐喻形象,而非仅停留于技术描述层面。其次,构建过程中遭遇多重困难,包括部分分类字段覆盖率不理想(如'平台'字段仅57%),需明确声明有效分母;新闻来源的付费墙与门户网站访问障碍增加了收集复杂性;此外,版权限制导致无法提供原始PDF文件,仅能通过摘要与文本证据保留关键分析信息。
常用场景
经典使用场景
该数据集被广泛应用于分析巴西媒体在2026年大选期间如何报道人工智能技术。研究者利用其包含321篇新闻的语料库,结合22个字段的编码手册,对报道中的叙事框架、技术机制、监管回应及政治想象形象进行系统分类与量化统计。数据集特别适合用于考察媒体对AI风险的呈现方式,如深度伪造技术的高频提及(68.5%),以及国家行为体作为主要叙事主体(85%)的现象。通过其结构化的分类数据与可视化工具,学者能够复现覆盖率、监管中心度等衍生指数的计算,并深入剖析AI议题在选举报道中的叙事张力。
衍生相关工作
该数据集衍生了一系列富有创见的经典工作,主要包括对政治想象形象的深度挖掘与叙事结构的语义建模。研究者基于其中的定性分析材料提炼出9种选举想象形象(如‘法官-警长’、‘诽谤性深度伪造’、‘口袋中的神谕’),这些形象成为理解媒体如何人格化技术风险的重要概念工具。同时,13篇锚点文章被选作五大叙事框架的范例,后续工作常围绕这些框架展开跨时段或跨国比较。此外,数据集的分析流程直接催生了‘定性分批次人工复核+AI代理辅助’的混合方法论,这一模式已被应用于其他拉美国家的政治传播研究中,推动了全球南方选举话语分析范式的标准化。
数据集最近研究
最新研究方向
该数据集聚焦于2026年巴西大选中媒体对人工智能议题的报道框架与想象图景,前沿研究方向涵盖叙事框架分析、技术机制识别与国家监管回应的交互关系。通过构建321篇新闻语料库,结合定量指标与定性分类法,研究揭示了深度伪造技术作为核心叙事载体(占比68.5%)、Meta平台高频提及(39%)以及国家行为体主导叙事(85%)等关键发现。该研究不仅映射了AI在选举中的实际应用风险,更通过构建'法庭-警长''口袋神谕'等九种想象图景,深入剖析了政治传播中技术焦虑与制度回应的辩证关系。其方法论创新在于融合监督式AI分类与人工质检,为计算传播学提供了可复现的分析范式,对理解全球南方国家选举中的AI治理具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务