遇见数据集

enem-audiodescricao

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

该数据集名为“ENEM 图片的专业音频描述:用于无障碍和视觉模型评估的葡萄牙语语料库”,由 tardellirs 在 Hugging Face 上发布。它包含 977 条由专业人士为巴西国家高中考试(ENEM)2019 年至 2025 年(包括常规考试和 PPL 重新应用)的图片编写的音频描述(人类书写,无 OCR 或模型输出)。其中 794 张图片以 PNG 格式提供,并从原始 INEP PDF 中提取,同时提供 Python 脚本用于从 PDF 重建图片以进行审计。每条记录包含丰富的元数据,如考试年份、日期、应用类型、考试手册、题目编号、语言、描述类别(图片、选项或选项前导)、原始标签(如“图表描述”)、前导文本(对于选项类描述需与前导文本拼接)、问题陈述、选项、答案、图片(PIL.Image 对象或文件路径)、图片属性(DPI、边界框、是否为矢量图等)、描述字符数、来源文件、SHA-256 哈希、重建信息等。描述性统计:977 条记录,794 张配对图片,762 个不同题目,每年分布从 114 到 175 条记录不等。描述文本中位数为 298 个字符(图片类为 334 个字符)。该数据集旨在作为评估葡萄牙语自动音频描述生成模型的金标准,以及研究在考试场景下不泄露答案的受限描述任务。注意:描述并非针对盲人读者进行验证,部分图片存在边缘裁剪,2019-2020 年配对图片极少,且描述存在故意不充分性以避免泄露答案。模型评估时需注意训练数据污染(题目已公开)。

This dataset is called Professional Audio Descriptions of ENEM Images: A Portuguese Corpus for Accessibility and Vision Model Evaluation, released by tardellirs on Hugging Face. It contains 977 audio descriptions written by professionals for images from the Brazilian National High School Exam (ENEM) from 2019 to 2025 (including regular exams and PPL re-applications), all human-written without OCR or model output. 794 images are provided in PNG format extracted from the original INEP PDFs, along with Python scripts to reconstruct images from PDFs for audit. Each record includes rich metadata such as exam year, date, application type, exam booklet, question number, language, description category (image, option, or option lead), original label (e.g., chart description), lead text (for option-type descriptions to be concatenated with the lead), question statement, options, answer, image (PIL.Image object or file path), image attributes (DPI, bounding box, whether it is a vector graphic, etc.), description character count, source file, SHA-256 hash, reconstruction information, and more. Descriptive statistics: 977 records, 794 paired images, 762 distinct questions, annual distribution ranging from 114 to 175 records. Median description length is 298 characters (334 for image category). The dataset is intended as a gold standard for evaluating Portuguese automatic audio description generation models and for studying restricted description tasks that do not reveal answers in exam scenarios. Note: Descriptions are not validated for blind readers, some images have edge cropping, there are very few paired images for 2019-2020, and descriptions are intentionally insufficient to avoid revealing answers. Model evaluation should consider training data contamination (questions are already public).

创建时间:
2026-08-18
原始信息汇总

数据集概述

基本信息

  • 数据集名称:ENEM专业图像音频描述(Audiodescrição profissional de imagens do ENEM)
  • 语言:巴西葡萄牙语(单语)
  • 规模:977条记录(1K<N<10K)
  • 许可证:INEP署名与MIT(混合许可)
  • 数据来源:专家生成(无OCR、无模型输出)

数据内容

  • 覆盖范围:巴西国家考试ENEM 2019–2025年,包括常规考试、PPL重考和2025年重考(P2)
  • 核心内容:977条由专业人士撰写的图像音频描述,与图像、题目题干、选项和答案对齐
  • 数据规模分布
    • 按年份:2019年114条、2020年96条、2021年139条、2022年150条、2023年141条、2024年162条、2025年175条
    • 配对图像:794条记录有配对图像;666条记录具有确定性图像引用
    • 图像按年份:2019年72张、2020年46张、2021年111张、2022年145张、2023年129张、2024年136张、2025年155张
  • 描述文本:100%人工撰写,无OCR、无模型转录

数据字段

关键字段包括:

  • 基础信息idano(年份)、dia(天数)、aplicacao(考试类型)、caderno(册子)、questao(题目编号)
  • 内容字段descricao(专业音频描述)、preambulo(共同前言,需与描述拼接)、enunciado(题干)、alternativas(选项)、gabarito(答案)
  • 图像字段image(嵌入的图像字节)、imagem(图像文件路径)、bbox_figura(图像边界框)、dpi_render(渲染DPI)
  • 分类字段classe(类别:figura/alternativa/alternativas)、genero(视觉类型分组)、rotulo(原始标签,95种不同标签)
  • 溯源字段arquivo(源文件)、sha256pagina(页码)、fonte(来源:pdf/pdf+txt/txt)

质量控制

  • 配对验证:152张图像经人工审核,随机抽样100张中0对错误(95%置信区间上限3.6%)
  • 图像保真度:通过脚本从INEP公开PDF重建的图像,665/666张与原始图像逐字节一致
  • 数据完整性:57个输出不变式在每次重新处理时验证

重要说明

  • 选项描述:不同选项的图像描述需将preambulo(前言)与descricao(描述)拼接使用
  • 覆盖局限性:2019–2020年的特殊册子用描述替代了图像,导致配对图像极少(2019年0张、2020年9张)
  • 分辨率保障:DPI自适应(300–1200 dpi),目标较小边600像素
  • 使用建议:该数据集适合作为葡萄牙语模型生成音频描述/替代文本的评估基准,但不应直接用于训练通用图像描述模型
搜集汇总
数据集介绍
enem-audiodescricao 数据集图片
构建方式
该数据集通过系统化的管线构建,涵盖2019至2025年巴西国家高中考试(ENEM)及其PPL重新应用的官方试卷。数据源自INEP发布的‘ledor’考卷,其中包含由专业音频描述员撰写的图像描述。提取过程采用多阶段脚本,包括从PDF中提取文本块、渲染页面区域以捕获矢量图形、以及将PDF与DOSVOX文本转录进行内容级融合,确保描述与对应图像、题干、选项和答案密钥精确对齐。所有描述均为人工撰写,无OCR或模型生成内容,并经过57项不变量验证以保证数据完整性。
特点
该数据集包含977条专业音频描述,其中666条配有对应图像,覆盖762道不同考题。其独特之处在于描述文本完全由人类专家撰写,且包含丰富的元数据,如题号、年份、应用类型、图像边界框及渲染DPI。数据集还提供了图像重建脚本,可依据公共PDF复现图像,其中665张图像与原始文件逐字节一致。此外,数据集中包含116条选项描述,需将‘preambulo’字段与描述拼接以获得完整文本,这一设计反映了专业音频描述在考试场景下的实践特点。
使用方法
数据集可通过Hugging Face的load_dataset函数加载,支持使用Python直接访问图像和文本字段。建议用户使用提供的reconstruir_imagens.py脚本验证图像来源,并在处理选项描述时注意拼接‘preambulo’。数据集适用于评估葡萄牙语视觉语言模型的图像描述能力,或作为研究音频描述在考试限制下如何平衡信息提供与答案不泄露的参考。使用时需注意训练数据污染问题,建议采用分年度评估或替代选项排列等控制策略。
背景与挑战
背景概述
enem-audiodescricao数据集由Tardelli R. C. Stekel于2026年创建,旨在构建巴西国家高中考试(ENEM)中专业图像音频描述(audiodescrição)的葡萄牙语语料库。该数据集从INEP公开的“ledor”考试册中独立提取,包含2019至2025年间977条由专家撰写的人工描述,并与题目、选项、答案及图像对齐,覆盖常规与PPL复考。其核心研究问题在于为视觉语言模型在葡萄牙语情境下的无障碍描述生成提供黄金标准,同时支持对模型在考试型图像描述任务中的功能评估。作为目前规模最大、来源专业且完全人工标注的此类语料,该数据集填补了巴西教育图像描述研究资源的空白,并为多模态模型在低资源语言上的性能评测提供了关键基准,对AI可及性研究及教育技术领域具有显著影响力。
当前挑战
该数据集面临的挑战首先在于领域问题的复杂性:ENEM图像涵盖图表、几何图形、化学结构等多元类型,而专业音频描述需在“提供访问”与“不泄露答案”间取得微妙平衡,这种受约束的描述任务缺乏现成范式,增加了模型评估的难度。构建过程中,技术性挑战尤为突出:约40%的图为矢量格式,难以用传统工具提取;PDF文本块边界模糊且存在不完整字体映射,需定制解析;2019-2020年考试册中图像被描述替换,导致图像覆盖不均;此外,部分图像存在边缘裁剪或文本污染,需人工审计,且需设计内容级融合策略解决跨格式重复记录问题,并通过57项不变量确保数据一致性,这些均显著提升了语料构建的复杂度。
常用场景
经典使用场景
该数据集作为葡语教育领域首个大规模专业图像描述语料库,其经典使用场景集中于视觉-语言模型的性能评估与训练基准构建。依托巴西国家高中教育考试(ENEM)2019至2025年间官方发布的977条专业音频描述文本,以及与之精确对齐的794幅图形图像、题干、选项及标准答案,研究者可系统性地检验模型在图像字幕生成、视觉问答及多项选择任务中的表现。数据集设计兼具人工作业的高质量标注与结构化的元数据体系,为对比不同模型架构在真实教育场景下的描述准确性、语义完整性及抗干扰能力提供了严谨的测试平台,尤其适用于跨语言(葡语)视觉-语言模型的泛化能力研究。
解决学术问题
该数据集直面教育领域专业图像描述资源匮乏的学术困境,有效解决了视觉-语言模型在低资源语言环境下的评估失真问题。传统基准多依赖英文描述或模型生成文本,缺乏人类专家撰写的黄金标准,难以验证模型输出的专业性与可读性。此数据集以INEP官方认证的读题者文本为基准,其内容受严格的时间限制与答题公平性约束,形成独特的“非充分描述性”优化目标,为研究描述生成中的信息平衡、冗余控制与线索规避提供了前所未有的实证样本,推动了描述质量评估从泛化指标向功能化、场景化标准的演进。
衍生相关工作
该数据集的发布催生了一系列衍生研究工作,促进了多学科交叉创新。在自然语言处理领域,研究者基于其高质量对齐数据,训练针对葡语的专用描述生成模型,并探索少样本学习与提示调优技术,以提升模型的低资源语言适应性。在计算机视觉领域,其丰富的图形类型与标注细节推动了图形理解、风格迁移及可解释性研究,尤其是在处理矢量图形与非自然图像方面。此外,其特有的“不泄漏答案”描述约束,引领了面向安全交互的文本生成研究,激励开发兼具信息性与策略性的描述框架,相关方法论已拓展至医疗影像报告、法律文档摘要等敏感领域,形成广泛的方法论辐射效应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务