遇见数据集

ImpText-Bench

收藏
github2026-05-26 更新2026-05-27 收录
数据链接:
官方服务:

资源简介:

ImpText-Bench是一个用于隐式文本推理的基准数据集,包含1,630个图像-文本记录,分为良性样本、物理变形、视觉伪装和认知建议等类别,旨在评估多模态大语言模型在检测和恢复隐藏文本内容方面的能力。

ImpText-Bench is a benchmark dataset for implicit text reasoning, containing 1,630 image-text records categorized into benign samples, physical deformations, visual camouflages, cognitive suggestions and other categories. It aims to evaluate the capabilities of multimodal large language models in detecting and recovering hidden textual content.

创建时间:
2026-05-25
原始信息汇总

数据集概述:ImpText

ImpText 是一个用于研究多模态大语言模型在内容安全方面失效模式的基准与工具增强框架,其核心任务是隐式文本推理(Implicit Text Reasoning, ITR)。该任务要求模型识别图像中是否包含通过物理变形、视觉伪装或认知暗示等方式故意隐藏的高风险文本,并恢复出目标文本。

任务定义

隐式文本推理(ITR)要求模型将图像 I 映射为 (y, T),其中 y 表示是否存在隐式文本,T 是恢复出的目标文本。这区别于标准OCR任务:系统必须首先检测隐藏意图,然后恢复被隐藏的内容。

期望的模型输出格式为: xml <has_hidden_text> Yes/No </has_hidden_text> <hidden_content> recovered text or None </hidden_content>

基准数据集 (ImpText-Bench)

  • 规模:包含 1,630 条图像-文本记录。
  • 分类:数据集分为良性样本、物理变形、视觉伪装和认知暗示四大主类别,具体子类别及数量如下:
主类别 子类别 数量
良性样本 正常图像 1,141
物理变形 拉伸 58
视觉伪装 对抗性纹理 134
视觉伪装 视觉干扰 93
视觉伪装 环境融合 73
视觉伪装 不规则排版 28
认知暗示 上下文补全 61
认知暗示 隐式对话 42
总计 所有样本 1,630
  • 数据格式:元数据存储在 imptext_bench/dataset.jsonl 文件中,每行是一个JSON对象,包含 idcategoryimage_pathis_white_samplehidden_content 字段。
  • 图像布局:下载后的图像应放置在 imptext_bench/images/ 目录下,分为 white/<id>.pngblack/<id>.png 两个子目录。
  • 数据获取:图像文件通过 Hugging Face 数据集 ImpText-Bench 分发。

评估协议

ImpText-Bench 采用双指标评估协议:

  1. 存在性分类:对隐式样本计算召回率,对良性样本计算准确率,并计算总体F1分数。
  2. 文本匹配分数 (TMS):评估对隐式样本的内容恢复质量。TMS 使用归一化编辑距离(NED)计算,当 NED <= tau 时,认为识别成功,默认容差 tau = 0.5。在论文视角的评估中,良性样本总结为准确率,隐式类别总结为召回率和TMS。

框架与工具

  • ImpText-Reader:将ITR任务分解为用于自适应图像恢复的视觉增强器(Visual Enhancer)和用于存在性分类与文本识别的语义推理器(Semantic Reasoner)的框架。
  • 图像工具库:实现了视觉增强器所使用的多项图像增强操作,包括阈值处理、边缘提取、颜色通道提取、有损压缩、色调分离、锐化、各向异性拉伸、CLAHE、降采样、形态学闭合和黑帽提取等。
  • OCR基线:提供了使用OCR风格多模态提示以及通用HTTP JSON OCR服务的评估脚本。
  • 阈值扫描:支持对保存的结果文件进行NED容差阈值 tau 的扫描分析。
搜集汇总
数据集介绍
ImpText-Bench 数据集图片
构建方式
ImpText-Bench的构建基于对多模态大语言模型内容安全失效模式的系统性研究,聚焦于高风险文本通过物理变形、视觉伪装或认知暗示等方式被有意隐藏的场景。该基准数据集包含1,630条图文记录,划分为良性样本、物理变形、视觉伪装及认知暗示四大主类,并进一步细分为正常图像、拉伸、对抗纹理、视觉干扰、环境融合、不规则排版、上下文补全及隐式对话等子类。每条记录由唯一标识符、类别标签、图像路径和隐藏文本内容构成,以JSON格式存储于dataset.jsonl清单中,对应的图像文件则通过Hugging Face数据集仓库分发,需下载至本地目录以供评估使用。
特点
ImpText-Bench的核心特点在于其对隐式文本推理任务的针对性设计,将标准OCR任务扩展为对隐藏意图的检测与内容恢复的双阶段过程。基准数据集覆盖了多种隐式文本表现形式,包括物理变形(如拉伸)、视觉伪装(如对抗纹理、视觉干扰、环境融合及不规则排版)及认知暗示(如下文补全与隐式对话),同时纳入良性样本以模拟现实中的类不平衡情况。评估采用双指标协议,即存在性分类的召回率与准确率以及基于归一化编辑距离的文本匹配分数,后者以默认容忍度τ=0.5衡量内容恢复质量。
使用方法
使用ImpText-Bench时,首先需通过Hugging Face CLI下载图像文件至imptext_bench/images目录,并运行check_benchmark.py脚本验证完整性。评估可通过evaluate_api.py脚本调用兼容OpenAI API的模型进行推理,支持设置并发数、模型参数及输出目录,并可选干运行模式。对于OCR基线,可使用evaluate_ocr.py脚本集成OpenAI或通用HTTP JSON OCR服务,通过运行时传入端点URL和令牌密钥。结果分析阶段可利用tau_sweep.py脚本对不同编辑距离容忍度阈值进行扫描,生成汇总报告;同时,工具库中的apply_tool.py脚本支持对图像应用CLAHE、边缘提取等增强操作,辅助理解视觉增强器的工作原理。
背景与挑战
背景概述
ImpText-Bench是由香港科技大学(广州)与香港科技大学联合团队于2025年构建的隐式文本推理基准数据集。随着多模态大语言模型在视觉理解任务中的广泛应用,一种新型的安全隐患逐渐浮现:高风险文本信息可能通过物理形变、视觉伪装或认知暗示等手段被刻意隐藏。当前主流的OCR系统与多模态大语言模型在面对此类隐式文本时,往往无法准确检测并恢复被隐藏的内容。ImpText-Bench精确聚焦这一领域核心问题,系统性地定义了隐式文本推理任务,要求模型同时判断图像中是否存在隐藏文本并恢复其内容。数据集包含1,630个精心设计的图像-文本记录,涵盖物理变形、视觉伪装、认知暗示等三大类共七个子类别的隐式文本样本,以及1,141个良性样本用于评估假阳性问题。该基准的提出为多模态大语言模型的安全性评估提供了全新的测试维度,推动了隐式文本推理这一关键研究方向的标准化进程。
当前挑战
ImpText-Bench所面对的挑战主要体现为三个方面。其一,隐式文本推理任务本身具有高度的认知复杂性,模型不仅需要具备传统的文字识别能力,更要能够理解人类设计隐藏文本的意图与策略,这远超标准OCR任务的范畴。其二,构建高质量的隐式文本数据集极具难度,需要系统性地设计物理变形(如拉伸)、视觉伪装(如对抗性纹理、环境融合、不规则排版)以及认知暗示(如上下文补全、隐含对话)等多样化的隐式方式,同时确保良性样本的真实性与类不平衡的合理性,以准确反映实际应用中的安全风险分布。其三,当前多模态大语言模型与OCR系统在面对这些精心构造的隐式文本样本时,存在显著的漏检与恢复失败问题,亟需开发能融合自适应图像增强与语义推理的联合解决方案,从而有效提升模型在复杂场景下的鲁棒性与安全性。
常用场景
经典使用场景
ImpText-Bench作为隐式文本推理(ITR)领域首个系统性基准,其经典使用场景聚焦于评估多模态大语言模型在面对物理变形、视觉伪装及认知暗示三类隐蔽文本时的感知与恢复能力。数据集包含1630对精心设计的图像-文本记录,涵盖正常样本与七类恶意子类,要求模型完成存在性判别与文本恢复的双重任务。研究者通过该基准可系统性地测度模型在非规范文本场景下的鲁棒性,尤其适用于检测现有OCR与视觉语言模型在对抗性纹理、环境融合、不规则排版及情境补全等复杂情境中的失效边界。
实际应用
ImpText-Bench在现实场景中具有广泛的应用价值,尤其在内容安全审核领域展现出关键作用。社交媒体平台可利用该基准评估系统对恶意隐匿文本(如经变形或伪装后的违规词句)的过滤能力;电子取证工具可借鉴其数据以提升对篡改文档中隐蔽信息的提取精度;自动化审计系统则能通过该基准验证对合同、票据中刻意模糊或嵌入背景文字的解译可靠性。此外,自动驾驶场景中的交通标志识别与工业质检中的缺陷标志检测,均可依托其物理变形与视觉伪装案例库进行针对性强化。
衍生相关工作
围绕ImpText-Bench已衍生出多项标志性工作,其中最具代表性的是ImpText-Reader框架。该框架将隐式文本推理任务解耦为视觉增强与语义推理两阶段,通过自适应图像修复与语义分类器协同工作,显著提升了在复杂伪装情境下的文字恢复准确率。基于该基准,研究者还发展了多种针对性方法,包括结合边缘检测与CLAHE增强的预处理流水线、融合上下文信息的认知补全网络,以及面向对抗性纹理的降噪自编码器。这些工作在基准的评估协议下展现出不同维度的优势,共同推动了隐式文本推理领域从单一OCR向多模态深层理解范式的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务