遇见数据集

sensenova/SenseNova-Vision-Benchmark

收藏
Hugging Face2026-07-08 更新2026-07-22 收录
官方服务:

资源简介:

SenseNova Vision Benchmark JSONL 是一个用于评估开源视觉语言模型的基准数据集,专注于检测和分割任务。该数据集包含52个JSONL文件,覆盖对象检测、图像分割、OCR(光学字符识别)、文档理解、接地(grounding)、关键点检测、点接地(point grounding)、视觉提示(visual prompt)以及GUI(图形用户界面)图标和文本定位等多种计算机视觉任务。具体任务包括:COCO、LVIS、VisDrone等标准检测数据集;DocLayNet、HierText等文档分析任务;RefCOCOg等引用表达式理解;以及ADE20K全景分割、COCO全景分割、GCG分割、推理分割和二进制分割等分割任务。数据集以JSONL格式组织,便于直接集成到统一评估脚本或转换为其他评估框架所需格式。所有文件分为检测和分割两大目录,检测目录下进一步细分为GUI评估、关键点评估、点评估和视觉提示评估子目录。该数据集旨在为多模态生成模型提供全面的视觉任务评估基准。

SenseNova Vision Benchmark JSONL is a benchmark dataset for evaluating open-source vision-language models, covering detection and segmentation tasks. It consists of 52 JSONL files that encompass a wide range of computer vision tasks, including object detection, image segmentation, OCR (optical character recognition), document understanding, grounding, keypoint detection, point grounding, visual prompting, and GUI (graphical user interface) icon and text localization. Specific tasks involve standard detection datasets such as COCO, LVIS, and VisDrone; document analysis tasks like DocLayNet and HierText; referring expression comprehension such as RefCOCOg; and segmentation tasks including ADE20K panoptic segmentation, COCO panoptic segmentation, GCG segmentation, reasoning segmentation, and binary segmentation. The dataset is organized in JSONL format, making it easy to plug into unified evaluation scripts or convert to formats required by other evaluation frameworks. All files are divided into two main directories: detection and segmentation, with the detection directory further subdivided into GUI evaluation, keypoint evaluation, point evaluation, and visual prompt evaluation subdirectories. This dataset aims to provide a comprehensive benchmark for evaluating multimodal generation models on diverse vision tasks.

提供机构:
sensenova
搜集汇总
数据集介绍
sensenova/SenseNova-Vision-Benchmark 数据集图片
构建方式
该数据集以JSONL格式系统性地整合了52个基准测试文件,覆盖检测与分割两大视觉任务。其构建逻辑基于任务类型进行层次化组织:检测类任务细分为通用目标检测(如COCO、LVIS)、文档与OCR分析(如DocLayNet、IC15)、GUI元素定位(如ScreenSpot系列)以及关键点与点定位评估;分割类任务则囊括全景分割(ADE20K、COCO)、语义分割(GCG)及推理分割(ReasonSeg)等。所有文件均采用统一JSONL格式,便于直接接入评估脚本或转换为其他框架兼容格式,显著降低了跨平台评测的适配成本。
特点
该数据集最显著的特点在于其全任务覆盖与精细化结构设计。它既包含传统视觉任务如目标检测、分割与关键点检测,又拓展至前沿领域如GUI界面元素定位、视觉提示理解及推理分割,体现了从基础感知到复杂场景理解的能力评估层级。此外,每个JSONL文件均独立存储对应样本的完整标注信息,支持任意子集独立评测,且通过`gui_eval`、`keypoint_eval`等子目录进一步细化任务场景,为多维度模型性能诊断提供了高度定制化的测试环境。
使用方法
使用方法极为简洁:用户可直接加载JSONL文件至Python环境,利用`jsonlines`库逐行解析每包含图像路径、目标框、分割掩码等标注字段的样本数据。对于统一评测,可遍历`detection/`与`segmentation/`目录下的全部文件,按任务类型聚合评估指标;若需特定场景验证,则仅加载对应子集(如`gui_eval/screenspot_mobile_v2_icon.jsonl`)。输出结果可与模型预测进行结构化对比,计算mAP、IoU等标准指标,从而高效完成对多模态模型的系统性能力评估。
背景与挑战
背景概述
SenseNova-Vision-Benchmark 是由商汤科技(SenseTime)旗下的 OpenSenseNova 团队于 2024 年创建的大规模视觉语言模型评估基准。该基准聚焦于将视觉任务统一为多模态生成范式,涵盖目标检测、图像分割、关键点检测、GUI 元素定位及 OCR 等核心研究方向,旨在系统性衡量开源视觉语言模型在细粒度视觉理解与生成任务上的综合性能。作为 SenseNova 开源生态的重要组成部分,该基准提供了 52 个标准化 JSONL 格式的评估文件,覆盖 COCO、LVIS、RefCOCOg、ADE20K 等经典数据集以及 ScreenSpotPro 等新兴 GUI 任务场景。其发布为领域内模型对比提供了统一且可复现的评测框架,显著推动了多模态生成模型在工业与学术场景中的透明化评估进程。
当前挑战
当前视觉语言模型面临的核心挑战在于缺乏统一且覆盖广泛的评估标准,现有基准多聚焦于单一任务(如图像描述或分类),难以真实反映模型在细粒度检测、分割及多类型定位任务中的泛化能力。SenseNova-Vision-Benchmark 所解决的问题包括:如何构建兼顾检测、分割、关键点、GUI 元素与文本定位的多任务评测体系,以及如何设计标准化 JSONL 格式以兼容不同模型的评估脚本。在构建过程中,团队面临的主要挑战包括:整合来源各异的数据集并保持标注一致性,处理 GUI 场景中元素密集遮挡导致的定位歧义,以及维护 OCR 与推理分割任务中细粒度语义与空间关系的高效标注。
常用场景
经典使用场景
在视觉与语言交汇的智能时代,SenseNova-Vision-Benchmark作为一个全面而精密的评估基准,专门用于评测开源视觉语言模型在物体检测与图像分割领域的表现。该数据集以JSONL格式组织,包含多达52个子任务文件,横跨通用目标检测、文档分析、汉字与场景文本识别、指代理解、关键点检测乃至图形用户界面元素定位等多元维度。诸如COCO、LVIS、RefCOCOg、VisDrone、DocLayNet、HierText以及IC15等经典基准均被囊括其中,支持研究者通过统一接口或转换适配到现有评估框架,从而系统性地衡量模型的精细视觉理解能力。
实际应用
该数据集的实践价值体现在它能直接赋能多种工业级视觉应用场景。在智慧文档处理中,模型依赖DocLayNet与SROIE数据可解析复杂版面的结构与关键字段;在自动驾驶与无人机巡检领域,由VisDrone驱动的检测能力有助于精准识别动态环境中的行人或车辆;在智能交互设计中,基于ScreenSpotPro系列的任务可以精确标定用户界面上的图标与文本,赋能GUI自动化测试与智能助手场景。此外,OCR学科中的HierText与TotalText评测使模型能应对自然场景中的多方向文字识别,而ADK20K与GCG分割任务则服务于远程遥感语义理解及医疗影像分析等严肃领域,全面体现了该基准在落地应用中的广泛适应性。
衍生相关工作
基于该基准的推广与性能比较,衍生出一系列推动视觉语言模型发展的经典工作。首先,商汤科技研究团队围绕该基准发布了SenseNova-Vision-7B-MoT模型,其混合专家结构在大范围检测与分割任务上展现出卓越泛化性能;同时,配套的大规模预训练语料SenseNova-Vision-Corpus-50M被广泛用于下游任务的微调与迁移学习。此外,关于GUI理解与屏幕元素定位的研究大量引用了该基准下的ScreenSpotPro系列数据,推动了像ScreenAgent、OS-Copilot这类智能体任务评估的标准化。COCO与RefCOCOg的指代分割子集也为对话式视觉理解与Prompt-Based视觉定位方法提供了可重复验证的实验平台,影响着从Mask2Former到GLIP等众多代表性框架的测评范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务