遇见数据集

LocateAnything-Data

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

LocateAnything-Data 是用于训练 LocateAnything 模型(一种快速高质量的视觉-语言定位模型,采用并行框解码)的公开训练数据发布。该数据集将检测和视觉定位统一为一个视觉-语言任务:给定一张图像和一个类别、短语、文本字符串或面向动作的指令,模型预测对应的边界框或点。数据覆盖了自然图像、密集场景、人物、自动驾驶、具身交互、图形用户界面、场景文本、文档和表格等多个视觉域。该数据集由多个上游数据集组合而成,包括但不限于 COCO、RefCOCO、RefCOCO+、RefCOCOg、G-RefCOCO、Flickr30K、HumanRef-CoT、Objects365、Open Images V6、OWDOD、PACO、PartImageNet、Unsplash、V3Det、CrowdHuman、DeepFashion2、HumanParts、MOT17Det、MOT20Det、SKU-110K、BDD100K、EgoObjects、nuImages、PixMo Points、RoboAfford、GroundCUA、OS-Atlas、ScaleCUA、ArT、BLIP3-OCR、IDL-OCR、HierText、ICDAR 2013、ICDAR 2015、LSVT、RCTW、ReCTS、SROIE、TextOCR、WildReceipt、CDLA、DocLayNet、M6Doc、PubLayNet、TableBank、TabRecSet 等。每个数据集按域分组,并组织为多个视图(例如,COCO检测和RefCOCO定位是两个不同的视图,共享相同的图像)。每条训练记录包含图像和查询:查询可以是边界框(detection_grounding任务)或点(pointing任务),坐标使用 LocateAnything 的归一化空间网格(可通过乘以图像的宽/高并除以1000映射到像素)。数据以 JSONL 格式提供注释,通过 WebDataset TAR 分片打包图像,并附带 Megatron-Energon 元数据用于分布式训练,以及 Parquet 文件记录每条记录和每张图像与原始数据集的映射关系。该数据集适用于多种视觉定位任务,包括目标检测、短语定位、指代理解、GUI 定位、OCR 文本检测、文档布局分析、表格检测等。注意:部分上游数据集的图像(如 CrowdHuman、DeepFashion2、Flickr30K、PartImageNet、Objects365、SKU-110K、Unsplash)需要从原始来源获取,此仓库仅包含注释和元数据。

LocateAnything-Data is the public training data release for training the LocateAnything model, a fast and high-quality vision-language grounding model with parallel box decoding. This dataset unifies detection and visual grounding into a single vision-language task: given an image and a category, phrase, text string, or action-oriented instruction, the model predicts a corresponding bounding box or point. The data covers multiple visual domains including natural images, dense scenes, people, autonomous driving, embodied interaction, graphical user interfaces, scene text, documents, and tables. The dataset is composed of multiple upstream datasets including but not limited to COCO, RefCOCO, RefCOCO+, RefCOCOg, G-RefCOCO, Flickr30K, HumanRef-CoT, Objects365, Open Images V6, OWDOD, PACO, PartImageNet, Unsplash, V3Det, CrowdHuman, DeepFashion2, HumanParts, MOT17Det, MOT20Det, SKU-110K, BDD100K, EgoObjects, nuImages, PixMo Points, RoboAfford, GroundCUA, OS-Atlas, ScaleCUA, ArT, BLIP3-OCR, IDL-OCR, HierText, ICDAR 2013, ICDAR 2015, LSVT, RCTW, ReCTS, SROIE, TextOCR, WildReceipt, CDLA, DocLayNet, M6Doc, PubLayNet, TableBank, TabRecSet, etc. Each dataset is grouped by domain and organized into multiple views (e.g., COCO detection and RefCOCO grounding are two different views sharing the same images). Each training record contains an image and a query: the query can be a bounding box (detection_grounding task) or a point (pointing task), with coordinates using LocateAnythings normalized spatial grid (which can be mapped to pixels by multiplying by the image width/height and dividing by 1000). Annotations are provided in JSONL format, images are packed via WebDataset TAR shards, and Megatron-Energon metadata is included for distributed training, along with Parquet files recording the mapping of each record and image to the original dataset. This dataset is suitable for various visual grounding tasks including object detection, phrase grounding, referring expression comprehension, GUI grounding, OCR text detection, document layout analysis, table detection, etc. Note: Images from some upstream datasets (e.g., CrowdHuman, DeepFashion2, Flickr30K, PartImageNet, Objects365, SKU-110K, Unsplash) need to be obtained from the original sources; this repository only contains annotations and metadata.

创建时间:
2026-07-26
原始信息汇总

LocateAnything-Data 数据集详情

数据集概述

LocateAnything-Data 是用于训练 LocateAnything 模型(快速高质量视觉语言定位,使用并行框解码)的公开训练数据。该数据集将目标检测和视觉定位统一为视觉-语言任务,给定图像和类别、短语、文本字符串或面向动作的指令,模型输出对应的边界框或点。

数据覆盖范围

数据集涵盖以下主要视觉领域和对应数据集:

领域 包含数据集
通用检测与定位 COCO、RefCOCO、RefCOCO+、RefCOCOg、G-RefCOCO、Flickr30K、HumanRef-CoT、Objects365、Open Images V6、OWDOD、PACO、PartImageNet、Unsplash、V3Det
密集目标检测 CrowdHuman、DeepFashion2、HumanParts、MOT17Det、MOT20Det、SKU-110K
自动驾驶与机器人 BDD100K、EgoObjects、nuImages、PixMo Points、RoboAfford
图形用户界面(GUI) GroundCUA、OS-Atlas、ScaleCUA
文本识别(OCR) ArT、BLIP3-OCR、IDL-OCR、HierText、ICDAR 2013、ICDAR 2015、LSVT、RCTW、ReCTS、SROIE、TextOCR、WildReceipt
文档、布局与表格 CDLA、DocLayNet、M6Doc、PubLayNet、TableBank、TabRecSet

空间监督格式

所有记录使用统一的 query 表示,包含两种任务类型:

  • detection_grounding:边界框 [x1, y1, x2, y2],用于类别检测、短语定位、GUI定位、OCR和布局定位
  • pointing:点 [x, y],用于基于点的定位

坐标基于归一化空间网格(范围0-1000),可通过 x * width / 1000y * height / 1000 映射到图像像素坐标。

发布格式

每个数据集有自己的文件夹,可能包含一个或多个注释视图(视图是同一媒体源上的不同类型的训练注释,例如COCO检测和RefCOCO定位是共享相同底层图像的不同视图)。

仓库结构包含:

  • records.jsonl:易于检查和处理的注释文件
  • records.jsonl.idx:字节偏移索引,支持直接行访问
  • TAR分片:未压缩的索引图像媒体分片
  • Parquet映射:记录溯源信息和原始媒体名称

下载方式

支持完整仓库下载和按数据集选择性下载,通过提供 download_subset.py 辅助工具实现:

  • 支持 --dataset 参数选择数据集
  • 支持 --annotations-only 仅下载注释和映射
  • 支持 --dry-run 查看下载内容预览
  • 自动解析共享依赖(如选择PACO会自动下载其引用的COCO媒体池)

使用与训练

  • 仓库面向 megatron-energon==7.4.0 训练框架
  • 提供多种入口:全部数据(metadataset.yaml)、完整混合(metadataset-full.yaml)、单数据集、单视图
  • 提供示例代码用于索引读取、可视化样本和训练数据加载

上游媒体获取说明

以下数据集图像需从原始来源获取,仓库仅提供注释、索引、映射和配置:

CrowdHuman、DeepFashion2、Flickr30K、PartImageNet(ImageNet)、Objects365、SKU-110K、Unsplash

其中 Unsplash 的媒体可复现获取流程尚未可用,暂不支持其媒体水合。其他数据集提供 hydrate_restricted_media.py 工具来准备本地媒体。

许可信息

LocateAnything-Data 由多个上游数据集构建,每个源数据集保持其原始许可证、使用条款、访问条件和归属要求。用户在使用前必须审查并遵守各源数据集的适用条款。该仓库不授予对上游媒体的额外权利。

搜集汇总
数据集介绍
LocateAnything-Data 数据集图片
构建方式
LocateAnything-Data的构建汇聚了涵盖自然图像、密集场景、行人、自动驾驶、具身交互、图形用户界面、场景文本、文档及表格等多元视觉领域的数十个公开数据集,通过统一的视觉-语言定位任务范式,将检测与指代分割整合为并行框解码的几何单元预测。其构建遵循层级化组织形式,每个数据集目录下包含可预览的JSONL格式标注记录,图像媒体以索引化的WebDataset TAR分片存储,并辅以Megatron-Energon元数据以支持分布式训练;同时提供Parquet映射文件,确保每条训练记录均可追溯至其原始图像的相对路径与哈希值。
特点
该数据集的核心特色在于其高度统一的空间监督表征,所有标注均采用共享的查询格式,依据任务类型区分边界框或关键点坐标,并归一化至千分之一网格,与原始像素坐标便捷互转。其覆盖范围之广,横跨通用检测、密集目标、自动驾驶、GUI、OCR及版面分析等六大领域,且多个数据集天然支持多任务与多域泛化。此外,发布格式兼顾可读性与高效训练,未压缩TAR分片支持按需读取,索引文件加速数据访问,映射机制确保数据血缘透明,为大规模多模态模型训练提供了坚实的数据基石。
使用方法
使用者可通过Hugging Face CLI完整下载仓库,或借助工具脚本按数据集ID选择性获取,并支持仅下载标注与映射的轻量模式。对于需从上游获取图像的部分数据集,提供了水合工具以整合本地媒体。数据加载方面,可通过示例脚本随机读取JSONL记录、可视化标注样本,或直接以Megatron-Energon为入口构建训练数据管道。映射关系便于通过SQL式查询将训练样本关联回原始图像,从而支持数据溯源与质量审计,整体流程设计兼顾灵活性与可扩展性。
背景与挑战
背景概述
LocateAnything-Data是于2026年由NVIDIA等机构的研究人员发布的公开训练数据集,旨在支撑LocateAnything模型的训练,该模型将目标检测与视觉定位统一为视觉-语言任务,通过并行框解码技术以高效、高质量的方式预测边界框或点。数据集覆盖自然图像、密集场景、人物、自动驾驶、具身交互、图形用户界面、场景文本、文档和表格等多个视觉领域,整合了COCO、RefCOCO、Objects365、Open Images V6、BDD100K、DocLayNet等众多知名数据集的标注,提供了统一的查询表示和标准化空间坐标。该数据集的发布为统一视觉定位任务的研究提供了多样化的空间监督,推动了视觉-语言基础模型的发展,对多模态理解和交互式AI领域具有重要影响力。
当前挑战
LocateAnything-Data面临的挑战包括:其一,在领域问题层面,传统的目标检测和视觉定位方法通常将坐标作为独立序列生成,难以处理多尺度、密集场景及多模态指令的复杂对应关系,且需要针对不同任务(如检测、指代、文档布局、GUI定位等)单独设计模型,缺乏统一高效的处理框架。其二,在数据集构建过程中,整合来自众多不同来源的数据集需要处理标注格式差异、坐标归一化、任务类型统一等问题;同时,部分数据集的数据需要从原始来源获取,如CrowdHuman、DeepFashion2、Objects365等,其媒体文件不在仓库中直接提供,需额外下载和验证;此外,Unsplash的媒体可复现问题尚未解决,导致该数据集的完整可复现性受限。
常用场景
经典使用场景
LocateAnything-Data作为LocateAnything模型的核心训练数据资源,其经典使用场景在于统一视觉定位任务的模型训练与评估。该数据集将目标检测、指称理解、点定位等多类任务整合为统一的视觉-语言联合学习范式,为研究者提供了跨自然图像、稠密场景、行人、自动驾驶、具身交互、图形界面、场景文本、文档与表格等多元领域的空间监督信号。通过大规模并行框解码的训练方式,该数据集支持模型将边界框或点视为结构化几何单元进行并行生成,从而显著提升推理速度与定位精度。其标准化的query表示和坐标系转换机制,使得研究者仅需简单映射即可在多样下游任务中复用训练数据,是探索通用视觉定位模型的关键基石。
实际应用
从实际应用角度看,该数据集在多个工业级场景中展现出广阔前景。在自动驾驶领域,它提供了包含BDD100K、nuImages等在内的路况图像标注,可用于训练车辆感知系统对行人、车辆及交通元素的精准定位,增强环境理解能力。在具身智能与机器人操控中,通过RoboAfford、PixMo Points等数据,模型能够学习从自然语言指令推断交互目标的空间位置,为人机协作提供感知基础。此外,在GUI理解方面,它支持智能助手对屏幕元素进行精确指称,赋能自动化界面操作与无障碍服务;在文档分析及OCR应用中,凭借DocLayNet、TableBank等数据,可极大提升版面解析与表格识别的准确率。这些应用无不彰显该数据集在弥合视觉与语言鸿沟、推动智能系统落地方面的实用价值。
衍生相关工作
基于LocateAnything-Data的独特设计,一系列相关研究工作得以衍生与深化。其统一的query表示和并行解码策略启发后续研究者在视觉定位模型中探索非自回归生成架构,推动了如并行框解码器、动态查询机制等新结构的出现。数据集的跨域覆盖特性促使研究者开发跨模态对齐网络,在多个基准上验证了多任务联合训练的增益,产生了大量关于视觉-语言统一模型的可扩展性研究。此外,该数据集中精细的文档和GUI标注推动了关于空间推理与细粒度区域理解的系列工作,衍生出面向智能交互的专用模型。其发布的Megatron-Energon兼容元数据和可回溯映射工具,也为大规模多数据集训练的可复现性设立了标杆,催生了更多关于高效数据加载与样本组织策略的工程性研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务