遇见数据集

masscount-cf

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

MassCount-CF是一个用于识别视觉语言模型中加性神经质量基数坐标的合成反事实计数语料库,作为论文《Counting Requires Mass: An Algebraic and Causal Account of Numerosity in Vision-Language Models》的配套数据集。该数据集完全通过合成生成,不包含真实图像或受版权保护的材料。数据规模包含99,989个主场景、326,623张图像和28,617,018个对象实例。数据结构以场景图为核心持久化构件,包含场景描述符(如凸包面积、覆盖率、最近邻统计、Ripleys K)和对象标准化坐标的parquet文件,图像可通过生成器按需重新生成任何分辨率。数据集包含12个场景家族,包括chain(44,400场景)、nuisance(19,915场景)、union_part(7,500场景)等。数据划分遵循FSC-147的类别不相交协议,按parent_chain_id分组分为测试集(62,499场景)、训练集(31,154场景)、验证集(6,332场景)和参考集(4场景)。数据集通过了完整性验证,包括场景ID唯一性、内容哈希唯一性、跨划分重复检查等。适用于计数、视觉语言模型、对象计数、数量感知等研究任务。

MassCount-CF is a synthetic counterfactual counting corpus for identifying additive neural mass cardinality coordinates in vision-language models, and it is the supporting dataset for the paper *Counting Requires Mass: An Algebraic and Causal Account of Numerosity in Vision-Language Models*. This dataset is entirely synthetic, containing no real images or copyright-protected materials. The dataset comprises 99,989 main scenes, 326,623 images, and 28,617,018 object instances. The core persistent building block of the data structure is the scene graph, including parquet files containing scene descriptors (such as convex hull area, coverage rate, nearest neighbor statistics, Ripley's K) and standardized object coordinates. Images can be regenerated at any resolution on demand via the generator. The dataset includes 12 scene families, such as chain (44,400 scenes), nuisance (19,915 scenes), union_part (7,500 scenes), etc. The data partitioning follows the class-disjoint protocol of FSC-147, and is grouped by parent_chain_id into the test set (62,499 scenes), training set (31,154 scenes), validation set (6,332 scenes), and reference set (4 scenes). The dataset has passed integrity verification, including checks for scene ID uniqueness, content hash uniqueness, cross-partition duplicate detection, and other items. It is applicable to research tasks such as counting, vision-language models, object counting, and numerosity awareness.

创建时间:
2026-07-21
搜集汇总
数据集介绍
masscount-cf 数据集图片
构建方式
MassCount-CF是一个合成反事实计数语料库,专为探索视觉-语言模型中的加性神经质量基数坐标而构建。其构建依托于场景图作为持久化工件,通过配套仓库中的生成器脚本,可基于每帧场景的结构化元数据(包括多边形面积、覆盖度、最近邻统计及Ripley's K等几何描述符)按需渲染任意分辨率的图像。数据集包含近10万帧主场景,涵盖12个场景族系,如链式、干扰变量、并集等类别,并严格遵循FSC-147的类别分离协议进行划分,确保训练、验证与测试集之间无场景族系交叉泄露。
特点
该数据集的核心特点在于其反事实设计——通过精心构造的场景族系(如链、并集、实例替换等)支持对计数机制的因果推断,而非仅提供静态标注。每个场景附带场景图和对象级元数据,提供归一化空间坐标及完整性报告(含去重、泄露检测),确保数据纯净。此外,场景覆盖范围从基础二元组合到自然背景干扰物、裁剪等困难条件,总计超过32万张已渲染图像及2800万个对象实例,为评估模型的计数鲁棒性提供了系统性控制变量。
使用方法
使用者可直接加载场景文件(Parquet格式)中的场景图和对象描述符,复现论文中的因果分析实验。若需像素级图像,可通过生成器脚本从场景图渲染指定分辨率的WEBP格式图片,渲染过程支持自定义输出尺寸。数据集预定义了训练、验证、测试及参考分割,推荐直接按split字段筛选场景ID进行模型训练与评估,或利用反事实族系标签(如'chain'、'nuisance')设计消融研究,探究模型对不同计数变量的依赖关系。
背景与挑战
背景概述
在视觉与语言模型(Vision-Language Models)迅猛发展的背景下,数值计数能力成为衡量模型感知与推理能力的关键指标之一。然而,现有研究多集中于模型能否输出正确计数,而对于其内部如何表征数值信息的机制性理解仍显匮乏。为此,MassCount-CF数据集于近年由相关研究团队构建,旨在通过反事实合成图像系统性地探索视觉-语言模型中的数值神经质量坐标(Neural Mass Cardinality Coordinate, NMCA)。该数据集包含近10万张主场景、超过28万张交付图像及2800余万个实例,由多类反事实家族(如链式、冗余、联合分部等)组成,遵循FSC-147的类别分离协议划分训练、验证与测试集。MassCount-CF的提出为解构模型数值计数的代数与因果机制提供了高质量基准,推动了该领域从行为观察向机制解释的深度转变。
当前挑战
该数据集所解决的领域核心挑战在于视觉-语言模型当前对“数”与“量”的认知缺乏可解释的代数结构,即模型虽能输出计数,却难以揭示其底层是否形成加性神经质量坐标。构建过程中面临的挑战尤为显著:首先,合成数据需精准模拟各类反事实情境,包括物体链式堆叠、冗余放置、分区合并等,以保证场景的因果有效性;其次,需确保跨分片的场景哈希唯一性,严格杜绝训练集与测试集间的哈希重复,这对生成管线的质量控制提出了极高要求;此外,构建28万余图像的规模下,需自动维护包含几何描述符(如凸包面积、邻近距离、Ripley's K)的完整场景图,并确保所有像素可从图结构重新生成,这要求生成器具备严格的因果关系保持与可复现性。
常用场景
经典使用场景
MassCount-CF数据集的经典使用场景在于量化与归因视觉-语言模型中的数值感知能力,特别是针对加法性神经质量基数坐标(NMCA)的识别与验证。该数据集通过精心设计的反事实计数语料,使研究者能够系统性地评估模型是否真正理解物体数量而非依赖表面关联特征。其场景图结构包含精细的几何描述符与物体分布统计量,支持可复现的像素级分析与因果推断实验。研究者可在此框架内深入探查模型如何从视觉输入抽象出数量表征,为理解机器计数行为的底层机制提供标准化测试平台。
解决学术问题
该数据集直面计算机视觉领域中长期存在的计数泛化性难题,即模型在训练分布外场景中表现急剧退化的问题。通过构建多族系反事实场景(如链式、干扰、并集等),MassCount-CF系统性地解耦了物体数量与其他视觉属性(如空间布局、物体大小、背景复杂度)之间的相关性,从而精准定位模型计数错误的根源。这一方法论解决了传统计数数据集中混淆变量难以控制的困境,推动学术界从纯观测性评估转向因果干预性诊断,在理论上深化了对视觉语言模型中数值认知代数结构的理解。
衍生相关工作
围绕MassCount-CF数据集已衍生出多项奠基性工作,最核心的当属其配套论文《Counting Requires Mass: An Algebraic and Causal Account of Numerosity in Vision-Language Models》,该文首次从因果代数视角系统阐释了计数能力的必要条件。后续研究在此基础上发展了基于场景图的干预性微调方法,以及融合雷普利K函数等空间统计特征的计数网络架构。此外,该数据集的反事实生成范式被扩展至其他感知任务,如跟踪透明度与物体间关系推理,形成了评估视觉语言模型组合泛化能力的新基准体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务