遇见数据集

thai_spatial_reasoning

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

Thai Spatial Reasoning 1.0.0 是一个用于泰语视觉语言模型持续预训练的数据集,专注于空间语言理解。该数据集包含 34,764 张真实照片和受控渲染图像,并提供了 243,348 个逻辑示例(每个图像对应一个标题和四个问答对)。数据划分为训练集(30,481 张)、验证集(2,271 张)和测试集(2,012 张)。数据集的文本和空间标注通过确定性模板从图像边界框几何事实中生成,确保每条句子可追溯至事实 ID。关系类型包括上/下、前/后、左/右、近/远、接触、大小比较和包含,涵盖图像、物体和世界参考框架。图像具有独立的许可证和归属信息;注释、生成文本和渲染图像受数据集级许可证保护。该数据集旨在用于评估和提升泰语视觉语言模型在空间推理任务上的能力。

Thai Spatial Reasoning 1.0.0 is a dataset for continual pre-training of Thai visual language models, focusing on spatial language understanding. It contains 34,764 real photos and controlled rendered images, providing 243,348 logical examples (each image corresponds to one caption and four question-answer pairs). The data is split into training (30,481 images), validation (2,271 images), and test (2,012 images) sets. Text and spatial annotations are generated from image bounding box geometric facts via deterministic templates, ensuring each sentence is traceable to a fact ID. Relation types include above/below, in front of/behind, left/right, near/far, touch, size comparison, and containment, covering image, object, and world reference frames. Images have independent licenses and attribution information; annotations, generated texts, and rendered images are protected by a dataset-level license. The dataset is intended for evaluating and improving the spatial reasoning capabilities of Thai visual language models.

创建时间:
2026-09-27
原始信息汇总

Thai Spatial Reasoning 1.0.0 数据集概述

基本信息

  • 数据集名称:Thai Spatial Reasoning
  • 版本:1.0.0
  • 任务类别:image-text-to-text
  • 语言:泰语(th)
  • 数据规模:10K < n < 100K
  • 许可证:other(mixed-per-image-licences)

数据集内容

项目 数值
图像数量 34,764
逻辑样本数(CPT) 243,348
每张图像 1 个描述 + 4 个问答对
划分 train: 30,481;validation: 2,271;test: 2,012
来源 带权利证据的真实照片,以及受控的反事实渲染图
  • data/*.parquet 为规范表:每张图像一行,含 Image 列、一个描述、四个问答结构列表、关系列表及权利字段。
  • cpt/examples-*.parquet 为纯文本索引,将一行图像扩展为五个逻辑样本,图像字节仅存储一次。

数据配置

  • default
    • train:data/train-*.parquet
    • validation:data/validation-*.parquet
    • test:data/test-*.parquet

方法

  1. 真实图像来自带对象框的源数据。逐图对照许可证允许列表检查权利,记录验证日期与证据 URL。带人物标签的图像需等待人工隐私决策,未获决策不予发布。
  2. 在任何文本生成之前,按重复组和渲染场景家族分配划分,任何组不跨越划分边界。
  3. 事实来源于基于框的保守图像帧几何(一个轴上真实分离、另一个轴上真实对齐,无裁剪轴,无遮挡参考对象)以及包含关系的源标注。接触、深度和距离绝不从二维框推断;渲染图则从已知三维状态测量。
  4. 泰语文本用确定性模板从这些事实组装,每句可追溯至事实 ID,事实含义不依赖模型。
  5. 类名重复的对象优先按其外观命名(如"คนที่ใส่เสื้อสี绿色的"),而非使用位置。固定的视觉模型为每个字段(颜色、服装、姿势、材质)从封闭列表返回一个值;它不写泰语,属性不能创建或删除空间事实。渲染图不发送给它,因为其颜色已知。
  6. 每个关系和每句话都对照源事实检查,发布前对泰语母语审查样本打分(该样本数为 0)。

评估与质量

  • 泰语母语审查门尚未通过。部分样本在 reports/audit_queue.csv 中排队等待母语者对关系、语言和忠实度进行审查。本版本在这些结论产生前发布,后续会重新打包。关系标签仅视为机器验证。
  • 验证报告:reports/validation.json
  • 审计报告:reports/audit.json
  • 划分清单:reports/split_manifest.json
  • 发布门检查结果:
    • rights_complete=pass
    • privacy_review_complete=pass
    • split_integrity=pass
    • logical_examples_per_image=pass
    • artifact_integrity=pass
    • human_audit=fail
    • lexicon_review=fail
    • declared_scale=fail
    • release_size=pass
  • 真实图像接受率:真实图像接受 5,778 / 20,823,比率 0.2775;渲染图接受 28,986 / 40,000,比率 0.7247。
  • 可用关系数量:above: 33,571;behind: 177,397;below: 33,571;far: 4,975;in_front_of: 177,397;larger_than: 104,893;left_of: 46,479;near: 81,090;not_touching: 199,465;occludes: 25,414;right_of: 46,479;smaller_than: 104,893;touching: 9,364。

预期用途

用于泰语视觉语言模型在空间语言上的持续预训练和评估:左/右、上/下、前/后、近/远、接触、大小比较和包含关系,涵盖图像、对象和世界参考系。

局限性

  • 图像帧的左/右和上/下仅在框清晰分离和对齐时可靠;数据集不声称从照片获得三维布局。
  • 渲染器输出为平面着色且合成:是关系对比的受控探针,不能替代照片。
  • 关系平衡反映源标注支持的内容。代表性不足的关系由渲染图补充,而非为照片虚构。
  • 泰语文本为模板生成。
  • 如 เสื้อสีเขียว 的描述来自固定视觉模型,而非源标注。抽查六个对象发现五个正确;仅当属性可区分同一图像中的对象时才使用,歧义描述被丢弃而非错误应用。属性文本视为模型生成。

版本与引用

  • 版本 1.0.0,由 run release-v13 构建,配置为 thai_spatial_reasoning_v1.yaml(配置哈希 dff750b131deec59,代码 ad8324a6dcd67a2a0780b05eb0f139108f3a19a3)。
  • 方法论参考见项目的 CITATIONS.md。

移除与联系

  • 请求移除图像或报告权利问题,可在项目仓库提 issue 或联系数据集维护者(smartwhatt/thai_spatial_reasoning)。
  • 每行图像携带 source_url、image_license 和 rights_evidence_uri,足以在未来修订中识别并移除确切图像。

Token 预算

  • 使用 Qwen/Qwen3-VL-2B-Instruct 图像处理器对本版本全部 34,764 张图像测量。文本用处理器分词器对描述、问题和答案计数。
划分 图像数 视觉 token 文本 token
train 30,481 13,715,675 6,628,004
validation 2,271 3,788,003 683,998
test 2,012 1,467,105 481,804
总计 34,764 18,970,783 7,793,806
  • 总计:26,764,589 tokens —— 18,970,783 视觉 + 7,793,806 文本,平均每张图像 545 视觉 token 和 224 文本 token。
  • 真实图像成本远高于渲染图:平均每张图像 1,778 视觉 token,而渲染图为 300,因为 1240x1754 照片不同于 640x480 场景。训练划分以渲染图为主,因此当前训练预算多为固定的 300-token 渲染图,而真实照片是每图像权重所在。
  • 持续预训练索引为独立数字:243,348 行携带 8,175,985 文本 token,若每行训练时附带图像则约 140,800,645 tokens。
搜集汇总
数据集介绍
thai_spatial_reasoning 数据集图片
构建方式
该数据集以真实照片与受控反事实渲染图像为基底,经由多阶段流水线构建而成。真实图像源自带物体边界框的开放数据源,每张图片均通过许可证白名单核查,记录验证日期与证据链接,涉及人物标签的样本须经隐私审查方可纳入。数据划分在文本生成之前即按重复组与渲染场景族分配,确保无组别跨越划分边界。空间事实从图像帧几何保守推导,涉及接触、深度与距离的关系则从渲染场景的三维状态中测量,杜绝从二维边界框臆测。泰文文本通过确定性模板从事实集组装,每句均可追溯至事实标识,其语义不依赖于任何模型。
特点
数据集涵盖34,764张图像,附有243,348条逻辑训练样本,每图配有一则描述与四组问答对,划分训练集30,481、验证集2,271及测试集2,012。空间关系囊括左右、上下、前后、远近、接触、遮挡、尺寸比较与包含等十三类,关系分布由源标注的支持度决定,欠表征关系以渲染图像补充而非凭空捏造。图像级许可证采用逐图管理模式,标注与生成文本则适用数据集层面的other许可。泰文描述由模板生成,属性描述如衣物颜色来自固定视觉模型,仅用于区分同图同类物体,模糊描述被丢弃而非误用。总令牌预算约2,676万,其中视觉令牌1,897万,文本令牌779万,真实图像单图视觉令牌成本远高于渲染图像。
使用方法
本数据集面向泰语视觉语言模型的持续预训练与空间语言评测,涵盖图像、物体与世界参考框架下的空间关系理解。使用者可通过data/*.parquet标准表获取每张图像的描述、问答结构、关系列表与权利字段,cpt/examples-*.parquet则提供纯文本索引以扩展逻辑样本,避免图像字节重复存储。训练时可按划分直接加载对应文件,引用令牌预算规划切片规模。需注意本版本的人工审核门尚未关闭,关系标签仅为机器验证,泰文文本为模板生成,属性描述为模型生成,渲染图像为平面着色合成场景,不适用于替代真实照片的三维布局推断。若需移除图像或报告权利问题,可通过图像行中的source_url、image_license与rights_evidence_uri精确定位并联系维护者。
背景与挑战
背景概述
泰语空间推理数据集(Thai Spatial Reasoning)诞生于泰语视觉语言模型持续预训练的需求背景之下,由研究人员构建并发布于HuggingFace平台。其核心研究问题在于弥补泰语多模态资源中空间语言理解的空白,通过真实照片与受控合成渲染相结合的方式,生成涵盖左右、上下、前后、远近、接触、尺寸比较及包含关系等空间关系的描述与问答对。该数据集为泰语基础视觉语言模型提供了大规模、结构化的空间推理训练与评测资源,对推动泰语多模态模型的细粒度空间语义理解具有奠基性意义。
当前挑战
该数据集所应对的领域挑战在于,空间关系推理要求模型从二维图像中准确辨别物体的相对位置、遮挡与接触状态,而现有泰语视觉语言资源在空间语义标注方面极度匮乏。构建过程中的挑战亦不容忽视:真实图像的许可与隐私审查须逐图核验并记录证据,人物标签图像需等待人工隐私裁决;二维边界框无法直接推断深度、距离与接触关系,须依赖保守的几何事实与三维场景状态;泰语文本由确定性模板生成,属性描述依赖固定视觉模型,且原生泰语者审核尚未完成,关系标签目前仅为机器验证,属性文本亦为模型生成,存在准确性风险。
常用场景
经典使用场景
在泰语视觉-语言模型的空间语言理解研究中,该数据集常被用于持续预训练与细粒度评估。其核心场景在于让模型习得图像、物体与世界参考系下的方位表达,涵盖左右、上下、前后、远近、接触、尺寸比较及包含关系。每张图像配有一句描述与四组问答,并扩展为五个逻辑示例,以文本模板锚定事实,使模型能够从多模态输入中稳定地学习空间语义的映射。
解决学术问题
该数据集直面泰语多模态资源匮乏与空间推理标注昂贵的双重困境。通过真实照片与受控反事实渲染相结合,并以确定性模板从几何事实生成泰语文本,它缓解了低资源语言中空间关系标注不一致、事实溯源困难等问题。其意义在于为泰语视觉-语言模型提供可追溯、可验证的空间语言监督信号,推动了低资源语言多模态理解的可复现研究。
衍生相关工作
围绕该数据集,后续工作多聚焦于泰语视觉-语言模型的持续预训练策略、空间关系对比学习以及合成数据与真实数据的混合训练。部分研究利用其逻辑示例索引探索文本-图像对齐效率,另有工作以其为基准评估模型在低资源语言下的空间推理泛化能力,并推动泰语多模态评测体系的建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务