thai_spatial_reasoning
收藏资源简介:
Thai Spatial Reasoning 1.0.0 是一个用于泰语视觉语言模型持续预训练的数据集,专注于空间语言理解。该数据集包含 34,764 张真实照片和受控渲染图像,并提供了 243,348 个逻辑示例(每个图像对应一个标题和四个问答对)。数据划分为训练集(30,481 张)、验证集(2,271 张)和测试集(2,012 张)。数据集的文本和空间标注通过确定性模板从图像边界框几何事实中生成,确保每条句子可追溯至事实 ID。关系类型包括上/下、前/后、左/右、近/远、接触、大小比较和包含,涵盖图像、物体和世界参考框架。图像具有独立的许可证和归属信息;注释、生成文本和渲染图像受数据集级许可证保护。该数据集旨在用于评估和提升泰语视觉语言模型在空间推理任务上的能力。
Thai Spatial Reasoning 1.0.0 is a dataset for continual pre-training of Thai visual language models, focusing on spatial language understanding. It contains 34,764 real photos and controlled rendered images, providing 243,348 logical examples (each image corresponds to one caption and four question-answer pairs). The data is split into training (30,481 images), validation (2,271 images), and test (2,012 images) sets. Text and spatial annotations are generated from image bounding box geometric facts via deterministic templates, ensuring each sentence is traceable to a fact ID. Relation types include above/below, in front of/behind, left/right, near/far, touch, size comparison, and containment, covering image, object, and world reference frames. Images have independent licenses and attribution information; annotations, generated texts, and rendered images are protected by a dataset-level license. The dataset is intended for evaluating and improving the spatial reasoning capabilities of Thai visual language models.
Thai Spatial Reasoning 1.0.0 数据集概述
基本信息
- 数据集名称:Thai Spatial Reasoning
- 版本:1.0.0
- 任务类别:image-text-to-text
- 语言:泰语(th)
- 数据规模:10K < n < 100K
- 许可证:other(mixed-per-image-licences)
数据集内容
| 项目 | 数值 |
|---|---|
| 图像数量 | 34,764 |
| 逻辑样本数(CPT) | 243,348 |
| 每张图像 | 1 个描述 + 4 个问答对 |
| 划分 | train: 30,481;validation: 2,271;test: 2,012 |
| 来源 | 带权利证据的真实照片,以及受控的反事实渲染图 |
data/*.parquet为规范表:每张图像一行,含Image列、一个描述、四个问答结构列表、关系列表及权利字段。cpt/examples-*.parquet为纯文本索引,将一行图像扩展为五个逻辑样本,图像字节仅存储一次。
数据配置
- default
- train:
data/train-*.parquet - validation:
data/validation-*.parquet - test:
data/test-*.parquet
- train:
方法
- 真实图像来自带对象框的源数据。逐图对照许可证允许列表检查权利,记录验证日期与证据 URL。带人物标签的图像需等待人工隐私决策,未获决策不予发布。
- 在任何文本生成之前,按重复组和渲染场景家族分配划分,任何组不跨越划分边界。
- 事实来源于基于框的保守图像帧几何(一个轴上真实分离、另一个轴上真实对齐,无裁剪轴,无遮挡参考对象)以及包含关系的源标注。接触、深度和距离绝不从二维框推断;渲染图则从已知三维状态测量。
- 泰语文本用确定性模板从这些事实组装,每句可追溯至事实 ID,事实含义不依赖模型。
- 类名重复的对象优先按其外观命名(如"คนที่ใส่เสื้อสี绿色的"),而非使用位置。固定的视觉模型为每个字段(颜色、服装、姿势、材质)从封闭列表返回一个值;它不写泰语,属性不能创建或删除空间事实。渲染图不发送给它,因为其颜色已知。
- 每个关系和每句话都对照源事实检查,发布前对泰语母语审查样本打分(该样本数为 0)。
评估与质量
- 泰语母语审查门尚未通过。部分样本在
reports/audit_queue.csv中排队等待母语者对关系、语言和忠实度进行审查。本版本在这些结论产生前发布,后续会重新打包。关系标签仅视为机器验证。 - 验证报告:
reports/validation.json - 审计报告:
reports/audit.json - 划分清单:
reports/split_manifest.json - 发布门检查结果:
- rights_complete=pass
- privacy_review_complete=pass
- split_integrity=pass
- logical_examples_per_image=pass
- artifact_integrity=pass
- human_audit=fail
- lexicon_review=fail
- declared_scale=fail
- release_size=pass
- 真实图像接受率:真实图像接受 5,778 / 20,823,比率 0.2775;渲染图接受 28,986 / 40,000,比率 0.7247。
- 可用关系数量:above: 33,571;behind: 177,397;below: 33,571;far: 4,975;in_front_of: 177,397;larger_than: 104,893;left_of: 46,479;near: 81,090;not_touching: 199,465;occludes: 25,414;right_of: 46,479;smaller_than: 104,893;touching: 9,364。
预期用途
用于泰语视觉语言模型在空间语言上的持续预训练和评估:左/右、上/下、前/后、近/远、接触、大小比较和包含关系,涵盖图像、对象和世界参考系。
局限性
- 图像帧的左/右和上/下仅在框清晰分离和对齐时可靠;数据集不声称从照片获得三维布局。
- 渲染器输出为平面着色且合成:是关系对比的受控探针,不能替代照片。
- 关系平衡反映源标注支持的内容。代表性不足的关系由渲染图补充,而非为照片虚构。
- 泰语文本为模板生成。
- 如
เสื้อสีเขียว的描述来自固定视觉模型,而非源标注。抽查六个对象发现五个正确;仅当属性可区分同一图像中的对象时才使用,歧义描述被丢弃而非错误应用。属性文本视为模型生成。
版本与引用
- 版本 1.0.0,由 run
release-v13构建,配置为thai_spatial_reasoning_v1.yaml(配置哈希dff750b131deec59,代码ad8324a6dcd67a2a0780b05eb0f139108f3a19a3)。 - 方法论参考见项目的
CITATIONS.md。
移除与联系
- 请求移除图像或报告权利问题,可在项目仓库提 issue 或联系数据集维护者(smartwhatt/thai_spatial_reasoning)。
- 每行图像携带
source_url、image_license和rights_evidence_uri,足以在未来修订中识别并移除确切图像。
Token 预算
- 使用
Qwen/Qwen3-VL-2B-Instruct图像处理器对本版本全部 34,764 张图像测量。文本用处理器分词器对描述、问题和答案计数。
| 划分 | 图像数 | 视觉 token | 文本 token |
|---|---|---|---|
| train | 30,481 | 13,715,675 | 6,628,004 |
| validation | 2,271 | 3,788,003 | 683,998 |
| test | 2,012 | 1,467,105 | 481,804 |
| 总计 | 34,764 | 18,970,783 | 7,793,806 |
- 总计:26,764,589 tokens —— 18,970,783 视觉 + 7,793,806 文本,平均每张图像 545 视觉 token 和 224 文本 token。
- 真实图像成本远高于渲染图:平均每张图像 1,778 视觉 token,而渲染图为 300,因为 1240x1754 照片不同于 640x480 场景。训练划分以渲染图为主,因此当前训练预算多为固定的 300-token 渲染图,而真实照片是每图像权重所在。
- 持续预训练索引为独立数字:243,348 行携带 8,175,985 文本 token,若每行训练时附带图像则约 140,800,645 tokens。





