SiGNgapore2D-CoT
收藏资源简介:
# SiGNgapore-CoT 在 [SiGNgapore2D](https://huggingface.co/datasets/NickyZimmerman/SiGNgapore2D) 的基础上,将原始指示牌标注信息转化为 QA 对和 CoT 推理思维链。 ## 数据集信息 数据集包含167张图片,每张图片至少有1个指示牌。总共有1139组QA对和对应的CoT。 ## JSON 数据结构说明 ### 📁 signgapore_points_grouped.json 该 JSON 文件描述了针对导视场景图片的多个导航任务(`tasks`),每个任务包含问题、推理过程、指令、标注点及其有效性判断。整体结构示例如下: ```json [ { "imagePath": "IMG_0037_frame_0014.jpg", "tasks": [ { "question": "How can I get to B4?", "instruction_cot": "...", "instruction": "It is a locational reference. You don't have to move.", "pixel_point_norm": [550, 975], "point_reason": "...", "point_valid": true }, ... ] }, ... ] ``` #### 每个 `task` 对象字段: | 字段名 | 类型 | 含义 | |--------|------|------| | `question` | `string` | 用户提出的目的地问题(如“How can I get to TOILET?”)。 | | `instruction_cot` | `string` | **Chain-of-Thought 推理过程**(含 `<SUMMARY>`/`<CAPTION>`/`<REASONING>`/`<CONCLUSION>` 标签),从图像中理解并生成指令的完整逻辑链。 | | `instruction` | `string` | 最终输出的自然语言导航指令(如“请向左走…”)。 | | `pixel_point_norm` | `[x, y]`(整数数组) | 在图像中选定的像素坐标点(**注意:此处为归一化像素坐标**),表示按指令行动时目标点的真实物理表面位置。 | | `point_reason` | `string` | 对所选像素点的语义解释,说明为何选取该点。 | | `point_valid` | `boolean` | 校验结果:`true` 表示该点满足约束条件(真实、可达、符合指令);`false` 表示不合规(如标在空气中、指示牌上)。 | #### ⚠️ 注意事项 - `pixel_point_norm` 中的 `(x, y)` 是图像坐标系:原点 `(0,0)` 为**左上角**,x 向右增长,y 向下增长。为**归一化坐标**,实际使用时需要转换成真实像素坐标: ```python def point_coor_to_pixel(point, img_width, img_height): x_norm, y_norm = point pixel_x = int(x_norm / 1000 * img_width) pixel_y = int(y_norm / 1000 * img_height) return (pixel_x, pixel_y) ``` - `point_valid: false` 并非错误,而是认为当前点不符合规范(例如标在指示牌文字上)。



