遇见数据集

SalihHub/blind-assist-tr-image-to-text_and_QA_suitable_UnslothFinetune

收藏
Hugging Face2026-04-27 更新2026-05-03 收录
官方服务:

资源简介:

该数据集旨在训练多模态模型,以帮助视觉障碍者在室内环境中导航。它包含59,035个图像-文本对,涵盖57个不同的室内场景类别。每个样本包括一张室内场景照片和一个关于场景的土耳其语问答对(例如障碍物检测、地板纹理、物体位置、导航指导)。数据集适用于盲人辅助/室内导航助手、土耳其语图像标注、土耳其语视觉问答以及Unsloth多模态微调(适合`simple_image_text`格式)。数据集分为训练集和测试集,训练集包含56,083个样本,测试集包含2,952个样本。数据集采用CC-BY 4.0许可,允许共享和改编,但需署名。

This dataset is designed for training multimodal models to assist visually impaired people in navigating indoor environments. It contains 59,035 image-text pairs covering 57 distinct indoor scene categories. Each sample consists of an indoor scene photograph and a Turkish question-answer pair about the scene (e.g., obstacle detection, floor texture, object location, navigation guidance). The dataset is suitable for blind assist / indoor navigation assistant, image captioning (Turkish), visual question answering (Turkish), and Unsloth multi-modal fine-tuning (suitable for `simple_image_text` format). The dataset is split into train (56,083 samples) and test (2,952 samples) sets. It is licensed under CC-BY 4.0, allowing sharing and adaptation with attribution required.

提供机构:
SalihHub
二维码
社区交流群
二维码
科研交流群
商业服务