遇见数据集

lt-ui-vlm

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

LT UI VLM 是一个用于将小型视觉语言模型适应立陶宛语用户界面和视觉指令理解的小型教育数据集。它包含立陶宛语公共网站和用户界面的截图,每张截图均配有立陶宛语的字幕描述以及问答标注。数据规模小于1000个样本,采用结构化组织,包含训练集和验证集,每个集合由图像文件夹和JSON Lines格式的元数据文件组成。元数据每条记录对应一个样本,包括图像文件名、立陶宛语问题和答案。标注模式为每图像一行字幕描述主要内容,以及2-4行关于界面导航、可见文本、UI元素或预期用户操作的问答对。该数据集专为立陶宛语视觉语言模型的适应而设计,适用于立陶宛语用户界面截图字幕生成、立陶宛语Web界面视觉问答、从用户界面截图预测用户行为等任务,并可用于基于LoRA的小型开源视觉语言模型微调教学实验。注意:数据集规模较小,仅用于实验目的,不代表所有立陶宛语用户界面,且仅包含公开页面或空表单,避免涉及私人或敏感信息。

LT UI VLM is a small educational dataset for adapting small vision-language models to Lithuanian user interfaces and visual instruction understanding. It contains screenshots of Lithuanian public websites and user interfaces, each accompanied by Lithuanian caption descriptions and Q&A annotations. The dataset size is less than 1000 samples, structured with training and validation sets, each consisting of an image folder and metadata files in JSON Lines format. Each metadata record corresponds to a training sample and includes the image filename, Lithuanian question, and answer. Annotations follow a specific pattern: each image should include one line describing the main content of the image as a caption, and 2-4 lines of Q&A pairs about interface navigation, visible text, UI elements, or expected user actions. The dataset is designed for adapting vision-language models to Lithuanian, suitable for tasks such as Lithuanian UI screenshot caption generation, Lithuanian web interface visual question answering, and predicting user behavior from UI screenshots, and can be used for teaching experiments in fine-tuning small open-source vision-language models based on LoRA. Note: The dataset is small-scale, intended only for experimental purposes, does not represent all Lithuanian user interfaces, and includes only public pages or empty forms to avoid private or sensitive information.

创建时间:
2026-05-19
原始信息汇总

数据集概述:LT UI VLM

LT UI VLM 是一个小型教育数据集,旨在帮助将小型视觉语言模型适配到立陶宛语用户界面和视觉指令理解任务中。

数据集结构与内容

  • 数据组成:包含立陶宛公共网站和界面的截图,以及对应的立陶宛语描述和问答标注。

  • 目录结构

    lt-ui-vlm/ README.md train/ images/ # 图像文件,例如 example_001.jpg metadata.jsonl # 训练样本元数据 validation/ # 验证集

  • 数据格式:每行 JSON 格式的元数据代表一个训练样本,同一张图像可对应多个不同问题。示例: json {"file_name":"images/example_001.jpg","question":"Ką vartotojas turėtų paspausti norėdamas prisijungti?","answer":"Vartotojas turėtų paspausti prisijungimo mygtuką viršutiniame dešiniajame kampe."}

标注指南

  • 每张图像推荐标注模式:1 条描述主内容的标注 + 2~4 条关于导航、可见文本、UI 元素或用户操作的问答。
  • 标注语言均为立陶宛语,旨在适配立陶宛语视觉语言模型。

预期用途

  • 立陶宛语 UI 截图描述。
  • 针对立陶宛网页界面的视觉问答。
  • 从立陶宛 UI 截图中预测用户操作。
  • 用于小型视觉语言模型的教育性 LoRA 微调实验。

限制说明

  • 数据集规模小,不能代表所有立陶宛用户界面。
  • 仅供实验使用,不适合生产环境。
  • 仅包含公共页面或空白表单,不含隐私或敏感信息。
搜集汇总
数据集介绍
lt-ui-vlm 数据集图片
构建方式
LT UI VLM是一个面向立陶宛语用户界面理解的小型教育型视觉语言数据集。其构建过程遵循精细的标注范式,首先选取立陶宛公共网站及界面的截图作为图像素材,随后为每张图像生成一条描述性标题,并附加2至4条关于导航、可见文本、UI元素或预期用户行为的问答对。所有标注内容均以立陶宛语撰写,并按照预设的JSON格式组织在metadata.jsonl文件中,同一图像可因不同提问而出现多次,从而丰富了数据集的多样性。
使用方法
使用该数据集时,需从train目录下的metadata.jsonl文件中读取训练样本,每条样本包含图像文件路径、立陶宛语问题及答案。可通过加载对应图像并与文本输入共同输入至小规模视觉语言模型,进行立陶宛语UI描述生成、视觉问答或用户行为预测等任务的LoRA参数高效微调。验证集位于validation目录,便于训练过程中的性能评估。训练实验应以教育研究为目的,避免用于生产环境。
背景与挑战
背景概述
随着多模态大语言模型在视觉-语言任务中的广泛应用,针对低资源语言的领域适配研究愈发重要。LT UI VLM数据集于近期由立陶宛的研究人员或机构创建,旨在解决立陶宛语用户界面理解与视觉指令跟随的稀缺问题。该数据集聚焦于立陶宛本地化场景,包含公共网页截图及其立陶宛语标注,涵盖图像描述、视觉问答等任务,为小型视觉-语言模型的LoRA微调提供高质量的实验资源。其发布不仅推动了对低资源语言在多模态领域的探索,也为立陶宛语人工智能应用奠定了数据基础,在跨语言与跨文化用户界面理解研究中具有启发性影响。
当前挑战
数据集面临的核心挑战包括:其一,立陶宛语作为低资源语言,在视觉-语言任务中缺乏大规模、多样化的标注数据,现有模型难以捕捉其语法与语义特性,导致UI理解与问答精度受限。其二,数据集规模极小(不足1000样本),难以覆盖立陶宛用户界面的多样性变化,易引发过拟合与泛化能力不足。此外,人工标注需同时确保视觉元素描述准确、问题设计合理且覆盖导航与操作意图,对标注者专业知识要求高;同时,严格避免私有与敏感信息,进一步限制了数据来源的扩展性。
常用场景
经典使用场景
LT UI VLM数据集专为立陶宛语界面下的视觉语言模型微调而设计,其经典使用场景涵盖立陶宛公共网站截图的自动描述生成、基于界面视觉信息的问答系统构建,以及用户操作预测任务。研究人员可利用该数据集对小型视觉语言模型进行LoRA高效微调训练,使模型能够理解立陶宛语用户界面中的导航元素、可见文本与预期用户行为,从而在立陶宛语环境下实现界面理解与视觉指令跟随的精准对齐。
解决学术问题
该数据集着力解决小语种视觉语言模型在用户界面理解领域的数据稀缺问题,填补了立陶宛语UI视觉问答与描述任务的空白。通过提供高质量的立陶宛语截图-问答-描述三元组注释,它使研究者能够探索跨语言视觉语义对齐、低资源场景下的模型迁移学习,以及LoRA微调策略对小模型适配特定领域任务的效能边界。这些探索对于推动多语言视觉语言模型的公平性与包容性具有重要的学术价值。
实际应用
在实际应用中,该数据集可赋能立陶宛语互联网产品的无障碍化改造,例如为视障用户开发基于界面截图的语音导航助手,或构建面向立陶宛语用户的智能客服系统,使其能够通过截图理解用户意图并给出操作指引。同时,它也可用于立陶宛政府或企业的网站可用性自动化测试工具,通过视觉问答形式检测界面元素是否符合设计规范,提升立陶宛语数字服务的用户体验与可及性。
数据集最近研究
最新研究方向
在当前多模态大模型研究浪潮中,LT UI VLM数据集聚焦于低资源语言(立陶宛语)在视觉语言理解领域的适配与微调,尤其关注用户界面(UI)理解这一垂直场景。该数据集结合了立陶宛公共网站的截图与立陶宛语标注的问答对,为小型开放权重视觉语言模型的LoRA高效微调提供了实验平台。其研究方向紧扣本土化多模态推理与用户行为预测的前沿,试图解决非英语界面智能理解与交互不足的痛点。通过立陶宛语UI图像的描述生成、视觉问答及操作预测,该数据集不仅探索了视觉语言模型在低资源语言环境下的泛化能力,也为欧盟小语种数字化转型中的多模态应用提供了基础资源与实验基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务