遇见数据集

LingT2I

收藏
arXiv2026-08-11 更新2026-08-13 收录
官方服务:

资源简介:

LingT2I是一个由多所国际机构联合开发的多语言文本到图像生成基准数据集,覆盖10种代表性语言,包含33K条提示词。该数据集由内容生成与文本渲染两个子集构成,分别评估模型在跨语言语义忠实度和文字渲染能力上的表现,其中内容生成子集涵盖10个评估维度。其构建过程基于DOCCI和EasyText语料,通过大语言模型进行维度感知标注与多语言翻译,确保文化适应性和语义一致性。该数据集旨在系统揭示跨语言T2I生成中的语言不平等性、多维权衡及语言依赖的生成模式,为开发更公平和包容的生成模型提供分析基础。

LingT2I is a multilingual text-to-image generation benchmark dataset jointly developed by multiple international institutions, covering 10 representative languages and comprising 33K prompts. This dataset comprises two subsets, namely Content Generation and Text Rendering, which respectively evaluate models' performance on cross-lingual semantic faithfulness and text rendering capability. Specifically, the Content Generation subset includes 10 evaluation dimensions. Its construction is grounded in the DOCCI and EasyText corpora, with dimension-aware annotation and multilingual translation carried out via large language models (LLMs) to ensure cultural adaptability and semantic consistency. This dataset aims to systematically uncover the language inequity, multi-dimensional trade-offs, and language-dependent generation patterns in cross-lingual T2I generation, providing an analytical foundation for developing more fair and inclusive generative models.

创建时间:
2026-08-11
原始信息汇总

LingT2I (TRIG-Multilingual) 数据集详情

数据集概述

LingT2I(TRIG-Multilingual)是一个多语言文生图(text-to-image)基准数据集,包含两个子集,用于评估多语言条件下的图像生成能力。

数据子集

子集名称 样本数量 用途
content_generation 30,000 多语言提示词,用于评估生成图像内容的各维度表现
text_rendering 3,000 多语言提示词,用于评估生成图像中渲染文本的效果

数据规模与语言

  • 总样本数:33,000条(10K < n < 100K)
  • 覆盖语言:英语(en)、中文(zh)、印地语(hi)、西班牙语(es)、阿拉伯语(ar)、法语(fr)、葡萄牙语(pt)、俄语(ru)、日语(ja)、韩语(ko),共10种语言
  • 评估维度:content_generation子集涵盖10个评估维度,text_rendering子集覆盖全部10种语言

数据字段说明

字段名 类型 说明
data_id string 样本ID
prompt string 生成提示词
dimension string 评估维度或子集标记(如IQ-R、TA-C、TR)
lang string 语言代码
dimensions sequence[string] 原始维度元数据
parent_dataset sequence[string] 来源数据集标签
img_id string 适用时的图像ID
render_text string text_rendering样本的目标文本
render_layout string text_rendering样本的JSON编码布局元数据
condition_image image text_rendering样本的文本放置条件图像(PIL格式),content_generation样本中为null

数据文件与加载方式

  • 数据集以parquet格式存储于 data/ 目录下
  • 原始JSON文件保留在仓库中用于溯源:raw/text-to-image-multilingual.jsonraw/trig_multilingual_tr.jsonraw/coarse_mask.zip
  • 可使用Hugging Face Datasets库加载,例如: python ds_cg = load_dataset("RISys-Lab/TRIG-Multilingual", split="content_generation") ds_tr = load_dataset("RISys-Lab/TRIG-Multilingual", split="text_rendering")

其他说明

  • 许可证:CC BY-NC-SA 4.0
  • 任务类别:text-to-image(文生图)
  • coarse_mask.zip文件仅为保持可追溯性保留,其放置图像已嵌入text_rendering子集的condition_image列中
搜集汇总
数据集介绍
LingT2I 数据集图片
构建方式
LingT2I基准数据集基于DOCCI与EasyText的文本语料,通过维度感知的提示构建管道生成提示。针对内容生成任务,利用Gemini 2.5 Flash从原始描述提取与10个评估维度相关的语义信息,生成聚焦的英文提示,并翻译为9种语言。文本渲染任务则固定英文背景,仅翻译待渲染文本。整个构建流程辅以自动验证、反向翻译与人工质量检查,确保跨语言语义一致性。
特点
LingT2I覆盖10种语言、33K提示,涵盖内容生成与文本渲染任务,语言选择兼顾语系与书写系统多样性。其内容生成子集包含30K提示,均匀分布于10维度;文本渲染子集含3K样本,聚焦于文本精确性。基准揭示语言不平等、非拉丁文字渲染失败、语言依赖的生成模式等关键现象,支持多维度性能权衡分析。
使用方法
LingT2I提供标准化评估协议,采用多语言CLIP模型(如MetaCLIP2)计算CLIPScore,以TRIGScore的MLLM评判法进行维度评估,文本渲染精度通过NED与OCR指标度量。研究者可加载基准数据,对T2I模型进行跨语言性能比较,分析语言间性能差异、维度间的权衡,以及文化偏见与渲染错误模式,从而指导公平性改进与模型优化。
背景与挑战
背景概述
文本到图像(T2I)生成技术近年来取得了显著进展,但现有研究多聚焦于英语环境,对多语言场景下的性能差异与语言特定效应探索不足。为填补这一空白,由哈利法大学、伦敦玛丽女王大学、香港中文大学等机构的研究人员于2026年构建了LingT2I基准数据集。该数据集覆盖10种广泛使用的语言,包含33K条提示词,系统性地评估了跨语言在内容生成与文本渲染两大任务中的表现。LingT2I的创建为跨语言T2I生成提供了统一的分析框架,揭示了语言不平等现象、语言相关的维度权衡以及隐含的文化生成模式,推动了更公平且更具文化包容性的生成模型研究,对多语言生成领域产生了深远影响。
当前挑战
LingT2I所解决的领域问题极具挑战性:一方面,多语言内容生成需准确理解不同语言的语义及文化内涵,但现有模型在处理低资源语言(如印地语)与非拉丁文字(如阿拉伯文、天城文)时表现出显著的性能下降,呈现出语言学上的不平等;另一方面,文本渲染任务要求在不同书写系统(如汉字、西里尔字母)中精确再现文字,而当前模型常出现字形破损、结构错误或语义替代等失败模式。此外,数据构建过程亦面临诸多困难,包括如何保持跨语言翻译的语义一致性、文化适应性及风格保真度,以及如何设计公平的多语言评估指标以避免英语中心偏差。这些挑战共同凸显了构建系统化跨语言分析框架的紧迫性与复杂性。
常用场景
经典使用场景
LingT2I数据集作为跨语言文本到图像生成领域的开创性基准,其经典使用场景集中于系统评估多语言环境下T2I模型的生成能力与跨语言一致性。该数据集覆盖10种广泛使用的语言,包含33K条提示词,分别针对内容生成与文本渲染两大核心任务,为研究者提供了标准化的评测框架,用于量化分析模型在不同语言上的性能差异、语言不平等现象以及多维度权衡关系。通过该数据集,研究者能够深入探究模型在非英语语境下的表现,揭示语言多样性对生成质量的影响。
解决学术问题
LingT2I数据集有效解决了当前T2I研究过度聚焦英语、忽视跨语言泛化能力评估的学术空白。它系统性地揭示了通用T2I模型存在的严重语言不平等,即高资源印欧语系表现优异而低资源语系显著落后;同时,该数据集还暴露了非拉丁文字系统在文本渲染任务中的结构性缺陷,以及语言特定文化因素与类型学特征对生成行为的多维影响。这些发现为构建更公平、更具文化包容性的多语言生成模型提供了坚实的实证基础与研究范式。
衍生相关工作
LingT2I数据集的发布催生了一系列衍生研究工作,集中在多语言T2I模型的公平性提升与文本渲染性能改进。研究者基于该基准,探索了原生多语言架构与后处理适配方法的性能对比,推动如Qwen-Image等模型实现更均衡的跨语言表现。此外,针对非拉丁文字渲染失败问题,衍生出字形感知编码器、脚本特定训练策略及低资源语言增强等研究方向。这些工作不仅深化了对跨语言生成模式的理解,也为构建真正意义上文化包容的生成模型指明了技术路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务