LingT2I
收藏资源简介:
LingT2I是一个由多所国际机构联合开发的多语言文本到图像生成基准数据集,覆盖10种代表性语言,包含33K条提示词。该数据集由内容生成与文本渲染两个子集构成,分别评估模型在跨语言语义忠实度和文字渲染能力上的表现,其中内容生成子集涵盖10个评估维度。其构建过程基于DOCCI和EasyText语料,通过大语言模型进行维度感知标注与多语言翻译,确保文化适应性和语义一致性。该数据集旨在系统揭示跨语言T2I生成中的语言不平等性、多维权衡及语言依赖的生成模式,为开发更公平和包容的生成模型提供分析基础。
LingT2I is a multilingual text-to-image generation benchmark dataset jointly developed by multiple international institutions, covering 10 representative languages and comprising 33K prompts. This dataset comprises two subsets, namely Content Generation and Text Rendering, which respectively evaluate models' performance on cross-lingual semantic faithfulness and text rendering capability. Specifically, the Content Generation subset includes 10 evaluation dimensions. Its construction is grounded in the DOCCI and EasyText corpora, with dimension-aware annotation and multilingual translation carried out via large language models (LLMs) to ensure cultural adaptability and semantic consistency. This dataset aims to systematically uncover the language inequity, multi-dimensional trade-offs, and language-dependent generation patterns in cross-lingual T2I generation, providing an analytical foundation for developing more fair and inclusive generative models.
LingT2I (TRIG-Multilingual) 数据集详情
数据集概述
LingT2I(TRIG-Multilingual)是一个多语言文生图(text-to-image)基准数据集,包含两个子集,用于评估多语言条件下的图像生成能力。
数据子集
| 子集名称 | 样本数量 | 用途 |
|---|---|---|
| content_generation | 30,000 | 多语言提示词,用于评估生成图像内容的各维度表现 |
| text_rendering | 3,000 | 多语言提示词,用于评估生成图像中渲染文本的效果 |
数据规模与语言
- 总样本数:33,000条(10K < n < 100K)
- 覆盖语言:英语(en)、中文(zh)、印地语(hi)、西班牙语(es)、阿拉伯语(ar)、法语(fr)、葡萄牙语(pt)、俄语(ru)、日语(ja)、韩语(ko),共10种语言
- 评估维度:content_generation子集涵盖10个评估维度,text_rendering子集覆盖全部10种语言
数据字段说明
| 字段名 | 类型 | 说明 |
|---|---|---|
| data_id | string | 样本ID |
| prompt | string | 生成提示词 |
| dimension | string | 评估维度或子集标记(如IQ-R、TA-C、TR) |
| lang | string | 语言代码 |
| dimensions | sequence[string] | 原始维度元数据 |
| parent_dataset | sequence[string] | 来源数据集标签 |
| img_id | string | 适用时的图像ID |
| render_text | string | text_rendering样本的目标文本 |
| render_layout | string | text_rendering样本的JSON编码布局元数据 |
| condition_image | image | text_rendering样本的文本放置条件图像(PIL格式),content_generation样本中为null |
数据文件与加载方式
- 数据集以parquet格式存储于
data/目录下 - 原始JSON文件保留在仓库中用于溯源:
raw/text-to-image-multilingual.json、raw/trig_multilingual_tr.json、raw/coarse_mask.zip - 可使用Hugging Face Datasets库加载,例如: python ds_cg = load_dataset("RISys-Lab/TRIG-Multilingual", split="content_generation") ds_tr = load_dataset("RISys-Lab/TRIG-Multilingual", split="text_rendering")
其他说明
- 许可证:CC BY-NC-SA 4.0
- 任务类别:text-to-image(文生图)
- coarse_mask.zip文件仅为保持可追溯性保留,其放置图像已嵌入text_rendering子集的condition_image列中




