lightonai/llamaindex-vdr-images
收藏资源简介:
该数据集包含用于[lightonai/llamaindex-vdr-fine-tuning]的文档页面图像,是[llamaindex/vdr-multilingual-train]的重新格式化衍生版本,专为多语言检索微调设计。数据集支持多语言(德语、英语、西班牙语、法语、意大利语),包含train分割,共有511,166个示例,总大小约118.68 GB。特征包括image_filename(稳定键)和image(文档页面图像),适用于视觉文档检索任务。
This dataset contains document page images intended for [lightonai/llamaindex-vdr-fine-tuning], and it is a reformatted derivative version of [llamaindex/vdr-multilingual-train], specifically designed for multilingual retrieval fine-tuning. The dataset supports multiple languages including German, English, Spanish, French and Italian, includes the train split, and has a total of 511,166 examples with an approximate total size of 118.68 GB. Its features include image_filename (a stable key) and image (document page images), which are suitable for visual document retrieval tasks.




