NeoBabel
收藏资源简介:
NeoBabel 是一个多语言图像生成框架,旨在解决现有系统对英语的过度依赖,为非英语用户创造更公平的访问。该框架支持六种语言,包括英语、中文、荷兰语、法语、印地语和波斯语。NeoBabel 使用大规模多语言预训练和高分辨率指令调整进行训练,并通过扩展的 m-GenEval 和 m-DPG 基准测试进行评估。该数据集包含 1.24 亿个多语言文本-图像对,旨在促进包容性 AI 研究。
NeoBabel is a multilingual image generation framework designed to address the over-reliance on English in existing systems and create more equitable access for non-English-speaking users. This framework supports six languages, including English, Chinese, Dutch, French, Hindi, and Persian. NeoBabel is trained using large-scale multilingual pre-training and high-resolution instruction tuning, and evaluated via extended m-GenEval and m-DPG benchmark tests. This dataset contains 124 million multilingual text-image pairs, aiming to facilitate inclusive AI research.
数据集概述
基本信息
- 数据集名称: NeoBabel-Pretrain
- 创建者: mderakhshani
- 托管平台: Hugging Face
- 数据集地址: https://hf.co/datasets/mderakhshani/NeoBabel-Pretrain
数据集状态
- 当前状态: 空数据集(无数据文件)
- 提示信息: 需上传或创建新数据文件后才能使用Dataset Viewer浏览
数据集描述
- 用途: 官方多语言预训练数据集(用于NeoBabel项目)
- 开发状态: 即将发布(coming soon)
其他信息
- YAML元数据警告: 仓库卡片中元数据为空或缺失
- 最近下载量: 0次(上月统计)

- 1NeoBabel: A Multilingual Open Tower for Visual GenerationCohere Labs, University of Amsterdam · 2025年



