Coalescence
收藏资源简介:
Coalescence 是一个大规模、统一的多模态数据集,整合了来自多种公共来源的图像、音频和文本数据。该数据集旨在支持视觉和音频投影器的微调、模态特定编码器与基础大型语言模型的融合,以及训练图像+音频→文本能力的模型。数据集包含约261K图像和115K音频文件,总计383,816条条目。数据以Parquet格式存储,涵盖多个领域,包括数学、OCR、名人识别、食物标注、宝可梦分析和一般图像理解。数据集通过配置(子集)管理,包括一个推荐使用的“filtered”子集,该子集自动聚合了所有29个安全子集,排除了NSFW内容。每个子集遵循标准化的PyArrow模式,包含id、image、audio和text字段。数据集适用于OCR、ASR、VQA、数学推理、安全过滤和NSFW理解等任务。
Coalescence is a large-scale, unified multimodal dataset that integrates image, audio, and text data from various public sources. This dataset aims to support fine-tuning of visual and audio projectors, fusion of modality-specific encoders with foundational large language models, and training of models with image+audio-to-text capabilities. The dataset contains approximately 261K images and 115K audio files, totaling 383,816 entries. Data is stored in Parquet format, covering multiple domains including mathematics, OCR, celebrity recognition, food annotation, Pokémon analysis, and general image understanding. The dataset is managed via configurations (subsets), including a recommended "filtered" subset that automatically aggregates all 29 safe subsets and excludes NSFW content. Each subset follows a standardized PyArrow schema, containing the fields id, image, audio, and text. The dataset is suitable for tasks such as OCR, ASR, VQA, mathematical reasoning, safety filtering, and NSFW understanding.
Coalescence 数据集概述
数据集基本信息
- 数据集名称: Coalescence: Unified Multimodal Vision-Audio & Language Dataset
- 发布者: Vinay Umrethe
- 发布日期: 2026年
- 存储库ID:
VINAYU7/Coalescence - 数据集地址: https://huggingface.co/datasets/VINAY-UMRETHE/Coalescence
- 数据格式: Parquet
- 总大小: 186GB
- 总条目数: 383,816
- 许可证: 混合许可证(需遵守各原始数据集的许可证)
数据集内容与结构
模态构成
- 图像: 约261K (268,026)
- 音频文件: 约115K (118,788)
支持语言
- 印地语 (hi)
- 马拉地语 (mr)
- 克什米尔语 (ks)
- 英语 (en)
- 伊博语 (ig)
- 阿拉伯语 (ar)
数据标签
- coalescence
- text
- image
- audio
- classification
- ocr
- asr
- math
配置与子集
数据集通过配置(子集)管理其多样化的数据源。主要配置如下:
推荐配置
filtered: (元配置)自动聚合所有29个安全子集,排除NSFW内容,包含约384k样本(图像+音频+文本)。
特定领域子集(部分列举)
OmniBench: 通用多模态基准数据LinxyLatexOCR: LaTeX OCR图像UnslothLatexOCR: 高质量LaTeX OCR数据MathVision: 视觉数学问题WeMath: 通用数学问题数据集FoodCaptioned: 带描述的食物图像PokemonBlipCaptioned: 宝可梦图像与描述PokemonInfo: 宝可梦信息PokemonCards: 宝可梦卡牌扫描图与数据Tiny_Stories: 小故事文本Tiny_Stories_Igbo: 伊博语小故事文本ToneBooks: 带音调分析的有声读物EnglishDialects: 英语方言数据Elise: 自动语音识别(ASR)数据Indian_Hindi: 印地语语音识别(ASR)Indian_Marathi: 马拉地语语音识别(ASR)SpectoGram_Captioned: 音频频谱图与描述Silvar_Med: 视觉医学分析MilitaryImages: 军事人员图像BhojpuriASR: 博杰普尔语ASRIndoAryanSinhalaASR: 印度-雅利安僧伽罗语ASRKashmiriArabicASR: 克什米尔阿拉伯语ASRAngikaDevanagariASR: 安吉卡天城文ASRArabicAudio: 阿拉伯语音频MilitaryAircraftCaptioned: 带描述的军用飞机图像NonverbalTTS: 非语言文本转语音数据CocoSmall: 过滤后的COCO子集CelebrityFaces: 名人面孔图像CelebaCaptions: 带LLaVA生成描述的CelebA数据NSFW1: NSFW图像-文本对(被filtered排除)NSFW2: NSFW标记提示/图像(被filtered排除)
数据模式
每个子集遵循标准化的PyArrow模式:
id(string): 唯一标识符。image(image): PIL可解码的图像对象(或None)。audio(audio): 包含{array: ..., sampling_rate: ...}的字典(或None)。text(string): 文本描述、转录或OCR输出。
主要用途
- 微调视觉和音频投影器
- 将模态特定编码器与基础大语言模型(LLM)合并
- 训练具备图像+音频→文本能力的模型
- 任务涵盖:OCR、ASR、视觉问答(VQA)、数学推理、安全过滤、NSFW理解。
涵盖主题与任务
| 主题 | 任务类型 | 对应配置文件 |
|---|---|---|
| 名人识别 | 人脸分类 | CelebrityFaces |
| 图像描述生成(名人) | 视觉到文本 | CelebaCaptions, MilitaryAircraftCaptioned |
| NSFW检测 | 分类、理解 | NSFW1, NSFW2 |
| 通用图像理解 | 描述生成、目标检测 | CocoSmall, MilitaryImages |
| LaTeX OCR | 公式识别、OCR | LinxyLatexOCR, UnslothLatexOCR |
| 数学推理 | 视觉数学问题 | MathVision |
| 数学监督微调数据 | 分步数学解答 | WeMath |
| 宝可梦 | 描述生成、识别、分类 | PokemonBlipCaptioned, PokemonInfo, PokemonCards |
| 食物 | 图像描述生成与识别 | FoodCaptioned |
| 语音识别与生成 | 音频描述生成 | BhojpuriASR, IndoAryanSinhalaASR, KashmiriArabicASR, AngikaDevanagariASR |
数据来源与出处
数据集聚合并重构了来自可信公共存储库的数据,共包含31个来源数据集。所有原始许可证均适用。
部分来源数据集列举:
theneuralmaze/celebrity_faces- 名人面孔图像irodkin/celeba_with_llava_captions- 带LLaVA生成描述的CelebA数据DRDELATV/SHORT_NSFW- 短NSFW图像-文本对DRDELATV/NSFW_LP- NSFW标记提示/图像RIW/small-coco-wm_50- 过滤后的COCO子集linxy/LaTeX_OCR- 合成LaTeX公式与图像unsloth/LaTeX_OCR- 高质量LaTeX OCR数据MathLLMs/MathVision- 数学视觉问题We-Math/We-Math- 通用数学问题数据集SPRINGLab/IndicTTS_Hidi- 印地语ASRSPRINGLab/IndicTTS_Marathi- 马拉地语ASRMrDragonFox/Elise- ASR数据Vikhrmodels/ToneBooks- ASR/描述数据vucinatim/spectrogram-captions- 音频频谱图与描述Hanhpt23/Silvar-Med- 视觉医学分析facebook/omnilingual-asr-corpus- ASR数据mehul7/captioned_military_aircraft- 军用飞机描述生成SinclairSchneider/military_images- 军事人员图像
伦理考量与警告
- 包含潜在敏感内容:包含NSFW材料(
NSFW1,NSFW2)。 - 使用建议:
- 为安全敏感的应用使用
filtered配置以排除NSFW内容。 - 在生产中应用严格的内容审核流程。
- 遵守关于成人内容和面部识别的当地法规。
- 为安全敏感的应用使用
- 未经过滤不适合儿童安全应用。
模型训练建议
该数据集针对微调多模态投影器(如LLaVA、Gemma-3n、LFM2)进行了优化。
推荐编码器配对
| 模型 | 视觉编码器 | 音频编码器 |
|---|---|---|
| Llama3.1/3.2 | timm/mobilenetv5_300m.gemma3n |
n0mad-0/gemma3n-usm-rip USM |
| InternVL | InternViT-300M |
— |
| Gemma-3n | timm/mobilenetv5_300m.gemma3n |
n0mad-0/gemma3n-usm-rip USM(非官方) |
| LFM2 | SigLIP2 NaFlex shape-optimized SigLIP2 NaFlex large (400M) SigLIP2 NaFlex base (86M) |
— |
建议用途
- 对齐视觉/音频特征与语言嵌入
- 训练跨模态注意力机制
- 提高在数学、符号和现实世界领域的泛化能力
- 在多模态任务上微调视觉语言模型
快速开始示例
python from datasets import load_dataset
加载推荐的"filtered"子集(排除NSFW内容)
dataset = load_dataset("VINAYU7/Coalescence", "filtered", split="train")
加载特定子集(例如印地语ASR数据)
hindi_data = load_dataset("VINAYU7/Coalescence", "Indian_Hindi", split="train")
引用
如果在本研究中使用此数据集,请引用: bibtex @misc{vinayumrethecoalescence2026, author = {Vinay Umrethe}, title = {Coalescence: Unified Multimodal Vision-Audio & Language Dataset}, year = {2026}, publisher={Hugging Face}, howpublished={url{https://huggingface.co/VINAYU7/Vespera3D}} }



