Coalescence
收藏资源简介:
Coalescence是一个大规模的统一多模态数据集,结合了来自不同公共来源的图像、音频和文本,设计用于训练和微调集成视觉、音频和语言理解的多模态模型。
Coalescence is a large-scale unified multimodal dataset that combines image, audio and text data from diverse public sources, and is designed for training and fine-tuning multimodal models that integrate visual, audio and language understanding capabilities.
Coalescence数据集概述
数据集基本信息
- 数据集名称: Coalescence: Unified Multimodal Vision-Audio & Language Dataset
- 存储库ID: VINAYU7/Coalescence
- 创建者: Mr. Vinay Umrethe
- 最后更新: 2025年10月28日
数据集特性
任务类别
- 特征提取
- 图像分类
- 图像到文本
- 图像文本到文本
- 自动语音识别
- 音频分类
- 任意到任意
- 图像特征提取
- 零样本分类
- 问答
语言支持
- 英语(en)
- 中文(zh)
- 俄语(ru)
- 印地语(hi)
- 马拉地语(mr)
- 伊博语(ig)
标签
- 数学(math)
- 光学字符识别(ocr)
- 自动语音识别(asr)
- 音乐(music)
- 语音(speech)
- 不适宜工作内容(nsfw)
规模类别
100K<n<1M
数据规模统计
| 模态 | 数量 |
|---|---|
| 图像 | 261,659 |
| 音频文件 | 115,311 |
| 总条目 | 373,972 |
| 源数据集 | 24 |
文件格式与分布
文件格式
- 行分隔JSON (JSONL)
文件类型分布
- .jpeg: 62,614
- .png: 199,045
- .wav: 115,311
- .mp3: 4
- 总文件数: 376,974
数据集结构
目录布局
Coalescence/ ├── manifests/ │ ├── train.jsonl │ ├── train_filtered.jsonl │ └── categorized/ ├── files/ │ ├── audio_000000.wav │ ├── img_000000.jpg │ └── ... └── README.md
支持模态
- 图像 + 文本
- 音频 + 文本
- 图像 + 音频 + 文本
源数据集
数据集整合了17个高质量源数据集,包括:
- theneuralmaze/celebrity_faces (名人面部图像)
- irodkin/celeba_with_llava_captions (CelebA带LLaVA生成字幕)
- DRDELATV/SHORT_NSFW (短NSFW图像文本对)
- DRDELATV/NSFW_LP (NSFW标记提示/图像)
- RIW/small-coco-wm_50 (过滤的COCO子集)
- linxy/LaTeX_OCR (合成LaTeX方程+图像)
- unsloth/LaTeX_OCR (高质量LaTeX OCR数据)
- MathLLMs/MathVision (数学视觉问题)
- We-Math/We-Math (通用数学问题数据集)
- SPRINGLab/IndicTTS_Hindi (ASR)
- SPRINGLab/IndicTTS_Marathi (ASR)
- MrDragonFox/Elise (ASR)
- Vikhrmodels/ToneBooks (ASR/描述)
- vucinatim/spectrogram-captions (音频频谱分析)
- Hanhpt23/Silvar-Med (视觉医学分析)
主题与任务覆盖
| 主题 | 任务类型 | 清单文件 |
|---|---|---|
| 名人识别 | 面部分类 | 6.CelebrityFaces.jsonl |
| 图像字幕(名人) | 视觉到文本 | 7.CelebaCaptions.jsonl |
| NSFW检测 | 分类、理解 | 8.NSFW1.jsonl, 9.NSFW2.jsonl |
| 通用图像理解 | 字幕、目标检测 | 5.CocoSmall.jsonl |
| LaTeX OCR | 公式识别、OCR | 10.LinxyLatexOCR.jsonl, 11.UnslothLatexOCR.jsonl |
| 数学推理 | 视觉数学问题 | 12.MathVision.jsonl |
| 数学SFT数据 | 逐步数学解决方案 | 13.WeMath.jsonl |
| 宝可梦 | 字幕、识别、分类 | 15.PokemonBlipCaptioned.jsonl, 16.PokemonInfo.jsonl, 17.PokemonCards.jsonl |
| 食物 | 图像字幕与识别 | 14.FoodCaptioned.jsonl |
JSONL模式示例
json { "id": "000123", "image": "files/img_000000.jpg", "audio": "files/audio_000000.wav", "text": "A natural sentence describing both the image and audio." }
存储需求
| 资源 | 需求 |
|---|---|
| 清单文件大小 | 234+ MB |
| 图像+音频 | ~35 GB |
| 推荐存储 | ≥60 GB |
| 训练输出 | ≥120 GB |
伦理考虑与警告
- 包含潜在敏感内容(NSFW材料)
- 未经过滤不适用于儿童安全应用
- 推荐使用train_filtered.jsonl排除NSFW内容
推荐用途
- 微调视觉和音频投影器
- 将编码器与基础LLM集成
- 数学推理和OCR & ASR任务的预训练
- 食物/字幕模型训练
- 名人识别系统开发
- NSFW感知安全过滤器构建
- 跨领域多模态泛化基准测试
许可证
- 原始公共数据集: 各不相同(MIT, Apache 2.0, CC-BY-SA等)
- 聚合和清单: 仅限非商业使用
- 不允许商业重新分发
引用
bibtex @dataset{Coalescence, author = {VINAYU7 (Vinay Umrethe)}, title = {Coalescence: Unified Multimodal Vision-Audio & Language Dataset}, year = {2025}, url = {https://huggingface.co/datasets/VINAYU7/Coalescence} }




