Multimodal Coding Dataset (MCD)
收藏资源简介:
MCD是一个大规模、高质量的指令微调数据集,包含598k个样本,用于多模态代码生成任务。数据集由四个主要部分组成:增强的HTML代码、图表图像代码对、图像增强的代码问答对和算法代码。这些数据来自网页截图、GitHub上的Python matplotlib代码、StackOverflow以及LeetCode等算法编码数据集。MCD旨在解决现有多模态模型在代码生成能力上的不足,为多模态代码生成提供高质量的数据支持。
MCD is a large-scale, high-quality instruction-tuning dataset containing 598k samples for multimodal code generation tasks. It consists of four main components: augmented HTML code, chart image-code pairs, image-enhanced code question-answer pairs, and algorithmic code. The data is sourced from web screenshots, Python matplotlib code on GitHub, StackOverflow, and algorithmic coding datasets such as LeetCode. MCD aims to address the shortcomings of current multimodal models in code generation capabilities, providing high-quality data support for multimodal code generation.
Multimodal Coding Dataset (MCD) 数据集概述
📌 数据集简介
- 名称: Multimodal Coding Dataset (MCD)
- 用途: 用于训练和评估多模态代码生成模型
- 规模: 包含598k高质量样本
- 领域: HTML生成、图表转代码、图像增强问答、算法问题
- 相关论文: VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
📂 数据集文件
- mcd_598k.json: JSON元数据,包含
images、messages和category - mcd_images.zip: JSON文件中引用的所有图像
📊 数据集统计
| 领域 | 样本数量 | 描述 |
|---|---|---|
| HTML | 200k | 增强且视觉吸引人的网页代码 |
| Chart | 210k | 来自真实世界和合成来源的图表图像-代码对 |
| QA | 59k | 带有说明性图像的StackOverflow问答 |
| Algorithm | 129k | 来自多个来源的算法编码问题 |
| 总计 | 598k |
💾 数据加载方式
python from datasets import load_dataset dataset = load_dataset("lingjie23/MultimodalCodingDataset")
🏗 数据集构建
- 来源: 从多个来源收集和整理多模态编码任务
- 图像类型: 渲染的图表、UI截图和问题图
- 文本格式: 采用OpenAI聊天格式,支持多轮交互
数据结构
每个条目包含:
- images: 一个或多个相关图像(例如图表、UI截图)
- messages: 用于代码生成的OpenAI格式对话数据
- category: 任务类别(HTML、chart、QA、algorithm)
示例
json { "images": ["mcd_images/chart_images/92.png"], "messages": [ { "content": "<image> You are an expert Python developer who specializes in writing matplotlib code based on a given chart." } ], "category": "chart" }
📜 引用
bibtex @article{jiang2025viscodex, title={VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models}, author={Lingjie Jiang and Shaohan Huang and Xun Wu and Yixia Li and Dongdong Zhang and Furu Wei}, journal={arXiv preprint arXiv:2508.09945}, year={2025} }




