遇见数据集

LLM_multimodal

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

LLM_multimodal 是一个为 LLM D6 模型系列设计的官方训练语料库,包含约 3000 亿个高质量 token,旨在平衡语言多样性、数学推理和编程能力。数据集涵盖英语、俄语以及多种编程语言,内容来自通用网络文本、学术/数学论文、代码仓库和对话数据。它分为两个主要子集:预训练(pre-train)子集,用于基础训练,包含大型文本文档,关注高质量、去重后的数据,如网络爬取文本、百科全书、文学作品、源代码以及 LaTeX 格式的方程和 STEM 学术文本;微调(fine-tune)子集,为对话和指令遵循任务精心策划,包含高质量提示-完成对,支持标准 ChatML 提示模板,涵盖物理常识推理、通用推理、多任务准确性和俄语理解等任务。该数据集专为 LLaMA-3 架构(特别是 D6 0.8B 参数定制版本)设计,并使用了一个针对英语、西里尔字母和编程语法优化的定制分词器进行训练。

LLM_multimodal is an official training corpus designed for the LLM D6 model family, containing approximately 300 billion high-quality tokens. It aims to strike a balance across linguistic diversity, mathematical reasoning capabilities, and programming proficiency. The corpus covers English, Russian, and multiple programming languages, with content sourced from general web text, academic and mathematical papers, code repositories, and conversational data. It is divided into two primary subsets: the pre-train subset, used for foundational model training, which comprises large-scale textual documents focusing on high-quality, deduplicated data including web-crawled text, encyclopedias, literary works, source code, LaTeX-formatted equations, and STEM academic texts; the fine-tune subset, meticulously curated for conversational and instruction-following tasks, which contains high-quality prompt-completion pairs, supports the standard ChatML prompt template, and covers tasks such as physical commonsense reasoning, general reasoning, multi-task accuracy, and Russian language comprehension. This corpus is specifically tailored for the LLaMA-3 architecture, particularly the custom 0.8B-parameter variant of the D6 model, and was trained using a custom tokenizer optimized for English, Cyrillic script, and programming syntax.

创建时间:
2026-07-12
搜集汇总
数据集介绍
LLM_multimodal 数据集图片
构建方式
LLM_multimodal数据集是为LLM D6模型系列打造的官方训练语料库,总计包含3000亿个高质量令牌。其构建过程精心平衡了语言多样性、数学推理与编程能力。数据集分为两大子集:预训练部分(pre-train)涵盖规模庞大的无监督语料,包括经过过滤去重的英文与俄语网页文本、百科文献、多语言代码仓库(如Python、C++、JavaScript等)以及LaTeX格式的数学论文与STEM学术文本,旨在奠定扎实的基础能力。指令微调部分(fine-tune)则精选高质量提示-完成对,采用ChatML格式以适配对话与指令跟随任务,涵盖物理常识推理(PIQA)、通用推理(HellaSwag)、多任务准确性(MMLU)及俄语理解(XWinograd RU)等场景。
特点
该数据集具备显著的多模态与多语言特性,覆盖英文、俄语及多种编程语言,令牌总数高达3000亿,规模宏大且质量上乘。其自定义分词器词汇量为52,000,针对英语、西里尔字母(俄语)及编程语法进行了专门优化,与LLaMA-3架构(D6 0.8B参数定制模型)高度兼容。预训练数据强调去重与高质量筛选,确保文本的纯正性与推理深度;指令微调数据则专注于对话交互,内置标准ChatML模板,便于直接应用于监督微调。整体设计在语言能力、数学逻辑与代码理解间取得了卓越平衡,为构建强大的大型语言模型提供了坚实的数据支撑。
使用方法
用户可通过Hugging Face的datasets库便捷调用该数据集。加载指令微调子集时,使用代码'load_dataset("firdavsus/LLM_multimodal", split="fine_tune")'即可获取结构化对话数据。对于规模庞大的预训练子集,建议启用流式加载模式以避免内存溢出,代码为'load_dataset("firdavsus/LLM_multimodal", split="pre_train", streaming=True)'。加载后可直接访问样本数据,例如通过索引'print(sft_dataset[0])'查看第一条指令-响应对。该数据集兼容标准ChatML格式,便于集成至各类训练框架,支持从基础预训练到指令微调的全流程开发,显著简化了多语言、多模态大模型的构建过程。
背景与挑战
背景概述
LLM_multimodal数据集由研究机构或个人研究者firdavsus于近期创建,旨在为大型语言模型LLM D6系列提供训练语料。该数据集包含约3000亿个高质量token,横跨英语、俄语及多种编程语言,覆盖通用文本、学术数学论文、代码仓库和对话数据等多个领域。其核心研究问题在于如何通过精心筛选和均衡的多模态语料提升模型在语言多样性、数学推理和编程能力上的表现。凭借其庞大的规模和结构化设计,该数据集对大型语言模型的预训练与指令微调领域具有显著影响力,尤其为多语言多模态模型的开发提供了关键资源。
当前挑战
LLM_multimodal数据集旨在解决的领域挑战包括:在大型语言模型训练中,如何平衡多语言、数学推理和编程能力等多种模态的需求,以避免单一领域数据主导导致的泛化能力不足。具体而言,需确保英语与俄语等低资源语言的流畅性,同时增强代码生成与数学逻辑的准确性。构建过程中面临的主要挑战在于从海量网络爬取、学术文献和代码仓库中过滤低质、重复内容,并保留高价值信息;此外,还需设计兼容英文、西里尔字母及编程符号的自定义分词器(52000词汇表),以及将3000亿token的庞大数据集组织为预训练与微调两个子集,以供流式加载和高效训练。
常用场景
经典使用场景
LLM_multimodal数据集专为大型语言模型的预训练与指令微调而设计,其3000亿token的海量语料融合了英语、俄语及多领域代码,构成了对多语言与编程能力并重的模型训练基石。经典使用场景包括从零开始训练具有推理能力的基座模型,例如基于LLaMA-3架构的D6系列模型,利用其预训练子集掌握语言规律与知识表示,再通过指令微调子集塑造其遵循人类意图进行对话、数学推理和代码生成的能力。数据集中数学论文、LaTeX公式与STEM文本的精心整合,使得模型在科学推理任务上表现卓越,成为构建通用多模态语言模型不可或缺的训练资源。
实际应用
在实际应用中,LLM_multimodal数据集驱动的大型语言模型可部署于多语言智能客服系统,同时处理英语与俄语用户的自然语言查询,并辅助编程代码的自动生成与调试。其强大的数学推理能力使其在教育科技领域大放异彩,能够为学生提供数学题目的逐步解答与概念讲解。此外,在软件开发环境中,模型可担任智能代码助手,基于用户自然语言描述生成Python、C++等语言的函数实现,或者对现有代码库进行重构与优化。该数据集还支持构建面向俄语群体的专属问答系统,借助XWinograd RU等评测任务确保语言理解的精准度,从而拓展到更广泛的跨文化信息检索场景。
衍生相关工作
基于LLM_multimodal数据集衍生了一系列具有影响力的研究工作,其中最为典型的是LLM D6模型系列,它作为直接在此语料上训练的代表作,验证了多语言与代码数据联合预训练的有效性。后续工作包括针对特定任务的适配模型,如专注于数学推理的D6-Math变体,通过进一步在数学文本上持续预训练显著提升了解题能力。另有研究者利用其指令微调子集构建了多语言对话系统评估基准,推动了跨语言对话质量自动评价技术的发展。此外,该数据集的语料分布特性激发了关于数据混合比例对多任务性能影响的分析,催生了动态数据调度策略的探索,为高效训练通用语言模型提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务