遇见数据集

schneewolflabs/ArtemisMix-v1

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

ArtemisMix-v1是一个用于Artemis模型(Schneewolf Labs的视觉语言旗舰模型)的第二阶段多模态指令微调语料库,包含350,000行数据。它由两个层次组成:L1(通用多模态指令,150,000行,42.9%),专注于基于图像的视觉问答和指令跟随;L4(文本排练,200,000行,57.1%),用于推理锚点和身份/声音/工具抗漂移。数据来源包括多个公开数据集,如LLaVA-Instruct-150K、the_cauldron等。数据模式包括id、layer、source、messages、image和reasoning字段,支持多语言(英语和多语言),任务类别包括视觉问答、图像文本到文本和文本生成。数据集旨在通过多模态指令微调提升模型性能,并保持身份和工具行为的稳定性。

许可证:Apache-2.0 语言: - 英语 - 多语言 任务类别: - 视觉问答 - 图像-文本转文本 - 文本生成 数据规模: - 10万<样本量<100万 标签: - 多模态 - 视觉语言模型(VLM) - 指令微调 - 推理 - Schneewolf Labs - Artemis # ArtemisMix-v1 本语料库为Schneewolf Labs旗舰级视觉语言模型**Artemis**的第二阶段多模态指令微调语料,该模型将Qwen3-VL的视觉Transformer(ViT)+多层感知器(MLP)投影头嫁接至A2解码器(属于A3系列)。 本次发布的为**精简版(v1)**:仅包含L1与L4两个层,共计35万条样本。计划中的L2层(多模态工具/AI智能体)与L3层(自定义蒸馏)将单独制作,后续再进行拼接。 ## 数据构成 | 层 | 样本量 | 占比 | 用途 | |----------|--------:|-------:|--------------------------------------------| | **L1** 通用多模态指令 | 150,000 | 42.9% | 图像锚定视觉问答 / 指令遵循 | | **L4** 文本预演 | 200,000 | 57.1% | 推理锚点 + 身份/语气/工具抗漂移 | 身份与工具调用抗漂移基础数据(采用过采样的i-DPO与A2-tool-orpo方案)占语料库的**17.1%**:通过高密度预演确保在全量微调过程中,模型的语气与工具调用行为保持稳定。 ### 数据源 #### L1(多模态): - `liuhaotian/LLaVA-Instruct-150K` — 120,000条(嵌入COCO 2017图像) - `HuggingFaceM4/the_cauldron` — 30,000条,涵盖ai2d、chartqa、docvqa、ocrvqa、scienceqa、textvqa六个子任务(每个子任务5000条,共6×5000) #### L4(文本预演): - `Jackrong/GLM-5.1-Reasoning-1M-Cleaned` — 50,000条 - `schneewolflabs/i-DPO` — 30,000条(从927条原始数据过采样32倍;包含身份与Luna语气数据) - A2-tool-orpo — 30,000条(从3029条原始数据过采样10倍;用于工具调用抗漂移训练) - `Jackrong/LogicMind-Chat-Reasoning-SFT-300K` — 30,000条 - `schneewolflabs/BigDenker-SFT` — 23,000条 - `Jackrong/Competitive-Programming-python-blend` — 15,000条 - `Jackrong/Claude-opus-4.6-TraceInversion-9000x` — 9,000条 - `Jackrong/DeepSeek-V4-Distill-8000x` — 8,000条 - `Jackrong/Claude-opus-4.7-TraceInversion-5000x` — 5,000条 ## 数据结构 | 字段 | 类型 | 说明 | |--------------|--------|----------------------------------------------------------------------| | `id` | 字符串 | 格式为`{layer}-{source}-{idx}`(过采样样本后缀为`-rN`) | | `layer` | 字符串 | 取值为`L1`或`L4` | | `source` | 字符串 | 上游数据集ID | | `messages` | 字符串 | JSON序列化的对话列表;多模态轮次使用包含`{"type":"image"}`/`{"type":"text"}`的内容列表 | | `image` | 图像 | 嵌入的二进制字节;纯文本(L4)样本此字段为`null` | | `reasoning` | 字符串 | 提取的`<think>`块(如存在);可为空 | 为兼容Apache Arrow格式,`messages`字段采用JSON编码,加载时需使用`json.loads`进行解析。 ## 许可证 采用Apache-2.0开源协议,与A1/A2/A3系列模型保持一致。各组成数据源保留其自身许可证(多为Apache-2.0、MIT或CC-BY协议);Jackrong提供的推理数据集与编程竞赛混合数据集采用混合宽松许可协议。

提供机构:
schneewolflabs
搜集汇总
数据集介绍
schneewolflabs/ArtemisMix-v1 数据集图片
构建方式
ArtemisMix-v1 数据集是专为 Artemis 多模态视觉语言模型设计的第二阶段指令微调语料库。其构建基于分层架构,当前版本仅包含 L1 和 L4 两个子层,总计约35万条数据。L1 层聚焦通用多模态指令,融合了 LLaVA-Instruct-150K 中12万条基于 COCO 2017 图像的问答数据,以及来自 the_cauldron 的3万条涵盖 AI2D、ChartQA、DocVQA 等六大领域的多模态样本。L4 层则为纯文本推理与行为对齐数据,从多个高质量推理数据集(如 GLM-5.1-Reasoning-1M-Cleaned、LogicMind-Chat-Reasoning-SFT-300K)中采样约20万条,并特别引入针对身份与工具调用抗漂移的 i-DPO 和 A2-tool-orpo 数据(经大幅过采样),确保模型在微调过程中保持行为稳健。
使用方法
使用时,用户可通过加载工具读取数据集,并将 JSON 序列化的 messages 字段解析为对话列表。对于包含图像的行,image 字段直接提供嵌入的字节数据,无需额外寻址。L1 层数据适合用于视觉问答与指令跟随任务,L4 层数据则专注于推理能力训练与行为对齐。建议开发者根据自身模型需求,选择性地混入 L2(工具/智能体)和 L3(自定义蒸馏)层数据以构建更完整的训练集。数据集采用 Apache-2.0 许可协议,各组成部分保留其原始许可证,混合许可的 Jackrong 推理数据集需注意合规使用。
背景与挑战
背景概述
ArtemisMix-v1是由Schneewolf Labs团队于近期构建的多模态指令微调数据集,作为其旗舰视觉语言模型Artemis的Stage-2训练语料。该数据集的核心研究问题在于如何在大规模多模态指令微调过程中,有效融合视觉问答与文本推理能力,同时抵御模型在身份保持与工具调用行为上的退化。通过将Qwen3-VL的视觉编码器与A2解码器嫁接,ArtemisMix-v1致力于在通用多模态理解与复杂推理之间取得平衡。该数据集在开放许可(Apache-2.0)下发布,其设计思路与层状拼接策略(L1多模态层与L4文本排练层)为后续多模态指令微调数据集构建提供了新范式,对视觉语言模型的可控微调领域具有重要参考价值。
当前挑战
ArtemisMix-v1主要面临两大领域挑战。其一,视觉语言模型在指令微调阶段极易发生灾难性遗忘,尤其体现在身份表征和工具调用能力上——模型可能在吸收新知识时丢失已习得的对话风格或功能行为。其二,数据集构建过程中需处理异源数据的格式统一与质量平衡问题:来自LLaVA、the Cauldron等多样来源的图片与文本需转为标准化消息结构,同时需通过过采样策略(如i-DPO数据扩增32倍)强化关键样本,以避免数据分布倾斜导致的微调不稳定。此外,推理轨迹的提取与结构化存储(如JSON序列化聊天记录)亦增加了预处理复杂度。
常用场景
经典使用场景
ArtemisMix-v1 数据集专为视觉语言模型(VLM)的多模态指令微调而设计,其经典使用场景聚焦于模型在图像理解与自然语言交互能力的深度融合。该数据集通过结构化的两层设计——L1 层承载通用多模态指令,涵盖视觉问答(VQA)与指令遵循任务,而 L4 层则专注于文本推理与行为锚定,为模型提供了丰富的对齐信号。研究者可借此微调模型以实现精准的图像描述、基于视觉内容的问答以及复杂的推理任务,从而在多模态对话系统中展现出优异的通用性与鲁棒性。
解决学术问题
ArtemisMix-v1 数据集旨在攻克视觉语言模型在微调过程中面临的几个关键学术难题:首先,通过 L1 层的大规模多模态指令样本,缓解了模型在视觉与文本模态间对齐时的语义鸿沟,显著提升了跨模态理解能力。其次,L4 层中特殊设计的身份与工具调用抗漂移样本(如 i-DPO 与 A2-tool-orpo 的过采样数据),有效解决了模型在全参数微调时容易遗忘原始身份特征与工具行为模式的问题。这些机制共同增强了模型在长尾推理、身份保持与工具使用场景下的稳定性,为构建更具适应性的通用 VLM 奠定了数据基础。
实际应用
在实际应用中,ArtemisMix-v1 数据集微调出的模型可部署于智能客服、教育辅导、医疗影像辅助诊断及工业质检等场景。例如,在智能客服领域,模型能结合用户上传的产品图片进行精准的故障排查与操作指导;在教育场景中,可针对图表或实验照片提供一步步的推理解答。此外,其强化的工具调用抗漂移特性使得模型能稳健地调用外部 API(如搜索、计算或绘图工具),应用于自动化工作流与机器人交互系统,显著提升了多模态 AI 在复杂环境下的实用性与可靠性。
数据集最近研究
最新研究方向
多模态指令微调与推理能力强化是当前视觉语言模型发展的关键前沿。ArtemisMix-v1数据集应运而生,其创新性地融合了通用视觉问答与文本推理锚点,通过精心设计的层级架构(L1多模态指令层与L4文本排练层)来平衡模型的视觉理解与身份保持能力。数据集特别引入了身份抗偏移(i-DPO)与工具调用鲁棒性训练样本,占总量的17.1%,这直接回应了当前大模型在持续微调中面临的灾难性遗忘与工具行为退化等核心挑战。该语料库的构建体现了对推理链(reasoning anchors)的深度重视,通过从Llava-Instruct、The Cauldron等多源数据中筛选高质量样本,并融入从GLM-5.1、LogicMind等开源推理数据集中提取的复杂逻辑链,旨在为Artemis模型注入结构化推理与长程思维能力。这一方向不仅推动多模态模型从感知向认知的跃迁,也为构建更可靠、更可控的通用人工智能体提供了数据基础范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务