schneewolflabs/ArtemisMix-v1
收藏资源简介:
ArtemisMix-v1是一个用于Artemis模型(Schneewolf Labs的视觉语言旗舰模型)的第二阶段多模态指令微调语料库,包含350,000行数据。它由两个层次组成:L1(通用多模态指令,150,000行,42.9%),专注于基于图像的视觉问答和指令跟随;L4(文本排练,200,000行,57.1%),用于推理锚点和身份/声音/工具抗漂移。数据来源包括多个公开数据集,如LLaVA-Instruct-150K、the_cauldron等。数据模式包括id、layer、source、messages、image和reasoning字段,支持多语言(英语和多语言),任务类别包括视觉问答、图像文本到文本和文本生成。数据集旨在通过多模态指令微调提升模型性能,并保持身份和工具行为的稳定性。
许可证:Apache-2.0 语言: - 英语 - 多语言 任务类别: - 视觉问答 - 图像-文本转文本 - 文本生成 数据规模: - 10万<样本量<100万 标签: - 多模态 - 视觉语言模型(VLM) - 指令微调 - 推理 - Schneewolf Labs - Artemis # ArtemisMix-v1 本语料库为Schneewolf Labs旗舰级视觉语言模型**Artemis**的第二阶段多模态指令微调语料,该模型将Qwen3-VL的视觉Transformer(ViT)+多层感知器(MLP)投影头嫁接至A2解码器(属于A3系列)。 本次发布的为**精简版(v1)**:仅包含L1与L4两个层,共计35万条样本。计划中的L2层(多模态工具/AI智能体)与L3层(自定义蒸馏)将单独制作,后续再进行拼接。 ## 数据构成 | 层 | 样本量 | 占比 | 用途 | |----------|--------:|-------:|--------------------------------------------| | **L1** 通用多模态指令 | 150,000 | 42.9% | 图像锚定视觉问答 / 指令遵循 | | **L4** 文本预演 | 200,000 | 57.1% | 推理锚点 + 身份/语气/工具抗漂移 | 身份与工具调用抗漂移基础数据(采用过采样的i-DPO与A2-tool-orpo方案)占语料库的**17.1%**:通过高密度预演确保在全量微调过程中,模型的语气与工具调用行为保持稳定。 ### 数据源 #### L1(多模态): - `liuhaotian/LLaVA-Instruct-150K` — 120,000条(嵌入COCO 2017图像) - `HuggingFaceM4/the_cauldron` — 30,000条,涵盖ai2d、chartqa、docvqa、ocrvqa、scienceqa、textvqa六个子任务(每个子任务5000条,共6×5000) #### L4(文本预演): - `Jackrong/GLM-5.1-Reasoning-1M-Cleaned` — 50,000条 - `schneewolflabs/i-DPO` — 30,000条(从927条原始数据过采样32倍;包含身份与Luna语气数据) - A2-tool-orpo — 30,000条(从3029条原始数据过采样10倍;用于工具调用抗漂移训练) - `Jackrong/LogicMind-Chat-Reasoning-SFT-300K` — 30,000条 - `schneewolflabs/BigDenker-SFT` — 23,000条 - `Jackrong/Competitive-Programming-python-blend` — 15,000条 - `Jackrong/Claude-opus-4.6-TraceInversion-9000x` — 9,000条 - `Jackrong/DeepSeek-V4-Distill-8000x` — 8,000条 - `Jackrong/Claude-opus-4.7-TraceInversion-5000x` — 5,000条 ## 数据结构 | 字段 | 类型 | 说明 | |--------------|--------|----------------------------------------------------------------------| | `id` | 字符串 | 格式为`{layer}-{source}-{idx}`(过采样样本后缀为`-rN`) | | `layer` | 字符串 | 取值为`L1`或`L4` | | `source` | 字符串 | 上游数据集ID | | `messages` | 字符串 | JSON序列化的对话列表;多模态轮次使用包含`{"type":"image"}`/`{"type":"text"}`的内容列表 | | `image` | 图像 | 嵌入的二进制字节;纯文本(L4)样本此字段为`null` | | `reasoning` | 字符串 | 提取的`<think>`块(如存在);可为空 | 为兼容Apache Arrow格式,`messages`字段采用JSON编码,加载时需使用`json.loads`进行解析。 ## 许可证 采用Apache-2.0开源协议,与A1/A2/A3系列模型保持一致。各组成数据源保留其自身许可证(多为Apache-2.0、MIT或CC-BY协议);Jackrong提供的推理数据集与编程竞赛混合数据集采用混合宽松许可协议。




