遇见数据集

1

收藏
魔搭社区2026-06-03 更新2026-07-15 收录
官方服务:

资源简介:

# Qwen Memory GT Release Notes 这份 README 说明把已经造好的 GT 交给别人时,应该给哪些文件,以及对方拿到后如何处理路径和训练输入。 ## 1. 推荐交付哪些文件 如果对方已经有原始图像数据,只需要给 GT JSONL 和少量说明/统计文件,不需要给 contact sheets、review images、agent 中间目录。 ### A. SpatialVID-HQ dynamic GT 这是动态场景数据,已使用 revalidated 版本,并且已经临时取消了 `select_stable` 中 `stable_value=low && fov_overlap<0.1` 的稳定参考。 必须给: ```text assets/data/qwen_memory_gpt55_teacher_spatialvidhq_dynamic_lt6_5agents_1500videos_no_geom_sparse_20260529/merged/revalidated/qwen_sft.jsonl ``` 推荐一起给: ```text assets/data/qwen_memory_gpt55_teacher_spatialvidhq_dynamic_lt6_5agents_1500videos_no_geom_sparse_20260529/merged/revalidated/summary.json assets/data/qwen_memory_gpt55_teacher_spatialvidhq_dynamic_lt6_5agents_1500videos_no_geom_sparse_20260529/merged/revalidated/stable_low_fov_lt01_unselected_corrections.jsonl assets/data/qwen_memory_gpt55_teacher_spatialvidhq_dynamic_lt6_5agents_1500videos_no_geom_sparse_20260529/merged/revalidated/stable_low_fov_lt01_unselected_summary.json assets/data/spatialvidhq_dynamic_2k5_motion_lt6/manifest.jsonl ``` 当前规模: ```text qwen_sft.jsonl: 120,077 samples create: 27,588 sparse: 47,505 select_coverage: 22,492 select_stable: 22,492 ``` ### B. DL3DV GT DL3DV 目前是按 batch 分开的最终文件,一共 15 个 batch。每个 batch 的最终训练文件都在: ```text */final_merged_logic_corrected/validated/qwen_sft.jsonl ``` 必须给下面 15 个文件: ```text assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_20260526_2258/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch0200_0399_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch0400_0599_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch0600_0799_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch0800_0999_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch1000_1199_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch1200_1399_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch1400_1599_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch1600_1799_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch1800_1999_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch2000_2199_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch2200_2399_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch2400_2599_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch2600_2799_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_batch2800_end_20260528/final_merged_logic_corrected/validated/qwen_sft.jsonl ``` 推荐一起给: ```text assets/data/dl3dv/manifest.jsonl assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_all_batches_summary_20260528.json assets/data/qwen_memory_gpt55_teacher_dl3dv_5agents_40videos_sparse_v2_final_audit_20260528.json ``` 当前规模: ```text DL3DV qwen_sft total: 216,521 samples ``` ## 2. JSONL 格式 每一行是一个样本,主要字段如下: ```json { "custom_id": "...", "task": "create|sparse|select_stable|select_coverage", "messages": [ {"role": "user", "content": "..."}, {"role": "assistant", "content": "{\"...\": ...}"} ], "images": [ {"label": "Current-1", "path": "...", "chunk_i": 1, "frame_index": 19} ], "metadata": {...}, "teacher_model": "...", "label_source": "..." } ``` 训练多图 Qwen 时,应该读取: - `messages`: 文本 prompt 和 assistant GT。 - `images[].path`: 对应输入图片路径,顺序就是多图输入顺序。 - `task`: 可用于分任务采样或统计。 `validated_requests.jsonl` 主要用于审计和复查,不是训练最小必需文件。训练优先用 `qwen_sft.jsonl`。 ## 3. 路径重映射 这些 JSONL 里的 `images[].path` 是当前服务器上的绝对路径。对方机器上的数据根目录不同的话,需要先做路径替换。 ### DL3DV 路径 当前路径前缀通常是: ```text /opt/liblibai-models/model-weights/DL3DV-ALL-960P ``` 如果对方的 DL3DV 根目录是: ```text /data/DL3DV-ALL-960P ``` 需要把 JSONL 中所有 `images[].path` 的这个前缀替换掉。 ### SpatialVID-HQ dynamic 路径 当前路径前缀通常是: ```text /opt/liblibai-models/user-workspace/yangying/HY-WorldPlay/assets/data/spatialvidhq_dynamic_2k5_motion_lt6 ``` 如果对方使用同样的 frame cache 结构,只需要替换这个根目录。 如果对方只有原始视频而没有 `frame_cache`,需要先按 `manifest.jsonl` 生成对应的帧缓存,或者让数据加载器根据 `metadata` / `images[].frame_index` 从原始视频中取帧。 ## 4. 推荐处理流程 ### Step 1: 拷贝 GT 文件 建议组织成类似结构: ```text qwen_memory_gt/ README.md dl3dv/ qwen_sft_batch_0000_0199.jsonl qwen_sft_batch_0200_0399.jsonl ... qwen_sft_batch_2800_end.jsonl manifest.jsonl spatialvidhq_dynamic/ qwen_sft.jsonl manifest.jsonl summary.json ``` ### Step 2: 重映射图片路径 示例脚本: ```bash python3 remap_qwen_memory_paths.py \ --input qwen_sft.jsonl \ --output qwen_sft.remap.jsonl \ --replace /old/root=/new/root ``` 示例 Python 实现: ```python import argparse import json parser = argparse.ArgumentParser() parser.add_argument("--input", required=True) parser.add_argument("--output", required=True) parser.add_argument("--replace", action="append", default=[]) args = parser.parse_args() replacements = [] for item in args.replace: old, new = item.split("=", 1) replacements.append((old, new)) with open(args.input, "r", encoding="utf-8") as fin, open(args.output, "w", encoding="utf-8") as fout: for line in fin: row = json.loads(line) for image in row.get("images", []): path = image.get("path") if not path: continue for old, new in replacements: if path.startswith(old): image["path"] = new + path[len(old):] break fout.write(json.dumps(row, ensure_ascii=False) + "\n") ``` ### Step 3: 合并训练文件 DL3DV 如果想训练时作为一个文件,可以直接拼接 15 个 batch: ```bash cat dl3dv/qwen_sft_batch_*.jsonl > dl3dv/qwen_sft.all.jsonl ``` 如果要混合 DL3DV 和 SpatialVID-HQ dynamic: ```bash cat dl3dv/qwen_sft.all.jsonl spatialvidhq_dynamic/qwen_sft.jsonl > qwen_memory_gt_all.jsonl ``` ### Step 4: 基础校验 至少检查: ```bash python3 - <<'PY' import json from pathlib import Path path = Path("qwen_memory_gt_all.jsonl") missing = 0 bad_json = 0 total = 0 for line in path.open("r", encoding="utf-8"): total += 1 try: row = json.loads(line) assert row.get("messages") assert row.get("images") for image in row["images"]: if not Path(image["path"]).exists(): missing += 1 except Exception: bad_json += 1 print({"total": total, "bad_json": bad_json, "missing_image_paths": missing}) PY ``` `missing_image_paths` 必须为 0 后再训练。 ## 5. 不建议交付的中间文件 下面这些一般不需要给别人: - `agent_*/prebuilt_contact_sheets/` - `agent_*/requests_built/` - `agent_*/raw_labels/` - `review_images/` - `contact_sheets/` - smoke / trial / prompt test 目录 - `merged/qwen_sft.jsonl` 旧版本。SpatialVID-HQ dynamic 应使用 `merged/revalidated/qwen_sft.jsonl`。 ## 6. 训练时任务含义 - `create`: 判断当前 chunk 是否属于已有 memory class。 - `sparse`: 判断类满后某个候选 chunk 是否可以移除。 - `select_stable`: 从稳定候选中选最多一个稳定参考。 - `select_coverage`: 从覆盖候选中选最多两个扩展/覆盖参考。 这些任务可以混合训练,也可以按 `task` 分别采样。快速验证模型能否适应多图输入时,建议每类任务先均匀采样一部分,避免 `create` 或 `sparse` 数量压过 `select`。

提供机构:
maas
创建时间:
2026-05-31
二维码
社区交流群
二维码
科研交流群
商业服务