ParaVT/ParaVT-Parquet
收藏资源简介:
ParaVT-Parquet数据集是ParaVT项目的训练标注数据集,用于长视频理解和多智能体代理框架的冷启动监督微调(SFT)和强化学习(RL)。该数据集包含约97K行的SFT语料库(来自多个子集,如Charades-STA时间定位、Gemini蒸馏的工具调用链、长视频推理、MuSeG并行工具调用、自蒸馏交错多模态工具思维链、时间视频定位和Video-R1子集)和4406行的多样化RL语料库(混合了多个数据源,包括多选题、开放问答、时间IoU等奖励形式)。数据集为多模态,涉及视频和文本,使用相对路径(sentinel路径)以保护隐私,需通过提供的materialize脚本转换为绝对路径。该数据集用于训练ParaVT-8B模型及其冷启动初始化版本。
许可证:Apache-2.0 任务类别: - 视频-文本到文本 - 视觉问答 语言: - 英语 标签: - 视频 - 长视频 - 推理 - 工具调用 - 多模态 - 思维链(Chain-of-Thought, CoT) - 智能体强化学习(Agentic RL) 样本规模: - 10万<样本数<100万 配置项: - 配置名称:sft 数据文件: - 拆分集:charades 路径:paravt_sft_charades_12k4.parquet - 拆分集:geminicot 路径:paravt_sft_geminicot_4k8.parquet - 拆分集:longvideoreason 路径:paravt_sft_longvideoreason_5k2.parquet - 拆分集:museg 路径:paravt_sft_museg_2k5.parquet - 拆分集:selftrace 路径:paravt_sft_selftrace_15k3.parquet - 拆分集:tvg 路径:paravt_sft_tvg_6k3.parquet - 拆分集:videor1 路径:paravt_sft_videor1_50k.parquet - 配置名称:rl 数据文件: - 拆分集:train 路径:paravt_rl_diverse_4k4.parquet --- # ParaVT-Parquet <div align="center"> [](https://arxiv.org/abs/2605.20342) [](https://evolvinglmms-lab.github.io/ParaVT/) [](https://github.com/EvolvingLMMs-Lab/ParaVT) [](https://huggingface.co/datasets/ParaVT/ParaVT-Source) [](https://huggingface.co/ParaVT/ParaVT-8B) [](https://huggingface.co/papers/2605.20342) </div> 本仓库托管[ParaVT](https://github.com/EvolvingLMMs-Lab/ParaVT)项目的训练标注数据:包含一个9.7万行的冷启动监督微调(Supervised Fine-Tuning, SFT)语料库,以及一个4406行的多样化强化学习(Reinforcement Learning, RL)语料库。源媒体文件存放于[`ParaVT/ParaVT-Source`](https://huggingface.co/datasets/ParaVT/ParaVT-Source);两个仓库设计为可通过一步“物化”流程完成路径映射(详见[使用方法](#usage))。 ## 项目概述 ParaVT是一个面向长视频理解的多智能体框架,通过**PARA-GRPO**(可解析性锚定与比例门控强化学习优化器,Parseability-Anchored and Ratio-gAted GRPO)进行后训练。本数据集正是用于训练[`ParaVT/ParaVT-8B`](https://huggingface.co/ParaVT/ParaVT-8B)模型及其冷启动初始化模型[`mwxely/ParaVT-8B-SFT`](https://huggingface.co/mwxely/ParaVT-8B-SFT)的精准训练语料库。 ## 路径清理 出于隐私保护原因,Parquet文件内的媒体绝对路径已被替换为相对占位符路径,这些路径对应四个虚拟根目录: | 占位符前缀 | 映射路径(位于`ParaVT-Source/<sentinel>/`下) | |---|---| | `longvt_source/` | 各来源的LongVT训练视频存档(`videor1_*`、`longvideoreason_*`、`geminicot_*`、`tvg_*`、`selftrace_*`) | | `museg/charades/` | 用于时序定位训练的Charades-STA片段 | | `museg/et_instruct_164k/` | MuSeG的`et_instruct_164k`片段 | | `selfqa/` | 自主整理的开放式问答片段(混合了HACS与Ego4D来源的数据) | 可通过[`paravt.data.materialize`](https://github.com/EvolvingLMMs-Lab/ParaVT/blob/main/paravt/data/materialize.py)工具将占位符路径还原为绝对路径。 ## 数据集结构 ### `sft` 配置(冷启动模式;总计9.7万行) | 拆分集 | 样本数 | 数据来源 | |---|---|---| | `charades` | 12,408 | Charades-STA时序定位任务 | | `geminicot` | 4,881 | Gemini蒸馏得到的工具调用链 | | `longvideoreason` | 5,238 | 长视频推理任务 | | `museg` | 2,499 | MuSeG并行工具调用任务 | | `selftrace` | 15,349 | 自主蒸馏得到的交错式多模态工具思维链(Multimodal Chain-of-Tool-Thought) | | `tvg` | 6,393 | 时序视频定位任务 | | `videor1` | 50,000 | Video-R1子集 | ### `rl` 配置(共4406行) | 字段 | 取值 | |---|---| | `data_source` 混合来源 | `videor1_mcq`(1600条) + `hacs` 开放式问答(OE,1439条) + `charades_tvg`(1200条) + `ego4d_naq` 开放式问答(OE,167条) | | 奖励指标 | 多项选择精确匹配率、开放式问答F1值、时序交并比(Intersection over Union, IoU) | | 数据格式 | `prompt` / `videos` / `reward_model` / `extra_info`(兼容`AReaL`训练框架) | ## 使用方法 bash # 1. 下载Parquet数据文件(约200 MB) huggingface-cli download ParaVT/ParaVT-Parquet --repo-type dataset --local-dir ./paravt-parquet # 2. 下载源视频与图像文件,并将所有压缩包解压至同一根目录。 # 每个压缩包内的文件带有完整的占位符路径(例如 `longvt_source/videor1_7/...`), # 因此解压目标需为顶级根目录。 huggingface-cli download ParaVT/ParaVT-Source --repo-type dataset --local-dir ./paravt-source ( cd ./paravt-source && find . -name "*.zip" -exec unzip -q -o -d . {} ; ) # 3. 将占位符路径转换为绝对 file:// URI(一次性完成) python -m paravt.data.materialize --root ./paravt-source --parquet-dir ./paravt-parquet --output-dir ./paravt-parquet-materialized 物化后的Parquet文件可直接用于[ParaVT/paravt/sft](https://github.com/EvolvingLMMs-Lab/ParaVT/tree/main/paravt/sft)与[ParaVT/paravt/rl](https://github.com/EvolvingLMMs-Lab/ParaVT/tree/main/paravt/rl)中提供的`lmms-engine`监督微调脚本与`AReaL`强化学习脚本。若需通过`datasets`库以编程方式访问数据: python from datasets import load_dataset sft_videor1 = load_dataset("ParaVT/ParaVT-Parquet", "sft", split="videor1") rl_train = load_dataset("ParaVT/ParaVT-Parquet", "rl", split="train") (若需读取视频,请先执行`materialize`流程;原始下载的Parquet文件仅包含占位符路径。) ## 引用 ### 论文标题 ParaVT:破解智能体视频强化学习中并行工具使用的工具先验悖论 bibtex @misc{yang2026paravt, title={{ParaVT}: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning}, author={Zuhao Yang and Kaichen Zhang and Sudong Wang and Keming Wu and Zhongyu Yang and Bo Li and Xiaojuan Qi and Shijian Lu and Xingxuan Li and Lidong Bing}, year={2026}, eprint={2605.20342}, archivePrefix={arXiv}, primaryClass={cs.CV} } ## 致谢 本SFT语料库复用了[LongVT](https://github.com/EvolvingLMMs-Lab/LongVT)训练数据的子集([`longvideotool/LongVT-Parquet`](https://huggingface.co/datasets/longvideotool/LongVT-Parquet));感谢LongVT项目团队发布清理后的数据集。MuSeG、Charades-STA、HACS与Ego4D源片段均归属于其各自的原始出版物。



