DataClaw-val
收藏数据链接:
官方服务:
资源简介:
DataClaw-val是第一个专门用于数据精炼的基准测试,通过JSON有效性和模式感知的字段/语义/序列指标对输出进行评分。
DataClaw-val is the first benchmark specifically dedicated to data refinement, which scores model outputs using JSON validity and pattern-aware field, semantic, and sequence metrics.
创建时间:
2026-06-23
原始信息汇总
数据集概述:DataClaw0
DataClaw0 是一个专注于从原始多模态流中智能提炼和结构化数据的代理式数据集。其核心目标是通过可学习的高阶数据处理能力,将高熵的原始多模态流(如长视频、GUI轨迹、具身动作序列、编辑序列等)转化为密集、可验证、面向特定应用的监督信号。
核心方法与创新
- 范式转变:从依赖启发式规则或通用视觉语言模型的被动标注,转向代理式数据裁剪——根据用户意图或下游任务目标,由9B参数的裁剪代理主动过滤冗余信息并重组数据。
- 两阶段流水线:
- 自底向上的事实锚点:提取确定性事实作为基础。
- 自顶向下的语义合成:在事实锚点基础上进行生成式语义合成,生成大规模数据集。
- 训练策略:将监督微调(SFT)与基于规则的分组相对策略优化(GRPO)相结合,实现对复杂裁剪意图的鲁棒对齐。
- 部署范式:提供两种配置——统一的全知模型(DataClaw-O) 或由多个领域专家组成的专家面板(DataClaw-E)。
数据集规模与领域
数据集涵盖五个核心物理与数字领域:
- 日常生活
- 教育
- GUI代理
- 具身智能
- AIGC(人工智能生成内容)
关键性能指标
- DataClaw-val基准:首个专注于数据精炼质量的基准,通过JSON有效性、模式感知的字段/语义/序列指标进行评估。
- 下游任务验证:
- GUI导航(AgentNet):在SSR/TSR指标上,DataClaw-SFT优于Gemini-3.1-Pro-SFT。
- 动作视频生成(Ego4D):DataClaw在FVD和Contact mAP指标上表现更优。
- 时空VQA(ReMoT):在总体准确率上,DataClaw-SFT优于基线。
发布计划
- 已发布:v1论文(arXiv)和项目页面(包含定性案例)。
- 即将发布(论文接收后):完整代码(SFT + GRPO训练与推理)、模型权重(DataClaw-O与DataClaw-E)、数据集(五个领域)、DataClaw-val基准与评估脚本、下游SFT任务复现指南。
搜集汇总
数据集介绍

构建方式
DataClaw-val基准数据集专为评估多模态数据精炼质量而设计,其构建基于DataClaw框架的核心理念——从原始流中主动裁剪结构化监督信号。该基准覆盖日常生活、教育、GUI代理、具身智能和AIGC五大核心物理与数字领域,通过自底向上的事实锚点提取与自顶向下的语义合成两阶段流水线,将来自长视频、GUI轨迹、具身轨迹和编辑序列的冗余信号转化为密集、可验证且面向特定应用的标注。每个样本均以JSON格式输出,确保结构化的评估标准得以统一应用。
特点
DataClaw-val作为首个专门针对数据精炼任务的基准,其独特之处在于采用三项分层指标全面评估结构化输出质量:Field评分检验JSON结构有效性,Semantic评分衡量语义准确度,Sequence评分捕捉时序一致性。该基准在五领域数据集上展现出强大的判别力,实验表明,DataClaw-E专家路由配置在Field和Semantic指标上媲美Gemini-3.1-Pro与GPT-4o等前沿视觉语言模型,而在下游任务如GUI导航、动作视频生成和时空视频问答中,DataClaw精炼的数据在相同预算下持续超越通用模型生成的标注,验证了其作为精炼质量终极试金石的可靠性。
使用方法
DataClaw-val的使用遵循标准化的评估流程。研究者需将待评估的数据精炼模型或系统的输出以JSON格式提交,而后利用配套的评估脚本计算Field、Semantic和Sequence三项指标得分。该基准提供了包含五领域标注的黄金标准数据集作为参考,支持与Gemini-3.1-Pro和GPT-4o等基线模型的直接对比。代码、模型权重及评估脚本将在论文接收后随DataClaw框架一同开源,届时可通过GitHub仓库获取完整的使用指南与复现配方,确保下游SFT任务的实验可重复性。
背景与挑战
背景概述
随着多模态数据的爆炸式增长,原始流中蕴含的信息通常以高度无序的状态存在,即所谓的“高数据熵”,这严重阻碍了高效的人类知识获取与高质量的人工智能后训练。现有被动式标注范式过度依赖启发式规则或通用视觉语言模型,不仅成本高昂且模式固化,难以发掘原始数据中深层的过程逻辑。在此背景下,由Wan等人于2026年提出的DataClaw项目应运而生,其核心思想是将数据处理提升为一种可学习的高阶能力,通过智能体驱动的数据定制范式,实现对长视频、图形界面轨迹、具身交互序列和编辑序列等原始多模态流的主动筛选与结构化重组。DataClaw-val作为该工作专属的基准数据集,专为评估数据精炼质量而设计,引入基于JSON有效性与模式感知的多维度评分体系,为多模态数据处理领域树立了全新的评测标尺。
当前挑战
DataClaw-val所面临的挑战主要集中在两个层面。在领域问题层面,它致力于解决原始多模态流中数据处理的高成本与低效性难题,现有方法难以自动从高噪声、高冗余的流式数据中提取出结构化的、可验证的监督信号,尤其缺乏一个统一且可量化的基准来衡量不同精炼方案在字段准确率、语义一致性和序列逻辑性上的表现。在数据集构建层面,挑战则体现为如何设计一套能够覆盖日常生活、教育、GUI代理、具身智能及AIGC五大核心领域数据特性的评测方案,既要保证JSON格式的严格有效性与模式契合度,又需兼顾语义层面的深度对齐与序列层面的逻辑流畅性,同时还要规避因单一指标带来的评价偏颇,确保基准能够真实反映智能体在多样化数据精炼任务上的综合能力。
常用场景
经典使用场景
DataClaw-val是首个专门面向多模态数据精炼与结构化质量评估的基准数据集,其经典使用场景在于衡量AI代理对原始流式数据(如长视频、GUI轨迹、具身交互序列及编辑过程)进行意图驱动的裁剪与重组能力。研究者借助该数据集,可系统性地评测模型输出的JSON结构有效性、字段完整性、语义保真度以及时序一致性,从而替代以往依赖人工规则或通用视觉语言模型的高成本且单调的被动标注模式。
解决学术问题
DataClaw-val解决了多模态数据处理中“数据熵”过高且缺乏可量化评估标准的学术难题。传统方法难以深度挖掘原始数据中嵌入的程序性逻辑与深层语义,而该基准通过引入基于事实锚点的自底向上提取与自顶向下语义合成框架,使得对复杂数据精炼任务的质量评估成为可能。其意义在于为Agent驱动的数据编排提供客观可复现的评判标准,推动了后训练阶段的高效知识获取范式革新。
衍生相关工作
DataClaw-val衍生了一系列重要工作,包括联合监督微调与规则驱动GRPO策略协同的DataClaw-9B精炼代理,以及统一Omni模型和路由专家面板两种部署范式。此外,该基准催生了针对多模态数据熵与适配性研究的系统性分析,例如在Ego4D动作视频生成、AgentNet GUI导航等下游任务中验证声场与语义多样性对模型泛化的影响,并在论文中呈现了完整的消融实验与尺度律曲线。
以上内容由遇见数据集搜集并总结生成



