遇见数据集

joy-qualified-cy

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是 JOY 审查平台中审查者 `cy` 标记为“合格”的样本快照,生成于 2026-09-04T20:16:02+00:00。数据集包含 597 个样本(共计 1.69 GiB 的 MP4 视频),涵盖三个任务类别:JOY-C(问答,QA,111 个样本)、JOY-E(事件定位,Grounding,382 个样本)和 JOY-N(叙述,Narration,104 个样本)。数据以 JSONL 格式存储元数据,并配有对应视频文件。所有自然语言文本均为英文,其中 `question_text` 和 `help_points[].content` 字段由原始中文翻译而来,保留了原对话式语域(如长指令、体育评论风格),用于测试指令提取、触发时机、弃权行为和输出格式遵从性。字段 `task_name_zh` 保留原始中文标签(“问答”、“定位”、“解说”),`task_name` 为英文标签。数据集包含对原始注释的少量修正:修复了六条被截断的 JOY-E 问题,移除了一条 JOY-N 样本(问题与注释不匹配),并处理了一条 JOY-N 中的中英拼接片段。数据集中的“合格”状态为审查者特定平台状态,不保证注释完全无误,可能包含模型辅助审查决策。用户需自行检查原始视频来源的许可条款,数据集不施加新的统一许可。

This dataset is a snapshot of samples labeled as qualified by reviewer cy in the JOY review platform, generated on 2026-09-04T20:16:02+00:00. It contains 597 samples (totaling 1.69 GiB of MP4 videos) across three task categories: JOY-C (Question Answering, QA, 111 samples), JOY-E (Event Grounding, 382 samples), and JOY-N (Narration, 104 samples). Data is stored in JSONL format for metadata, accompanied by corresponding video files. All natural language text is in English, with the `question_text` and `help_points[].content` fields translated from original Chinese, retaining the original conversational register (e.g., long instructions, sports commentary style), designed to test instruction extraction, trigger timing, abstention behavior, and output format compliance. The field `task_name_zh` retains the original Chinese labels ("问答", "定位", "解说"), and `task_name` contains English labels. The dataset includes minor corrections to original annotations: fixing six truncated JOY-E questions, removing one JOY-N sample (question-annotation mismatch), and handling one JOY-N instance with mixed Chinese-English segments. The qualified status is platform-specific for the reviewer and does not guarantee annotation correctness; it may involve model-assisted review decisions. Users should check the license terms of original video sources; the dataset imposes no new unified license.

创建时间:
2026-09-05
原始信息汇总

数据集概述

该数据集为 JOY 审查平台上标注为 qualified(合格)样本的快照,由审查员 cy 筛选,导出时间为 2026-09-04T20:16:02+00:00,共包含 597 个样本,对应 1.69 GiB 的 MP4 视频

数据集配置与任务类型

数据集包含三个子配置,分别对应不同的视频理解任务:

配置名 任务类型 task_name 样本数
joy_c 视频问答 QA 111
joy_e 事件定位 Grounding 382
joy_n 视频解说 Narration 104

文件结构与内容

  • 元数据文件data/joy_c.jsonldata/joy_e.jsonldata/joy_n.jsonl,每行包含用户问题、问题时间、所有标注帮助点及其最佳时间、来源元数据、相对视频路径、字节大小、SHA-256 哈希及平台审查快照信息。
  • 视频目录videos/JOY-C/videos/JOY-E/videos/JOY-N/,存放对应的 MP4 文件。
  • 清单文件MANIFEST.json,记录数量、大小、哈希、来源和导出时间戳。

语言与文本处理

  • 所有自然语言文本均为 英文,其中 question_texthelp_points[].content 字段已由中文翻译为英文。
  • 翻译过程保留了原文的对话语气(如 joy_e 中的长指令与口语化表达、joy_n 中的体育赛事解说风格),以保持对指令提取、触发时机、弃权行为和输出格式遵循度的测试意图。
  • task_name_zh 保留原始中文标签(问答/定位/解说),task_name 为英文标签(QA/Grounding/Narration)。
  • 其他字段(如 help_points[].indexhelp_points[].best_time)与原始导出逐字节一致。

数据修正说明

与原始导出相比,数据进行了以下三项修正:

  1. 删除了 6 个 joy_e 问题 中未完整的尾部指令(在句子边界处截断),其余约束和帮助点保持不变。
  2. 移除了 1 个 joy_n 样本,因其问题与对应的帮助点所描述的视频内容不一致(问题关于“跑步或传球序列”,而帮助点标注的是女子足球广播开场),因此 joy_n 实际样本数为 104。
  3. 修正了一个 joy_n 帮助点中英文片段混入中文的情况,该问题在翻译过程中自动解决。

审查与局限性

  • “qualified” 是平台特定审查状态,不代表所有注释均无错误,数据可能包含模型辅助审查的决策。
  • 不包含被拒绝、未审查、人工复审或错误记录。

许可证

  • 数据集未设置统一的整体许可证,每个样本保留其来源平台的 license 字段值。用户在再分发或商业使用前,需自行核查原始来源条款。
搜集汇总
数据集介绍
joy-qualified-cy 数据集图片
构建方式
本数据集源自JOY评审平台,由评审员cy筛选出标记为qualified的样本,于2026年9月4日生成快照,共含597个样本,对应1.69 GiB的MP4视频。数据按任务类别划分为三个配置:joy_c(问答)、joy_e(事件定位)和joy_n(叙述),分别包含111、382和104个样本。每条元数据记录了用户问题、提问时间、所有注释帮助点及其最佳时间、源元数据、视频相对路径、字节大小、SHA-256哈希及平台评审快照。原始注释以中文撰写,其中question_text和help_points[].content字段已英译,并保留对话语体,以考验模型对指令提取、触发时机、弃权行为及输出格式遵循的能力。此外,三处源注释缺陷得到修正,包括截断问题、移除一个不匹配样本及修复中英混杂片段。
使用方法
使用者可通过HuggingFace数据集加载API直接引用三个配置,例如使用load_dataset('joy-qualified-cy', name='joy_c')等。每个配置的数据文件为JSONL格式,与对应的视频文件存储于videos/目录下,并配套MANIFEST.json文件,其中包含样本计数、大小、哈希及导出时间等关键校验信息,便于数据完整性和溯源验证。针对不同任务类型,研究者可设计相应评估管线:对于QA任务,可度量答案与问题语义的匹配度;对于Grounding任务,可比较预测时间戳与best_time字段的偏差;对于Narration任务,则需既评估叙述内容准确性又评估时间对齐精度。值得注意的是,由于文本已英译,原始中文标签task_name_zh仍被保留,以便与源平台追溯对照。用户在使用前应依据各样本的原始许可条款确认合规性,数据集本身未附加新的统一授权。
背景与挑战
背景概述
JOY-qualified-cy数据集源于JOY评审平台,由评审员cy于2026年9月4日筛选并导出,涵盖597个视频样本,总容量1.69 GiB,细分为QA、事件定位与连续解说三大类任务。该数据集的核心研究问题聚焦于视频理解中的多模态推理、时间定位及实时描述能力,旨在为视频问答与时间戳预测提供细粒度、高难度的评估基准。其应用横跨智能监控、视频检索与人机交互等前沿领域,通过对长对话式指令、规避性回答等复杂场景的收录,显著提升了模型在真实世界视频理解任务中的鲁棒性测试标准,对该领域的发展具有重要的推动作用。
当前挑战
该数据集所应对的领域挑战包括多约束指令的理解与执行、模糊时间点的精准定位、以及输出格式的严格遵循,尤其在长视频中需处理冗余信息和干扰事件。构建过程中遭遇了多重困难:部分源标注存在指令截断,需谨慎修复而非简单舍弃;发现一个样本的问答内容与注解严重不符,必须剔除以保证数据的语义一致性;面对中英双语混杂及口语化表达,翻译须保留原始对话风格,避免破坏其评测意图。此外,数据许可标注分散且无统一授权,要求使用者自行核验来源条款,但这为负责任的数据再分发与合规商用带来了隐性挑战。
常用场景
经典使用场景
JOY-qualified-cy数据集作为视频理解领域的高质量标注资源,其核心经典使用场景聚焦于三项关键任务:视觉问答(VideoQA)、事件时间定位(Temporal Grounding)和连续叙述(Dense Video Captioning)。该数据集精心筛选597个经过评审专家把关的视频样本,覆盖体育转播、日常活动等多类动态场景,为研究者提供了在真实、复杂且带有口语化指令的视频环境下的基准测试平台。借助其中包含的用户问题、注释帮助点及其对应时间戳,研究者可深入评估多模态模型在理解视频内容、精准捕捉事件发生时刻以及生成时间对齐描述上的能力,从而推动视频理解技术从粗粒度识别向细粒度语义推理的演进。
解决学术问题
该数据集精准回应了当前视频理解研究面临的核心挑战:如何在真实交互场景中处理富含隐含约束、口语化表达和歧义性的用户指令。通过保留对话式提问的原始语境和多样化的任务导向指令,数据集促使模型不仅要理解视觉内容,还需掌握指令中隐含的触发时机、否定条件及输出格式要求,有力促进了指令跟随、弃权行为决策等关键能力的学术探索。其精细的时序标注与高质量叙述文本,为研究视频-语言时序对齐、语义角色解析以及长视频中的事件边界检测提供了难得的实验素材,填补了现有数据集在指令复杂度和注释精细度上的不足,对建立更具鲁棒性和泛化能力的视频理解模型具有深远意义。
实际应用
在实际应用层面,JOY-qualified-cy数据集所驱动的模型技术可无缝迁移至众多工业级场景。例如,在智能体育直播中,模型能基于用户的即时提问(如“刚才那个进球前发生了什么”)实现自动事件回放与实时解说;在视频内容审核与检索场景中,可辅助快速定位特定事件的精确发生时刻,大幅提高素材检索效率;在辅助视障人士的视频内容理解中,能通过生成时间对齐的详细叙述,提供更丰富的环境信息。此外,多轮对话式的查询能力亦可用于开发智能视频助理,实时响应用户对监控录像或教学视频的自然语言询问,推动视频交互从被动浏览迈向主动理解,提升用户体验与信息获取的便捷性。
数据集最近研究
最新研究方向
该数据集聚焦于视频理解领域的前沿研究,尤其关注基于时间的事件定位、连续视觉叙事及视频问答任务。其样本经过精细审查,涵盖长尾、多约束指令,强调模型的指令提取、触发时机、拒答行为及输出格式遵守能力。当前研究方向包括:利用此类高质量、细粒度标注数据训练和评估多模态大模型在复杂时序场景中的推理与生成能力;探索对话式指令(如口语化、带情绪表达)对模型性能的影响;以及研究跨语言(中译英)数据对于模型泛化能力的提升。该数据集的发布支持了视频理解从简单描述向动态事件推理和时间感知对话的演进,推动构建更贴近真实用户交互的视频智能系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务