V2C (Video-to-Commonsense)
收藏OpenXLab2026-04-18 收录
官方服务:
资源简介:
我们展示了直接从视频中生成常识字幕的第一项工作,以描述意图、效果和属性等潜在方面。我们提出了一个新的数据集“视频到常识(V2C)”,其中包含约 9k 个人类代理执行各种动作的视频,并用 3 种常识描述进行注释。
提供机构:
OpenDataLab创建时间:
2022-06-07

我们展示了直接从视频中生成常识字幕的第一项工作,以描述意图、效果和属性等潜在方面。我们提出了一个新的数据集“视频到常识(V2C)”,其中包含约 9k 个人类代理执行各种动作的视频,并用 3 种常识描述进行注释。