AutoCaption
收藏资源简介:
这个数据集包含了两个子集,用于不同的视频理解任务训练和评估。sft_data 子集旨在为视频语言模型的监督微调提供训练数据,包含9419条记录。每个记录包含视频文件名和对话列表,对话列表中包含每个对话回合的发言者和消息内容。mcts_vcb 子集用于MCTS VCB评估,但目前没有记录。每个记录包含视频文件名和关键点列表,关键点列表中包含关键点描述、分类和阈值标准。
This dataset contains two subsets for training and evaluating distinct video understanding tasks. The sft_data subset is designed to provide training data for supervised fine-tuning of video-language models, consisting of 9419 records. Each record includes the video filename and a dialogue list, which contains the speaker and message content for each dialogue turn. The mcts_vcb subset is used for MCTS VCB evaluation, but currently has no records. Each record includes the video filename and a key point list, which contains key point descriptions, classifications and threshold criteria.
数据集概述:AutoCaption
基本信息
- 数据集名称: AutoCaption
- 许可证: Apache-2.0
- 语言: 英语 (en)
- 标签: 视频 (video)、对话 (conversations)、MCTS、多模态 (multimodal)
- 规模: 1K < n < 10K
- 任务类别: 文本生成 (text-generation)、视频分类 (video-classification)
- 总样本数: 11,184
子集概览
| 子集名称 | 分割 | 样本数 | 描述 |
|---|---|---|---|
sft_data |
train | 9,419 | 用于监督微调的数据 |
mcts_vcb |
test | 1,765 | MCTS-VCB评估基准 |
数据集结构
sft_data (train)
- video_name (string): 对应视频的文件名
- conversations (list): 人机对话样本,结构如下:
- from (string)
- value (string)
mcts_vcb (test)
- video_name (string): 对应视频的文件名
- kp_list (list of struct): 视频关键点列表,结构如下:
- text (string): 描述视频中的关键点
- category (string): 预定义的五个类别之一
- threshold (string): 余弦相似度阈值
加载方式
python from datasets import load_dataset
加载特定子集和分割
sft_data_dataset = load_dataset("HasuerYu/AutoCaption", "sft_data", split="train") mcts_vcb_dataset = load_dataset("HasuerYu/AutoCaption", "mcts_vcb", split="test")
加载所有子集
datasets = { sft_data: load_dataset("HasuerYu/AutoCaption", "sft_data", split="train"), mcts_vcb: load_dataset("HasuerYu/AutoCaption", "mcts_vcb", split="test") }
相关资源
- 论文: Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
- GitHub: AutoCaption
引用
bibtex @dataset{HasuerYu_AutoCaption, title = {HasuerYu/AutoCaption}, url = {https://huggingface.co/datasets/HasuerYu/AutoCaption}, year = {2025} }




