StoryReasoning Dataset
收藏资源简介:
StoryReasoning数据集包含4,178个故事,这些故事来源于52,016张电影图像,具有结构化的场景分析、基础故事和一致的角色引用。
The StoryReasoning Dataset comprises 4,178 stories derived from 52,016 movie stills, featuring structured scene analysis, foundational narratives, and consistent character references.
StoryReasoning 数据集概述
数据集简介
StoryReasoning 是一个用于创建连贯视觉故事的框架和数据集,专注于解决多帧视觉叙事中的关键挑战:
- 跨帧保持角色和对象身份一致性
- 将文本元素与视觉实体关联
- 减少指代幻觉
- 从图像序列构建连贯叙事
核心特性
- 跨帧一致性:通过视觉相似性和面部识别保持角色和对象身份一致性
- 思维链推理:显式建模角色、对象、场景和叙事结构
- 基础叙事:使用专用XML标签将叙事元素直接链接到视觉实体
- 减少幻觉:相比未微调的基础模型减少12.3%的幻觉
数据集详情
- 包含4,178个故事
- 源自52,016张电影图像
- 提供结构化场景分析、基础故事和一致的角色引用
访问方式
- 数据集地址:https://huggingface.co/datasets/daniel3303/StoryReasoning
- 模型地址:https://huggingface.co/daniel3303/QwenStoryteller
模型信息
Qwen Storyteller是基于Qwen2.5-VL 7B微调的模型,专为基础视觉叙事设计,具备:
- 端到端对象检测
- 重识别功能
- 基础故事生成能力
输出格式
- 思维链分析 (
<think></think>标签):- 结构化分析表格(角色、对象、场景、叙事)
- 基础故事:
<gdi>:特定帧的图像标签<gdo>:角色和对象提及的实体引用标签<gda>:角色动作标签<gdl>:背景元素的位置/地标标签
引用信息
bibtex @misc{oliveira2025storyreasoningdatasetusingchainofthought, title={StoryReasoning Dataset: Using Chain-of-Thought for Scene Understanding and Grounded Story Generation}, author={Daniel A. P. Oliveira and David Martins de Matos}, year={2025}, eprint={2505.10292}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2505.10292}, }
联系方式
Daniel A. P. Oliveira (daniel.oliveira@inesc-id.pt)




