遇见数据集

FIFA World Cup Full-Match Video Dataset

收藏
github2026-06-09 更新2026-07-09 收录
官方服务:

资源简介:

该数据集提供经典FIFA世界杯比赛的YouTube全场比赛参考链接和结构化比赛注释。它不重新分发视频文件,而是存储YouTube视频ID和URL,并将每场比赛链接到结构化足球数据,包括比赛元数据、球队统计数据、阵容、阵型、文本事件时间线和赛前预测投票。数据集专为长格式体育视频研究设计,模型需要将完整的足球广播与结构化时间和比赛级证据连接起来。

This dataset provides YouTube full-match reference links and structured match annotations for classic FIFA World Cup matches. It does not redistribute any video files, but instead stores YouTube video IDs and URLs, and links each match to structured football data including match metadata, team statistics, lineups, formations, textual event timelines, and pre-match prediction votes. This dataset is specifically designed for long-form sports video research, where models need to connect complete football broadcasts with structured temporal and match-level evidence.

创建时间:
2026-06-09
原始信息汇总

数据集概述

该数据集为 FIFA World Cup Full-Match Video Dataset,旨在为长视频体育理解和多模态推理研究提供结构化支持。数据集不直接分发视频文件,而是提供 YouTube 全场比赛视频的引用以及对应的结构化比赛注释。

核心特性

  • 视频来源:引用自 YouTube 的 FIFA 世界杯全场比赛播放列表。
  • 数据构成:40 条索引视频记录,对应 40 个结构化的比赛文件夹。
  • 赛事覆盖:涵盖 7 届世界杯(1998 年法国至 2022 年卡塔尔),涉及 25 支国家队。
  • 比赛阶段:包括小组赛(20 场)、16 强赛(8 场)、四分之一决赛(5 场)、半决赛(2 场)和决赛(5 场)。
  • 事件数据:总事件时间线行数为 3,543 行,每场比赛事件行数在 4 到 465 行之间,平均为 88.6 行。
  • 统计字段:观察到 22 个球队级别的统计指标名称。

数据集结构

数据集根目录为 FIFA_World_Cup_Games/,其结构如下:

  • meta.jsonl:顶层视频/来源索引文件,每行是一个 JSON 对象,包含 video_idurltitleteamsworld_cupmatch_info_url 字段。
  • README.md:本说明文件。
  • images/:包含数据集的示例海报 poster.jpeg
  • games/:核心数据目录,包含所有结构化比赛文件夹。
    • 每个比赛文件夹命名格式为 YYYY-stage-TeamA-vs-TeamB,例如 2022-final-Argentina-vs-France
    • 每个文件夹内包含以下 5 个结构化 JSON 文件:
      • metadata.json:视频链接和比赛场馆元数据。
      • stats.json:球队级别的比赛统计数据。
      • events.json:文本事件时间线。
      • lineups.json:首发阵容、替补队员和阵型。
      • prediction.json:赛前预测投票结果。
  • poster_assets/:包含用于构建海报的 YouTube 缩略图。

数据文件详情

meta.jsonl

字段 类型 描述
video_id string YouTube 视频 ID
url string YouTube 观看链接
title string 原始或轻度清洗后的视频标题
teams list[string] 比赛中的球队
world_cup string 世界杯届次(例如 2022 Qatar
match_info_url string 关联的 Soccer365 比赛页面链接

metadata.json

字段 类型 描述
source_video.id string YouTube 视频 ID
source_video.url string YouTube 观看链接
source_video.title string 清洗后的比赛标题
source_video.date string 比赛日期(格式 YYYY-MM-DD
match_info.home_team string 主场/第一支球队
match_info.away_team string 客场/第二支球队
match_info.stage string 比赛阶段
match_info.datetime string 来源时间字符串
match_info.stadium string 体育场名称
match_info.location string 体育场所在城市与国家
match_info.temperature string 温度(如可用)
match_info.weather string 天气(如可用)
match_info.viewers string 观众人数
match_info.referees list[string] 裁判团队(如可用)
soccer365_url string 来源比赛页面链接

stats.json

文件以统计指标名称为顶层键,每个键映射一个球队名称到具体数值的字典。常用统计指标包括:期望进球(xG)、射门、射正、射门被封堵、扑救、控球率、角球、犯规、越位、黄牌、红牌、进攻、危险进攻、传球、传球成功率、任意球、界外球、传中、抢断等。不同比赛的统计字段集可能有所不同。

events.json

包含一个按时间顺序排列的事件列表,每个事件包含 minute(比赛分钟数)、type(事件类型代码,如 whistlegoalsubstycrc)和 description(可读的事件描述文本)字段。

lineups.json

以球队名称为键,每个球队对象包含 starting(首发球员列表)和 substitutes(替补球员列表),以及全局的 formation(阵型信息,如 4-3-3)。每个球员对象包含 number(球衣号码)和 name(球员姓名)字段。

prediction.json

包含赛前用户预测投票结果,包括各队获胜的百分比和票数,以及平局的百分比和票数。

数据质量说明

  • 数据集链接了公开的 YouTube 全场比赛视频与 Soccer365 结构化比赛页面。
  • events.json 是基于来源页面的文本时间线,并非帧级别的官方追踪数据。
  • 事件和统计数据的详细程度因比赛年份而异,近期比赛数据更丰富。
  • 每组结构化比赛文件夹均已与 meta.jsonl 中的 YouTube 视频 ID、Soccer365 链接和参赛球队进行核对。
  • 球队顺序遵循来源页面,不应始终视为 FIFA 的官方主客场安排。

应用场景

该数据集适用于以下研究领域:

  • 长视频理解:全场比赛推理、长上下文视频语言建模、事件时间定位。
  • 多模态问答:结合视频、统计数据和事件时间线的比赛级问答。
  • 视觉检索:基于文本的比赛时刻检索、跨模态检索。
  • 时序预测:下一事件预测、比分和势头建模、赛前期望分析。
  • 体育分析:跨届赛事球队统计对比、阵型和阵容分析、比赛强度分析。
搜集汇总
数据集介绍
构建方式
该数据集的构建依托于YouTube官方世界杯完整比赛播放列表,通过多阶段爬取与清洗流程实现。研究团队首先从指定播放列表中提取视频ID、URL及标题信息,并从中解析出参赛队伍与世界杯届次;随后将解析后的队伍名称与届次进行标准化处理,例如将‘Korea Republic’统一为‘South Korea’。在此基础上,每一条视频记录被链接至Soccer365平台的对应比赛页面,进而爬取包括比赛元数据、球队统计、阵容阵型、文字事件时间线以及赛前预测投票在内的结构化数据。最终,所有数据以每场比赛独立文件夹的形式组织,并经过严格的文件完整性校验,确保每个文件夹均包含完整的五个JSON文件。
特点
该数据集的核心特点在于其将完整的YouTube比赛视频引用与多维度结构化比赛数据进行了深度关联。数据涵盖从1998年法国世界杯至2022年卡塔尔世界杯共7届赛事,涉及40场经典对决,并覆盖小组赛至决赛的各个阶段。每场比赛均提供元数据、球队统计、阵容与阵型信息、详细文字事件时间线及赛前预测投票结果,总事件行数达3543条。尤为值得一提的是,数据集保留了队伍级别的22项统计指标,且通过标准化文件夹命名与统一的数据模式,极大便利了跨比赛、跨届次的横向比较与分析。
使用方法
使用者可通过Hugging Face数据集库或本地文件路径快速加载数据。首先利用`datasets`库加载`meta.jsonl`文件以获取视频索引,随后依据比赛文件夹名称读取对应的`metadata.json`、`stats.json`、`events.json`、`lineups.json`及`prediction.json`文件。由于数据集不直接包含视频文件,研究者需通过`meta.jsonl`或`metadata.json`中提供的YouTube `video_id`或`url`字段,配合`yt-dlp`等工具独立下载视频。该数据集适用于长视频理解、多模态问答、视觉检索、时序预测及体育分析等研究场景,为连接视频内容与结构化比赛证据提供了坚实的桥梁。
背景与挑战
背景概述
在视频理解研究领域,长序列视频分析与多模态推理长期面临数据匮乏的窘境,尤其是针对体育赛事这类兼具复杂时空结构、丰富语义信息与动态叙事逻辑的场景。为此,研究团队于近期构建了FIFA World Cup Full-Match Video Dataset,该数据集由独立研究者主导开发,覆盖自1998年至2022年间七届世界杯共40场经典完整赛事,囊括小组赛至决赛全部阶段。其核心研究问题在于通过整合YouTube完整比赛视频引用、结构化的事件时间线、球队统计、阵容阵型及赛前预测投票等多模态数据,构建一个统一基准以支撑长视频推理、问答、检索与预测等任务。该数据集不仅为体育视频智能分析提供了标准化的评估平台,更对推动体育科学、时序建模与跨模态学习的交叉研究产生了深远影响。
当前挑战
该数据集所解决的领域问题核心在于长格式体育视频理解中的多模态关联与时空定位挑战,即如何跨越数十分钟乃至数小时的比赛视频,准确链接视频画面与结构化事件描述、统计信息及阵型数据,并实现对关键节点(如进球、换人、犯规)的时序定位。此外,构建过程中亦面临多重挑战:其一,从YouTube非结构化的比赛标题与元数据中自动解析并统一球队名称、赛事届次与阶段,须处理别名映射与版本歧义;其二,外部比赛页面的链接依赖人工校验与规则匹配,确保每个视频记录与Soccer365页面严格对应,难度体现在跨语言、跨届次的非规范化数据源衔接;其三,结构化数据爬取受限于不同届次比赛页面的字段差异,导致事件覆盖率、统计字段完整性随比赛年份变化,历史比赛的统计信息缺失与文本事件粒度稀疏问题尤为突出,最终生成的数据质量高度依赖于源页面的数据丰度与一致性。
常用场景
经典使用场景
在长时域体育视频理解这一前沿研究领域,FIFA World Cup Full-Match Video Dataset为学界提供了弥足珍贵的数据基石。该数据集精心整合了自1998年法国世界杯至2022年卡塔尔世界杯共七届赛事的40场完整比赛视频索引,每一场比赛均配备详尽的元数据、双方阵容阵型、时序化事件文本、团队级统计指标以及赛前民意预测结果。研究者可借助这一结构化资源,深入探索全场比赛视频的推理建模,例如对进球、换人、犯规及罚牌等关键事件的时域定位,对加时赛与点球大战等特殊阶段的语义理解,以及在超长视频语境下进行连贯的多模态语言建模。该数据集天然回避了视频文件的直接分发,转而以YouTube视频ID和URL为媒介,兼顾了学术研究的灵活性与版权合规性。
解决学术问题
该数据集系统地回应了体育视频分析中数据孤岛与结构化缺失的长期困扰。此前,多数公开数据集的赛事覆盖范围有限或只提供短视频片段,难以支撑需要全局视角的全场比赛理解任务;而FIFA World Cup Full-Match Video Dataset不仅覆盖了从小组赛到决赛的完整赛程,还提供了每场比赛统一的五类结构化文件,包括预判演进的赛前舆论场、动态变换的阵型布局、以及逐分钟呈现的事件时间线。基于这些信息,研究者得以攻克视频与统计数据跨模态对齐的难题,实现多跳问答,例如结合阵容数据与射门统计来追问某位球员的攻防贡献,或依据事件序列与赛前预测的偏差来评估意外事件的影响。该数据集亦为时序预测提供了优质试验田,支持从历史事件序列中学习比赛节奏与领先变化的内在规律,从而推动体育人工智能在更深层次的认知推理上取得突破。
衍生相关工作
围绕FIFA World Cup Full-Match Video Dataset衍生的经典工作已初步勾勒出体育视频分析的新范式。在长视频理解方向上,研究者基于该数据集提出了结合事件时间线预训练与层级化时序注意力机制的模型架构,有效提升了全场比赛视频中罕见事件的检测精度。在多模态问答领域,一项代表性工作构建了融合视频帧、文本事件与统计表格的知识图谱,使问答系统能够回答“阿根廷在决赛中比法国多出了多少脚射正”这类需要跨源信息整合的复杂问题。视觉检索方面,有学者利用CLIP风格的对比学习策略,实现了从事件文本描述到对应视频片段的跨模态检索,在召回率上显著超越传统基于关键词的基线方法。时序预测同时催生了用于预测下一进攻序列的对手建模方法,以及基于赛前民意分布与实际结果偏差的异常比赛检测框架。这些工作充分验证了该数据集作为体育人工智能研究基础设施的可靠性与启发性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务