遇见数据集

sport-statistics

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

该数据集是一个足球比赛数据集合,涵盖比赛级、球队级和球员级信息,旨在支持比赛结果预测和预测市场建模研究,如最终比分、半场比分、角球、大小球、首球时间等。数据收集自多个来源,以JSON Lines格式提供,每个JSON对象一行。数据集包含多个文件:matches.jsonl(1140行,每场比赛一条记录,包含比分、开球时间、球队ID等字段)、match_stats.jsonl(760行,每场比赛的球队级统计数据,分为总体、上半场和下半场,指标包括预期进球(xG)、控球率、射门、传球、犯规等)、match_lineup.jsonl(47837行,每行对应一个(比赛,球员)组合,包含球员阵容、位置、是否首发等信息)、match_player_stats.jsonl(442行,每场比赛的球员级统计数据,覆盖约103个指标,如预期进球、射门、传球准确率等,但仅覆盖部分顶级联赛和2024-25赛季后的比赛,分布不均)。此外,还包括维度表:players.jsonl(1296名球员)、teams.jsonl(23支球队)、leagues.jsonl(1个联赛)、tournaments.jsonl(115个赛季)、tournament_stages.jsonl(115个阶段)和sports.jsonl(1个运动)。数据质量注意事项:match_stats和match_player_stats并非覆盖所有比赛;比分字段类型不一致(字符串或整数);时间戳为Unix秒;指标命名在match_stats和match_player_stats中不一致(snake_case vs SCREAMING_SNAKE_CASE)。建议在使用前进行字段分布检查和校准。数据集许可证为CC-BY-NC-4.0,仅限非商业用途,需注明出处。

This dataset is a collection of football match data covering match-level, team-level, and player-level information, designed to support research on match outcome prediction and prediction market modeling, such as final score, half-time score, corners, over/under, time of first goal, etc. The data is collected from multiple sources and provided in JSON Lines format, with one JSON object per line. The dataset includes multiple files: matches.jsonl (1140 rows, one record per match, containing fields such as score, kickoff time, team IDs), match_stats.jsonl (760 rows, team-level statistics per match, divided into overall, first half, and second half, with metrics including expected goals (xG), possession, shots, passes, fouls, etc.), match_lineup.jsonl (47837 rows, each row corresponds to a (match, player) combination, containing player lineup, position, whether starting, etc.), match_player_stats.jsonl (442 rows, player-level statistics per match, covering about 103 metrics such as expected goals, shots, pass accuracy, etc., but only covering some top leagues and matches after the 2024-25 season, with uneven distribution). Additionally, dimension tables are included: players.jsonl (1296 players), teams.jsonl (23 teams), leagues.jsonl (1 league), tournaments.jsonl (115 seasons), tournament_stages.jsonl (115 stages), and sports.jsonl (1 sport). Data quality notes: match_stats and match_player_stats do not cover all matches; score field types are inconsistent (string or integer); timestamps are in Unix seconds; metric naming is inconsistent between match_stats and match_player_stats (snake_case vs SCREAMING_SNAKE_CASE). It is recommended to check field distributions and calibrate before use. The dataset license is CC-BY-NC-4.0, for non-commercial use only, with attribution required.

创建时间:
2026-08-30
原始信息汇总

数据集概述

该数据集为“Gamblistics Sport Statistics”,是一个足球比赛数据集合,涵盖比赛级、球队级和球员级数据,主要用于比赛结果预测和博彩市场建模研究(如最终比分、半场比分、角球数、大小球、首个进球时间等)。

数据集基本信息

  • 许可证:CC-BY-NC-4.0(非商业用途,需注明出处)
  • 语言:英语
  • 标签:体育、足球、比赛数据、比赛统计、球员统计
  • 数据规模:10K < n < 100K 行
  • 数据格式:JSON Lines(.jsonl),每行一个 JSON 对象

文件结构与行数

核心数据表

文件 行数 内容
matches.jsonl 1,140 每场比赛一行,包含比赛ID、开球时间(Unix 秒)、主客队名称及ID、全场/半场/90分钟比分、比赛状态、联赛/锦标赛/阶段ID、轮次名称
match_stats.jsonl 760 每场比赛的球队级统计,分为整体、上半场、下半场三个时段,指标包括 xG、控球率、射门、射正、角球、传球、黄牌、越位、犯规等
match_lineup.jsonl 47,837 每行对应一个(比赛,球员)组合,包含阵容信息、首发/队长/门将标识、球衣号码、位置、球员姓名/国籍等
match_player_stats.jsonl 442 每场比赛的球员级统计,包含球员ID、球队ID、位置及约103个统计指标(如 EXPECTED_GOALS、SHOTS_TOTAL 等),所有球员均携带完整指标字典,非事件项填充为0

维度表

文件 行数 内容
players.jsonl 1,296 球员ID、姓名、国籍、主要位置、类型、出生日期
teams.jsonl 23 球队ID、名称、国家、球场、城市、容量
leagues.jsonl 1 永久联赛(如英超)ID、名称、国家、运动ID
tournaments.jsonl 115 某联赛的某一赛季
tournament_stages.jsonl 115 锦标赛阶段ID、对应锦标赛、联赛、类型、比赛场数
sports.jsonl 1 运动ID、名称

连接键

  • matches.idmatch_stats.idmatch_player_stats.id 一一对应
  • match_lineup.id 格式为 <matchId>_<playerId>,通过 matchId 关联 matches.id
  • 球队:matches.homeTeamId / awayTeamIdteams.id
  • 球员:match_lineup.playerId / match_player_stats.players[].playerIdplayers.id
  • 比赛与联赛/锦标赛:matches.leagueIdleagues.idmatches.tournamentIdtournaments.id

已知数据质量注意事项

  • match_statsmatch_player_stats 并非覆盖所有比赛,约三分之二的比赛缺少球队统计,多数比赛缺少球员统计(存在非随机缺失问题)
  • matches 中的比分字段部分行为字符串、部分为整数,需转换为可空整数
  • 时间戳为 Unix 秒(非毫秒)
  • 指标命名不一致:match_stats 使用 snake_casematch_player_stats 使用 SCREAMING_SNAKE_CASE
  • 球员统计中的常量零列(如常规联赛中的点球大战指标)不应视为事件缺失,需删除或生成指标观察掩码
  • 数据来源为逆向工程,格式可能变化,训练前需检查字段分布

建议用途

  • 预测全场比分(主队/客队泊松率)
  • 半场比分及半场结果市场
  • 大小球(1.5/2.5球)
  • 总角球数
  • 首个进球时间
  • 球员级 xG / 射门 / 评分建模

用于博彩市场的分类/回归目标需在留出集上进行校准(Platt 或 isotonic),未校准的概率对期望值计算具有误导性。

来源与许可

数据收集自多个公开来源,仅在 CC-BY-NC-4.0 许可下用于研究和教育目的。数据集包含球员和教练的公开姓名、国籍及出生日期,不包含其他个人数据。若使用本数据集,请引用提供者并注明原始来源。

搜集汇总
数据集介绍
sport-statistics 数据集图片
构建方式
该数据集涵盖足球比赛的多维度数据,包括比赛级、球队级与球员级信息。其构建源于对多源异构数据的整合,以JSON Lines格式存储,每条记录对应一个JSON对象。核心表matches.jsonl记录每场比赛的基础信息与比分,而match_stats.jsonl则提供球队层面的分时段技术统计。值得注意的是,match_lineup.jsonl将原始的每场球员阵列扁平化为每球员一行,便于关联分析。此外,维度表如players、teams等为数据提供了丰富的上下文。整体设计旨在支撑比赛结果预测与博彩市场建模等研究。
使用方法
使用此数据集时,首要任务是进行数据清洗与标准化,包括将比分字段统一为整数、时间戳转换为可读格式,并归一化指标命名。其次,充分利用其层级结构,通过关联键(如matches.id)整合不同表的数据。针对预测任务,如最终比分或半场结果,可构建泊松回归等模型,并强调对输出概率进行校准(如Platt缩放或等渗回归),以确保预期价值计算的可靠性。由于数据覆盖不均,需在建模时考虑缺失机制,必要时剔除常量零列或引入观测掩码。最终,数据遵循CC-BY-NC-4.0许可,仅限非商业研究与教育用途。
背景与挑战
背景概述
足球比赛数据分析是体育科学与计算机科学交叉领域的重要研究方向,其核心在于通过量化指标揭示比赛规律并预测结果。Gamblistics Sport Statistics数据集由Nguyen Thuc Tuyen于2026年创建,旨在为比赛结果预测和博彩市场建模提供全面的数据支持。该数据集整合了比赛、球队、球员层面的多维信息,涵盖进球、预期进球(xG)、控球率、射门等关键指标,并特别关注半场比分、角球、首球时间等细分市场。其发布填补了现有公开足球数据在细粒度时序统计上的空白,为研究者提供了标准化、可复现的基准,对体育预测模型的发展具有显著推动作用。
当前挑战
该数据集面临的挑战既源于足球领域的复杂性,也源于数据构建过程中的技术难题。领域层面,比赛结果受战术、伤病、天气等多重因素影响,且事件稀疏(如进球),导致预测建模需处理高不确定性,同时博彩市场要求概率校准以避免误导。构建层面,数据来源异构,存在键冲突、字段类型不一致(如分数为字符串或整数)、指标命名风格迥异,且部分统计缺失并非随机(MNAR),需设计健壮的清洗策略。此外,数据覆盖不均(顶级联赛全,基层联赛缺)、时间戳单位混淆、以及专有格式易变,均需持续监控与适配。这些挑战共同要求数据处理与建模具备高度鲁棒性。
常用场景
经典使用场景
该数据集作为足球赛事多维度结构化数据的集合,其经典使用场景聚焦于构建预测性市场模型。研究者常依托其比赛级、球队级及球员级三个层次的数据粒度,运用泊松回归等统计方法对全场比分、半场比分、角球总数、大小球(如2.5球)以及首个进球时间等目标变量进行建模。这一过程不仅有助于检验传统足球胜负预测理论的效力,更为计算博彩赔率中的隐含概率提供了数据支撑,推动了体育数据分析从描述性统计向推断性建模的范式演进。
解决学术问题
此数据集有效解决了足球研究领域中因数据碎片化而导致的跨层级分析难题。它将比赛结果、球队战术统计(如控球率、射正次数、xG)及球员个人表现(如预期进球、传球成功率)统一于同一关系型框架内,使学者能够系统考察不同粒度特征对比赛结果的非线性影响。其对于缺失数据的明确标注及评估校准的强调,更是为处理现实世界数据不完整性问题提供了方法论参考,促进了在有限样本下进行稳健统计推断与概率校准的学术探索,提升了赛事预测研究的科学严谨性。
实际应用
在实际应用中,该数据集为足球数据分析平台、体育媒体以及博彩相关研究机构提供了可复用的数据基础设施。它支持开发自动化赛事预览系统,通过实时整合球队近况与球员贡献,生成数据驱动的战术分析报告。同时,数据集也可服务于球迷社区的互动应用,如基于历史角球数据或进球时间分布构建个性化预测游戏。在商业领域,非商业授权下,它成为了教学案例和算法竞赛的优质数据源,帮助从业者在真实数据环境下打磨预测模型,优化决策辅助工具。
数据集最近研究
最新研究方向
该数据集聚焦于足球比赛的多维度结构化数据,涵盖比赛、球队、球员三个层级,为足球赛事结果预测与博彩市场建模提供了丰富的基础数据。当前研究前沿方向集中在利用机器学习模型(如泊松回归、深度神经网络)对比赛进球数、半场比分、角球数等目标进行精准预测,并强调模型输出概率的校准(如Platt缩放或等渗回归)以确保在期望值计算中的可靠性。数据集特色在于包含了球员级详细统计数据(如预期进球、传球准确率等),但存在缺失非随机(MNAR)的问题,这促使研究者探索鲁棒的缺失数据处理方法。此外,数据覆盖2024-25赛季以来的顶级联赛,为研究现代足球战术演变与球员表现提供了实证基础,推动了体育分析学与可解释人工智能的交叉研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务