遇见数据集

tennis-sackmann-archive

收藏
github2026-06-26 更新2026-07-09 收录
官方服务:

资源简介:

这是一个网球数据集的归档镜像,包含Jeff Sackmann编译的公共网球数据集,具体包括四大满贯的逐点日志(slam_pointbypoint)、男子巡回赛数据(atp)和女子巡回赛数据(wta),所有数据仅用于非商业用途,遵循CC BY-NC-SA 4.0许可。

This is an archived mirror of a tennis dataset, which contains the public tennis datasets compiled by Jeff Sackmann. Specifically, it includes point-by-point logs of the four Grand Slams (slam_pointbypoint), men's tour data (atp), and women's tour data (wta). All data is for non-commercial use only and is licensed under CC BY-NC-SA 4.0.

创建时间:
2026-06-26
原始信息汇总

数据集概述:Jeff Sackmann 网球数据存档

该数据集是 Jeff Sackmann 公开收集的网球数据的镜像存档,旨在确保数据的长期可用性和可引用性。数据集仅包含原始数据和文档,不包含任何模型、分析或衍生代码。该存档也同步镜像在 Hugging Face Hub 上。

数据集构成

数据集包含三个主要子集,按文件夹组织:

文件夹 内容说明 文件数量 时间覆盖范围
slam_pointbypoint/ 四大满贯赛事的逐点日志(每项赛事每年包含一个 *-points.csv 和一个 *-matches.csv),以及一个 data_dictionary.txt 数据字典文件 166 个 CSV 文件 2011–2024 年,涵盖澳大利亚网球公开赛、法国网球公开赛、温布尔登网球锦标赛、美国网球公开赛
atp/ 男子职业网球巡回赛数据:比赛结果、排名和球员信息表,跨越多十年,附带 matches_data_dictionary.txt 174 个 CSV 文件 截至 2026 年
wta/ 女子职业网球巡回赛数据:比赛结果、排名和球员信息表 125 个 CSV 文件 截至 2026 年

每个文件夹内均包含 Jeff Sackmann 原始仓库的 README 文件(名为 UPSTREAM_README.md),以标注数据来源。

数据来源

  • 大满贯逐点日志数据:https://github.com/JeffSackmann/tennis_slam_pointbypoint
  • ATP 数据:https://github.com/JeffSackmann/tennis_atp
  • WTA 数据:https://github.com/JeffSackmann/tennis_wta

数据快照版本说明:slam_pointbypoint 数据抓取自上游仓库的 6febb77 提交(2024 年 10 月);atpwta 数据抓取自 2026 年 6 月的上游仓库提交。

许可与归属

  • 许可证:Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0)
  • 版权声明:所有数据由 Jeff Sackmann 收集和整理,并在此许可证下重新分发。使用数据时必须署名 Jeff Sackmann,并链接回上述原始仓库。使用仅限非商业用途,任何再分发必须使用相同许可证。
  • 镜像声明:本镜像不主张对数据的任何所有权,也不添加任何额外权利。
搜集汇总
数据集介绍
构建方式
该数据集为Jeff Sackmann所编译的公开网球数据的归档镜像,旨在确保数据的持久可获取性与可引用性。数据集仅包含原始数据及其文档,未附加任何模型、分析或衍生代码。其内容源自三大上游仓库:涵盖2011至2024年间四大满贯逐球记录及比赛元数据的slam_pointbypoint,追溯至2026年的男子职业赛事(ATP)与女子职业赛事(WTA)的完整比赛结果、排名与选手信息表。所有数据快照均取自特定上游提交版本,如slam_pointbypoint截至于2024年10月,而ATP和WTA则更新至2026年6月,保障了数据源的透明与可追溯。
特点
该数据集以结构化CSV文件形式组织,分为slam_pointbypoint、atp与wta三个核心文件夹,分别存储大满贯逐球数据、男子及女子巡回赛数据,并各自附带详尽的数据字典(data_dictionary.txt或matches_data_dictionary.txt)以说明字段含义。每个文件夹内同时保留了Jeff Sackmann原始仓库的README文件作为来源证明。整体覆盖时间跨度长,大满贯逐球数据精细到每一分的进程,巡回赛数据则囊括数十年间的比赛、排名与选手资料,为网球统计与历史分析提供了丰富且标准化的数据基础。
使用方法
用户可通过Hugging Face数据集页面或GitHub仓库直接获取CSV文件。下载后,可根据分析需求选择对应文件夹:研究大满贯比赛细节可查阅slam_pointbypoint目录下按年份和赛事命名的*-points.csv与*-matches.csv文件;分析男子或女子职业赛事则分别使用atp与wta目录中的表格。数据以标准CSV格式存储,兼容主流数据处理工具(如Pandas、R)。使用时应遵守CC BY-NC-SA 4.0许可协议,注明数据来源为Jeff Sackmann并链接至原始仓库,且仅限非商业用途。
背景与挑战
背景概述
网球作为一项高度依赖数据统计的竞技运动,其比赛记录、球员排名与赛事进程的数字化分析对于运动科学、战术研究与体育产业发展至关重要。tennis-sackmann-archive数据集由Jeff Sackmann创建并维护,于2024年以镜像形式存档于Hugging Face平台,旨在永久保留其长期编制的公开网球数据。该数据集涵盖男子(ATP)与女子(WTA)巡回赛的历年比赛结果、排名和球员信息,以及2011年至2024年四大满贯赛事的逐分记录,为体育数据科学、机器学习模型训练及统计分析提供了标准化、可引用的宝贵资源,深刻推动了网球领域的数据驱动研究。
当前挑战
该数据集所解决的领域问题主要在于网球运动数据的碎片化与难以获取,传统上比赛记录散落于不同机构与格式中,阻碍了规模化分析与建模,而此数据集提供了统一、结构化的历史数据。构建过程中面临的挑战包括:数据的持续更新与版本控制,需同步三大来源(ATP、WTA、大满贯)截至2026年的动态变化;数据采集与清洗的复杂性,需处理不同赛事、时间跨度及数据源间的一致性问题;此外,以CC BY-NC-SA 4.0许可协议限制非商业用途,也增加了学术研究之外应用场景的合规性考量。
常用场景
经典使用场景
在体育数据科学领域,网球运动因其丰富的比赛数据和明确的评分规则,成为量化分析与预测建模的理想对象。tennis-sackmann-archive数据集汇聚了杰夫·萨克曼长期收集整理的男子职业网球协会(ATP)、女子网球协会(WTA)巡回赛历史比赛结果、排名与球员信息,以及四大满贯赛事从2011年至2024年的逐分记录。研究者常利用该数据集构建比赛胜负预测模型,例如基于Elo评分系统或逻辑回归对球员表现进行动态评估;同时,逐分数据为点球博弈策略分析、关键分压力下的决策研究提供了精细化的时序数据支持。该场景要求数据集具备完整的时间跨度和多维度对齐的赛事元数据,而本数据集恰好以其长达十余年的覆盖范围和统一的数据结构满足了这一需求,成为网球统计建模领域的基准数据源之一。
实际应用
实际应用中,该数据集已渗透至体育产业多个环节。在赛事运营层面,网球赛事组织者利用历史比赛数据优化赛程编排与种子选手分区策略,例如通过分析不同场地类型的胜率差异调整签表平衡性。体育媒体与数据转播商则基于逐分记录开发实时数据可视化系统,在直播中呈现球员在不同回合数的得分分布、发球胜率等动态统计,极大提升了观赛体验的数字化深度。此外,职业选手的教练团队常借助该数据集进行对手分析:通过提取特定对手在关键分上的战术偏好(如发球落点选择、网前截击频率),制定针对性的训练与比赛策略。在博彩合规领域,监管机构利用历史赔率与比赛结果的关联分析,辅助识别异常投注模式,维护竞猜市场的公平性。这些实际场景不仅印证了数据集从学术到产业的桥梁作用,也凸显了其在高频决策场景中的实用价值。
衍生相关工作
该数据集衍生了一系列具有影响力的学术与实践工作。在机器学习领域,研究者基于四大满贯逐分数据开发了计时维度的球员状态演化模型,通过循环神经网络(RNN)预测单分胜负概率,相关论文发表于国际体育分析会议。在统计方法创新方面,有工作利用Elo与Bradley-Terry模型构建了男子与女子网球的动态等级系统,并与官方排名进行对比验证,推动了适应性与时变能力评分体系的发展。在体育计量经济学中,学者借助该数据集检验了“主场优势”效应在个体运动中的显著性,发现大满贯比赛中本土球员的胜率提升与裁判倾向、观众支持等因素相关。此外,该数据集还被用于开发开源软件包如`tennis-r`和`pyTennisStats`,这些工具封装了数据清洗与建模接口,为后续研究者提供了便捷的二次开发平台。上述衍生工作共同构成了围绕该数据集的活跃科研生态,进一步巩固了其作为网球数据分析领域标准参考数据集的核心地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务