遇见数据集

ai-sports-prediction-index

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

AI Sports Prediction Index 是一个用于评估大型语言模型(LLM)实时预测能力的基准数据集,专注于MLB(美国职业棒球大联盟)比赛和UFC(终极格斗冠军赛)赛事的预测。该数据集由PredictedSports发布,许可证为CC BY 4.0,每周刷新,每月1日发布版本更新。数据规模约为1,000至10,000行,包含三个配置:mlb_predictions(MLB预测数据)、ufc_predictions(UFC预测数据)和models(模型信息)。每个预测记录包含模型名称、胜率、得分预测、选择、实际结果、收盘共识价格以及每选择收盘线价值(clv_pp)。所有预测均为盲线(line-blind)生成:模型在比赛开始前,仅接收统计数据包,从未接触博彩线,且所有事件发生在模型训练截止日期之后,确保了预测的不可污染性。评分方法包括:基于最终结果的胜者判定(选择概率更高的一方)、Brier评分和log loss评分(针对MLB的p_home或UFC的p_a)、ROI(以收盘隐含概率为基准,一个单位投注的回报率)以及clv_pp(从选择时间到收盘市场向模型选择方向移动的百分点)。数据集还包含models.csv,列出每个模型的活跃窗口和已评级游戏计数,用于控制比较窗口。该数据集适用于LLM预测能力评估、概率预测基准、时间序列分析以及体育博彩相关研究。注意事项:数据集起始于2026年6月30日,尚处于早期阶段,不同模型之间的差异可能尚未统计显著;未包含输入数据包、选择时间价格序列、专家精选选择以及用户相关数据。

AI Sports Prediction Index is a benchmark dataset for evaluating the real-time prediction capabilities of large language models (LLMs), focusing on MLB (Major League Baseball) and UFC (Ultimate Fighting Championship) events. Released by PredictedSports under CC BY 4.0 license, it is refreshed weekly with version updates on the 1st of each month. The dataset contains approximately 1,000 to 10,000 rows and includes three configurations: mlb_predictions (MLB predictions), ufc_predictions (UFC predictions), and models (model information). Each prediction record includes model name, win probability, score prediction, selection, actual result, closing consensus price, and closing line value per pick (clv_pp). All predictions are line-blind: models receive only statistical packages before game start, never accessing betting lines, and all events occur after model training cutoffs, ensuring uncontaminated predictions. Scoring methods include winner determination (higher probability side), Brier score and log loss (for p_home in MLB or p_a in UFC), ROI (based on closing implied probabilities with unit stake), and clv_pp (percentage points the market moves toward the models selection from pick time to closing). The dataset also includes models.csv listing active windows and rated game counts per model. It is suitable for LLM prediction evaluation, probabilistic forecasting benchmarks, time series analysis, and sports betting research. Note: The dataset starts from June 30, 2026, and is in an early stage; it does not include input data packages, selection time price series, expert picks, or user-related data.

创建时间:
2026-07-27
原始信息汇总

数据集概述

AI Sports Prediction Index 是一个用于评估LLM(大语言模型)在体育赛事预测方面能力的公开数据集,专注于MLB(美国职业棒球大联盟)比赛和UFC(终极格斗冠军赛)比赛。

核心特点

  • 无污染评估:该数据集被设计为“污染不可能”的LLM评估。所有预测事件均发生在模型训练截止日期之后,每个预测都带有比赛开始前的时间戳,且模型在预测时未接触任何博彩赔率信息,确保评估结果真实可靠。
  • 持续更新:数据集每周刷新,每月1日发布版本更新,并持续增长。

数据集内容

  • 包含每个MLB比赛和UFC比赛的模型预测记录,格式为每个模型每场被评分的赛事一行。
  • 每个数据行包含:胜率预测、比分预测、选择结果、实际比赛结果、收盘共识赔率及每项选择的收盘线价值(CLV)。
  • 数据集包含三个配置文件:
    • mlb_predictions:MLB比赛预测数据(CSV文件)
    • ufc_predictions:UFC比赛预测数据(CSV文件)
    • models:参与评估的模型列表,包括每个模型的活跃窗口和已评分比赛数量

涉及的模型

数据集包含来自Anthropic、OpenAI、Google、xAI、DeepSeek、Moonshot和Z.ai的前沿模型。所有模型通过OpenRouter以相同的提示和数据包调用。模型名单每月1日更新,新模型在完成首个完整月前为临时状态。

评分方法

  • 胜者评分为较高概率方与最终比分对比的结果。
  • Brier分数和对数损失用于评估主队概率(MLB)或选手A概率(UFC)与实际结果的匹配度。
  • ROI(投资回报率)计算基于一个单位在收盘隐含概率下的投注收益。
  • 收盘市场为比赛前最新的多博彩公司共识价格,0%为市场基准线。
  • clv_pp 表示从选择时间到收盘期间市场向模型选择方向移动的百分比点数,正值表示该选择优于收盘价。

使用说明

  • 数据集许可证为CC BY 4.0,允许任何用途,但需注明来源。
  • 由于数据集起始于2026年6月30日且较新,部分模型之间的差异在统计上尚不可区分。
  • 有意的排除项包括:输入数据包、选择时间价格序列、专家选择及任何用户相关信息。
  • 提供了GitHub镜像仓库,包含用标准Python库重新计算整个排行榜的脚本,可与实时网站结果匹配。

外部链接

  • 实时排行榜:https://predictedsports.com/leaderboard
  • 方法学说明:https://predictedsports.com/accuracy
  • 任意两个选择者对比:https://predictedsports.com/vs
  • GitHub镜像:https://github.com/ashjanderson/ai-sports-prediction-index
搜集汇总
数据集介绍
ai-sports-prediction-index 数据集图片
构建方式
该数据集源自对每场MLB比赛及UFC对决的线性盲测LLM预测,系统性地收集了各模型对每场赛事的预测结果,涵盖胜率、比分预测、选择、赛果及收盘市场共识价格,并附有每项预测相对于收盘线的价值指标。数据构建过程严苛,确保所有预测均产生于模型训练截止日期之后,且每项预测均附带赛前时间戳,实现泄漏免疫的评估环境。此外,数据集通过标准化查询接口调用Anthropic、OpenAI、Google、xAI等前沿模型,确保输入数据包一致,以保障评估的公平性与可重复性。
特点
该数据集的核心特征在于其独特的泄漏免疫评估机制,所有预测在事件发生前即已生成,且模型未曾接触任何博彩赔率,彻底杜绝了数据污染的可能性。数据集持续更新,已包含超过数千条预测记录,覆盖MLB与UFC两大体育联盟,并提供多维度评估指标,如Brier分数、对数损失、基于收盘价的投资回报率(ROI)及收盘线价值变化(CLV)。通过配套的模型档案文件,研究者可精确掌握各模型的有效窗口期及参与场次,支持细致的时间窗口对比分析。
使用方法
使用者可便捷地加载各数据子集(如mlb_predictions、ufc_predictions及models),通过标准CSV格式进行深度分析。数据集附有开源Python脚本,能够从原始CSV数据一键重算完整排行榜,确保分析过程与线上实时排名高度一致。此外,数据每月定期发布版本,每周刷新,支持研究者追踪模型表现的动态变化。借助提供的方法论文档与头对头比较工具,用户可以灵活评估不同模型在特定场景下的预测效能,或进行跨模型、跨时间段的系统性基准测试。
背景与挑战
背景概述
AI体育预测指数(AI Sports Prediction Index)数据集由PredictedSports团队于2026年创建,旨在系统评估前沿大型语言模型(LLM)在真实世界体育赛事预测中的表现。其核心研究问题在于,如何通过时间戳、无泄漏的预测基准,衡量LLM在动态环境下的概率预测能力。数据集覆盖MLB和UFC赛事,每场比赛均附带模型预测的胜负概率、得分预测及选择,并与最终结果及收盘市场赔率对应比较。该数据集的核心创新在于‘不可污染性’:所有事件均晚于模型训练截止,预测时间戳早于事件发生,且模型仅接收统计数据,未见博彩线路,确保评估免受数据泄漏影响。此基准为LLM在实际决策场景中的可靠性提供了严谨的检验平台,对概率预测领域的研究具有一定的引领作用,推动了对模型前瞻性能力的标准化测评。
当前挑战
该数据集所面临的挑战涵盖领域与构建两个层面。领域层面,其致力于解决的挑战在于,传统静态基准(如问答)无法衡量模型在时间敏感、真实世界事件中的预测能力,而现有预测基准常受数据污染困扰。该数据集以体育赛事为窗口,要求模型在不确定性下输出校准的概率,并应对市场动态变化,这极大考验模型的泛化与推理能力。构建层面,挑战在于确保预测的绝对无泄露——每项预测需带事件前时间戳,模型仅获统一数据包,且比赛结果晚于训练截止;同时需处理不同模型运行窗口差异(月度轮换、新模型试用期),并严格排除输入数据包、实时价格等敏感信息。此外,数据集规模尚小(2026年6月30日始建),多模型间差异在统计上未完全可分离,需持续周更积累数据,以提升评估的稳健性与可解释性。
常用场景
经典使用场景
该数据集作为一项独特的、无污染的预测基准,为评估大型语言模型(LLM)在真实世界时序预测任务中的泛化能力提供了前所未有的机会。研究者可利用其对MLB比赛和UFC格斗的逐场预测记录,开展严格的模型性能对比,涵盖胜率概率、比分预测、选择与市场收盘价等维度。其核心价值在于每一个预测均带有赛前时间戳,且模型输入仅为统计数据包,彻底规避了训练数据泄露的风险,使得评估结果具有高度的可信度与可复现性。此基准不仅适用于前沿模型的横向比较,也为探索不同模型在概率校准、决策阈值设定等方面的表现提供了丰富的数据基础。
衍生相关工作
该数据集的发布已催生一系列衍生研究,最典型的是基于其发布的排行榜复现脚本,促进了预测评估工具的标准化。后续工作可围绕多个方向展开:利用Brier分数分解技术,深入剖析模型预测误差的来源(如校准度与分辨度);构建元学习框架,探索如何融合不同模型的概率输出以提升集成性能;以及分析CLV指标的统计特性,研究模型预测对市场价格动态的影响。此外,该数据集还为验证‘先验知识注入’‘思维链推理’等提示工程策略在真实时序预测中的有效性提供了测试床,推动了模型预测能力优化研究的发展。
数据集最近研究
最新研究方向
该数据集聚焦于大型语言模型在真实世界时序预测中的零泄漏评估,开创了体育赛事概率预测作为LLM基准的先河。其前沿研究方向包括:利用无污染、带时间戳的预测数据,系统评估前沿模型在MLB与UFC赛事中的校准能力与决策价值,并引入Brier分数、对数损失及收盘线价值(CLV)等多维指标,量化模型预测与市场效率的偏差。该数据集紧密关联体育博彩智能化与AI可验证性热点,为概率预测、市场有效性检验及模型鲁棒性研究提供了不可多得的实验场,其持续更新的设计亦为动态基准与在线学习研究奠定基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务