遇见数据集

transfertalk-players

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

TransferTalk 球员数据集是一个完全合成、虚构的多模态足球运动员数据集,包含 1,000 个球员档案。每个档案由一段详细的文本描述和一张匹配的插画球员卡片图像组成。该数据集专为大学数据科学顶点项目设计,用于构建一个类似 Transfermarkt 的多模态演示应用程序(包括推荐系统和 AI 生成的球探报告)。所有球员姓名、球队、联赛和国籍均属于虚构的“Meridian League”,不涉及任何真实人物、球队或联赛,从而避免真实知识产权、隐私或关于真实人物幻觉的问题。数据集包含 1,000 行、17 列(16 个结构化字段 + image_path)。文本字段由本地开源大语言模型 Qwen/Qwen2.5-1.5B-Instruct 生成,图像由 stabilityai/sdxl-turbo 生成,均在 Colab GPU 上通过 transformers/diffusers 运行,未使用爬取、人工编写或公式/随机替换内容。字段包括:team(虚构俱乐部名称)、league(虚构联赛名称)、nationality(虚构国籍)、position(场上位置,如 GK、CB、FB 等)、style(球风类型,如“Poacher”、“Sweeper Keeper”)、age(17-38 岁)、first_name/last_name/full_name(虚构球员姓名)、bio(短篇虚构传记,LLM 生成)、strengths/weaknesses(LLM 生成的列表)、scouting_report(LLM 生成的球探报告文本)、pace/shooting/passing/dribbling/defending/physical(0-99 的技能评分,LLM 生成)、market_value_eur(通过确定性公式从统计数据和年龄计算得出,非 AI 生成)、player_id(顺序标识符)、image_path(匹配球员卡片插画的相对路径)。数据集预期用途为教学或演示多模态嵌入、推荐系统和基于 LLM 的合成数据生成流水线。许可证为 MIT。

The TransferTalk Player Dataset is a fully synthetic, fictional multimodal football player dataset containing 1,000 player profiles. Each profile consists of a detailed text description and a matching illustrated player card image. The dataset is designed for a university data science capstone project to build a multimodal demo application similar to Transfermarkt (including a recommendation system and AI-generated scouting reports). All player names, teams, leagues, and nationalities belong to the fictional Meridian League and do not involve any real persons, teams, or leagues. The dataset contains 1,000 rows and 17 columns (16 structured fields + image_path). Text fields are generated by the local open-source LLM Qwen/Qwen2.5-1.5B-Instruct, and images are generated by stabilityai/sdxl-turbo, both run on Colab GPU via transformers/diffusers, without scraping, manual writing, or formula/random replacement. Fields include: team (fictional club name), league (fictional league name), nationality (fictional nationality), position (e.g., GK, CB, FB), style (e.g., Poacher, Sweeper Keeper), age (17-38), first_name/last_name/full_name (fictional player names), bio (short fictional biography generated by LLM), strengths/weaknesses (LLM-generated lists), scouting_report (LLM-generated scouting report text), pace/shooting/passing/dribbling/defending/physical (0-99 skill ratings, LLM-generated), market_value_eur (calculated via deterministic formula from statistics and age, not AI-generated), player_id (sequential identifier), image_path (relative path to matching player card illustration). The intended use is for teaching or demoing multimodal embeddings, recommendation systems, and LLM-based synthetic data generation pipelines. License: MIT.

创建时间:
2026-08-21
原始信息汇总

TransferTalk Players Dataset 数据集概述

基本信息

  • 规模:1,000 条数据,包含 17 列(16 个结构化字段 + image_path
  • 模态:文本 + 图像(多模态)
  • 语言:英语
  • 任务类型:文本生成、图像到文本
  • 许可证:MIT
  • 数据类别:合成数据、多模态、体育、足球(英式/美式足球)
  • 数据量级:1K < n < 10K

核心特点

该数据集为完全合成、虚构的足球运动员档案数据集,包含 1,000 名球员的详细信息。所有球员、球队、联赛及国籍均属于虚构的宇宙("The Meridian League"),不涉及任何真实球员、球队或联赛,避免现实世界的知识产权、隐私或对真实人物产生幻觉的问题。

数据模式

字段 类型 描述
team 字符串 虚构俱乐部名称
league 字符串 虚构联赛名称
nationality 字符串 虚构国籍
position 字符串 场上位置(GK、CB、FB、DM、CM、AM、W、ST)
style 字符串 比赛风格原型(如"Poacher"、"Sweeper Keeper")
age 整数 17-38 岁
first_namelast_namefull_name 字符串 虚构球员姓名
bio 字符串 简短虚构传记(LLM 生成)
strengthsweaknesses 列表[字符串] LLM 生成的优点与缺点
scouting_report 字符串 LLM 生成的球探报告文本
paceshootingpassingdribblingdefendingphysical 整数(0-99) LLM 生成的技能评分
market_value_eur 浮点数 派生值(非 AI 生成),通过统计数据和年龄的确定性公式计算
player_id 整数 顺序标识符
image_path 字符串 对应球员卡片插图的相对路径

生成方法

  • 文本生成:使用本地开源权重 LLM(Qwen/Qwen2.5-1.5B-Instruct
  • 图像生成:使用 stabilityai/sdxl-turbo,通过 2 步 SDXL-Turbo 流水线生成
  • 运行环境transformers/diffusers 在 Colab GPU 上运行
  • 生成方式:按每批 10 个配置文件,通过结构化 JSON 提示生成,每个批次使用随机采样的少量示例引导格式和写作风格;使用括号深度 JSON 修复程序从部分格式错误的模型输出中恢复有效对象
  • 无抓取、无人工编写内容、无公式/随机替代生成内容本身

探索性数据分析(EDA)摘要

已发现并处理或标记的 AI 生成问题:

  1. 重复全名(初始 621/1000):初始名称池 20x20=400 种组合远小于 1,000 个样本,产生生日悖论冲突。已修复:将名称池扩展至 46x46=2,116 种组合。
  2. 不完整记录(32/1000):部分 LLM 响应在 JSON 中途截断,导致缺少必填字段。已修复:删除并重新生成。
  3. 重复全名再次出现(31/1000):修复 #2 的重新生成使用了原始小名称池,导致重复。已修复:采用与问题 #1 相同的方法解决。
  4. 统计值范围限制:尽管要求 0-99,模型从未产生极端值(观察范围为 4-98)。标记但未修正,作为轻微的指令遵循差距。
  5. 守门员统计建模:守门员(GK)的defending平均值高于所有位置,因为模型对所有位置复用了相同的 6 项统计模式,而非守门员特定属性。标记为模式设计限制。
  6. 弱文本-数字对齐:使用"world class"、"exceptional"等最高级语言的scouting_report配置文件,其market_value_eur仅比无此语言的配置文件平均高约 6.4%,方向正确但信号弱于预期。
  7. 年龄-38 分布检查:年龄 38 的计数(61)明显高于其他年龄的平均值(44.7,均匀采样下期望约 45.5),约 2.3 个标准差偏差。经审查判定为正常随机噪声,而非系统性错误。

统计相关性检查支持 LLM 通常保持了位置与技能评级之间的合理关系(如shootingdefending:-0.74;physicaldefending:+0.59)。

仓库文件

  • transfertalk_players_raw.jsontransfertalk_players_raw.csv — 数据集文件
  • player_cards/ — 1,000 张球员卡片图像({player_id}.png
  • Synthetic_Data_Generation.ipynb — 第 1 部分生成笔记本
  • EDA_notebook.ipynb — 第 2 部分 EDA 笔记本

预期用途

该数据集为 TransferTalk 毕业设计项目构建,是一个类似 Transfermarkt 风格的多模态演示应用(推荐系统 + AI 生成的球探报告)。适用于教学/演示多模态嵌入、推荐系统和基于 LLM 的合成数据生成流水线。

许可证

MIT。所有内容均为合成和虚构。

搜集汇总
数据集介绍
transfertalk-players 数据集图片
构建方式
在合成数据生成与多模态学习交叉领域,该数据集采用完全自动化的生成流程以规避真实世界数据涉及的隐私与版权风险。文本内容由本地部署的开源语言模型Qwen2.5-1.5B-Instruct以结构化JSON提示方式分批生成,并通过花括号深度解析程序修复部分格式错误的输出;球员卡片图像则基于球员位置、风格及球队色彩属性构造提示,利用SDXL-Turbo模型以两步扩散管道逐条合成。市场价值、身高、惯用脚等衍生字段由确定性公式计算,并非AI生成内容,从而确保核心生成式组件与特征工程之间的清晰边界。
特点
该数据集呈现出多模态、全合成与高度结构化的特征。其包含1000条球员档案,每条均配有丰富的文本描述与对应的球员卡片插图,涵盖30个字段,涉及身份信息、技能评分、球探报告及市场价值历史等。所有姓名、球队与联赛均构建于虚构的‘子午线联赛’宇宙中,彻底杜绝真实实体映射。数据规模适中,适合作为教学演示与推荐系统实验的基准资源。字段间保持了统计一致性,例如射门与防守评分呈显著负相关,体现了模型对位置与技能关系的合理捕捉,同时少数指令遵循偏差也被明确标注。
使用方法
该数据集适用于多模态嵌入学习、推荐系统构建及大语言模型合成数据生成流程的教学与演示。使用者可通过加载JSON或CSV文件获取结构化文本字段,并利用player_cards目录下的图像文件建立图文配对。典型流程包括多模态特征提取、相似度计算与推荐排序,亦可基于现有字段进行二次特征工程或模型微调。配套的生成与探索性分析笔记本提供了完整的复现路径与数据质量核查示例,便于研究者理解合成数据的构建逻辑与潜在偏差,从而在受控环境中开展可重复的实验。
背景与挑战
背景概述
近年来,多模态合成数据在数据科学教育中扮演着愈发重要的角色,尤其当真实数据涉及隐私或版权限制时。transfertalk-players数据集诞生于一个大学数据科学毕业设计项目,由研究人员利用本地开源大语言模型和扩散模型,生成了1000个完全虚构的足球运动员档案,每个档案包含丰富的文本描述与配对的插图球员卡。该数据集旨在构建一个类似Transfermarkt的多模态演示应用,核心研究问题在于如何借助生成式AI构建具备真实感、内部一致且无知识产权风险的多模态球员数据,以支撑推荐系统与球探报告生成等任务。其影响力在于为合成多模态数据生成流程提供了可复现的教学案例,并展示了特征工程与生成内容相结合的数据构建范式。
当前挑战
该数据集所应对的领域问题在于,如何在缺乏真实数据或受限于隐私与版权的条件下,生成兼具视觉与文本模态、且内在逻辑自洽的球员档案,以用于多模态推荐与文本生成任务。构建过程中遭遇了多重挑战:初始名称池过小导致621/1000条记录全名重复,需扩展名称组合并重新生成;部分LLM输出因JSON截断而产生32条不完整记录;重新生成时又因沿用旧名称池导致31条全名重复,须再次迭代修复。此外,模型在0-99评分区间内从未输出真实极值,守门员沿用通用六维属性致使防守评分异常偏高,球探报告中的最高级措辞与市场价值仅呈现约6.4%的弱关联,均暴露出指令遵循与文本-数值对齐的局限。
常用场景
经典使用场景
在体育数据科学与多模态学习领域,合成数据集常被视作规避隐私与版权掣肘的试验田。TransferTalk球员数据集以千条全合成、虚构的足球运动员档案为基石,每一档案均将长文本描述与插画风格球员卡图像有机配对,形成了文本与视觉模态交织的经典使用场景。研究者可借此开展跨模态检索、图文匹配以及条件文本生成等任务,例如根据球探报告生成球员图像,或依据技能雷达图补全缺失的传记文本。其经典用法还涵盖多模态嵌入学习的基准测试,为模型理解体育领域专有概念提供了可控且无偏的语料环境。
衍生相关工作
围绕该数据集的衍生工作主要沿合成数据生成方法论与多模态应用两条脉络展开。在生成技术层面,其采用的局部开源大模型与扩散模型级联流程,启发了后续关于低成本合成多模态语料构建的研究,尤其是针对JSON结构化输出的修复策略被纳入相关工具链。在应用层面,基于该数据集开发的TransferTalk演示应用衍生出球员相似度推荐、图文双向检索以及风格化球员卡生成等原型系统。其公开的探索性数据分析报告亦被用作教学范例,推动了关于生成数据质量评估与偏差检测的讨论,间接促进了合成数据在体育分析领域的可信度研究。
数据集最近研究
最新研究方向
在体育数据分析与多模态生成式人工智能深度交织的浪潮中,transfertalk-players数据集为合成数据驱动的球员画像与推荐系统研究开辟了新的实验场域。该数据集以完全虚构的“子午线联赛”为背景,巧妙规避了现实世界知识产权与隐私风险,同时借助本地开源大模型与扩散模型生成文本与图像配对,使研究者得以在无数据伦理掣肘的环境下,探索多模态嵌入、跨模态检索与基于LLM的球探报告自动生成等前沿议题。当前,围绕该数据集的探索聚焦于评估合成多模态数据对下游推荐与检索任务的泛化能力,并借助其内置的特征工程字段剖析文本描述与数值评级之间的语义对齐强度,为构建更鲁棒、可解释的体育AI系统提供方法论镜鉴。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务