transfertalk-players
收藏资源简介:
TransferTalk 球员数据集是一个完全合成、虚构的多模态足球运动员数据集,包含 1,000 个球员档案。每个档案由一段详细的文本描述和一张匹配的插画球员卡片图像组成。该数据集专为大学数据科学顶点项目设计,用于构建一个类似 Transfermarkt 的多模态演示应用程序(包括推荐系统和 AI 生成的球探报告)。所有球员姓名、球队、联赛和国籍均属于虚构的“Meridian League”,不涉及任何真实人物、球队或联赛,从而避免真实知识产权、隐私或关于真实人物幻觉的问题。数据集包含 1,000 行、17 列(16 个结构化字段 + image_path)。文本字段由本地开源大语言模型 Qwen/Qwen2.5-1.5B-Instruct 生成,图像由 stabilityai/sdxl-turbo 生成,均在 Colab GPU 上通过 transformers/diffusers 运行,未使用爬取、人工编写或公式/随机替换内容。字段包括:team(虚构俱乐部名称)、league(虚构联赛名称)、nationality(虚构国籍)、position(场上位置,如 GK、CB、FB 等)、style(球风类型,如“Poacher”、“Sweeper Keeper”)、age(17-38 岁)、first_name/last_name/full_name(虚构球员姓名)、bio(短篇虚构传记,LLM 生成)、strengths/weaknesses(LLM 生成的列表)、scouting_report(LLM 生成的球探报告文本)、pace/shooting/passing/dribbling/defending/physical(0-99 的技能评分,LLM 生成)、market_value_eur(通过确定性公式从统计数据和年龄计算得出,非 AI 生成)、player_id(顺序标识符)、image_path(匹配球员卡片插画的相对路径)。数据集预期用途为教学或演示多模态嵌入、推荐系统和基于 LLM 的合成数据生成流水线。许可证为 MIT。
The TransferTalk Player Dataset is a fully synthetic, fictional multimodal football player dataset containing 1,000 player profiles. Each profile consists of a detailed text description and a matching illustrated player card image. The dataset is designed for a university data science capstone project to build a multimodal demo application similar to Transfermarkt (including a recommendation system and AI-generated scouting reports). All player names, teams, leagues, and nationalities belong to the fictional Meridian League and do not involve any real persons, teams, or leagues. The dataset contains 1,000 rows and 17 columns (16 structured fields + image_path). Text fields are generated by the local open-source LLM Qwen/Qwen2.5-1.5B-Instruct, and images are generated by stabilityai/sdxl-turbo, both run on Colab GPU via transformers/diffusers, without scraping, manual writing, or formula/random replacement. Fields include: team (fictional club name), league (fictional league name), nationality (fictional nationality), position (e.g., GK, CB, FB), style (e.g., Poacher, Sweeper Keeper), age (17-38), first_name/last_name/full_name (fictional player names), bio (short fictional biography generated by LLM), strengths/weaknesses (LLM-generated lists), scouting_report (LLM-generated scouting report text), pace/shooting/passing/dribbling/defending/physical (0-99 skill ratings, LLM-generated), market_value_eur (calculated via deterministic formula from statistics and age, not AI-generated), player_id (sequential identifier), image_path (relative path to matching player card illustration). The intended use is for teaching or demoing multimodal embeddings, recommendation systems, and LLM-based synthetic data generation pipelines. License: MIT.
TransferTalk Players Dataset 数据集概述
基本信息
- 规模:1,000 条数据,包含 17 列(16 个结构化字段 +
image_path) - 模态:文本 + 图像(多模态)
- 语言:英语
- 任务类型:文本生成、图像到文本
- 许可证:MIT
- 数据类别:合成数据、多模态、体育、足球(英式/美式足球)
- 数据量级:1K < n < 10K
核心特点
该数据集为完全合成、虚构的足球运动员档案数据集,包含 1,000 名球员的详细信息。所有球员、球队、联赛及国籍均属于虚构的宇宙("The Meridian League"),不涉及任何真实球员、球队或联赛,避免现实世界的知识产权、隐私或对真实人物产生幻觉的问题。
数据模式
| 字段 | 类型 | 描述 |
|---|---|---|
team |
字符串 | 虚构俱乐部名称 |
league |
字符串 | 虚构联赛名称 |
nationality |
字符串 | 虚构国籍 |
position |
字符串 | 场上位置(GK、CB、FB、DM、CM、AM、W、ST) |
style |
字符串 | 比赛风格原型(如"Poacher"、"Sweeper Keeper") |
age |
整数 | 17-38 岁 |
first_name、last_name、full_name |
字符串 | 虚构球员姓名 |
bio |
字符串 | 简短虚构传记(LLM 生成) |
strengths、weaknesses |
列表[字符串] | LLM 生成的优点与缺点 |
scouting_report |
字符串 | LLM 生成的球探报告文本 |
pace、shooting、passing、dribbling、defending、physical |
整数(0-99) | LLM 生成的技能评分 |
market_value_eur |
浮点数 | 派生值(非 AI 生成),通过统计数据和年龄的确定性公式计算 |
player_id |
整数 | 顺序标识符 |
image_path |
字符串 | 对应球员卡片插图的相对路径 |
生成方法
- 文本生成:使用本地开源权重 LLM(
Qwen/Qwen2.5-1.5B-Instruct) - 图像生成:使用
stabilityai/sdxl-turbo,通过 2 步 SDXL-Turbo 流水线生成 - 运行环境:
transformers/diffusers在 Colab GPU 上运行 - 生成方式:按每批 10 个配置文件,通过结构化 JSON 提示生成,每个批次使用随机采样的少量示例引导格式和写作风格;使用括号深度 JSON 修复程序从部分格式错误的模型输出中恢复有效对象
- 无抓取、无人工编写内容、无公式/随机替代生成内容本身
探索性数据分析(EDA)摘要
已发现并处理或标记的 AI 生成问题:
- 重复全名(初始 621/1000):初始名称池 20x20=400 种组合远小于 1,000 个样本,产生生日悖论冲突。已修复:将名称池扩展至 46x46=2,116 种组合。
- 不完整记录(32/1000):部分 LLM 响应在 JSON 中途截断,导致缺少必填字段。已修复:删除并重新生成。
- 重复全名再次出现(31/1000):修复 #2 的重新生成使用了原始小名称池,导致重复。已修复:采用与问题 #1 相同的方法解决。
- 统计值范围限制:尽管要求 0-99,模型从未产生极端值(观察范围为 4-98)。标记但未修正,作为轻微的指令遵循差距。
- 守门员统计建模:守门员(GK)的
defending平均值高于所有位置,因为模型对所有位置复用了相同的 6 项统计模式,而非守门员特定属性。标记为模式设计限制。 - 弱文本-数字对齐:使用"world class"、"exceptional"等最高级语言的
scouting_report配置文件,其market_value_eur仅比无此语言的配置文件平均高约 6.4%,方向正确但信号弱于预期。 - 年龄-38 分布检查:年龄 38 的计数(61)明显高于其他年龄的平均值(44.7,均匀采样下期望约 45.5),约 2.3 个标准差偏差。经审查判定为正常随机噪声,而非系统性错误。
统计相关性检查支持 LLM 通常保持了位置与技能评级之间的合理关系(如shooting与defending:-0.74;physical与defending:+0.59)。
仓库文件
transfertalk_players_raw.json、transfertalk_players_raw.csv— 数据集文件player_cards/— 1,000 张球员卡片图像({player_id}.png)Synthetic_Data_Generation.ipynb— 第 1 部分生成笔记本EDA_notebook.ipynb— 第 2 部分 EDA 笔记本
预期用途
该数据集为 TransferTalk 毕业设计项目构建,是一个类似 Transfermarkt 风格的多模态演示应用(推荐系统 + AI 生成的球探报告)。适用于教学/演示多模态嵌入、推荐系统和基于 LLM 的合成数据生成流水线。
许可证
MIT。所有内容均为合成和虚构。




