遇见数据集

calcio-guru

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

Calcio Guru — Italian Football 是一个专为自托管检索增强生成(RAG)聊天机器人构建的、完全可重新分发的意大利足球知识库。该数据集聚焦于意大利足球联赛体系,涵盖意甲、意乙和意丙联赛。数据集包含两个核心组件:一是预构建的Qdrant向量存储(使用mxbai-embed-large模型,维度为1024,包含约10,100个向量点),用户下载后可直接使用,无需进行额外的文本嵌入处理;二是由1,518个源文本文档组成的原始语料库,每个文档对应一个.txt文件,内容包括俱乐部阵容、俱乐部简介、维基百科文章、赛季信息以及比赛结果文件。数据来源于三个开放且可自由分发的渠道:Wikidata(CC0许可)提供俱乐部阵容、球员出场与进球数据、荣誉记录、经理信息以及自1898年以来的赛季冠军信息;Wikipedia(CC BY-SA 4.0许可)提供俱乐部、德比战、赛事相关的文章、赛季总结以及球员和经理的传记;openfootball(CC0许可)提供2013年至今的意甲和意乙比赛结果。整个语料库在CC BY-SA 4.0许可下整合发布,确保了使用的合规性。该数据集专为足球领域的问答、信息检索和聊天机器人应用而设计,特别适用于构建基于RAG架构的、具备深度领域知识的AI助手。数据集支持英语和意大利语。

Calcio Guru — Italian Football is a fully redistributable knowledge base for self-hosted Retrieval-Augmented Generation (RAG) chatbots, focused on Italian football. The dataset covers the Italian football league system, including Serie A, Serie B, and Serie C. It consists of two core components: a pre-built Qdrant vector store (using the mxbai-embed-large model with 1024 dimensions, containing approximately 10,100 vector points) that users can download and use directly without additional text embedding processing, and an original corpus of 1,518 source text documents, each in a .txt file, containing club rosters, club profiles, Wikipedia articles, season information, and match results. The data is sourced from three open and freely distributable channels: Wikidata (CC0 license) provides club rosters, player appearances and goals, honors, manager information, and season champions since 1898; Wikipedia (CC BY-SA 4.0 license) provides articles on clubs, derbies, competitions, season summaries, and biographies of players and managers; openfootball (CC0 license) provides match results for Serie A and Serie B from 2013 onwards. The entire corpus is integrated and released under the CC BY-SA 4.0 license, ensuring compliance. The dataset is designed for football-related question answering, information retrieval, and chatbot applications, particularly suitable for building AI assistants with deep domain knowledge based on RAG architecture. The dataset supports English and Italian.

创建时间:
2026-06-13
原始信息汇总

数据集概述

数据集名称:Calcio Guru — Italian Football

许可协议:CC BY-SA 4.0(可再分发)

语言:英语、意大利语

标签:足球、意甲、意大利、RAG、Qdrant

用途:为自托管RAG聊天机器人“Calcio Guru”提供意甲/意乙/意丙足球知识库。


文件内容

  • seriea-qdrant-open.tar.gz
    预构建的Qdrant向量存储(基于mxbai-embed-large模型,1024维,约10,100个向量点)。可通过项目脚本scripts/restore-vectors.sh恢复。

  • corpus.zip
    1,518份源文本文档,包含俱乐部名单、个人简介、维基百科文章、赛季总结、比赛结果等(每份为.txt文件)。


数据来源与许可(均可再分发)

来源 许可 内容
Wikidata CC0 俱乐部名单(含出场/进球)、个人简介、荣誉、教练、自1898年以来的赛季冠军
Wikipedia CC BY-SA 4.0 俱乐部/德比/赛事文章、赛季总结、球员与教练传记
openfootball CC0 2013年至今的意甲、意乙比赛结果

组合后的语料库以 CC BY-SA 4.0 发布(继承Wikipedia的相同许可条款),需注明来源为Wikidata、Wikipedia和openfootball。不包含受版权保护的书籍、爬取数据或非商业来源。

搜集汇总
数据集介绍
calcio-guru 数据集图片
构建方式
该数据集基于三类可自由分发的数据源构建而成,分别源自Wikidata(CC0许可)收录的俱乐部阵容、球员出场与进球数据、荣誉及教练信息,以及自1898年以来的赛季冠军记录;Wikipedia(CC BY-SA 4.0许可)提供的俱乐部、德比赛事、联赛赛季总结及球员教练传记;以及openfootball(CC0许可)收录的自2013年至今的意甲与意乙比赛结果。这三类数据经过整合与清洗,最终形成包含1518份独立文本文件的语料库,并以每份文件对应一个俱乐部名册、球员简介或赛季结果等实体的方式进行组织。
特点
该数据集的最大特色在于其完全可再分发性与即用性,不仅提供了原始文本语料库(corpus.zip),还附带了基于mxbai-embed-large模型构建的预置Qdrant向量存储(seriea-qdrant-open.tar.gz),包含约10100个1024维向量。用户无需自行执行嵌入计算,只需下载向量存储并通过项目脚本恢复,即可直接用于检索增强生成(RAG)聊天机器人。此外,所有数据均来自合规的开源许可来源,避免了版权争议,适合学术研究与工业应用。
使用方法
用户可通过克隆Calcio Guru项目仓库,并从HuggingFace详情页下载预置的Qdrant向量存储文件(seriea-qdrant-open.tar.gz),利用项目提供的scripts/restore-vectors.sh脚本进行恢复,即可跳过嵌入生成步骤,直接进行语义检索。若需自定义嵌入或查看原始数据,可下载corpus.zip解压后获得1518份文本文件,结合任意嵌入模型与向量数据库重新构建索引。该数据集尤适用于构建意甲足球领域的问答系统或知识增强型对话模型,支持英文与意大利文双语内容。
背景与挑战
背景概述
数据集Calcio Guru由致力于意大利足球智能问答的研究团队创建,发布于2024年,旨在构建一个完全可再分发的知识库,以支持自托管RAG(检索增强生成)聊天机器人。该数据集聚焦于意大利足球的顶级联赛(Serie A、Serie B和Serie C),整合了来自Wikidata(CC0)、Wikipedia(CC BY-SA 4.0)和openfootball(CC0)的公开数据,涵盖俱乐部名单、球员档案、赛季结果及历史冠军信息等1518个文本文件。通过预构建的Qdrant向量存储(基于mxbai-embed-large模型,1024维,约10100个向量点),研究者可跳过嵌入步骤直接进行对话式查询,极大降低了非专业用户构建足球领域问答系统的门槛。该数据集以CC BY-SA 4.0许可发布,保障了学术与商业场景的合规使用,成为意大利足球知识图谱与自然语言交互研究的代表性资源。
当前挑战
该数据集面临的挑战首先源于领域问题的复杂性:足球信息具有高度动态性,例如球员转会、教练更迭及赛事结果需实时更新,而现有静态文本库难以反映最新变动,可能引发RAG系统的过时回复。其次,构建中需调和来自Wikidata、Wikipedia和openfootball的多源异构数据,如维基百科的叙述性文本与openfootball的结构化结果在格式与粒度上存在差异,预处理时需设计统一的字段映射与去重策略。此外,预构建向量存储依赖特定嵌入模型(1024维),若后续模型版本升级或替换,需重新生成全部向量点,影响系统的可移植性。最后,数据许可的合规性要求严格(仅限CC0与CC BY-SA 4.0),排除了商业媒体与付费数据库,导致某些深度统计(如球员薪资、转会费)缺失,限制了问答的知识边界。
常用场景
经典使用场景
Calcio Guru数据集专为意大利足球领域的检索增强生成(RAG)系统设计,其经典使用场景在于构建一个可完全再分发的、自托管的足球知识问答机器人。该数据集包含1518份文本语料,覆盖了意大利足球甲级、乙级及丙级联赛的俱乐部阵容、球员档案、赛季总结、比赛结果及维基百科文章,并配套提供了基于mxbai-embed-large模型构建的约10100个向量的Qdrant向量存储。研究者可直接克隆项目仓库并加载向量存储,无需重复执行嵌入计算,即可快速部署一个面向意大利足球的智能问答系统,实现高效的信息检索与自然语言生成。
实际应用
在实际应用场景中,Calcio Guru数据集支撑了多种面向球迷和体育从业者的智能服务。它可以被集成到个人或社区搭建的足球资讯平台中,作为后台知识引擎,实时回答关于历史冠军、球员转会、比赛结果等查询。媒体机构和数据分析公司可利用其构建自动化的赛事报道辅助系统,或为解说员提供即时背景信息。此外,该数据集的向量存储特性使其适合移动端和边缘设备部署,用户无需依赖云端API即可获得离线问答能力,这在网络受限的环境下尤其具有实用价值。
衍生相关工作
Calcio Guru数据集本身作为RAG系统的一部分,催生了一系列相关研究工作。其预构建向量存储的端到端流程启发了领域特定的知识库构建方法论,例如如何从多源异构数据(结构化表格、非结构化文本)中提取并整合信息。后续工作可能围绕增强查询多样性、处理跨语言事实冲突、以及针对体育赛事动态更新向量索引等方向展开。该数据集也常被用作对比实验的基座,用于评估不同嵌入模型、检索策略或生成模型在垂直领域RAG任务中的效果,推动了轻量化、可复现的对话系统设计范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务