遇见数据集

PleIAs/Telco-Common-Corpus

收藏
Hugging Face2026-06-25 更新2026-07-22 收录
官方服务:

资源简介:

Telco Common Corpus (TCC) 是一个包含约100亿标记的完全开放、免费许可的电信知识集合,涵盖科学文献、专利、开放数据和开放网络项目,其许可和来源在文档级别进行了验证。该数据集源于GSMA为使AI服务于电信行业的努力,旨在解决当前模型在电信任务(如网络管理)上的不足。数据来源多样,包括3GPP预备文档、RFC规范、IEEE开放获取论文、美国及欧盟专利、Wikipedia和Wikidata的电信相关内容等,总计约100亿标记。处理过程使用Pleias内部管道(Stratum)和开源视觉语言模型(如dots.ocr)解析文档,保留表格等结构,并主要通过CommonLingua检测语言,数据集主要为英语。

Telco Common Corpus (TCC) is a ten billion tokens collection of fully open, free licensed telecommunications knowledge (scientific literature, patents, open data, and open-web projects) with licence and provenance verified at a document-level. It stems from GSMAs effort to make AI work for the telecom sector, addressing shortcomings in current models for telecom tasks. The dataset comprises diverse sources including 3GPP preparatory documents, RFC specifications, IEEE open access papers, US and EU patents, Wikipedia and Wikidata telecom content, totaling approximately ten billion tokens. Processing involves a Pleias internal pipeline (Stratum) using open weights VLMs like dots.ocr to parse documents while preserving structure, and the dataset is primarily English with language detection via CommonLingua.

提供机构:
PleIAs
搜集汇总
数据集介绍
PleIAs/Telco-Common-Corpus 数据集图片
构建方式
Telco Common Corpus (TCC) 的构建源于 GSMA 推动人工智能在电信领域应用的宏大愿景。当前模型在真实电信任务(如网络管理)中表现欠佳,且多年未有显著进步,基于此,TCC 应运而生。该数据集精心整合了逾百亿词元的电信知识,来源涵盖经同行评议的科研文献、专利、开源项目及开放数据,并严格以文档级别验证其许可与出处。在构建过程中,多数原始文档为 doc 或 PDF 格式,需借助先进处理技术。研究者利用 Pleias 内部管道(Stratum),依靠开放权重的视觉语言模型(如 dots.ocr)对每份文档进行章节级精细解析,从而保留表格等关键结构信息。最终,通过 CommonLingua 语言检测工具识别少数非英语文档,确保数据集以英语为主体,形成规模宏大、来源多元的专业语料库。
特点
TCC 的独特之处在于其来源的丰富性与专业性。语料涵盖 3GPP 准备文档、RFC 规范与草案、IEEE 开放获取期刊、OpenAlex 开放论文、美国与欧盟专利、维基百科电信条目等十余类数据,其中 3GPP 文档和 IEEE 论文分别贡献约 35 亿与 12 亿词元,专利合计近 30 亿词元,构成了深厚的专业知识基底。所有来源均经许可证验证,公共领域和 CC 系列许可为主,确保了合规性与开放性。文档级别的溯源能力使得训练数据透明度极高,有助于模型理解电信领域的技术术语、标准演进与专利细节。这种聚焦于电信核心知识的多源异构特征,使其在现有模型中独树一帜,为提升模型在电信基准任务上的表现奠定了坚实基础。
使用方法
使用 TCC 时,研究者可将其作为预训练或领域微调的专用语料库。由于数据集以文档级标注许可和来源信息,用户能够灵活筛选特定类型的数据(如仅使用 3GPP 准备文档或 IEEE 论文)以适应不同训练需求。数据经过精细的章节级解析,保留了表格等结构要素,便于模型学习技术文档中的格式化信息。推荐在训练前根据任务目标进行进一步过滤与分词,例如针对网络管理任务优先选择 RFC 或标准文档。研究者可直接从 Hugging Face 平台获取数据集,并结合现有框架(如 Hugging Face Transformers 或 Datasets 库)加载,借助其开放的许可证属性,可安全地用于学术研究或商用场景,推动电信专用大语言模型的发展。
背景与挑战
背景概述
电信行业作为现代社会的基础设施,其技术文档与知识体系高度专业化,然而当前大语言模型在电信任务上表现不佳,尤其在网络管理与运维等关键领域进展甚微。Telco-Common-Corpus(TCC)数据集由GSMA主导,联合Pleias等机构于近期创建,旨在构建首个经文档级许可与来源验证的开放电信知识语料库。该数据集汇聚了来自3GPP标准文档、IETF RFC规范、IEEE开放获取论文、美欧专利及维基百科等多元来源的百亿级token,覆盖从传播理论到编码算法的全领域知识。TCC的发布填补了电信领域高质量开放语料的空白,为构建领域专用大模型奠定了数据基础,有望推动电信人工智能从通用模型向专业应用的实质性跃迁。
当前挑战
TCC所面临的挑战首先源于领域自身的技术复杂性:电信任务涵盖网络配置优化、故障诊断、协议合规性检验等高度专业场景,现有通用模型缺乏对标准规范(如3GPP、IETF RFC)的深层语义理解,且过去两年性能未见显著提升。在数据集构建过程中,挑战同样严峻:原始数据多源自PDF或DOC文档,存在格式异构、表格结构复杂、版权归属模糊等问题,需依赖开放权重视觉语言模型进行文档级精准解析与结构还原,同时借助语言检测工具对极少量多语言内容进行识别与过滤。此外,跨来源的许可证兼容性验证与元数据标准化工作,进一步增加了语料清洗的成本与难度。
常用场景
经典使用场景
Telco-Common-Corpus(TCC)作为首个十亿级规模、全开放许可的电信领域语料库,其经典使用场景集中于预训练大规模语言模型(LLM)的领域适应阶段。研究者和工程师可直接用其微调通用LLM,或从头训练专用于电信任务的模型,因语料内容横跨3GPP标准文档、IETF规范、IEEE开放论文及美欧专利,确保模型能深度掌握网络协议、频谱规划、编码算法等核心知识。该语料库的分层结构(保留表格与章节逻辑)使模型能准确理解技术文档中的复杂格式,从而在部署中有效解析标准文档、应答运维查询并辅助设计决策。
解决学术问题
TCC的构建直面当前LLM在电信任务中性能停滞不前的关键学术困境——开放基准测试揭示现有模型对网络管理与标准化术语的理解远未达到实用水平。该数据集通过提供经文档级许可验证、去重且结构保留的高质量语料,从根本上解决了领域专属语料匮乏、许可不清导致的研究可复现性障碍。其意义在于跨越了通用知识与行业深水区之间的鸿沟,使学界得以开展电信领域的持续预训练、知识蒸馏及多任务评估,最终推动模型在专业问答、故障诊断和标准解释等任务上实现可观测的进步。
衍生相关工作
TCC的发布催生了多项标志性衍生研究,最直接的当属Open-Telco LLM Benchmarks——基于该语料构建的电信模型评测体系,系统衡量LLM在30余项真实任务上的表现。此外,Pleias团队围绕其开源管道Stratum开发了文档解析与质量控制方法,如利用视觉语言模型(dots.ocr)还原PDF表格结构,以及使用CommonLingua进行多语言过滤,这些技术随后被迁移至法律、医学等其他专业领域。学术界亦出现若干在TCC基础上进行持续预训练的改进方案,通过对比不同许可语料对模型鲁棒性的贡献,推动了对开放数据生态在专业AI中价值的深入理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务