遇见数据集

T-ECD

收藏
github2026-08-10 更新2026-08-15 收录
官方服务:

资源简介:

T-ECD(T-Tech电子商务跨域数据集)是一个公开匿名的真实电子商务用户交互数据集,适用于推荐系统的教学和研究任务,包括实验室、课程、论文和科学实验。它保留了工业电子商务数据的特性:时间结构、稀疏性、流行度偏差、不同类型的操作、不同的交互界面以及多个具有重叠用户的域。

T-ECD (T-Tech Cross-domain E-commerce Dataset) is a publicly available, anonymized real-world e-commerce user interaction dataset intended for teaching and research tasks related to recommender systems, including laboratory experiments, coursework, academic papers, and scientific studies. It retains the core characteristics of industrial e-commerce data: temporal structure, sparsity, popularity bias, diverse interaction types, distinct interaction interfaces, and multiple domains with overlapping user bases.

创建时间:
2026-08-10
原始信息汇总

T-ECD 数据集概述

数据集简介

T-ECD(T-Tech E-commerce Cross-Domain Dataset)是一个开放的匿名化真实电子商务用户交互数据集,专为推荐系统的教学与研究设计,适用于实验课、课程设计、毕业论文及科学实验。

核心特征

  • 保留工业级电商数据特性:时间结构、稀疏性、流行度偏差
  • 包含多种用户行为类型和交互界面
  • 支持跨域推荐研究(多个领域存在重叠用户)

数据内容

用户事件:view(浏览)、click(点击)、clickout(点击离开)、like(点赞)
时间信息:事件时间戳
电商领域:marketplace、retail、offers、reviews、payments 等多个领域
交互界面:通过 subdomain 区分目录、搜索、推荐板块
商品目录:类别、子类别、品牌、内容嵌入向量
用户特征:匿名化区域和社会人口统计聚类
数据集版本

  • small:适用于教学和快速实验
  • full:适用于工业规模方法验证

快速开始

提供 Jupyter Notebook(T-ECD_quickstart.ipynb),支持本地笔记本或免费 Google Colab 运行,主要流程包括:

  1. 下载小规模数据切片
  2. 展示表结构
  3. 按时间构建训练/验证/测试集
  4. 训练 Random 和 TopPopular 基线模型
  5. 训练 iALS 模型
  6. 评估指标:HitRate@k、NDCG@k、Coverage@k
  7. 展示带商品类别的推荐结果

可通过调整笔记本开头的参数,选择不同领域、时间范围或数据量。

资源需求

场景 资源要求
small + 单领域 + 1-4周窗口 8-16 GB RAM,无需 GPU
small 全量或神经网络模型 16+ GB RAM,建议 GPU
full 分布式训练,参考多卡配置(如 8×H100)

资源有限时可:仅选取单一领域、限定日期范围、保留 top-N 活跃用户/热门商品、按需读取 parquet 列。

评估规范

严禁随机划分训练/测试集(避免未来信息泄漏),应采用:

  • train:过去时间段
  • validation:邻近未来(用于参数调优)
  • test:后续时间段(用于最终评估)

该时间分割方案已在 quickstart 笔记本中实现。

应用场景

  • 电商用户行为分析
  • 推荐系统构建与评估
  • 基线模型与个性化模型对比
  • 流行度偏差与多样性研究
  • 冷启动推荐
  • 跨域推荐
  • 序列推荐
  • 搜索、目录与推荐板块对用户行为的影响研究

更多任务思路可参考 usecases.md 文件。

数据获取方式

数据集可在 Hugging Face 平台获取(https://huggingface.co/datasets/t-tech/T-ECD),相关技术文章发布在 Habr(https://habr.com/ru/companies/tbank/articles/950696/),学术论文 DOI 为 https://doi.org/10.1145/3770855.3817588。

搜集汇总
数据集介绍
T-ECD 数据集图片
构建方式
T-ECD数据集由T-Tech构建,源自真实电商平台的匿名化用户交互记录。数据构建过程严格遵循工业级标准,涵盖了用户浏览、点击、点击出站及点赞等多种行为事件,并附有精确的时间戳。数据集中整合了多个电商领域,如市场、零售、优惠、评论和支付,通过子域区分不同的交互界面,如目录、搜索和推荐模块。商品目录信息丰富,包括类别、子类别、品牌及内容嵌入,用户特征则以匿名化的区域和社会人口统计聚类呈现。数据集提供小型和完整两个版本,分别适应教学研究和工业级规模的应用需求。
使用方法
T-ECD数据集的使用方法便捷多样,官方提供快速入门笔记本,支持在普通笔记本电脑或Google Colab上运行,自动下载数据子集并演示完整的最小工作流。使用者可通过调整参数灵活选择不同域、时间窗口和数据规模,以适应各自的计算资源。推荐评估协议强调时间顺序划分,避免随机划分导致的数据泄露。数据集适用于多种研究任务,如用户行为分析、推荐系统构建与评估、冷启动处理、跨域和序列推荐研究,并通过提供基线模型和评估指标(如HitRate、NDCG)简化对比实验。
背景与挑战
背景概述
T-ECD(T-Tech电子商务跨域数据集)是由T-Tech机构于2025年创建并公开的匿名化真实电商用户交互数据集,其核心研究问题在于为推荐系统领域提供一个兼具工业级复杂性与可访问性的实验平台。该数据集保留了工业数据的核心特质,包括时间序列结构、稀疏性、流行度偏差、多元行为类型(如浏览、点击、购买意向和收藏),并整合了市场、零售、优惠、评论及支付等多个电商域,同时通过子域名映射了目录、搜索和推荐等交互界面。T-ECD的发布对推荐系统研究产生了显著影响,为跨域推荐、序列推荐、冷启动及流行度偏差等前沿课题提供了宝贵的数据基础,其配套的科学出版物(DOI:10.1145/3770855.3817588)进一步巩固了其学术价值。
当前挑战
T-ECD所面临的挑战涵盖领域问题的复杂性与构建过程的艰巨性。在领域层面,该数据集旨在推动推荐系统研究的深入,如跨域知识迁移、时序建模及稀疏交互下的冷启动难题,同时需应对工业场景中固有的流行度偏差和多样化行为信号的融合。构建过程中,首要挑战是确保数据的匿名化与隐私保护,同时保留足够的特征粒度(如用户社会人口统计聚类和内容嵌入)以供研究。此外,设计双版本(small与full)需在数据规模与资源需求间取得平衡,训练/验证/测试的时间切片划分需严格避免未来信息泄露,而多域异构数据的整合及大规模交互矩阵的高效存储(如parquet格式)亦对数据集架构提出了苛刻要求,这些均体现了构建高质量基准数据集的复杂工程挑战。
常用场景
经典使用场景
T-ECD数据集作为首个保留工业级电商特性的跨域匿名交互数据集,其经典使用场景集中于推荐系统的学术验证与教学实践。研究者可基于其多域覆盖(市场、零售、报价、评论、支付)与时间戳结构化事件流,开展离线评测与模型对比。数据集设计遵循时序一致性原则,提供基于时间划分的训练/验证/测试协议,有效规避传统随机切分导致的数据泄漏问题。其轻量级版本支持快速原型验证,而完整版本则面向规模化实验,使得从课程设计到前沿课题研究均能以此为依据,构建可复现、可比较的推荐算法评估基准。
解决学术问题
该数据集精准解决了推荐系统领域长期存在的工业级数据稀缺与benchmark失真的双重挑战。T-ECD保留了真实电商环境中的稀疏性、流行度偏差及多行为类型(浏览、点击、点击出、点赞),使学术研究能够深入探究这些现象对模型泛化能力的影响。其跨域结构及用户重叠特性,为跨域推荐、冷启动和序列推荐等前沿问题提供了天然实验场。此外,通过分离不同交互表面(目录、搜索、推荐块),研究者可量化各模块对用户行为的贡献,促进对推荐生态系统的系统性理解,从而推动学术方法向工业应用的可靠过渡。
实际应用
在实际应用层面,T-ECD可直接服务于电商平台的推荐系统优化与决策支持。工程团队可借助该数据集模拟真实流量分布,测试多目标排序、多样性控制及流行度偏差缓解策略,从而提升用户参与度和平台转化率。其多域覆盖特性有助于构建统一推荐模型,实现跨业务线(如零售与支付)的知识迁移,降低冷启动阶段的运营成本。同时,时间窗口切分方案支持在线学习与增量更新策略的离线模拟,使算法迭代更为稳健。该数据集亦可作为教学工具,帮助学生建立从数据预处理到模型评估的完整工业级思维,缩短学术与产业实践之间的鸿沟。
数据集最近研究
最新研究方向
T-ECD 作为首个源自工业级多域电子商务平台的匿名交互数据集,其前沿研究方向聚焦于跨域推荐与序列推荐的深度融合,旨在应对真实场景中数据稀疏性与流行度偏差的双重挑战。该数据集凭借其保留时间结构、多交互类型及多表面(目录、搜索、推荐块)的独特设计,为验证大模型时代下的冷启动策略与个性化排序算法提供了严苛的测试床。近期研究趋势着力于利用其时间切分协议,探索在非独立同分布数据分布下,如何提升推荐系统对动态用户兴趣的捕捉能力及多样性表现,从而弥合学术实验与工业部署之间的鸿沟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务