T-ECD
收藏资源简介:
T-ECD(T-Tech电子商务跨域数据集)是一个公开匿名的真实电子商务用户交互数据集,适用于推荐系统的教学和研究任务,包括实验室、课程、论文和科学实验。它保留了工业电子商务数据的特性:时间结构、稀疏性、流行度偏差、不同类型的操作、不同的交互界面以及多个具有重叠用户的域。
T-ECD (T-Tech Cross-domain E-commerce Dataset) is a publicly available, anonymized real-world e-commerce user interaction dataset intended for teaching and research tasks related to recommender systems, including laboratory experiments, coursework, academic papers, and scientific studies. It retains the core characteristics of industrial e-commerce data: temporal structure, sparsity, popularity bias, diverse interaction types, distinct interaction interfaces, and multiple domains with overlapping user bases.
T-ECD 数据集概述
数据集简介
T-ECD(T-Tech E-commerce Cross-Domain Dataset)是一个开放的匿名化真实电子商务用户交互数据集,专为推荐系统的教学与研究设计,适用于实验课、课程设计、毕业论文及科学实验。
核心特征
- 保留工业级电商数据特性:时间结构、稀疏性、流行度偏差
- 包含多种用户行为类型和交互界面
- 支持跨域推荐研究(多个领域存在重叠用户)
数据内容
用户事件:view(浏览)、click(点击)、clickout(点击离开)、like(点赞)
时间信息:事件时间戳
电商领域:marketplace、retail、offers、reviews、payments 等多个领域
交互界面:通过 subdomain 区分目录、搜索、推荐板块
商品目录:类别、子类别、品牌、内容嵌入向量
用户特征:匿名化区域和社会人口统计聚类
数据集版本:
small:适用于教学和快速实验full:适用于工业规模方法验证
快速开始
提供 Jupyter Notebook(T-ECD_quickstart.ipynb),支持本地笔记本或免费 Google Colab 运行,主要流程包括:
- 下载小规模数据切片
- 展示表结构
- 按时间构建训练/验证/测试集
- 训练 Random 和 TopPopular 基线模型
- 训练 iALS 模型
- 评估指标:HitRate@k、NDCG@k、Coverage@k
- 展示带商品类别的推荐结果
可通过调整笔记本开头的参数,选择不同领域、时间范围或数据量。
资源需求
| 场景 | 资源要求 |
|---|---|
| small + 单领域 + 1-4周窗口 | 8-16 GB RAM,无需 GPU |
| small 全量或神经网络模型 | 16+ GB RAM,建议 GPU |
| full | 分布式训练,参考多卡配置(如 8×H100) |
资源有限时可:仅选取单一领域、限定日期范围、保留 top-N 活跃用户/热门商品、按需读取 parquet 列。
评估规范
严禁随机划分训练/测试集(避免未来信息泄漏),应采用:
- train:过去时间段
- validation:邻近未来(用于参数调优)
- test:后续时间段(用于最终评估)
该时间分割方案已在 quickstart 笔记本中实现。
应用场景
- 电商用户行为分析
- 推荐系统构建与评估
- 基线模型与个性化模型对比
- 流行度偏差与多样性研究
- 冷启动推荐
- 跨域推荐
- 序列推荐
- 搜索、目录与推荐板块对用户行为的影响研究
更多任务思路可参考 usecases.md 文件。
数据获取方式
数据集可在 Hugging Face 平台获取(https://huggingface.co/datasets/t-tech/T-ECD),相关技术文章发布在 Habr(https://habr.com/ru/companies/tbank/articles/950696/),学术论文 DOI 为 https://doi.org/10.1145/3770855.3817588。




