登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Product Catalog Deduplication Dataset
Product Catalog Deduplication Dataset
收藏
kaggle
2026-03-13 更新
2026-03-21 收录
产品目录
数据去重
数据链接:
https://www.kaggle.com/datasets/tahaberkterekli/synthetic-e-commerce-product-matching-dataset
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
A synthetic dataset for product catalog matching, entity resolution, and dedupli
应用场景:
创建时间:
2026-03-13
相关数据集
🛍️ Shop Product Catalog Dataset
电子商务
产品目录
A structured retail dataset of branded fashion products with detailed attributes
kaggle
2025-06-06 更新
12
0
timaeus/pile-pile-cc-elimination-slm-l1sae416
文本处理
数据去重
这是一个包含文本数据和元数据的数据集,文本数据以字符串形式存储,元数据包含数据集名称等信息。数据集划分为训练集,共有25579个示例,数据集总大小为111443159.40223字节,下载大小为66917860字节。
Hugging Face
2025-03-17 更新
7
0
10% dilution test (dedup)
数据去重
性能测试
Deduplicated simulation datasets for performance comparison (10% dilution)
DataCite Commons
2020-09-23 更新
6
0
GitHub Repository Deduplication Dataset
软件工程
数据去重
GitHub Repository Deduplication Dataset是由雅典经济与商业大学创建的一个数据集,旨在解决GitHub项目复制和分叉导致的软件工程研究结果偏差问题。该数据集包含10649348个重复的GitHub项目,每个项目都与一个最终的父项目关联,这些父项目是根据六种度量标准进行排名的。数据集通过创建一个由18.2百万节点和12百万边组成的去噪图来计算相关项目,该图通过将边
arXiv
2020-06-16 更新
9
0
bigcode/stack-dedup-python-fns
Python编程语言
数据去重
--- dataset_info: features: - name: content dtype: string - name: id dtype: int64 splits: - name: train num_bytes: 5830516471 num_examples: 5359051 download_size: 277979509
Hugging Face
2024-04-30 更新
6
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广