arabic-ecom-data
收藏资源简介:
该数据集是用于微调电商检索和嵌入模型的阿拉伯语查询-产品对训练数据,由LLM(qwen3.6-27b-awq模型)生成,包含现代标准阿拉伯语和利比亚方言内容。数据集包含两个配置子集:pairs_with_negatives包含133,605个样本(训练集125,517,测试集8,088),每个样本包含用户查询、正面对应文档和挖掘的困难负面对文档,形成三元组结构;positives包含589,865个样本(训练集558,253,测试集31,612),每个样本仅包含用户查询和正面对应文档(困难负面对文档为null)。数据采用基于查询文本哈希的严格分割方式,确保查询不跨分割泄露,且与评估基准数据集完全分离。每个样本的文档包含名称、品牌、类别、属性和描述字段。该数据集专门用于电商目录搜索任务,支持对比学习训练,可联合使用两个子集进行模型微调。数据来源于单一电商平台目录,为合成数据,近似但不完全等同于真实用户查询。
数据集概述
数据集名称:Arabic E-Commerce Search Training Data
数据集地址:https://huggingface.co/datasets/prestoai/arabic-ecom-data
语言:阿拉伯语(现代标准阿拉伯语 + 利比亚方言)
任务类别:文本检索、句子相似度
标签:电子商务、阿拉伯语、搜索、检索、利比亚方言、MSA、训练数据、困难负样本、对比学习
数据集规模:100K ~ 1M 条记录
数据来源与生成方式
- 数据由大语言模型
qwen3.6-27b-awq合成生成,模拟用户查询与产品文档的匹配关系。 - 基于单一电子商务平台的商品目录构建,类别分布可能不适用于所有阿拉伯市场。
- 该数据集是 训练集,对应的评估基准为
prestoai/arabic-ecom-search-bench,建议在此训练,在评估基准上测试。
子集配置
该数据集包含两个子集,可通过 Hugging Face load_dataset 的 config_name 参数选择:
| 子集名称 | 训练集 | 测试集 | 总计 | 说明 |
|---|---|---|---|---|
pairs_with_negatives |
125,517 | 8,088 | 133,605 | 每行包含一个正样本和一个挖掘得到的困难负样本(三元组格式) |
positives |
558,253 | 31,612 | 589,865 | 每行仅包含正样本,困难负样本字段为 null |
训练/测试集划分规则
- 划分依据:对查询文本
user_query取 MD5 哈希值,根据md5(user_query) % 100的值分配,当结果 >= 95 时归入测试集。 - 同一查询文本的所有数据行保证落在同一分区,无查询泄露。
- 两个子集使用相同的划分边界,因此训练时联合使用不会产生跨子集泄露。
- 此数据集的查询与评估基准
arabic-ecom-search-bench的查询互不相交。
数据模式
两个子集共享相同的列结构:
json { "user_query": "...", "positive_document": { "name": "...", "brand": null, "categories": ["..."], "attributes": [], "description": "..." }, "hard_negative_document": { "name": "...", ... } | null }
user_query:用户查询文本positive_document:与查询匹配的正样本产品文档,包含名称、品牌、类别、属性、描述hard_negative_document:挖掘出的困难负样本产品文档,在positives子集中为null
使用示例
python from datasets import load_dataset
加载三元组数据(锚点 + 正样本 + 困难负样本)
pairs = load_dataset("prestoai/arabic-ecom-data", "pairs_with_negatives") pairs_train, pairs_test = pairs["train"], pairs["test"]
加载仅正样本数据(训练时可使用批次内负采样)
pos = load_dataset("prestoai/arabic-ecom-data", "positives") pos_train, pos_test = pos["train"], pos["test"]
典型用法:在对比学习微调中联合使用两个子集,positives 提供批次内负样本,pairs_with_negatives 提供挖掘的困难负样本。将产品文档渲染为 name | brand | categories | attributes | description 格式输入文本编码器。
局限性
- 合成数据:查询和文档均由大语言模型生成,模拟而非真实的用户查询。
- 目录来源单一:数据源自单个电子商务平台,类别分布可能无法泛化到所有阿拉伯市场。
- 方言覆盖:仅包含现代标准阿拉伯语和利比亚方言。
许可协议
该数据集仅用于研究和评估目的。
引用信息
bibtex @misc{arabicecomsearchbench2025, title={ArabicEcomSearchBench: A Benchmark for End-to-End Arabic E-Commerce Retrieval}, author={Mohamed Okasha, AbuBaker Naji and Talal Badi}, year={2025}, url={https://huggingface.co/datasets/prestoai/arabic-ecom-search-bench} }





