遇见数据集

arabic-ecom-data

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

该数据集是用于微调电商检索和嵌入模型的阿拉伯语查询-产品对训练数据,由LLM(qwen3.6-27b-awq模型)生成,包含现代标准阿拉伯语和利比亚方言内容。数据集包含两个配置子集:pairs_with_negatives包含133,605个样本(训练集125,517,测试集8,088),每个样本包含用户查询、正面对应文档和挖掘的困难负面对文档,形成三元组结构;positives包含589,865个样本(训练集558,253,测试集31,612),每个样本仅包含用户查询和正面对应文档(困难负面对文档为null)。数据采用基于查询文本哈希的严格分割方式,确保查询不跨分割泄露,且与评估基准数据集完全分离。每个样本的文档包含名称、品牌、类别、属性和描述字段。该数据集专门用于电商目录搜索任务,支持对比学习训练,可联合使用两个子集进行模型微调。数据来源于单一电商平台目录,为合成数据,近似但不完全等同于真实用户查询。

创建时间:
2026-06-28
原始信息汇总

数据集概述

数据集名称:Arabic E-Commerce Search Training Data
数据集地址:https://huggingface.co/datasets/prestoai/arabic-ecom-data
语言:阿拉伯语(现代标准阿拉伯语 + 利比亚方言)
任务类别:文本检索、句子相似度
标签:电子商务、阿拉伯语、搜索、检索、利比亚方言、MSA、训练数据、困难负样本、对比学习
数据集规模:100K ~ 1M 条记录

数据来源与生成方式

  • 数据由大语言模型 qwen3.6-27b-awq 合成生成,模拟用户查询与产品文档的匹配关系。
  • 基于单一电子商务平台的商品目录构建,类别分布可能不适用于所有阿拉伯市场。
  • 该数据集是 训练集,对应的评估基准为 prestoai/arabic-ecom-search-bench,建议在此训练,在评估基准上测试。

子集配置

该数据集包含两个子集,可通过 Hugging Face load_datasetconfig_name 参数选择:

子集名称 训练集 测试集 总计 说明
pairs_with_negatives 125,517 8,088 133,605 每行包含一个正样本和一个挖掘得到的困难负样本(三元组格式)
positives 558,253 31,612 589,865 每行仅包含正样本,困难负样本字段为 null

训练/测试集划分规则

  • 划分依据:对查询文本 user_query 取 MD5 哈希值,根据 md5(user_query) % 100 的值分配,当结果 >= 95 时归入测试集。
  • 同一查询文本的所有数据行保证落在同一分区,无查询泄露。
  • 两个子集使用相同的划分边界,因此训练时联合使用不会产生跨子集泄露。
  • 此数据集的查询与评估基准 arabic-ecom-search-bench 的查询互不相交。

数据模式

两个子集共享相同的列结构:

json { "user_query": "...", "positive_document": { "name": "...", "brand": null, "categories": ["..."], "attributes": [], "description": "..." }, "hard_negative_document": { "name": "...", ... } | null }

  • user_query:用户查询文本
  • positive_document:与查询匹配的正样本产品文档,包含名称、品牌、类别、属性、描述
  • hard_negative_document:挖掘出的困难负样本产品文档,在 positives 子集中为 null

使用示例

python from datasets import load_dataset

加载三元组数据(锚点 + 正样本 + 困难负样本)

pairs = load_dataset("prestoai/arabic-ecom-data", "pairs_with_negatives") pairs_train, pairs_test = pairs["train"], pairs["test"]

加载仅正样本数据(训练时可使用批次内负采样)

pos = load_dataset("prestoai/arabic-ecom-data", "positives") pos_train, pos_test = pos["train"], pos["test"]

典型用法:在对比学习微调中联合使用两个子集,positives 提供批次内负样本,pairs_with_negatives 提供挖掘的困难负样本。将产品文档渲染为 name | brand | categories | attributes | description 格式输入文本编码器。

局限性

  • 合成数据:查询和文档均由大语言模型生成,模拟而非真实的用户查询。
  • 目录来源单一:数据源自单个电子商务平台,类别分布可能无法泛化到所有阿拉伯市场。
  • 方言覆盖:仅包含现代标准阿拉伯语和利比亚方言。

许可协议

该数据集仅用于研究和评估目的。

引用信息

bibtex @misc{arabicecomsearchbench2025, title={ArabicEcomSearchBench: A Benchmark for End-to-End Arabic E-Commerce Retrieval}, author={Mohamed Okasha, AbuBaker Naji and Talal Badi}, year={2025}, url={https://huggingface.co/datasets/prestoai/arabic-ecom-search-bench} }

搜集汇总
数据集介绍
arabic-ecom-data 数据集图片
构建方式
该数据集由大语言模型qwen3.6-27b-awq生成,专门为阿拉伯语电商搜索场景构建。数据源自单一电商平台的商品目录,涵盖现代标准阿拉伯语和利比亚方言。数据集包含两个子集:pairs_with_negatives提供三元组结构(查询、正例文档与挖掘出的难负例),而positives仅包含正例对。训练集与测试集通过查询文本的MD5哈希值按比例划分(桶≥95归入测试),确保同一查询始终落在同一分区,且两个子集共享相同的划分边界,避免数据泄露。
特点
该数据集规模介于10万至100万条之间,其中positives子集包含约58.9万条正例对,pairs_with_negatives子集包含约13.3万条三元组。每个样本包含用户查询和结构化产品文档(名称、品牌、类别、属性、描述),方便文本编码器处理。难负例通过挖掘技术生成,增强了对比学习训练的效果。数据集的查询和文档均为合成生成,虽能模拟真实用户查询,但类别分布可能无法完全泛化至所有阿拉伯语市场。
使用方法
用户可通过HuggingFace的load_dataset函数加载数据集,指定子集名称即可获取对应的训练和测试拆分。典型用法是同时加载两个子集进行联合训练:positives提供批次内负例,pairs_with_negatives提供挖掘的难负例。加载后,可将每个产品文档拼接为'名称 | 品牌 | 类别 | 属性 | 描述'的文本形式,输入到文本编码器中。该数据集与阿拉伯语电商搜索基准测试集配合使用,在训练后评估检索和嵌入模型的性能。
背景与挑战
背景概述
阿拉伯语电子商务搜索领域长期面临数据稀缺的困境,尤其是针对现代标准阿拉伯语和利比亚方言的检索与嵌入模型训练资源匮乏。由Mohamed Okasha、AbuBaker Naji和Talal Badi于2025年创建的arabic-ecom-data数据集,依托大型语言模型qwen3.6-27b-awq生成合成查询与产品描述,构建了包含约59万正样本对和13万含困难负样本三元组的训练数据。该数据集与对应的评估基准arabic-ecom-search-bench形成完整训练-评估闭环,通过基于查询文本哈希的严格分割策略避免数据泄露,为阿拉伯语电子商务检索研究提供了标准化训练资源,显著推动了该领域的发展。
当前挑战
数据集面临的核心挑战源于阿拉伯语电子商务检索的领域特性与构建过程。领域层面,阿拉伯语复杂的形态变化、丰富的方言多样性(如利比亚方言)以及电商目录中产品描述的异构性,使得跨语言检索和语义匹配极具难度。构建过程中,完全依赖LLM合成数据可能引入与真实用户查询分布的偏差,且数据仅源于单一电商平台,其品类分布难以泛化至整个阿拉伯市场。此外,如何有效利用正样本对与挖掘的困难负样本进行对比学习训练,平衡合成数据与真实场景的差距,仍是提升检索模型泛化能力的关键难题。
常用场景
经典使用场景
阿拉伯语电子商务搜索数据集(arabic-ecom-data)的经典使用场景聚焦于检索与语义匹配任务的模型微调。该数据集精心设计了两种子集配置:其一为包含硬负样本的pairs_with_negatives,以三元组形式呈现查询、正例文档与难负例文档;其二为正样本对positives,仅包含查询与正例文档。这种结构使其成为对比学习(contrastive learning)范式的理想训练资源,研究者可联合使用两个子集,利用正样本对进行批内负采样(in-batch negatives),同时借助硬负样本强化模型对细微语义差别的辨识能力,从而有效提升阿拉伯语电商场景下的检索准确性与排序效果。
实际应用
在实际应用中,该数据集赋能阿拉伯语电商平台的智能搜索系统,使算法模型能够精准理解用户用现代标准阿拉伯语或方言输入的商品查询意图,并召回最相关的产品信息。基于此数据微调的检索模型可直接改善阿拉伯语市场的在线购物体验,提升商品搜索结果的相关性与用户满意度。此外,该数据集的结构化产品字段(名称、品牌、类别、属性、描述)为多模态表示学习提供了天然接口,可支撑构建端到端电商检索流水线,广泛应用于阿拉伯语跨境电商、本地化推荐系统及语音搜索助手等商业化产品中。
衍生相关工作
该数据集作为训练核心,与同期发布的评估基准arabic-ecom-search-bench形成完整的训练-评测闭环,催生了多项流程化研究工作。其合成数据生成方法(采用qwen3.6-27b-awq模型)为低资源场景下的数据增强技术提供了可复现范式,激发了对大语言模型作为领域数据生成器可靠性的系统探究。数据集对比学习友好的结构设计,促使研究者探索硬负样本挖掘策略与批内负采样方法的协同优化。此外,该工作还推动了阿拉伯语方言感知的检索模型研发,并成为检验跨领域迁移学习效果的重要测试床,为后续构建更广泛的多语言电商检索统一基准奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务