EcomEval
收藏资源简介:
EcomEval是一个全面的多语言多模态基准测试,用于评估电子商务领域的LLM。它涵盖六个类别和37个任务,涉及七种语言(英语、中文、印尼语、越南语、泰语、马来语、葡萄牙语),解决低资源设置问题并反映全球在线电子商务的广度。
EcomEval is a comprehensive multilingual multimodal benchmark for evaluating large language models (LLMs) in the e-commerce domain. It covers six categories and 37 tasks across seven languages, including English, Chinese, Indonesian, Vietnamese, Thai, Malay and Portuguese, addressing low-resource settings and reflecting the breadth of global online e-commerce.
EcomEval数据集概述
数据集简介
EcomEval是一个全面的多语言多模态基准测试,专门用于评估大型语言模型在电子商务领域的性能。该数据集涵盖6个主要类别和37个任务,覆盖7种语言(英语、中文、印尼语、越南语、泰语、马来语、葡萄牙语),旨在解决低资源语言环境问题并反映全球在线电子商务的广度。
任务类别
- Ecom Question Answering(电商问答)
- Shopping Concepts(购物概念)
- User Understanding(用户理解)
- Shopping Reasoning(购物推理)
- Ecom Generation(电商生成)
- Ecom Multimodal(电商多模态)
数据集构建流程
- 收集来自大型语言模型使用的API调用日志和网站查询
- 通过前缀分组对API数据进行聚类,并使用微调模型对网站数据进行分类,形成37个代表性任务类别
- 验证采样问题是否与电子商务相关、连贯且无歧义
- 使用大型语言模型、外部资源和人工专家评审生成并事实核查多语言答案
引用信息
如需使用本数据集,请引用以下文献:
@article{EcomEval, title={EcomEval: Towards Reliable Evaluation of Large Language Models for Multilingual and Multimodal E-Commerce Applications}, author={Shuyi Xie and Ziqin Liew and Hailing Zhang and Haibo Zhang and Ling Hu and Zhiqiang Zhou and Shuman Liu and AnXiang Zeng}, journal={arXiv preprint arXiv}, url={https://arxiv.org/abs/2510.20632}, year={2025} }




