遇见数据集

multilingual-queries-2026

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

MAST Multilingual Queries 2026 是一个用于多语言代理搜索(Agentic Search)评估的数据集,属于 FIRE 2026 的 MAST(Multilingual Agentic Search Track)任务。该数据集基于 BrowseComp-Plus(ACL 2026)构建,后者包含约10万份来自网络的英语文档、具有挑战性的英语查询以及人工判断。在 MAST 2026 设置中,系统接收多语言查询,从英语 BrowseComp-Plus 语料库中检索相关证据,并生成简洁且正确的英语答案。数据集中每个语言配置为一个独立的 Hugging Face 子集,共包含15种语言:阿拉伯语、孟加拉语、威尔士语、德语、英语、西班牙语、芬兰语、法语、印地语、俄语、斯瓦希里语、泰米尔语、泰语、乌尔都语和中文。每种语言包含50个查询,总计750个查询。每个记录包含两个字段:qid(查询标识符,以语言代码为前缀)和 query(加密后的查询文本)。查询文本经过加密处理,以防止基准测试意外泄露,用户需使用提供的 canary 密钥进行解密。该数据集适用于评估多语言代理搜索系统的检索召回率、搜索效率和答案准确率。

MAST Multilingual Queries 2026 is a dataset for evaluating multilingual agentic search, part of the MAST (Multilingual Agentic Search Track) task at FIRE 2026. It is built upon BrowseComp-Plus (ACL 2026), which contains approximately 100,000 English web documents, challenging English queries, and human judgments. In the MAST 2026 setup, systems receive multilingual queries, retrieve relevant evidence from the English BrowseComp-Plus corpus, and generate concise and correct English answers. Each language configuration in the dataset is an independent Hugging Face subset, covering 15 languages: Arabic, Bengali, Welsh, German, English, Spanish, Finnish, French, Hindi, Russian, Swahili, Tamil, Thai, Urdu, and Chinese. Each language contains 50 queries, totaling 750 queries. Each record has two fields: qid (query identifier prefixed with the language code) and query (encrypted query text). The query texts are encrypted to prevent accidental benchmark leakage, and users must decrypt them using the provided canary key. The dataset is suitable for evaluating retrieval recall, search efficiency, and answer accuracy of multilingual agentic search systems.

创建时间:
2026-08-06
原始信息汇总

MAST Multilingual Queries 2026 数据集概述

基本信息

  • 许可证: cc-by-sa-4.0
  • 任务类型: 问答(question-answering)、文本检索(text-retrieval)
  • 数据集用途: 面向多语言智能体搜索(MAST@FIRE 2026)的多语言查询集,用于评估多语言智能体搜索系统回答不同语言复杂问题的能力

任务设置

  • 系统接收多语言查询,从英语的 BrowseComp-Plus 语料库(约10万篇网络文档)中检索相关证据,并生成简洁、正确的英语答案
  • 评估指标包括:基于人工验证相关性标签的检索召回率、搜索效率、以及对照 BrowseComp-Plus 真实答案的准确率

数据集结构

  • 15 个语言子集,每种语言作为独立的 Hugging Face 配置(config)提供
  • 每个配置包含一个训练集拆分,数据文件为 JSONL 格式
  • 数据字段:
    • qid: 查询标识符,以语言代码为前缀(如 zh-798
    • query: 加密的查询文本
  • 语言列被省略,因为语言由配置名称和 qid 前缀表示

查询加密机制

  • 所有查询文本均经过混淆处理,以防止基准测试数据泄露
  • 使用数据集提供的 canary 字符串作为解密密钥,通过 XOR 加密方式进行解密

语言子集详情

语言代码 语言 语系 文字 使用人数(百万) 资源等级 查询数量
zh 中文 汉藏语系 汉字 1,351 50
fr 法语 印欧语系 拉丁字母 332 50
ru 俄语 印欧语系 西里尔字母 199 50
es 西班牙语 印欧语系 拉丁字母 510 50
de 德语 印欧语系 拉丁字母 133 50
ar 阿拉伯语 亚非语系 阿拉伯字母 375 50
bn 孟加拉语 印欧语系 孟加拉字母 280 50
fi 芬兰语 乌拉尔语系 拉丁字母 6 50
hi 印地语 印欧语系 天城文字母 584 50
th 泰语 壮侗语系 泰文字母 56 50
ur 乌尔都语 印欧语系 阿拉伯字母 313 50
sw 斯瓦希里语 尼日尔-刚果语系 拉丁字母 194 50
ta 泰米尔语 达罗毗荼语系 泰米尔字母 91 50
cy 威尔士语 印欧语系 拉丁字母 0.92 50
en 英语 印欧语系 拉丁字母 - 50

数据规模

  • 总共上传 750 条查询,分布在 15 个子集
  • 每个子集包含 50 条查询

相关链接

  • MAST 官方网站: https://mast-benchmark.github.io/
  • BrowseComp-Plus GitHub 仓库: https://github.com/texttron/BrowseComp-Plus/
搜集汇总
数据集介绍
multilingual-queries-2026 数据集图片
构建方式
该数据集是基于MAST@FIRE 2026多语言智能体搜索任务构建的,包含15种语言的750条查询,每种语言对应一个Hugging Face子集。查询文本经过加密混淆处理,以降低基准测试泄露风险。每个子集包含JSONL格式的记录,包括qid和加密的query字段,qid使用语言代码前缀,如'zh-798'。
特点
数据集覆盖高、中、低资源语言,如英语、中文、法语等,体现了广泛的语言多样性和资源分层。查询文本加密处理,保护基准测试的完整性。任务要求系统从英语语料库中检索证据并生成简洁的英文答案,评估包括检索召回率、搜索效率和答案准确性。
使用方法
用户可通过Hugging Face的load_dataset函数加载特定语言子集,并使用提供的解密函数和canary密钥对查询文本进行解密。解密后的查询可用于评估多语言智能体搜索系统,系统需从英语语料库中检索相关文档并生成答案。
背景与挑战
背景概述
多语言查询数据集multilingual-queries-2026由MAST基准倡议团队于2026年创建,旨在支撑FIRE 2026会议上的多语言智能体搜索赛道(MAST)。该数据集基于BrowseComp-Plus扩展而来,后者作为ACL 2026收录的可复现、可验证基准,提供了约10万篇英文网络文档及人工判断。MAST的核心研究问题在于评估多语言智能体搜索系统能否针对不同语言提出的复杂问题,从英文语料中检索证据并生成简洁准确的英文答案。该数据集覆盖15种语言,按资源高低分为三档,共计750条查询,其发布为跨语言信息检索与智能体系统研究提供了标准化评测平台,推动了多语言问答与检索技术的进步。
当前挑战
该数据集面临的挑战包括:领域内,多语言查询在语义、句法和文化背景上的巨大差异,使得跨语言检索与答案生成极具难度;智能体系统需在有限的交互中有效规划、推理并综合多源证据,同时保证检索效率,这对现有模型构成显著压力。构建过程中,团队需确保查询的复杂性与可验证性,避免与现有基准重复;此外,为防止数据泄露,所有查询文本采用加密混淆,并以金丝雀字符串作为解密密钥,增加了数据分发与使用的复杂性。不同语言资源的不均衡也要求精心设计查询数量与难度,以公平评估系统性能。
常用场景
经典使用场景
multilingual-queries-2026数据集作为MAST@FIRE 2026多语言智能体搜索赛道的基础评测资源,其核心应用场景聚焦于多语言复杂问答与跨语言信息检索的交叉领域。该数据集精心设计了涵盖15种语言、总计750条查询的评估集合,每条查询均源自真实世界的信息需求,并经由人工标注验证,确保了高度的权威性与挑战性。研究者可借此基准,系统性地评估智能体系统在多语言环境下理解复杂问题、规划搜索路径、整合异构证据并生成简洁准确英文回答的能力,从而精准量化模型的跨语言理解与推理水平。
衍生相关工作
受该数据集启迪,衍生出了一系列在跨语言嵌入模型微调、多语言对话式检索策略优化及智能体决策过程的可解释性研究等方向的经典工作。例如,研究者基于此数据集提出结合机器翻译与对比学习的新型检索器,以缓解低资源语言表示稀疏问题;另有工作探索将大型语言模型作为核心控制器,在与外部搜索引擎的交互中实现多步推理,并利用该数据集验证了其效率与稳健性。这些衍生工作不仅丰富了多语言智能体搜索的理论框架,也促进了BrowseComp-Plus等基准的可扩展性与生态建设。
数据集最近研究
最新研究方向
该数据集聚焦于多语言智能体搜索的前沿探索,旨在评测系统在跨语言复杂问答中的检索与推理能力。其构建基于BrowseComp-Plus的扩展,通过引入15种资源层级不同的语言,覆盖广泛语系与文字系统,推动多语言信息检索向智能体化发展。研究热点包括利用加密混淆技术避免数据泄漏、评估检索效率与回答准确性,并促进低资源语言的agentic搜索研究。该数据集为构建可复现、可验证的多语言问答基准提供了重要资源,对提升全球信息可访问性与跨语言人机交互具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务