multilingual-queries-2026
收藏资源简介:
MAST Multilingual Queries 2026 是一个用于多语言代理搜索(Agentic Search)评估的数据集,属于 FIRE 2026 的 MAST(Multilingual Agentic Search Track)任务。该数据集基于 BrowseComp-Plus(ACL 2026)构建,后者包含约10万份来自网络的英语文档、具有挑战性的英语查询以及人工判断。在 MAST 2026 设置中,系统接收多语言查询,从英语 BrowseComp-Plus 语料库中检索相关证据,并生成简洁且正确的英语答案。数据集中每个语言配置为一个独立的 Hugging Face 子集,共包含15种语言:阿拉伯语、孟加拉语、威尔士语、德语、英语、西班牙语、芬兰语、法语、印地语、俄语、斯瓦希里语、泰米尔语、泰语、乌尔都语和中文。每种语言包含50个查询,总计750个查询。每个记录包含两个字段:qid(查询标识符,以语言代码为前缀)和 query(加密后的查询文本)。查询文本经过加密处理,以防止基准测试意外泄露,用户需使用提供的 canary 密钥进行解密。该数据集适用于评估多语言代理搜索系统的检索召回率、搜索效率和答案准确率。
MAST Multilingual Queries 2026 is a dataset for evaluating multilingual agentic search, part of the MAST (Multilingual Agentic Search Track) task at FIRE 2026. It is built upon BrowseComp-Plus (ACL 2026), which contains approximately 100,000 English web documents, challenging English queries, and human judgments. In the MAST 2026 setup, systems receive multilingual queries, retrieve relevant evidence from the English BrowseComp-Plus corpus, and generate concise and correct English answers. Each language configuration in the dataset is an independent Hugging Face subset, covering 15 languages: Arabic, Bengali, Welsh, German, English, Spanish, Finnish, French, Hindi, Russian, Swahili, Tamil, Thai, Urdu, and Chinese. Each language contains 50 queries, totaling 750 queries. Each record has two fields: qid (query identifier prefixed with the language code) and query (encrypted query text). The query texts are encrypted to prevent accidental benchmark leakage, and users must decrypt them using the provided canary key. The dataset is suitable for evaluating retrieval recall, search efficiency, and answer accuracy of multilingual agentic search systems.
MAST Multilingual Queries 2026 数据集概述
基本信息
- 许可证: cc-by-sa-4.0
- 任务类型: 问答(question-answering)、文本检索(text-retrieval)
- 数据集用途: 面向多语言智能体搜索(MAST@FIRE 2026)的多语言查询集,用于评估多语言智能体搜索系统回答不同语言复杂问题的能力
任务设置
- 系统接收多语言查询,从英语的 BrowseComp-Plus 语料库(约10万篇网络文档)中检索相关证据,并生成简洁、正确的英语答案
- 评估指标包括:基于人工验证相关性标签的检索召回率、搜索效率、以及对照 BrowseComp-Plus 真实答案的准确率
数据集结构
- 共 15 个语言子集,每种语言作为独立的 Hugging Face 配置(config)提供
- 每个配置包含一个训练集拆分,数据文件为 JSONL 格式
- 数据字段:
qid: 查询标识符,以语言代码为前缀(如zh-798)query: 加密的查询文本
- 语言列被省略,因为语言由配置名称和 qid 前缀表示
查询加密机制
- 所有查询文本均经过混淆处理,以防止基准测试数据泄露
- 使用数据集提供的 canary 字符串作为解密密钥,通过 XOR 加密方式进行解密
语言子集详情
| 语言代码 | 语言 | 语系 | 文字 | 使用人数(百万) | 资源等级 | 查询数量 |
|---|---|---|---|---|---|---|
| zh | 中文 | 汉藏语系 | 汉字 | 1,351 | 高 | 50 |
| fr | 法语 | 印欧语系 | 拉丁字母 | 332 | 高 | 50 |
| ru | 俄语 | 印欧语系 | 西里尔字母 | 199 | 高 | 50 |
| es | 西班牙语 | 印欧语系 | 拉丁字母 | 510 | 高 | 50 |
| de | 德语 | 印欧语系 | 拉丁字母 | 133 | 高 | 50 |
| ar | 阿拉伯语 | 亚非语系 | 阿拉伯字母 | 375 | 中 | 50 |
| bn | 孟加拉语 | 印欧语系 | 孟加拉字母 | 280 | 中 | 50 |
| fi | 芬兰语 | 乌拉尔语系 | 拉丁字母 | 6 | 中 | 50 |
| hi | 印地语 | 印欧语系 | 天城文字母 | 584 | 中 | 50 |
| th | 泰语 | 壮侗语系 | 泰文字母 | 56 | 中 | 50 |
| ur | 乌尔都语 | 印欧语系 | 阿拉伯字母 | 313 | 中 | 50 |
| sw | 斯瓦希里语 | 尼日尔-刚果语系 | 拉丁字母 | 194 | 低 | 50 |
| ta | 泰米尔语 | 达罗毗荼语系 | 泰米尔字母 | 91 | 低 | 50 |
| cy | 威尔士语 | 印欧语系 | 拉丁字母 | 0.92 | 低 | 50 |
| en | 英语 | 印欧语系 | 拉丁字母 | - | 高 | 50 |
数据规模
- 总共上传 750 条查询,分布在 15 个子集中
- 每个子集包含 50 条查询
相关链接
- MAST 官方网站: https://mast-benchmark.github.io/
- BrowseComp-Plus GitHub 仓库: https://github.com/texttron/BrowseComp-Plus/





