shulin16/mmina
收藏资源简介:
MMInA数据集是一个用于评估多跳多模态互联网任务的基准数据集。该数据集包含6个文件夹,共1,050个多跳任务,覆盖14个不断演变的网站。每个任务都提供了意图和参考答案的JSON文件,以及所需的信息。数据集分为多个子文件夹,每个文件夹包含不同跳数的任务,如2跳、3跳、5跳、6跳、7跳、8跳、9跳、10跳等。数据集的主要用途是评估大型语言模型(LLM)代理在多跳多模态任务中的工具使用能力。
MMInA数据集是一个用于评估多跳多模态互联网任务的基准数据集。该数据集包含6个文件夹,共1,050个多跳任务,覆盖14个不断演变的网站。每个任务都提供了意图和参考答案的JSON文件,以及所需的信息。数据集分为多个子文件夹,每个文件夹包含不同跳数的任务,如2跳、3跳、5跳、6跳、7跳、8跳、9跳、10跳等。数据集的主要用途是评估大型语言模型(LLM)代理在多跳多模态任务中的工具使用能力。
MMInA: Benchmarking Multihop Multimodal Internet Agents Dataset
数据集详情
MMInA是一个用于评估实体代理执行组合式互联网任务的多跳和多模态基准数据集。该数据集包含6个文件夹,涉及1,050个多跳任务,跨越14个不断演变的网站。每个任务的意图和参考答案以JSON文件形式提供,同时包含所需信息。
数据集子文件夹说明
- normal: 包含176个任务,均为2跳或3跳任务。
- multi567: 包含180个任务,均为5跳、6跳、7跳任务。
- compare: 包含100个任务,部分为2跳、3跳、4跳任务。所有任务需要先回答一个可比较的问题。
- multipro: 包含86个任务,均为8跳、9跳、10跳任务。
- shopping: 包含200个任务,所有任务涉及OneStopMarket中的商品。
- wikipedia: 包含308个任务,所有任务限定在维基百科内。部分为可比较任务,其他为简单任务(其中108个任务从WebQA过滤而来)。
数据集字段说明
- task_id: 表示任务在当前文件夹中的位置。
- start_url: 提供给代理的初始网页。
- intent 和 intent_template: 任务的核心部分,第一部分说明每跳的最终状态,第二部分是解决任务的参考URL,第三部分是问题。
- procedure: 指多跳任务中使用的评估方法(如论文所述)。
- eval_types: 单跳任务的评估方法,并提供参考答案。
数据集来源
- Repository: https://github.com/shulin16/MMInA
- Paper: https://arxiv.org/abs/2404.09992
使用场景
该数据集旨在评估大型语言模型(LLM)代理在多跳多模态任务中的工具使用能力。
直接使用
使用此数据集时,应首先选择模型(LLM或VLM)作为代码格式的代理,并在预设环境中实现。可以使用此数据集和环境来评估代理在组合式多跳互联网任务中的能力。
超出范围的使用
该数据集仅作为评估基准,不适用于训练代理模型。
偏差、风险和限制
该数据集存在以下限制:
- 维基百科相关问题的评估定义不明确,由于LLM/VLM的可解释性问题。
引用
BibTeX:
@misc{zhang2024mmina, title={MMInA: Benchmarking Multihop Multimodal Internet Agents}, author={Ziniu Zhang and Shulin Tian and Liangyu Chen and Ziwei Liu}, year={2024}, eprint={2404.09992}, archivePrefix={arXiv}, primaryClass={cs.CV} }




