遇见数据集

TAPILOT-CROSSING

收藏
arXiv2024-03-08 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

TAPILOT-CROSSING数据集是由香港大学和微软亚洲研究院合作创建的,旨在评估大型语言模型(LLM)代理在交互式数据分析中的能力。该数据集包含1024个交互记录,涵盖了NORMAL、ACTION、PRIVATE和PRIVATE ACTION四个实际应用场景。数据集的构建利用了DECISION COMPANY这一多代理环境,有效减少了人工干预的需求。TAPILOT-CROSSING数据集特别关注于模拟真实世界的数据分析场景,其中用户与LLM代理通过实时数据探索进行合作,以支持决策制定。此外,数据集还引入了自适应交互反射(AIR)策略,通过从成功的历史中学习,指导LLM代理进化为有效的交互式数据分析代理。

The TAPILOT-CROSSING dataset was co-created by The University of Hong Kong and Microsoft Research Asia, aiming to evaluate the capabilities of large language model (LLM) agents in interactive data analysis. This dataset contains 1024 interaction records, covering four real-world application scenarios: NORMAL, ACTION, PRIVATE, and PRIVATE ACTION. The construction of the dataset leverages the multi-agent environment DECISION COMPANY, which effectively reduces the need for manual intervention. The TAPILOT-CROSSING dataset specifically focuses on simulating real-world data analysis scenarios, where users collaborate with LLM agents through real-time data exploration to support decision-making. Furthermore, the dataset introduces the Adaptive Interaction Reflection (AIR) strategy, which guides LLM agents to evolve into effective interactive data analysis agents by learning from successful historical interactions.

提供机构:
香港大学
创建时间:
2024-03-08
搜集汇总
数据集介绍
TAPILOT-CROSSING 数据集图片
构建方式
在交互式数据分析领域,大规模语言模型(LLM)智能体与人类协作进行实时数据探索的需求日益增长,但真实交互日志的收集成本高昂。为应对这一挑战,TAPILOT-CROSSING 应运而生。该数据集的构建依托于一个创新的多智能体环境——DECISION COMPANY,其中四个GPT-4智能体(管理员、客户、数据科学家与AI聊天机器人)通过模拟对话生成数据分析交互。构建流程涵盖数据获取与预处理、客户画像生成、分析场景模拟、计划讨论及交互日志仿真,仅需两名博士生在一个月内以低于100美元的成本完成,并通过人工校准确保质量。
特点
TAPILOT-CROSSING 包含1024条交互记录,覆盖1176个用户意图,横跨四种实用场景:NORMAL(显式需求)、ACTION(需响应反馈)、PRIVATE(涉及未见过的私有库)以及PRIVATE ACTION(前两者结合)。其独特之处在于融合了代码生成与多项选择两种答案类型,并引入私有库函数召回率(AccR)作为评估指标,以衡量智能体对自定义函数的准确运用。数据集以多意图查询、长上下文和复杂代码生成为特点,全面挑战LLM智能体在动态交互中的语义解析与决策能力。
使用方法
TAPILOT-CROSSING 作为基准测试,旨在评估LLM智能体在交互式数据分析中的表现。使用时,研究者可将模型置于不同交互模式下,通过代码生成与多项选择任务进行评测。数据集支持链式思考(COT)与推理行动(ReAct)等推理策略,并提供了执行器、用户模拟器和图表转表格工具等辅助工具。此外,自适应交互反思(AIR)策略可引导模型从成功历史中学习伪代码逻辑,从而提升性能。评估指标包括准确率(Acc)及结合私有库召回率的AccR,为模型优化提供细粒度反馈。
背景与挑战
背景概述
交互式数据分析作为人类与大型语言模型代理协同工作的新兴范式,正在重塑数据驱动决策的实践方式。然而,真实世界中用户意图的模糊性与动态调整需求,使得现有基准测试难以全面评估语言模型代理在这一任务中的表现。为此,香港大学与微软亚洲研究院等机构的研究人员于2024年提出了TAPILOT-CROSSING基准数据集,该数据集包含1024条人机交互记录,覆盖正常模式、动作模式、私有库模式及私有动作模式四种实际场景。通过创新的多代理环境DECISION COMPANY,研究者以极低的成本(不足100美元)高效构建了该数据集,显著降低了传统众包方式的高昂开销。TAPILOT-CROSSING的提出填补了交互式数据分析代理评估领域的空白,为衡量语言模型在复杂人机协作中的能力提供了标准化测试平台。
当前挑战
TAPILOT-CROSSING面临的挑战主要体现在三个方面。首先,交互式数据分析本身要求代理能够应对用户意图的模糊性,例如在动作模式中代理需处理澄清请求、代码修正等六类复杂交互行为,这对模型的语义理解与多轮对话能力构成了严峻考验。其次,私有库模式要求代理在预训练阶段未接触的自定义函数环境中准确生成代码,实验显示最佳模型GPT-4-Turbo的准确率仅达12%,凸显了模型在理解与调用用户专属库函数方面的显著短板。最后,数据集构建过程中需确保交互日志的质量与真实性,尽管DECISION COMPANY环境大幅减少了人力投入,但初始生成的代码中仅23.5%可直接作为参考,仍需人工校准以消除错误与无意义交互,这对标注效率与一致性提出了额外要求。
常用场景
经典使用场景
在数据驱动决策日益成为核心竞争力的时代,交互式数据分析作为人类与大型语言模型(LLM)智能体协作的桥梁,正逐渐渗透至医疗、游戏、娱乐等多元领域。TAPILOT-CROSSING 数据集应运而生,其最经典的使用场景在于模拟真实世界中人与LLM智能体之间多轮、动态的交互式数据探索过程。该基准包含了1024次交互,覆盖了常规、行动、私有库及私有库行动四种实践模式,通过代码生成与多项选择两种答案形式,系统性地评估智能体在处理模糊用户意图、执行代码修正、进行可视化问答及洞察挖掘等复杂任务时的综合能力,为衡量交互式数据分析智能体的性能提供了标准化的试验场。
衍生相关工作
TAPILOT-CROSSING 的发布催生了一系列富有启发性的衍生工作。其核心贡献之一——自适应交互反思(AIR)策略,为后续研究如何让LLM从交互历史中自主提炼伪代码逻辑并用于上下文学习提供了范式模板。该数据集对私有库模式的关注,直接推动了针对LLM理解与调用用户自定义函数能力的研究,例如后续工作开始探索如何构建更鲁棒的函数检索与代码生成管线。此外,TAPILOT-CROSSING 中揭示的模型在长上下文处理、指令遵循等方面的短板,也激发了诸如更高效的长文本注意力机制、以及提升模型对复杂指令响应鲁棒性等相关研究的开展。它不仅是评估工具,更成为了驱动交互式数据分析智能体领域持续创新的重要引擎。
数据集最近研究
最新研究方向
在大语言模型(LLM)智能体驱动的交互式数据分析领域,TAPILOT-CROSSING基准测试的提出标志着从单轮代码生成向多轮人机协作分析范式的关键转变。该数据集通过经济高效的多智能体环境DECISION COMPANY构建,覆盖常规、动作、私有库及私有动作四种实操场景,精准模拟了真实世界中用户意图模糊、需动态调整分析策略的复杂交互需求。前沿研究聚焦于如何利用自适应交互反射(AIR)策略,使LLM从历史成功交互中学习伪代码逻辑,从而在无需大规模人工标注的前提下,实现高达44.5%的相对性能提升。这一方向不仅推动了智能体在数据探索中的语义解析与工具调用能力,更与当前AI辅助决策、低代码数据分析等热点事件紧密相连,为构建更鲁棒、更贴合人类协作习惯的数据分析智能体奠定了关键基准。
相关研究论文
  • 1
    Tapilot-Crossing: Benchmarking and Evolving LLMs Towards Interactive Data Analysis Agents香港大学 · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务