遇见数据集

zjunlp/LongDS

收藏
Hugging Face2026-06-07 更新2026-06-14 收录
官方服务:

资源简介:

LongDS-Bench是一个用于评估长视野、多轮次智能体数据分析的基准测试。真实世界的分析很少是一系列独立问题:过滤器、指标定义、假设、中间表和分支特定结果会在多轮次中不断演变。LongDS测试智能体是否能正确维护和应用这些不断演化的分析状态。LongDS包含基于真实Kaggle笔记本和数据集构建的68个任务,涵盖2225个对话轮次,涉及六个领域:商业、社区、教育、地球科学、社会公益和体育。这些任务覆盖了代表性的状态演化模式,包括初始分析状态构建、状态继承、状态更新、反事实扰动、回滚到早期状态以及多状态组合。

LongDS-Bench is a benchmark for evaluating long-horizon, multi-turn agentic data analysis. Real-world analysis is rarely a sequence of independent questions: filters, metric definitions, assumptions, intermediate tables, and branch-specific results evolve over many turns. LongDS tests whether agents can maintain and apply these evolving analytical states correctly. LongDS contains 68 tasks constructed from real-world Kaggle notebooks and datasets, spanning 2,225 turns across six domains: Business, Community, Education, Geoscience, Social Good, and Sports. The tasks cover representative state-evolution patterns, including initial analytical state construction, state inheritance, state update, counterfactual perturbation, rollback to earlier states, and multi-state composition.

提供机构:
zjunlp
搜集汇总
数据集介绍
zjunlp/LongDS 数据集图片
构建方式
LongDS基于来自真实世界的Kaggle笔记本与数据集构建,覆盖商业、社区、教育、地球科学、社会公益及体育六大领域,共包含68个复杂任务,总计2225轮交互。每条任务被拆解为若干回合,每回合提供上下文与用户问题,并配有参考代码与答案。任务组织采用域-数据集-任务编号的三级目录结构,核心评估文件为task.json,其中依次记录了每回合的交互规范。通过将多轮分析中的状态演化——如初始构建、继承、更新、反事实扰动、回滚及多状态组合——系统性地编码为可重现的任务,确保了评测的标准化与可复现性。
特点
LongDS的核心特色在于其聚焦于长程、多轮自主数据分析中的状态持续与演化问题。与其将分析视为独立查询的序列,该基准测试刻意设计了需跨回合维持的分析状态,包括过滤器、度量定义、假设及中间表格等要素的演进。涵盖六种典型状态演化模式,使得评测能深入检验智能体在复杂分析流程中的记忆与推理能力。此外,采用评判式语言模型进行自动评估,无需智能体输出遵循固定格式,保留了交互的灵活性,同时通过参考答案保障评分的一致性。
使用方法
使用LongDS进行评测时,仅需读取每个任务目录下的task.json文件,该文件包含了所有回合的上下文与问题。评估过程中,智能体仅被提供context与question字段,基于当前状态生成响应;answer字段仅供评估器参照,不泄露给被评模型。系统采用评判式语言模型协议,可比对智能体回答与参考答案,实现自动化评分。任务索引记录于task_list.json,用户可按域、数据集及编号快速定位目标任务,并辅以ipynb与py文件进行复查与复现,从而具备可扩展的评估入口与细致的调试支持。
背景与挑战
背景概述
LongDS数据集的构建源于对智能体在执行长时程、多轮次数据分析任务时所面临的认知瓶颈的深度关注。真实世界的数据分析过程往往并非简单的单次问答,而是涉及过滤条件、指标定义、假设验证及中间结果表的持续演化,这要求智能体具备高效的上下文管理与状态追踪能力。该数据集由浙江大学等机构的研究人员于2026年发布,旨在评估智能体在复杂多变的分析场景中能否维持并正确应用不断演化的分析状态。LongDS基于真实世界的Kaggle笔记本与数据集构建,包含68个任务与2225轮对话,横跨商业、社区、教育、地球科学、社会公益与体育六个领域。其系统化的状态演化模式设计,为评估和推动数据科学智能体的长期规划与多步推理能力提供了重要基准,对相关领域的研究具有显著影响力。
当前挑战
LongDS数据集主要应对两大层面的挑战。于领域问题层面,它聚焦于智能体在长期交互数据分析中难以准确维护与运用动态演变分析状态的核心难题,涵盖了从初始状态构建、继承、更新、反事实扰动、回滚到多状态组合的复杂演进模式,这些问题往往导致现有模型在长时程任务中出现逻辑断裂或状态混淆。于数据集构建层面,挑战则在于如何从海量真实数据分析日志中提炼出具有代表性的多轮交互片段,并在此基础上设计一套精准反映状态演化逻辑的任务规范,同时确保跨领域任务分布均衡且评估过程具备可复现性与客观性,最终通过大语言模型裁判协议实现有效评判。
常用场景
经典使用场景
在智能数据分析代理的演进浪潮中,LongDS作为一项开创性基准,专门用于评估代理在长期、多轮对话中的数据分析能力。该数据集从真实世界的Kaggle笔记本与数据集中精心提炼出68项任务,横跨商业、社区、教育、地球科学、社会公益与体育六大领域,共计2225轮交互。其核心使用场景在于测试代理能否在分析过程中持续维护并正确应用不断演化的分析状态,包括初始状态的构建、状态的继承与更新、反事实扰动、回溯到早期状态以及多状态组合等复杂模式。这使得LongDS成为衡量现代语言代理在动态分析任务中状态追踪与推理能力的不可或缺的标杆。
解决学术问题
LongDS精准地击中了当前数据分析代理研究中的一个关键盲区:现有基准通常评估独立、单轮的问题回答,忽视了真实世界中分析任务的多轮性与状态演化特性。该数据集系统性地揭示了当代理面对过滤器变换、指标重定义、中间表生成、分支结果迭代等长期依赖场景时,其表现往往出现严重退化。通过构建涵盖六种典型状态演化模式的任务体系,LongDS为学术界提供了一个标准化的评估框架,使得研究者能够量化和诊断代理在长程推理中的具体失败点,从而推动状态保持与更新机制的深入探索。这一贡献不仅填补了基准测试的空白,更为开发下一代稳健的多轮数据分析代理奠定了坚实基础。
衍生相关工作
LongDS的发布催生了一系列富有启发性的衍生研究工作。其任务构建管线和评估协议为后续的数据集设计提供了蓝本,例如在其他领域(如医疗、法律)发展类似的多轮状态演化基准。伴随LongDS而生的DataMind项目整合了该基准,并推动了关于代理记忆机制、上下文压缩策略以及反事实推理方法的系统研究。基于LongDS的失败模式分析,研究者已提出改进的提示工程方案与专门的记忆增强架构,以缓解长程数据分析中的状态丢失问题。这些衍生工作不仅深化了对语言代理在复杂分析任务中局限性的理解,也为构建真正具备持续推理能力的智能体指明了技术路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务