遇见数据集

DSWorld-8K

收藏
arXiv2026-07-17 更新2026-07-21 收录
官方服务:

资源简介:

DSWorld-8K是由香港科技大学(广州)研究团队构建的高质量数据集,旨在支持数据科学世界模型的训练。该数据集包含8000条数据科学代理轨迹,涵盖真实世界和合成状态转换,每条样本包含当前状态、操作、下一状态及解释转换逻辑的思维链轨迹,数据来源基于MMTU中的60K真实表格和NumPy/Pandas生态系统操作库。数据集通过结合真实轨迹收集与可扩展合成流程构建,利用高级LLM生成多样工作流状态和数据科学操作,并执行验证以确保样本质量。该数据集主要应用于训练数据科学世界模型,以预测数据科学操作效果,解决自主数据科学代理因依赖试错计算而导致的效率瓶颈问题,提升代理训练和推理速度。

DSWorld-8K is a high-quality dataset constructed by the research team from The Hong Kong University of Science and Technology (Guangzhou), designed to support the training of data science world models. It contains 8,000 data science agent trajectories covering both real-world and synthetic state transitions. Each sample includes the current state, action, next state, and a chain-of-thought trajectory that explicates the transition logic. The data sources are based on 60K real tables from MMTU and the NumPy/Pandas ecosystem operation libraries. The dataset is built by combining real trajectory collection and scalable synthetic workflows, leveraging advanced LLMs to generate diverse workflow states and data science operations, and conducting validation to ensure sample quality. This dataset is primarily used for training data science world models to predict the effects of data science operations, addressing the efficiency bottlenecks of autonomous data science agents caused by relying on trial-and-error computations, and improving the training and inference speeds of these agents.

创建时间:
2026-07-17
搜集汇总
数据集介绍
DSWorld-8K 数据集图片
构建方式
DSWorld-8K的构建融合了真实轨迹采集与合成数据生成两大途径。首先,通过在真实数据科学任务上运行自主智能体,记录其环境状态转换轨迹,并借助先进大语言模型为每条轨迹合成对应的思维链推理过程,以阐释转换逻辑。为突破真实数据规模的限制,研究进一步设计了可扩展的合成管道:基于MMTU大规模多任务表格理解基准中的多样化数据集,利用状态构造器生成结构化环境状态;从NumPy与Pandas生态中采样数据操作与错误类型,引导大语言模型合成可执行动作;最终通过编译器执行动作获取真实的下一个状态,并仅保留通过验证的高质量样本,同时补充合成思维链轨迹以解释转换动态。
特点
DSWorld-8K最显著的特点在于其规模与质量的精心平衡。数据集包含约8000条高质量的数据科学智能体轨迹,每条样本均由当前状态、动作、下一状态及推理轨迹四元组构成,为世界模型的学习提供了丰富的监督信号。其覆盖范围广泛,不仅包含成功执行的常规操作,更通过错误类型库的引入,系统地纳入了多样化的执行失败场景,使得模型能够学习鲁棒的异常处理能力。此外,结合真实世界轨迹与合成数据的双源构建策略,既保证了数据在真实任务上的生态效度,又通过可控的合成管道实现了规模化的扩展,有效缓解了真实数据获取昂贵且稀缺的瓶颈。
使用方法
DSWorld-8K专为训练数据科学世界模型而设计,其典型应用分为两个阶段。首先,使用该数据集对基于大语言模型的模拟器进行监督微调,使模型获得基础的状态转换预测能力,即给定当前工作流状态与候选数据科学操作,预测下一环境状态。在此基础上,进一步结合反思性世界模型优化策略,利用数据集中提供的真实下一状态与预测结果进行对比,生成反思反馈,并通过基于群体相对策略优化的强化学习迭代优化预测质量。该数据集可有效支持自主数据科学智能体的训练与推理加速,使智能体在执行昂贵计算前预见操作后果,实现约14倍的强化学习训练加速与3至6倍的推理加速。
背景与挑战
背景概述
DSWorld-8K数据集由香港科技大学(广州)的研究团队于2026年构建,旨在解决自主数据科学智能体在训练与推理过程中因大量采用试错工作流而导致的昂贵计算开销问题。该数据集聚焦于数据科学世界模型的训练,其核心研究问题在于如何通过建模数据科学工作流中的状态转移,使智能体能够在执行昂贵计算之前预判操作效果。DSWorld-8K包含约8000条高质量的状态转移轨迹,融合了真实采集与合成生成的数据,并辅以链式思维推理轨迹以解释转移逻辑。该数据集的提出为数据科学领域的世界模型研究奠定了数据基础,推动了高效自主数据科学系统的发展,并在转移预测任务上以35.6%的性能提升超越了最强基线模型。
当前挑战
DSWorld-8K所面临的挑战首先体现在领域问题层面:自主数据科学智能体在执行数据探索、模型训练等操作时,往往依赖耗时计算进行试错,缺乏高效预判能力,导致大规模部署时效率瓶颈显著。构建过程中亦遭遇多重挑战:一是真实世界数据科学工作流的转移轨迹采集成本高昂且规模有限,难以支撑模型有效学习;二是合成数据虽可扩展,但需确保生成的动作在真实环境中执行后获得的下游状态与实际约束一致,并经过严格验证以筛选有效样本;三是合成的链式思维推理轨迹需准确解释转移逻辑,对大型语言模型的推理能力提出了较高要求,且需避免与真实轨迹之间存在分布偏移,影响模型的泛化性。
常用场景
经典使用场景
DSWorld-8K数据集作为数据科学世界模型的核心训练资源,其最经典的用法是用于训练能够预测数据科学操作执行效果的状态转移模型。在自主数据科学智能体的典型工作流中,智能体面对特征工程、模型训练、评估等复杂操作时,不再需要逐一执行昂贵计算,而是借助DSWorld-8K训练得到的世界模型进行高效的下一状态预测。该数据集包含约8000条高质量的数据科学智能体轨迹,融合了真实世界采集与精心合成的高保真转移样本,覆盖了从数据预处理到模型评估的完整执行链条,为数据科学世界模型的学习提供了丰富且多样的训练素材。
实际应用
在实际应用中,DSWorld-8K数据集训练出的世界模型被广泛应用于加速自主数据科学智能体的开发与部署流程。在智能体训练阶段,该模型替代以往依赖真实环境交互的强化学习过程,大幅降低训练时间成本;在推理阶段,搜索型智能体在评估海量候选解决方案时,可借助世界模型快速模拟执行结果,避免重复运行代码的高昂开销。训练后模型还展现出跨不同操作系统环境的稳健泛化能力,使其在生产级数据分析平台、自动化机器学习竞赛、以及企业内部数据科学工作流管理系统中均具有重要的实际应用价值。
衍生相关工作
DSWorld-8K数据集的提出催生了一系列重要的学术衍生工作。围绕该数据集的训练数据合成管线,研究者进一步探索了基于大规模表格数据源和可控动作采样的更高效转移轨迹生成方法。在模型优化方面,基于该数据集发展出的反思性世界模型优化策略,开创性地将误差感知强化学习引入状态转移预测领域,形成了一套从监督微调至迭代优化训练范式。此外,该数据集驱动的DSWorld框架启发了将世界模型思想拓展至更广泛的自主智能体领域,包括网页导航、软件交互等数字环境中的状态预测研究,为构建高效、前瞻性自主系统奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务