遇见数据集

DCAgent3/financeagent_terminal_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120ba231273

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 12240700 num_examples: 156 download_size: 12113586 dataset_size: 12240700 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/financeagent_terminal_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120ba231273 数据集图片
构建方式
该数据集依托于金融智能体评估框架,采用沙箱化终端交互环境进行构建。每条数据实例由多轮对话组成,涵盖用户指令与智能体响应,并附带智能体标识、模型名称、运行日期及任务类型等元数据。构建过程中引入自动化测试与Oracle验证机制,确保每一轮交互的有效性与正确性,通过任务分解与多轮迭代生成高质量对话轨迹。数据集包含156个训练样本,总大小约12.2 MB,所有样本均经过严格筛选与验证,以保障评估基准的可靠性。
特点
数据集聚焦金融领域智能体的终端操作能力评估,兼具多轮对话与代码执行轨迹特征。其核心特色在于融合沙箱环境与测试验证,每条样本均包含完整的对话历史、验证器输出及运行标识,便于追踪智能体行为。数据覆盖多种任务类型与模型提供商,支持跨模型、跨任务的对比分析。样本规模适中且经过Oracle验证,适合作为金融智能体基准测试的参考数据,兼顾真实性与可复现性。
使用方法
该数据集可直接通过HuggingFace datasets库加载,默认配置下仅包含train划分。用户可利用conversations字段提取多轮对话,结合agent、model、task等字段进行分组筛选与统计分析。verifier_output字段提供验证结果,可用于评估智能体表现或训练奖励模型。建议在金融智能体研究中作为评测基准,或用于微调对话模型。使用时需注意数据仅含训练集,不适用于直接训练-验证划分,应结合外部测试集进行泛化评估。
背景与挑战
背景概述
智能体在金融终端环境中的工具调用与任务执行能力,构成了自动化金融工作流的关键技术瓶颈。该数据集由GLM-4模型团队于2025年前后构建,依托SWESmith沙箱框架并集成测试预言验证机制,聚焦于金融终端场景下智能体多轮对话与操作轨迹的细粒度记录。其核心研究问题在于评估智能体在真实金融软件环境中的任务完成度与鲁棒性,涵盖代理类型、模型来源、运行标识与验证器输出等多维元数据。该数据集为金融领域智能体基准测试提供了可复现的沙箱验证范式,对推动终端自动化与可信评测具有参考意义。
当前挑战
金融终端智能体所面临的领域难题在于任务语义的模糊性与操作序列的强约束性,智能体需在有限交互轮次内准确解析用户意图并生成合规的命令调用链,而金融软件环境的封闭性与状态依赖性进一步加剧了泛化难度。构建过程中,沙箱环境的隔离性要求与测试预言的可验证性之间存在张力,需确保每条轨迹在受控条件下可重放且结果可判定。数据采集还需覆盖多样化的任务类型与模型行为差异,同时维持验证器输出的客观性与一致性,以规避因环境漂移或模型随机性导致的标签噪声。
常用场景
经典使用场景
在金融领域智能体研究不断深化的背景下,该数据集为基于大语言模型的金融任务智能体提供了经过验证的对话轨迹与评估记录。其经典使用场景集中于训练和评估智能体在模拟金融终端环境中的交互能力,涵盖从用户指令理解到多步操作执行的完整流程。研究者可借助其中156个训练实例,分析智能体在多轮对话中的决策路径与工具调用模式,进而构建具有复杂任务处理能力的金融助手。
实际应用
在金融科技的实际部署中,该数据集可用于开发智能投顾、自动化交易辅助及合规审查助手等应用。智能体通过模仿数据中的成功交互模式,能够理解用户模糊的金融查询并执行精确操作,如查询市场数据、生成报告或执行模拟交易。同时,验证器输出为系统上线前的安全与正确性测试提供了客观依据,有助于降低金融机构在自动化流程中的运营风险。
衍生相关工作
以该数据集为基础,后续研究衍生出多个经典工作方向。例如,有学者利用其对话结构开展金融智能体的多轮记忆增强与工具调用优化;另一些工作则基于验证器输出构建自动评估基准,对比不同大语言模型在金融任务中的表现。这些衍生研究进一步拓展了数据集在智能体训练框架、金融领域适配及人机协作范式中的影响力,形成了从数据到方法再到应用的良性循环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务