遇见数据集

internlm/Agent-FLAN

收藏
Hugging Face2024-03-20 更新2024-04-19 收录
官方服务:

资源简介:

Agent-FLAN数据集旨在通过微调大型语言模型(LLMs)来提升其在代理任务中的表现。该数据集由AgentInstruct、Toolbench和定制的负面代理样本组成,采用特定的数据生成管道进行训练。数据集的特征包括对话格式,每个对话包含角色、内容和损失等字段。通过精心设计的训练语料库,Agent-FLAN使Llama2-7B模型在各种代理评估数据集上表现优于之前的最佳工作,并显著减轻了幻觉问题。

The Agent-FLAN dataset is developed to improve the performance of large language models (LLMs) on agentic tasks through fine-tuning. It consists of AgentInstruct, Toolbench, and custom negative agent samples, and is trained via a dedicated data generation pipeline. The dataset features a dialogue format, where each dialogue contains fields including role, content, and loss. With its carefully curated training corpus, Agent-FLAN enables the Llama2-7B model to outperform prior state-of-the-art approaches across diverse agent evaluation benchmarks, and substantially alleviates the hallucination issue.

提供机构:
internlm
原始信息汇总

数据集概述

数据集名称

  • AgentFLAN

数据集配置

  • 默认配置 (default):
    • 包含多个数据文件,每个文件对应不同的数据分割:
      • agent_instruct_react
      • agent_instruct_tflan
      • toolbench_instruct_j1s1_3k
      • toolbench_negative
      • toolbench_react_10p
      • toolbench_tflan_60p_r10r5u7
      • toolbench_tflan_cot_30p

数据集信息

  • 特征 (features):
    • conversation:
      • role (字符串类型)
      • content (字符串类型)
      • loss (布尔类型)
    • id (字符串类型)

许可证

  • Apache-2.0

标签

  • agent
搜集汇总
数据集介绍
internlm/Agent-FLAN 数据集图片
构建方式
Agent-FLAN数据集由上海人工智能实验室等机构提出,旨在提升大型语言模型(LLMs)的智能体能力。该数据集通过混合多个来源构建而成,包括AgentInstruct、ToolBench以及定制的负样本数据。具体而言,数据来源于agent_instruct_react、agent_instruct_tflan、toolbench_instruct_j1s1_3k、toolbench_negative、toolbench_react_10p、toolbench_tflan_60p_r10r5u7和toolbench_tflan_cot_30p等七个子集。每个样本包含对话结构,由角色(role)、内容(content)和损失标记(loss)组成,格式遵循Llama-2-chat的模板协议。通过这种多源融合与精心设计的数据生成管线,Agent-FLAN有效解耦了格式遵循与智能体推理,从而优化了训练语料的分布。
使用方法
使用Agent-FLAN数据集时,用户可借助HuggingFace平台直接加载。数据集包含default配置,通过data_files字段指定了七个JSONL格式的子集,每个子集对应不同的训练分割,如agent_instruct_react和toolbench_negative等。用户可根据任务需求选择特定分割进行微调,例如针对智能体推理或负样本学习。数据以对话格式组织,遵循Llama-2-chat的模板协议,其中角色包括user、system和assistant,并带有loss字段用于控制训练时的损失计算。建议结合Lagent和T-Eval工具进行模型评估,以实现最佳效果。
背景与挑战
背景概述
随着大型语言模型(LLMs)在自然语言处理任务中取得显著成功,如何赋予其智能体(Agent)能力成为关键问题。Agent-FLAN数据集由上海人工智能实验室、商汤科技及香港中文大学等机构的研究人员于2024年提出,旨在解决开源LLMs在智能体任务中远逊于API-based模型的困境。该数据集基于AgentInstruct、ToolBench及ShareGPT等来源,通过精细设计训练语料,系统性地解耦格式遵循与智能体推理,从而提升模型在工具使用与任务规划上的表现。Agent-FLAN的发布推动了智能体微调方法的发展,为后续研究提供了重要基准。
当前挑战
Agent-FLAN面临的核心挑战包括:一是当前智能体训练语料与预训练数据分布存在显著偏移,导致模型难以有效融合智能体推理能力;二是LLMs在格式遵循与智能体推理等能力上学习速度不一致,传统训练方法易引发能力冲突;三是现有方法在增强智能体能力时引入幻觉问题,损害模型可靠性。此外,构建过程中需精心设计负样本以抑制幻觉,并平衡多源数据集(如AgentInstruct与ToolBench)的混合策略,确保模型在通用能力与智能体任务间取得协调。
常用场景
经典使用场景
在大型语言模型(LLM)向智能体(Agent)能力演进的研究浪潮中,Agent-FLAN数据集应运而生,成为连接通用语言模型与自主代理行为的关键桥梁。该数据集最经典的使用场景聚焦于对LLM进行高效智能体微调(Agent Tuning),旨在弥合开源模型与闭源API模型在工具调用、任务规划与多步推理等代理任务上的性能鸿沟。通过整合AgentInstruct、ToolBench以及精心设计的负样本数据,Agent-FLAN为模型提供了格式遵循与代理推理解耦的训练语料,使得Llama2-7B等基座模型在各类代理评估基准上实现了显著超越既往最优方案3.5%的突破性进展。
解决学术问题
在学术界,Agent-FLAN直面当前LLM代理能力训练中的三大核心困境:训练语料中格式遵循与代理推理的纠缠不清、模型对不同代理能力维度的学习速率差异,以及传统微调方法在提升代理能力时诱发幻觉的副作用。该数据集通过精细化的数据解耦与重构策略,系统性地解决了如何在不牺牲通用能力的前提下,高效注入工具使用与任务分解等高级代理技能这一关键科学问题。其提出的负样本构造机制尤为亮眼,不仅为幻觉评估提供了标准化基准,更从数据层面为抑制模型在代理场景下的错误生成开辟了新路径,对推动语言模型从被动应答向主动规划转型具有里程碑式的理论意义。
实际应用
在实际应用层面,Agent-FLAN数据集催生出的微调模型已展现出在复杂工具调用生态系统中的卓越适应性。例如在自动化工作流引擎中,模型能够精准解析用户意图,动态编排API调用序列,完成跨平台信息检索与数据操作;在智能客服领域,经过Agent-FLAN微调的系统可自主理解多轮对话中的隐含需求,灵活调用CRM、知识库等后端工具,实现端到端的任务闭环。此外,在代码生成与调试场景下,模型能依据自然语言描述,自主规划调试步骤并调用编译器接口,显著提升了开发效率。这些实践充分验证了该数据集在将通用LLM转化为可靠数字代理方面的巨大工程价值。
数据集最近研究
最新研究方向
当前,大语言模型在智能体任务中的能力提升成为前沿热点,Agent-FLAN数据集应运而生。该数据集通过精细解构训练语料,创新性地将格式遵循与智能体推理能力分离,并引入定制化负样本,有效缓解了模型在工具调用中的幻觉问题。基于Llama2-7B的实验表明,Agent-FLAN在多个评测基准上超越此前最优方法3.5%,且随着模型规模扩展,智能体能力持续增强,同时通用能力也获得轻微提升。这一工作为构建高效、可靠的智能体大模型提供了数据与方法的双重范式,对推动LLM在自动化工具使用、复杂任务规划等实际场景的落地具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务