遇见数据集

Multi-Turn

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集包括三个多轮交互环境数据集:ALFWorld、WebShop和ScienceWorld,分别对应家务操作、在线购物、科学实验等任务领域,提供多轮交互轨迹用于训练和评估自主智能体。

The dataset includes three multi-turn interactive environment datasets: ALFWorld, WebShop, and ScienceWorld, corresponding to task domains such as household manipulation, online shopping, and scientific experiments, providing multi-turn interaction trajectories for training and evaluating autonomous agents.

创建时间:
2026-07-29
原始信息汇总

数据集概述

该数据集是 TCOD(Temporal Curriculum for On-Policy Distillation)项目的官方代码库,旨在通过时间课程框架稳定多轮交互环境中从教师智能体到学生智能体的知识蒸馏过程。

核心问题

标准的多轮智能体在线策略蒸馏(On-Policy Distillation, OPD)面临 轨迹级 KL 散度不稳定性(Trajectory-Level KL Instability):随着学生智能体探索更长的交互轨迹,复合误差使其分布逐渐偏离教师分布,导致监督信号不可靠,最终引发性能崩溃。

解决方案:TCOD

TCOD 通过时间课程策略解决上述问题:训练过程中逐步扩展轨迹深度——从短而稳定的前缀逐步过渡到完整的多轮交互。该方法包含两种互补的轨迹排序策略:

  • TCOD-b2f(反向到正向):从轨迹的后期步骤开始蒸馏(此时任务结果更明确),逐步向轨迹开始处扩展监督。
  • TCOD-f2b(正向到反向):从学生最接近分布的前期步骤开始,逐步扩展到更长的时间范围。

关键结果

  • 相比标准 OPD,在三个基准上最高提升 +18 分
  • 训练过程中 KL 散度曲线显著更稳定
  • 学生智能体在多个任务上超越其教师智能体
  • 对教师自身失败的任务具有更好的泛化能力

支持环境

环境 说明
ALFWorld 已实现 OPD、TCOD-b2f、TCOD-f2b 工作流
WebShop 已实现 OPD、TCOD-b2f、TCOD-f2b 工作流;需约 1TB 内存
ScienceWorld 已实现 OPD、TCOD-b2f、TCOD-f2b 工作流

实现内容

  • 三个环境的完整多轮 OPD 工作流
  • 三个环境的 TCOD-b2f 工作流
  • 三个环境的 TCOD-f2b 工作流
  • 基于学生与教师令牌级 logprobs 的蒸馏信号
  • 示例配置文件位于 TCOD_examples/* 目录

仓库结构

opd_multi_turn/ ├── TCOD_examples/ │ ├── alfworld/ (opd.yaml, tcod_b2f.yaml, tcod_f2b.yaml) │ ├── webshop/ (opd.yaml, tcod_b2f.yaml, tcod_f2b.yaml) │ └── scienceworld/ (opd.yaml, tcod_b2f.yaml, tcod_f2b.yaml) └── trinity/common/workflows/envs/TCOD/ ├── alfworld/ ├── webshop/ └── scienceworld/

安装与配置

  1. 创建环境:使用 conda 创建 Python 3.10 环境
  2. 安装依赖pip install -e ".[dev]" 及 flash-attn==2.8.1
  3. 环境配置:需更新 YAML 中的占位路径,包括学生模型路径、教师模型路径、训练数据路径和评估数据路径
  4. 数据准备:各环境需分别下载并处理数据(详情见 README 对应章节)

快速开始

  1. 启动 Ray:ray start --head
  2. 运行实验:使用 trinity run --config <配置文件路径> 指定环境(ALFWorld/WebShop/ScienceWorld)和方法(OPD/TCOD-b2f/TCOD-f2b)

关键配置说明

  • algorithm.advantage_fn 需保持为 multi_turn_opd
  • rollout_args.logprobs 必须启用(设为 0)以计算蒸馏差距
  • TCOD 配置使用 workflow_args.checkpoint_strategy: linear
  • 常见可调参数包括 buffer.total_stepstrainer.total_stepsworkflow_args.max_env_stepsworkflow_args.checkpoint_steps

模型与论文信息

  • 论文已发表于 COLM 2026
  • 论文 arXiv 地址:https://arxiv.org/abs/2604.24005
  • ModelScope 模型集合:https://modelscope.cn/collections/wjqkoko/TCOD
  • Hugging Face 模型集合:https://huggingface.co/collections/kolerk/tcod
搜集汇总
数据集介绍
Multi-Turn 数据集图片
构建方式
Multi-Turn数据集是为支持多轮自主智能体在交互环境中进行在线策略蒸馏研究而构建的,涵盖ALFWorld、WebShop和ScienceWorld三个基准环境。数据集通过采集教师智能体在多轮交互中的完整轨迹,并利用学生与教师的令牌级对数概率差异作为蒸馏信号,形成训练数据。构建过程中,TCOD框架设计了两种轨迹排序策略,即从后向前(b2f)和从前向后(f2b),以逐步扩展训练深度,确保学生智能体在训练中始终处于教师指导范围内。数据配置通过YAML文件管理,并提供了相应的处理脚本,以适配各环境的数据格式。
特点
该数据集的核心特点在于其时间课程设计,有效缓解了多轮智能体在线策略蒸馏中的轨迹级KL散度不稳定问题。通过渐进式扩展轨迹深度,数据集使训练过程更加稳定,显著提升了学生智能体的性能,在多个基准上最高可提升18个百分点。此外,数据集支持两种互补的轨迹排序策略,适应不同的训练需求,并展现出超越教师智能体的泛化能力,尤其在教师自身失败的任务上表现突出。数据集的构建注重实用性与可复现性,提供了完整的安装、配置和运行流程。
使用方法
使用者可通过HuggingFace或ModelScope获取数据集及配套代码,并参照README中的安装指南进行环境配置,包括依赖安装和数据处理。实验中,需根据目标环境(ALFWorld、WebShop、ScienceWorld)选择对应的YAML配置文件,并设置教师与学生模型路径、训练数据及评估数据路径。启动Ray集群后,使用trinity run命令运行实验。数据集支持三种工作流:标准在线策略蒸馏(OPD)和两种时间课程变体(TCOD-b2f与TCOD-f2b),使用者可根据研究目的选择,并通过调整配置项(如总步数、环境最大步数等)进行实验定制。
背景与挑战
背景概述
TCOD数据集由香港中文大学James Cheng教授团队于2026年构建,专注于多轮交互环境中自主智能体的知识蒸馏研究。该数据集涵盖ALFWorld、WebShop和ScienceWorld三个基准环境,旨在解决大型教师模型向小型学生模型迁移能力时面临的不稳定问题。团队引入时间课程框架,通过渐进式轨迹深度扩展策略,显著提升了学生智能体的性能表现,部分任务甚至超越教师模型,为多轮交互智能体的高效部署提供了新范式。
当前挑战
该数据集主要应对多轮交互环境中标准on-policy蒸馏的轨迹级KL不稳定性问题,即随着学生模型探索轨迹延长,累积误差导致监督信号失真。构建过程中面临多重挑战:WebShop环境需约1TB内存,资源需求苛刻;三个环境需分别安装配置依赖并处理路径;教师模型在部分任务上的失败限制了蒸馏上限,需设计课程策略平衡轨迹顺序与深度。这些挑战推动了TCOD在训练稳定性和泛化能力上的突破。
常用场景
经典使用场景
在智能体与复杂环境交互的学术探索中,多轮对话与任务执行类智能体的训练历来面临长轨迹下知识迁移的稳定性挑战。该数据集专为多轮自主智能体的在线策略蒸馏研究设计,其核心功能在于为研究者提供一套标准化的训练与评估框架。依托ALFWorld、WebShop及ScienceWorld三个经典交互环境,该数据集支持标准在线策略蒸馏(OPD)以及创新的时间课程蒸馏策略(TCOD-b2f与TCOD-f2b)的完整工作流配置,使研究者能够系统性地考察不同蒸馏顺序对智能体轨迹级知识迁移效果的影响,从而作为验证时序课程学习理论有效性的关键实验平台。
解决学术问题
该数据集精准回应了多轮智能体在线策略蒸馏中一个棘手的学术难题——轨迹级KL散度不稳定性。随着学生智能体探索轨迹的延伸,预测误差的累积导致其状态分布逐渐偏离教师模型,使得监督信号失真,进而引发性能崩塌。这一现象在传统蒸馏方法中普遍存在却缺乏系统解决方案。该数据集通过内置的时间课程机制,从短而稳定的轨迹前缀逐步过渡至完整多轮回放,巧妙地维持了学生与教师之间的分布相似性,有效稳定了训练过程中的KL曲线。该数据集为推动知识蒸馏理论在多轮复杂环境下的纵深发展提供了坚实的实证基础,对理解时序课程在强化学习中的价值具有深远意义。
衍生相关工作
此数据集的发布催生了系列相关学术工作,成为多轮智能体蒸馏领域的重要参照。相关研究一方面深入探索了时间课程策略的变体,如自适应课程步长调整与非对称蒸馏信号设计,以进一步增强训练稳定性;另一方面,其提供的对比性实验框架也被广泛借鉴,用于评估其他知识迁移方法(如逆强化学习、行为克隆与离线蒸馏)在多轮交互任务中的表现。此外,该数据集所暴露的轨迹级KL不稳定问题,激发了后续关于在线蒸馏正则化技巧与课程强化学习通用范式的研究,推动了该领域从经验调优向理论驱动的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务