Multi-Turn
收藏资源简介:
该数据集包括三个多轮交互环境数据集:ALFWorld、WebShop和ScienceWorld,分别对应家务操作、在线购物、科学实验等任务领域,提供多轮交互轨迹用于训练和评估自主智能体。
The dataset includes three multi-turn interactive environment datasets: ALFWorld, WebShop, and ScienceWorld, corresponding to task domains such as household manipulation, online shopping, and scientific experiments, providing multi-turn interaction trajectories for training and evaluating autonomous agents.
数据集概述
该数据集是 TCOD(Temporal Curriculum for On-Policy Distillation)项目的官方代码库,旨在通过时间课程框架稳定多轮交互环境中从教师智能体到学生智能体的知识蒸馏过程。
核心问题
标准的多轮智能体在线策略蒸馏(On-Policy Distillation, OPD)面临 轨迹级 KL 散度不稳定性(Trajectory-Level KL Instability):随着学生智能体探索更长的交互轨迹,复合误差使其分布逐渐偏离教师分布,导致监督信号不可靠,最终引发性能崩溃。
解决方案:TCOD
TCOD 通过时间课程策略解决上述问题:训练过程中逐步扩展轨迹深度——从短而稳定的前缀逐步过渡到完整的多轮交互。该方法包含两种互补的轨迹排序策略:
- TCOD-b2f(反向到正向):从轨迹的后期步骤开始蒸馏(此时任务结果更明确),逐步向轨迹开始处扩展监督。
- TCOD-f2b(正向到反向):从学生最接近分布的前期步骤开始,逐步扩展到更长的时间范围。
关键结果
- 相比标准 OPD,在三个基准上最高提升 +18 分
- 训练过程中 KL 散度曲线显著更稳定
- 学生智能体在多个任务上超越其教师智能体
- 对教师自身失败的任务具有更好的泛化能力
支持环境
| 环境 | 说明 |
|---|---|
| ALFWorld | 已实现 OPD、TCOD-b2f、TCOD-f2b 工作流 |
| WebShop | 已实现 OPD、TCOD-b2f、TCOD-f2b 工作流;需约 1TB 内存 |
| ScienceWorld | 已实现 OPD、TCOD-b2f、TCOD-f2b 工作流 |
实现内容
- 三个环境的完整多轮 OPD 工作流
- 三个环境的 TCOD-b2f 工作流
- 三个环境的 TCOD-f2b 工作流
- 基于学生与教师令牌级 logprobs 的蒸馏信号
- 示例配置文件位于
TCOD_examples/*目录
仓库结构
opd_multi_turn/ ├── TCOD_examples/ │ ├── alfworld/ (opd.yaml, tcod_b2f.yaml, tcod_f2b.yaml) │ ├── webshop/ (opd.yaml, tcod_b2f.yaml, tcod_f2b.yaml) │ └── scienceworld/ (opd.yaml, tcod_b2f.yaml, tcod_f2b.yaml) └── trinity/common/workflows/envs/TCOD/ ├── alfworld/ ├── webshop/ └── scienceworld/
安装与配置
- 创建环境:使用 conda 创建 Python 3.10 环境
- 安装依赖:
pip install -e ".[dev]"及 flash-attn==2.8.1 - 环境配置:需更新 YAML 中的占位路径,包括学生模型路径、教师模型路径、训练数据路径和评估数据路径
- 数据准备:各环境需分别下载并处理数据(详情见 README 对应章节)
快速开始
- 启动 Ray:
ray start --head - 运行实验:使用
trinity run --config <配置文件路径>指定环境(ALFWorld/WebShop/ScienceWorld)和方法(OPD/TCOD-b2f/TCOD-f2b)
关键配置说明
algorithm.advantage_fn需保持为multi_turn_opdrollout_args.logprobs必须启用(设为0)以计算蒸馏差距- TCOD 配置使用
workflow_args.checkpoint_strategy: linear - 常见可调参数包括
buffer.total_steps、trainer.total_steps、workflow_args.max_env_steps和workflow_args.checkpoint_steps
模型与论文信息
- 论文已发表于 COLM 2026
- 论文 arXiv 地址:https://arxiv.org/abs/2604.24005
- ModelScope 模型集合:https://modelscope.cn/collections/wjqkoko/TCOD
- Hugging Face 模型集合:https://huggingface.co/collections/kolerk/tcod





