遇见数据集

shorthand-agent-comm

收藏
Hugging Face2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

该数据集用于训练 Qwen3.5-9B 代理(通过 LoRA 微调)以在简略的已学习插槽标记简写中通信。数据集包含 v4 架构的轨迹数据:翻译器(translator)将英文任务转换为 slot-marker 简写规范,工作器(worker)执行 agentic 循环(读/编辑/测试/完成),然后翻译器将简写报告转换为英文摘要。数据规模为 2,883 条轨迹(有效性 92-98%),其中 195 条作为保留集。训练数据包括 v4_worker_train.jsonl(11,532 行)和 v4_translator_train.jsonl(8,649 行)。此外还包含 v1/v3 版本的训练和评估数据(如 real_*.jsonl、eval_*.jsonl、train_pairs.jsonl 等),以及生成脚本、验证模式和基准测试代码。该数据集适用于训练基于简写通信的代理模型,特别适合需要高效 token 消耗的任务执行场景(中位数 1.3-2.5k tokens/任务)。

This dataset is used to train the Qwen3.5-9B agent (via LoRA fine-tuning) to communicate in a concise learned slot-marker shorthand. The dataset contains trajectory data of the v4 architecture: a translator converts English tasks into slot-marker shorthand specifications, a worker executes an agentic loop (read/edit/test/complete), and then the translator converts the shorthand report into an English summary. The data scale is 2,883 trajectories (validity 92-98%), with 195 as a holdout set. Training data includes v4_worker_train.jsonl (11,532 lines) and v4_translator_train.jsonl (8,649 lines). Additionally, it contains training and evaluation data for v1/v3 versions (e.g., real_*.jsonl, eval_*.jsonl, train_pairs.jsonl, etc.), as well as generation scripts, validation patterns, and benchmark code. This dataset is suitable for training agent models based on shorthand communication, especially for task execution scenarios requiring efficient token consumption (median 1.3-2.5k tokens/task).

创建时间:
2026-08-29
原始信息汇总

数据集概述:shorthand-agent-comm

项目背景

该数据集服务于 trained shorthand 项目,旨在通过LoRA微调Qwen3.5-9B智能体,使其能够使用一种简洁的学习型槽标记(slot-marker)简写语言进行通信。

v4架构(当前版本)

系统采用三段式流水线架构:

  1. 翻译器 (TRANSLATOR)GreenPT/shorthand-translator-v4,将英文任务转换为槽标记简写规范
  2. 工人 (WORKER)GreenPT/shorthand-worker-v4,以简写原生智能体循环运行,在pytest沙箱中执行读/编辑/测试/完成操作
  3. 翻译器回译:将简写完成报告转换为英文摘要

数据构成

  • 总轨迹数:2,883条(有效性92–98%)
  • 保留数据:195条独立任务

训练数据文件

文件 内容
v4_traj_raw.jsonl 原始v4轨迹数据
v4_worker_train.jsonl 工人角色训练数据,共11,532行
v4_translator_train.jsonl 翻译器角色训练数据,共8,649行
v4_heldout_*.jsonl 195条保留测试任务

其他数据文件

  • real_*.jsonl:v3真实任务评估数据
  • eval_*.jsonltrain_pairs.jsonlreader_train*.jsonlencoder_train_v3.jsonl:v1/v3训练及评估数据

模型与训练细节

  • 教师模型Qwen/Qwen3.5-397B-A17B(通过HF Inference Providers的:deepinfra路由)
  • 微调方式:LoRA(r=64,3轮训练,bf16精度,包含分词器)
  • 验证结果:20任务烟雾测试中成功率100%,每个任务中位token消耗1.3–2.5k

成本统计(v4,第三轮)

项目 金额
教师API(397B生成) $1.68
GPU(a100-large) ~$7
第三轮总计 ≈ $9
项目GPU总成本 ≈16个a100小时 ≈ $40

脚本与工具

  • gen_v4.py:v4数据生成器
  • schema.py:简写验证模块
  • loop_bench.py:循环基准测试
  • run_*.pytrain_sft.py:评估运行器与SFT训练脚本
  • swe_harness.py:SWE-bench测试框架

使用说明

详细使用方法请参考代码仓库中的GUIDE.md文件,或访问GreenPT/trained-shorthand-report获取完整报告。仓库提供了基于peft库的快速加载示例,支持动态切换翻译器与工人两个适配器。

搜集汇总
数据集介绍
shorthand-agent-comm 数据集图片
构建方式
该数据集源自“trained shorthand”项目,旨在通过LoRA微调Qwen3.5-9B智能体,使其能够使用一种紧凑的槽标记速记语言进行通信。数据构建采用教师模型Qwen3.5-397B-A17B生成轨迹,共包含2,883条轨迹,经有效性筛选后(92-98%有效)形成v4_traj_raw.jsonl,并进一步按角色拆分为worker训练集(11,532行)和translator训练集(8,649行)。同时保留195个任务作为独立测试集,用于后续评估。
特点
数据集的核心特点在于其双重角色架构:translator负责将英文任务转换为速记规范,worker则在pytest沙盒中执行读写测试循环,最终由translator将速记报告转回英文。评估显示,在195个保留任务上,速记循环的成功率为60.0%,但中位token数高达1,436,相比功能型英文基线(79.5%成功率,293 token)成本高出约5.3倍。这揭示了速记通信在代理任务中的性能与效率权衡。
使用方法
使用者可通过加载Qwen3.5-9B基础模型,并利用PEFT库分别挂载translator和worker的LoRA适配器(GreenPT/shorthand-translator-v4和shorthand-worker-v4)来复现实验。训练数据可直接用于监督微调,而v4_bench_heldout.jsonl提供了完整的基准记录,便于对比不同提示策略。详细的使用指南参见GUIDE.md和配套报告。
背景与挑战
背景概述
shorthand-agent-comm数据集由GreenPT团队于2025年创建,旨在探索一种新颖的智能体间通信范式——训练Qwen3.5-9B代理通过微调(LoRA)使用紧凑的槽标记速记进行交互。该研究源于对大语言模型代理在复杂任务中通信效率的关切,核心问题在于能否通过定制化通信协议来提升多代理系统的性能。该数据集包含2,883条训练轨迹及195条保留任务,涵盖翻译器与工作者两种角色的训练数据,其独特的架构设计(翻译器将英文任务转换为速记规范,工作者基于速记执行代理循环)为多代理协作提供了新视角。尽管初步实验显示速记循环在成本与成功率上不及功能型英文基线,但其在特定场景下的潜力仍引起领域关注,为后续优化代理通信策略奠定了基础。
当前挑战
该数据集面临的核心挑战包括:其一,速记通信的有效性问题——尽管设计了槽标记速记以压缩信息,实测表明速记循环在保留任务上的成功率(60.0%)低于功能型英文基线(79.5%),且令牌开销为后者的5.3倍,揭示出高度压缩通信可能引入语义损失与任务理解偏差;其二,构建过程的复杂性——数据生成依赖大型教师模型(Qwen3.5-397B-A17B),虽付出约16个A100小时的成本,仍面临轨迹有效性波动(92-98%)及早期小规模测试的高估问题,需通过扩大保留集多轮验证以校正性能基准;此外,多角色适配器(翻译器与工作者)的协同训练对数据一致性提出严苛要求,如何兼顾通信效率与任务成功率仍是亟待突破的瓶颈。
常用场景
经典使用场景
该数据集服务于'速记智能体通信'(trained shorthand)项目,其经典使用场景聚焦于多智能体系统中高效、紧凑的通信协议研究。研究者可利用其中包含的2,883条轨迹以及195条留出任务数据,训练和评估大语言模型在翻译器与执行器之间的槽标记速记通信能力。通过将自然语言任务转化为简洁的符号化规格,并驱动执行器在pytest沙箱环境中完成代码编写与测试,该数据集为探究智能体间内部通信的压缩表征与语义保真度提供了标准化的实验平台。
衍生相关工作
围绕该数据集衍生的相关工作主要在智能体通信压缩与多智能体协作两个方向展开。一方面,研究者可在公开的v4基准与训练数据之上,探索更优的速记语言学习算法,如对比学习或元学习,以逼近功能化英语基线的成功率。另一方面,该研究的基准测试框架(包括留出集及其评测脚本)可被复用至其他模型架构或任务域,推动构建低token预算的具身智能或软件工程智能体,其发布的端到端训练与基准评测代码亦成为后续同类研究的基础设施。
数据集最近研究
最新研究方向
在Agent通信效率与可扩展性研究的前沿,shorthand-agent-comm数据集针对多Agent系统中语言交互的瓶颈,开创性地探索了基于槽标记的紧凑通信协议。通过大规模微调Qwen3.5-9B模型,该工作引入transformer与worker双角色架构,使agent能够以简练的速记符码进行任务规划与执行,显著降低token开销并提升复杂任务处理能力。数据集的构建依托于高成本教师模型生成的近三千条高质量轨迹,并经过严谨的留出集验证,体现了科研严谨性。尽管实验揭示速记通信在性能与成本上暂时不及功能型英语基线,其蕴含的认知压缩思想为构建高可扩展性agent系统提供了新范式,预示着未来智能体将具备更高效、更隐秘的交互机制。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务