遇见数据集

calendar-agent-benchmark

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集专为日历代理(Calendar Agent)的训练和评估设计,结合了工具调用监督微调(SFT)和基于环境的强化学习(RLVR)。数据全部由确定性模板和记忆型 CalendarEnv 环境合成生成,确保相同种子下的初始状态、用户请求和目标行为完全一致。数据集包含五个 JSONL 文件:训练 SFT 的 3,000 条样本、SFT 验证的 300 条样本、用于 RLVR 训练的 256 条样本、开发集 200 条以及最终评估集 400 条。SFT 数据覆盖三类动作:基本日程管理(2,100 条训练/210 条验证)、多参与者日程创建(600/60)和多参与者只读对照组(300/30)。RLVR 数据由五个模板构成,每个模板对应不同的目标行为:冲突后创建(80 条)、多参与者创建(48 条)、删除确认(64 条)、已确认删除(32 条)和缺失时间澄清(32 条)。所有 SFT 的助手工具调用、工具观察和最终自然语言回答均由确定性专家策略在环境中执行生成的轨迹。RLVR 数据不包含正确答案,而是由验证器在训练过程中对学生生成的工具轨迹和最终回答进行评分。数据集不包含任何 Teacher 变体,且五个拆分之间日期范围互不重叠。最终评估使用固定种子 42 和 vLLM 服务器进行。该数据集为合成数据,不涵盖真实日历服务中的认证、权限、隐私或网络故障,因此最终结果仅反映所定义五个模板的工具使用和安全策略能力,而非通用代理性能。

This dataset is specifically designed for the training and evaluation of Calendar Agent, combining tool-calling supervised fine-tuning (SFT) and environment-based reinforcement learning (RLVR). All data are synthesized by deterministic templates and the memory-based CalendarEnv environment, ensuring that the initial state, user request, and target behavior are completely consistent under the same seed. The dataset includes five JSONL files: 3,000 samples for SFT training, 300 samples for SFT validation, 256 samples for RLVR training, 200 samples for development set, and 400 samples for final evaluation set. SFT data cover three types of actions: basic schedule management (2,100 training / 210 validation), multi-participant schedule creation (600/60), and multi-participant read-only control group (300/30). RLVR data consist of five templates, each corresponding to a different target behavior: conflict creation (80 samples), multi-participant creation (48 samples), deletion confirmation (64 samples), confirmed deletion (32 samples), and missing time clarification (32 samples). All SFT assistant tool calls, tool observations, and final natural language responses are trajectories generated by deterministic expert policies executing in the environment. RLVR data do not contain correct answers; instead, a validator scores the student-generated tool trajectories and final responses during training. The dataset does not include any Teacher variant, and the date ranges of the five splits do not overlap. Final evaluation uses a fixed seed of 42 and a vLLM server. The dataset is synthetic and does not cover authentication, permissions, privacy, or network failures in real calendar services, so the final results only reflect the tool usage and safety policy capabilities of the defined five templates, not general agent performance.

创建时间:
2026-08-12
原始信息汇总

Calendar Agent Training and Evaluation 数据集概述

数据集基本信息

  • 许可证:Apache-2.0
  • 语言:韩语(ko)
  • 任务类别:文本生成(text-generation)
  • 标签:工具调用(tool-calling)、智能体(agents)、RLVR、日历(calendar)
  • 名称:Calendar Agent Training and Evaluation

数据构成

文件 数量 构成
sft_train.jsonl 3,000 基本场景、多参与者创建、安全对照组
sft_validation.jsonl 300 SFT训练中验证
rlvr_train.jsonl 256 冲突恢复与多参与者创建128个、安全边界128个
dev.jsonl 200 检查点选择,五个模板各40个
final.jsonl 400 最终评估,五个模板各80个

SFT行为类别分布

行为类别 训练集 验证集
基本日程管理 2,100 210
多参与者日程创建 600 60
多参与者只读对照组 300 30

RLVR训练模板

模板 数量 目标行为
conflict_then_create 80 冲突确认后在空闲时间创建日程
multi_attendee_create 48 确认参与者可用性后创建日程
delete_confirmation 64 查询删除对象并请求批准
confirmed_delete 32 用户批准后删除日程
missing_time_clarification 32 请求缺失的开始时间和持续时间

生成方式

  • 所有文件通过确定性场景模板和内存 CalendarEnv 生成。
  • 相同种子生成相同的初始状态、用户请求和目标行为。
  • SFT的助手工具调用、工具观察和最终自然语言回答由确定性专家策略执行环境生成的轨迹。
  • RLVR数据中不包含正确答案的助手完成,训练中学生生成的工具轨迹和最终答案由验证器评分。
  • 公开的五个分割未应用教师变体,教师选择路径仅改变用户话语的表达方式。
  • 使用的模型为 cyankiwi/Qwen3.6-35B-A3B-AWQ-4bit,修订版本为 00fcea2d3bcf5389b518d4fc082e5590e0ba4844

验证说明

  • 专家轨迹在内存日历环境中执行。
  • 仅保存达到目标状态、工具回合不超过4次并通过语义密集奖励检查的记录。
  • SFT训练与验证、RLVR训练、dev和final使用互不重叠的日期范围。
  • dev检查点选择和final评估在应用服务器种子42和 VLLM_BATCH_INVARIANT=1 的vLLM服务器上执行。

生成命令

bash PYTHONPATH=. python -m scripts.synthesize_calendar_sft PYTHONPATH=. python -m scripts.synthesize_calendar_rlvr

局限性

  • 场景为在内存日历环境中运行的合成数据。
  • 不包含真实日程服务的认证、权限、个人信息、网络故障等情况。
  • final结果衡量五个已定义模板的工具使用和安全政策,不代表通用Agent性能。
搜集汇总
数据集介绍
calendar-agent-benchmark 数据集图片
构建方式
该数据集通过确定性场景模板与内存日历环境(CalendarEnv)构建,每个种子生成唯一的初始状态、用户请求及目标行为。SFT数据由确定性专家策略执行环境生成轨迹,包含工具调用、环境观测及最终自然语言回答;RLVR数据不含标准答案,由学生模型生成轨迹并由验证器评分。数据分为SFT训练/验证、RLVR训练、开发与最终评估五个部分,各自覆盖不同日期的场景,确保无重叠。场景覆盖基本日程管理、多参会者创建、冲突处理、删除确认及缺失信息澄清等行为类别,并通过对比模板实现安全控制。
特点
数据集具备结构化多样性,SFT构建融合基础管理(2100条)、多参与者创建(600条)及只读对照(300条)三大行为范畴,RLVR则细分为冲突后创建、多参与者创建、删除确认、已确认删除及缺失时间澄清五种模板。所有记录均经专家轨迹验证,满足目标状态达成、工具调用轮次控制及语义密集奖励等严格标准。数据按功能隔离训练与评估,确保无重叠日期,从而可靠衡量工具使用与安全策略。此外,数据集提供可复现的生成脚本,便于扩展与复刻实验,同时明确提示其合成性质及对通用Agent性能的局限性。
使用方法
使用本数据集时,可分别调用指定脚本生成SFT与RLVR数据。SFT阶段,利用sft_train.jsonl与sft_validation.jsonl训练模型遵循工具调用和最终回答格式;RLVR阶段,以rlvr_train.jsonl为基础,让学生模型自主生成轨迹,环境验证器根据冲突解决、多参会者协调等规则评分,实现强化学习训练。开发与最终评估文件(dev.jsonl、final.jsonl)用于检查点选择和最终性能衡量,推荐在固定服务器种子下,采用vLLM(VLLM_BATCH_INVARIANT=1)进行批量推理,以保障结果一致性与可比性。
背景与挑战
背景概述
该数据集由cyankiwi研究团队创建于2025年,旨在推动基于工具调用的语言代理在日历管理场景中的训练与评估。其核心研究问题在于如何通过监督微调(SFT)与环境交互的强化学习(RLVR)相结合,使代理能够执行复杂日历操作,如多参会者调度、冲突解决及安全敏感操作。数据集提供了分层设计,包含SFT训练集、验证集、RLVR训练集及开发与最终测试集,覆盖五类行为模板,并采用确定性场景生成与专家轨迹验证,确保了数据的高质量和可复现性。其在工具调用与代理对齐领域具有潜力,为后续研究提供了标准化基准,尤其针对中文环境下的日程管理任务,推动了安全且高效的日历代理发展。
当前挑战
该数据集面临的挑战主要源于两个方面。领域问题方面,日历管理涉及多步骤推理、动态环境中的冲突检测与用户意图澄清,需代理在有限工具调用内准确完成操作,同时平衡效率与安全性,如删除确认等敏感操作;构建挑战方面,合成数据虽基于确定性场景模板,但需确保策略轨迹的可靠性与通用性,验证过程需紧密贴合环境状态,且需消除分割重叠以避免评估偏差。此外,现有限制在于未涵盖真实服务中的认证、权限、网络故障等复杂因素,导致最终性能仅反映特定模板下的能力,难以全面代表代理的真实表现,这为跨域泛化与实际部署带来了挑战。
常用场景
经典使用场景
该数据集专为日历智能体的训练与评估而设计,聚焦于工具调用(tool-calling)与强化学习(RLVR)的实践。其经典使用场景包括:基于SFT数据的监督微调,以教会模型执行基础日程管理、多参会人日程创建等任务;利用RLVR数据实现环境交互式学习,通过冲突恢复、删除确认等模板,训练模型在动态环境中做出安全且合理的决策;同时,数据集提供了独立的验证与测试分割,便于研究者在固定日期范围内进行模型性能的公正评估与调优。
衍生相关工作
该数据集衍生了多个方向的研究工作,包括:基于RLVR的智能体安全对齐研究,探索如何在工具调用过程中避免破坏性操作;多轮对话中工具调用的策略学习,以提升复杂日程管理任务的完成率;以及针对开源语言模型(如Qwen)的微调增强技术,验证了小型模型通过专项训练可达到专业日历代理的性能。此外,其方法论可迁移至其他工具密集型场景(如邮件管理、任务调度),催生了通用工具调用智能体的泛化研究。
数据集最近研究
最新研究方向
calendar-agent-benchmark数据集聚焦于结合监督微调与基于环境反馈的强化学习(RLVR)训练日历智能体,其前沿研究方向在于通过精心设计的冲突处理、多参会者协调及安全边界场景,实现工具调用能力的精准优化与对齐。该基准采用确定性模板合成高质量轨迹,并引入可验证的奖励机制,推动智能体从静态指令遵循向动态环境交互与安全决策演进。其多层级数据划分(SFT、RLVR、dev、final)为模型迭代提供了严谨的评估框架,尤其在多轮工具查询、确认删除及信息澄清等复杂任务中,强调对用户意图的主动探查与最小风险操作。这一工作反映了当前大语言模型智能体研究中从单一任务执行向环境适应性、策略鲁棒性及安全合规性深化的趋势,对领域内可复用、标准化智能体评估体系的构建具有重要参考价值,也为理解工具增强型对话系统的能力边界提供了新视角。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务