遇见数据集

pine-realtime-1.0-preview-tau2-voice-trajectories

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

pine-realtime-1.0-preview数据集是一个用于评估语音代理在实时对话场景中性能的基准测试轨迹集合。它基于tau2-bench语音用户模拟器和Sierra自动评分器构建,包含航空(50个任务)、零售(114个任务)和电信(114个任务)三个领域,总计278个任务。所有任务采用常规语音复杂度配置,用户模拟器使用OpenRouter的GPT-5.2模型。数据集内容主要包括两部分:轨迹文件(包含评分摘要、任务信息、时间步评分轨迹和基准端混合音频文件both.ogg)和代理端录音文件(以立体声格式记录实际通话,左声道为代理语音,右声道为用户语音)。评估采用单次尝试通过率(Pass@1)指标,三个领域平均得分为78.0%,所有任务均产生有效评分,无基础设施错误排除。每个任务默认预算为1200模拟秒,超时未完成视为失败。数据集仅支持英语评估,每个任务仅包含一次试验,不提供多次尝试的方差分析。需注意,语音ID可能与参考集不一致,因为使用了本地配置的语音配置文件;基准端音频按模拟时间线拼接隐藏模型调用间隙,而代理端录音按实际时间记录保留真实停顿。

The pine-realtime-1.0-preview dataset is a benchmark trajectory collection for evaluating the performance of voice agents in real-time dialogue scenarios. It is built based on the tau2-bench voice user simulator and the Sierra automatic scorer, encompassing a total of 278 tasks across three domains: aviation (50 tasks), retail (114 tasks), and telecommunications (114 tasks). All tasks use a regular voice complexity configuration, with the user simulator employing OpenRouters GPT-5.2 model. The dataset primarily consists of two parts: trajectory files (including scoring summaries, detailed task information, time-step scoring trajectories, and benchmark-side mixed audio files both.ogg) and agent-side recording files (recorded in stereo format for actual calls, with the left channel as agent speech and the right channel as user speech). Evaluation uses the single-attempt pass rate (Pass@1) metric, with an average score of 78.0% across the three domains; all tasks generated valid scores without infrastructure error exclusions. Each task has a default budget of 1200 simulated seconds, and timeout without completion is considered a failure. The dataset supports only English evaluation, with each task containing only one trial and no variance analysis for multiple attempts. Note that voice IDs may not match the reference set due to locally configured voice profiles; benchmark-side audio is concatenated along the simulated timeline, hiding model call gaps, while agent-side recordings are recorded in real-time, preserving all actual pauses.

创建时间:
2026-06-03
原始信息汇总

数据集概述:pine-realtime-1.0-preview — tau2-bench (voice) 轨迹数据集

  • 许可证:MIT
  • 标签:tau2-bench、voice-agent、trajectories

数据集内容

数据集以压缩包 pine-realtime-1.0-preview_trajectories.tar.gz 形式提供,包含:

  • 任务轨迹trajectories/{airline, retail, telecom}/ 目录下,每个领域包含:
    • results.json:评分摘要及任务列表。
    • simulations/<sim_id>.json:每次模拟的逐时间步评分轨迹。
    • artifacts/task_<id>/sim_<id>/audio/both.ogg:基准侧混合音频。
  • 代理侧录音agent-recordings/<provider_session_id>.ogg,为代理侧立体声录音(左声道为代理,右声道为用户),通过 provider_session_id 与每个轨迹关联。

数据集规模与性能

  • 任务总数:278 个任务(航空 50 / 零售 114 / 电信 114)。
  • 语音复杂度:常规(regular)。
  • 用户模拟器openrouter/openai/gpt-5.2
  • Pass@1 得分(2026-06-09)
    • 航空:78.0%
    • 零售:78.1%
    • 电信:78.1%
    • 简单平均:78.0%
  • 评分情况:全部 278 个任务均产生评分,无任何排除。

评估方法

  • 测试工具:使用官方 τ²-bench 工具,包含 tau2 语音用户模拟器和 Sierra 自动评分器,未做修改。
  • 任务集合:涵盖已发布语音划分中的所有 50 个航空任务、114 个零售任务和 114 个电信任务。
  • 试验次数:每个任务一次试验(pass1)。
  • 语音设置:常规语音复杂度,启用真实环境噪声和信道噪声。
  • 预算限制:每个任务 1200 模拟秒,超时视为失败(非基础设施错误)。
  • 评分规则:每个领域的 pass1 得分为成功数除以该领域评分任务数。
  • 重试机制:基础设施错误进行重试,保持 Pass@1 值。429 速率限制(来自模拟用户 LLM/TTS 和代理服务器)均被重试直至获得有效评分。

已知限制与不足

  • 语音 ID:使用的本地语音配置可能与规范的排行榜语音 ID 不一致,导致音频表现不同。
  • 单次试验:仅包含 pass1 数据,无法体现多次试验的方差。
  • 语言:仅支持美国英语。

代理侧与基准侧录音差异

  • 代理侧录音agent-recordings/)以真实时间(wall-clock time)记录,包含所有实时的停顿。
  • 基准侧录音.../audio/both.ogg)以模拟时间(simulation time)回放,时间间隔被压缩,隐藏了计算延迟。两者记录了同一通话,但时间轴不同。
搜集汇总
数据集介绍
pine-realtime-1.0-preview-tau2-voice-trajectories 数据集图片
构建方式
该数据集基于τ²-bench官方评测框架,采用Sierra自动评分器与tau2语音用户模拟器构建。所有278个任务涵盖航空、零售和电信三个领域,每个任务执行单次试验(pass1),使用regular语速复杂度并启用真实噪声。任务预算为1200模拟秒,超时未完成视为失败。基础设施错误(如用户模拟器的LLM/TTS限流或Pine Realtime服务器的并发限制)导致的429错误会被重试,直至获得有效评分结果,确保全部278个任务均有评分。
特点
数据集包含完整的语音原生轨迹,以JSON格式存储,与公开排行榜采用相同格式。每个轨迹提供两种音频记录:基准侧(benchmark side)的混合音频按模拟时间拼接,隐藏了计算延迟;代理侧(agent-side recording)采用真实时钟时间,保留了每次暂停。两者差异源于τ²-bench的200毫秒固定步长中用户模拟器进行多次模型调用所致的计算耗时。所有任务均通过评分,无基础设施错误排除。
使用方法
用户可通过解压`pine-realtime-1.0-preview_trajectories.tar.gz`获取数据,其中`trajectories/`目录按领域存放`results.json`(汇总评分与任务列表)、`simulations/<sim_id>.json`(逐刻评分轨迹)及`artifacts/`中的基准侧混合音频(`both.ogg`)。`agent-recordings/`目录提供代理侧立体录音(左声道为代理,右声道为用户),通过`provider_session_id`关联轨迹。此外,可访问`https://tau-bench.pinevoice.ai/`使用交互式可视化工具同步播放两种录音。
背景与挑战
背景概述
随着语音交互技术的迅猛发展,评估语音智能体在复杂任务环境中的表现成为关键议题。tau2-bench作为语音智能体的权威评测基准,其下的pine-realtime-1.0-preview数据集由Pine团队于2025年6月发布,包含278个涵盖航空、零售与电信三大领域的全音频轨迹,旨在系统评估语音助手在真实噪声环境下的端到端任务完成能力。该数据集首次整合了完整的客户端与基准端双轨音频记录,并采用GPT-5.2模拟用户与ElevenLabs语音合成,开创了多模态语音任务轨迹的量化标准,对语音智能体领域的研究范式和自动化评测体系产生了深远影响。
当前挑战
该数据集面临的核心挑战包括:首先,领域层面,语音智能体需在动态噪声、模拟用户随机打断与反馈以及预算时间受限(1200秒)的条件下,精准完成多轮任务,尤其在高复杂度场景下极易因交互延迟或理解歧义导致失败。其次,构建过程中,研究团队需应对双重速率限制——来自模拟用户LLM/TTS服务的OpenRouter限流与Pine后端服务器的并发容量瓶颈,任何429错误均需反复重试直至获得有效评定;此外,音频录制存在真实时间与模拟时间两种基准,使得客户端与基准端录音在时间轴上存在显著差异,给轨迹同步分析与可视化带来了技术难度。
常用场景
经典使用场景
在语音智能体评估领域,pine-realtime-1.0-preview-tau2-voice-trajectories数据集被广泛用于衡量语音对话系统在真实世界多轮交互中的端到端表现。该数据集合了278个覆盖航空、零售和电信三个垂直领域的任务轨迹,每个任务均包含完整的音频记录、分级结果以及仿真时间与真实时间双轨录音,使得研究者能够在统一框架下对语音智能体的任务完成率、对话效率及鲁棒性进行标准化评测。尤其值得关注的是,该数据集采用了规范的τ²-bench评估工具与语音用户模拟器,并启用了真实噪声环境,从而为复现和比较不同语音智能体方案提供了可靠的基准。
实际应用
在实际产业部署中,该数据集所定义的评估场景与框架已成为语音客服系统、智能语音助手及实时语音交易平台的核心测试基准。例如,航空领域任务可用于验证系统在退改签、航班查询等标准化业务流程中的准确度和响应时效,而零售与电信领域任务则能检验代理在处理退换货、套餐变更等多样化用户意图时的适应能力。此外,双轨录音的差异化设计使得开发者能够直观对比模拟时域与真实时域下的行为差异,为优化语音流控、降低延迟和提升用户无感体验提供了可量化的调试依据。多家企业已将此类评估流水线集成至持续集成与部署环节,以确保模型在量产环境中保持稳定的通过率。
衍生相关工作
基于该数据集的研究生态已衍生出多项重要工作,涵盖语音超对齐、鲁棒性增强以及多模态交互分析三个方向。例如,部分工作借鉴其评估方法论,提出了基于分位故障分析的语音智能体压力测试框架,专门对预算超限和并发限速等边缘场景进行强化。另有一系列研究围绕双时轴录音的时序对齐展开,开发了语音级精细化诊断工具,能够检测并修补代理在200毫秒级模拟节拍中的上下文漏检问题。与此同时,该数据集也催生了跨领域泛化学习的新范式,研究者利用其三个垂直领域的同质化评估接口,验证了轻量级语音适配器在域间迁移中的有效性。这些衍生成果不仅深化了对语音智能体能力的认识,也推动了评估体系本身的自我进化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务