OutboundEval
收藏资源简介:
OutboundEval是一个全面的基准数据集,用于在专家级智能外呼场景中评估大语言模型。它涵盖六个主要业务领域和30个代表性子场景,每个场景都有特定流程分解、加权评分和领域自适应指标。该数据集通过大模型驱动的用户模拟器生成多样化、角色丰富的虚拟用户,具有真实行为、情感变化和沟通风格,并提供动态评估方法,整合自动化和人工评估,衡量任务执行准确性、专业知识应用、适应性和用户体验质量。
OutboundEval is a comprehensive benchmark dataset for evaluating large language models (LLMs) in expert-level outbound call scenarios. It covers six core business domains and 30 representative sub-scenarios, each equipped with specific process breakdowns, weighted scoring criteria, and domain-adaptive evaluation metrics. This dataset leverages LLM-powered user simulators to generate diverse, role-rich virtual users that exhibit realistic behaviors, emotional shifts, and distinct communication styles. Additionally, it provides a dynamic evaluation framework that integrates automated and manual assessments to measure task execution accuracy, professional knowledge application, adaptability, and the quality of user experience.
OutboundEval-Xbench 数据集概述
数据集简介
OutboundEval是一个用于评估大语言模型在专家级智能外呼场景中性能的双维度基准测试。该基准测试针对现有方法在数据集多样性、用户模拟真实性和评估指标准确性三个关键局限性进行了改进。
核心特性
基准设计
- 涵盖6个主要业务领域
- 包含30个代表性子场景
- 每个场景具有特定流程分解
- 采用加权评分机制
- 配备领域自适应指标
用户模拟器
- 基于大模型驱动
- 生成多样化、角色丰富的虚拟用户
- 模拟真实行为、情绪变化和沟通风格
- 提供受控且真实的测试环境
评估方法
- 动态评估适应任务变化
- 结合自动化和人工评估
- 测量任务执行准确性
- 评估专业知识应用能力
- 测试适应性和用户体验质量
评估结果
在12个先进大语言模型上的实验结果显示:
排名前三模型
- doubao-1.5-32k (字节跳动):总分0.8881
- gpt-4.1 (OpenAI):总分0.8818
- claude-4-sonnet (Anthropic):总分0.8748
评分维度
- 任务流程合规性评分
- 通用交互能力评分
应用价值
为构建可靠、拟人化的外呼AI系统提供实用见解,在专业应用中为大语言模型基准测试建立了实用、可扩展且面向领域的新标准。




