eyorg/tenacious_bench_v0.1
收藏资源简介:
TenaciousBench v0.1是一个包含220个任务的评估基准,专门用于评估基于LLM的B2B外展销售代理。它涵盖了10个失败维度,包括ICP目标精度、信心感知措辞、信号基础保真度、音调安全性、避免幻觉、CTA行为、竞争对手差距推理、定价纪律、多轮异议处理和线程延续连贯性。数据集分为训练集(110个任务)、开发集(66个任务)和保留集(44个任务)。每个任务都是一个JSON对象,包含任务ID、元数据、输入、真实值和评分标准等信息。数据集的主要用途是评估LLM-based B2B外展销售代理,次要用途是通过DPO/ORPO训练评判/批评模型,以及作为B2B外展质量标准的少样本提示示例。
TenaciousBench v0.1 is a 220-task evaluation benchmark designed to assess LLM-based B2B outbound sales agents across ten failure dimensions: ICP targeting precision, confidence-aware phrasing, signal grounding fidelity, tone safety, hallucination avoidance, CTA behavior, competitor gap reasoning, pricing discipline, multi-turn objection handling, and thread continuation coherence. The dataset is split into training (110 tasks), development (66 tasks), and held-out (44 tasks) sets. Each task is structured as a JSON object containing task ID, metadata, input, ground truth, and scoring rubric. Primary use cases include evaluating LLM-based B2B outbound sales agents, with secondary applications in training judge/critic models via DPO/ORPO and providing few-shot prompting examples for B2B outreach quality rubrics.





