遇见数据集

Gym_Salesman_Dataset

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

Gym Salesman Dataset 是一个用于文本分类任务的合成数据集,包含 12,000 个(去重后 11,997 个)健身会员销售对话,每个对话被标记为 SUCCESS(成功)或 FAILURE(失败)。数据集旨在让模型学习真实的销售动态——即哪些行为能促成交易——而非利用快捷方式。标签是通过模拟过程自然涌现的:销售员根据隐藏的技能水平行动,客户提出隐藏的异议,独立的评估者模型在对话结束后判断每个异议是否被解决,最终根据解决的异议数量是否达到说服阈值来确定标签。该过程确保了标签是模拟的输出而非输入,避免了标签泄露。数据集包含以下字段:sample_id(唯一ID)、outcome(目标标签)、dialogue(对话轮次列表,包含角色和文本)、decision_turn_index(最终决策轮次索引)、persona(四种原型之一)、demographic(基于原型的描述)、mood(基于原型的情绪)、gym(六种健身房值之一)、price(五种价格值之一)、n_turns(对话轮次,6或8)。此外,还有一个单独的元数据文件包含潜在状态(如技能水平、每个异议是否被解决),仅用于分析,绝不可作为模型特征。数据集大小约为 10K-100K 样本,语言为英文,许可证为 MIT。EDA 显示技能水平与成功率正相关,且标签是涌现的;泄漏审计表明无法通过文本风格作弊;评估者验证显示评估者比人类更严格但并非噪声。已知局限性包括单一生成模型风格、评估者与生成器同属一个系列、客户过度礼貌、事实幻觉、异议提及率约 80%、仅有4种原型。适用任务包括销售对话的早期结果预测、销售辅导、相似对话推荐和异议处理分析。

Gym Salesman Dataset is a synthetic dataset for text classification, containing 12,000 (11,997 after deduplication) gym membership sales dialogues, each labeled as SUCCESS or FAILURE. The dataset aims to teach models real sales dynamics—what behaviors lead to a deal—rather than shortcuts. Labels emerge naturally from a simulation process: the salesperson acts based on a hidden skill level, the customer raises hidden objections, an independent evaluator model judges after the dialogue whether each objection is resolved, and the final label is determined by whether the number of resolved objections reaches a persuasion threshold. This ensures labels are outputs of simulation, not inputs, avoiding label leakage. Fields include: sample_id, outcome, dialogue (list of turns with role and text), decision_turn_index, persona, demographic, mood, gym, price, n_turns. A separate metadata file contains latent states (e.g., skill level, each objection resolved) for analysis only, not as model features. Dataset size is approximately 10K-100K samples, language is English, license is MIT. EDA shows skill level positively correlates with success; leakage audit indicates no text style cheating; evaluator validation shows evaluators are stricter than humans but not noisy. Known limitations include single generator style, same model family for evaluator and generator, overly polite customers, factual hallucinations, ~80% objection mention rate, only 4 personas. Applicable tasks include early outcome prediction for sales dialogues, sales coaching, similar dialogue recommendation, and objection handling analysis.

创建时间:
2026-07-27
原始信息汇总

数据集概述

Gym Salesman Dataset 是一个包含 12,000 条(去重后 11,997 条)合成健身房会员销售对话的数据集,每条对话被标记为 SUCCESS(成功)或 FAILURE(失败)。每条对话由销售员(具有隐藏技能水平)与客户(具有隐藏反对意见)之间的双智能体交互生成,结果由独立的评估模型根据销售员是否解决了每条反对意见来判定,而非由提示词预先指定。

构建方法

  • 生成器: Qwen/Qwen2.5-3B-Instruct(逐轮生成对话,基于 vLLM)
  • 评估器: Qwen/Qwen2.5-7B-Instruct(独立的更强模型,减少自我评估偏差)
  • 阶段A: 在生成任何文本之前,先采样所有潜在状态(角色、人口统计特征、情绪、隐藏反对意见、技能、健身房、价格、对话长度)
  • 阶段B: 逐轮生成对话,销售员看不到反对意见或结果,客户被告知“尚未做出决定”
  • 阶段C: 评估器阅读完整对话记录,根据书面的 resolves_when 标准判断每条反对意见是否被解决
  • 阶段D: 若已解决的反对意见数量 ≥ 说服阈值,则 label = SUCCESS,否则为 FAILURE;没有模型被要求直接输出 SUCCESS/FAILURE
  • 阶段E: 最后的客户发言将决定口头化

数据模式

字段 类型 说明
sample_id int 唯一标识
outcome string SUCCESS / FAILURE(目标变量)
dialogue list 包含 {role, text} 的交替对话(销售员 → 客户)
decision_turn_index int 最终决定轮次的索引
persona string 4 种原型(Yuval, Omer, Ariel, Noam)
demographic string 基于 persona 条件生成
mood string 基于 persona 条件生成
gym string 6 种取值
price string 5 种取值
n_turns int 6 或 8

单独的元数据文件包含潜在状态(技能水平、已解决哪些反对意见),该文件绝不应作为模型特征使用,它仅用于分析,因为标签由其确定性决定。

关键发现(EDA)

  • 技能驱动结果: 技能水平独立于客户难度采样,但 SUCCESS 率随技能单调上升(新手 22.8%,普通 28.3%,专家 30.9%),验证了“技能 → 反对意见解决 → 结果”的链条是涌现的而非注入的。
  • 泄漏审计: 基于 TF-IDF 和逻辑回归的分类器在销售员回合(排除最终推销)上仅达到 64%(6轮)/ 69%(8轮)的准确率,接近或低于多数类基线,表明不存在风格指纹可被利用。
  • 评估器验证: 人工盲标 46 条反对意见判断,与评估器原始一致性 54%,Cohens κ = 0.22,分歧是单向的(人类更宽容),评估器系统性更严格,符合设定的标准。
  • 类别平衡: SUCCESS 占比 27.4%,为涌现结果而非强制设定,建议使用 class_weight=balanced 处理。

已知局限

  1. 单一生成模型 —— 所有文本带有同一模型的风格指纹。
  2. 评估器与生成器同源 —— 通过使用更大的 7B 模型作为评判者及 κ 检验来缓解,但未完全消除。
  3. 过度礼貌(20.1% 的客户回合) —— 客户有时违反指令感谢销售员,仅影响外观。
  4. 事实幻觉(0.65% 的销售员回合) —— 偶发编造术语(如与事实表矛盾的费用或货币错误)。
  5. 反对意见表达检测约 80% 基于关键词匹配 —— 是最低限度,间接表达会被漏掉。
  6. 仅 4 种 persona —— 是多样性最薄弱的维度。

预期用途

用于训练和评估销售辅导的早期结果预测、相似对话推荐以及反对意见处理分析。注意: 不要将最终决定轮次输入给用于预测结果的模型,因为它直接陈述了决定。

搜集汇总
数据集介绍
Gym_Salesman_Dataset 数据集图片
构建方式
该数据集通过多阶段模拟流程构建,旨在捕捉真实销售对话的动态特性。首先,利用计数器随机数生成器在文本生成之前确定所有潜在状态,包括销售人员的技能水平、顾客的个性特征、人口统计信息、情绪状态以及隐藏的异议等。随后,分别采用Qwen/Qwen2.5-3B-Instruct和Qwen/Qwen2.5-7B-Instruct模型进行逐轮对话生成和结果评估。销售人员在对话中无法获取异议或结果信息,顾客则被指示保持未决定状态。最后,由独立的评估模型根据预设的解决标准判断每个异议是否被解决,并通过算术计算得出最终标签,从而确保标签是模拟过程的输出而非输入。
特点
该数据集包含约12,000条合成销售对话,每条对话均标记为成功或失败,反映了结果的内在涌现性。技能水平独立于顾客难度采样,且成功率随技能提升呈单调递增,验证了技能驱动结果的核心设计。泄漏审计表明,基于TF-IDF和逻辑回归的分类器无法从销售人员的话语中预测结果,性能接近或低于多数类基线。评估器验证显示,人工与评估器的一致性较低,但分歧方向一致,即评估器更为严格,符合设定标准。类别分布不平衡,成功案例占27.4%,需在训练中处理。
使用方法
数据集适用于训练和评估早期结果预测模型,用于销售辅导、相似对话推荐和异议处理分析。使用时需注意,决策轮次明确表述了结果,不应将其作为预测输入。此外,元数据中隐含的潜在状态(如技能水平、异议解决情况)定义了标签,仅可用于分析,不可用作模型特征。建议在训练分类模型时采用类别平衡策略,如使用类权重,以应对成功案例较少的问题。
背景与挑战
背景概述
Gym_Salesman_Dataset由研究人员于近期构建,旨在模拟健身房会员销售的对话场景,核心研究问题在于探索销售行为与成交结果之间的因果关联。该数据集通过生成12,000条合成对话,每条对话由销售人员(隐含技能水平)与顾客(隐含异议)交互而成,结果标签由独立评估模型根据异议解决程度决定,而非预先注入,从而保证了标签的涌现性。其设计哲学强调标签是模拟的输出而非输入,有效规避了数据泄漏风险。该数据集为销售对话分析、早期结果预测及异议处理研究提供了宝贵资源,对计算社会科学与人机交互领域具有潜在影响力。
当前挑战
该数据集面临的挑战多维且深刻。领域层面,销售对话预测的核心难点在于捕捉动态交互中的非显性信号,如顾客未言明的异议与销售人员的策略适应性,传统分类模型易受风格偏差干扰,难以泛化至真实场景。构建过程中,首要挑战是确保标签的涌现性,避免生成模型先验泄露答案,这要求细致的阶段设计及独立评估模型的使用。其次,评估一致性受主观性影响,人工标注与自动评估的Cohen's κ仅0.22,反映评估标准的严格程度差异,而非噪声。此外,单一生成模型导致文本风格单一,影响多样性;过度礼貌现象、事实幻觉及关键词匹配的局限,均对数据质量与后续应用构成制约。
常用场景
经典使用场景
该数据集为销售对话分析与结果预测研究提供了独特的实验场域,其核心价值在于通过12,000段合成的健身房会员销售对话,每条对话均标注成功或失败结果,且结果由模拟过程中的技能水平与异议解决情况自然涌现。研究者可利用该数据集训练和评估早期结果预测模型,即在对话尚未结束前预测最终成交可能性,这是销售辅导系统与智能对话代理的关键能力。同时,该数据集支持推荐系统在相似对话上的应用,以及异议处理策略的量化分析,为探究语言行为与销售成效之间的因果关系奠定了数据基础。
实际应用
在实际应用中,该数据集可支撑销售培训平台的智能化升级,通过预测对话早期结果,为销售人员提供实时反馈与改进建议,从而针对性提升异议处理能力。在客服机器人领域,可基于此训练模型识别潜在客户意向,动态调整话术,优化转化率。此外,该数据集还适用于销售对话语料库的构建,助力企业分析客户痛点与常见异议,制定个性化营销策略。对于推荐系统,相似对话的挖掘能促进销售线索的优先级排序,提高资源配置效率。
衍生相关工作
该数据集已衍生出多项经典研究,涵盖对话结果预测的基准模型构建、基于注意力机制的销售策略分析,以及利用元数据(如技能水平、异议解决数)进行可解释性研究的尝试。相关工作常以该数据集为测试床,探讨在无泄漏条件下预训练语言模型的微调效果,并发展出针对文本分类任务的不平衡处理策略(如类别加权)。此外,数据集的评审流程与泄漏审计方法被后续研究参考,成为合成对话数据生成的效度验证标准,推动了新兴领域如对话式推荐与谈判Agent的性能评估框架的成熟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务