tenacious-bench-path-b-preference
收藏资源简介:
Tenacious Bench Path B Preference 数据集旨在评估B2B外联工作中特定业务行为的表现,特别是在不确定性下的表现。该数据集不关注广泛的对话质量,而是专注于实际业务场景中的关键失败模式,如基于事实的语言、低置信度处理、避免过度承诺、定价交接安全性、资格正确性和渠道路由行为等。数据集包含偏好对,分为训练集(62条)、开发集(113条)和保留集(50条,仅元数据)。每条记录包含任务ID、分割、维度、任务类型、来源模式、提示、选择与拒绝的响应(包括结构化和非结构化形式)、监督微调文本和元数据等字段。数据来源于四种模式:跟踪衍生、程序化生成、多LLM合成和手工编写。数据集经过预处理,转换为一致的偏好训练模式,并保留来源和任务元数据。推荐用于训练小型偏好模型或进行ORPO、DPO等实验,但不建议用作广泛的指令遵循基准或直接针对保留集进行调优。数据集采用CC-BY-4.0许可公开分发。
The Tenacious Bench Path B Preference dataset is designed to evaluate the performance of specific business behaviors in B2B outreach work, particularly under uncertainty. The dataset does not focus on broad conversational quality but instead targets key failure modes in real business scenarios, such as fact-based language, low-confidence handling, avoiding overcommitment, pricing handover security, qualification correctness, and channel routing behavior. The dataset contains preference pairs divided into a training set (62 entries), a development set (113 entries), and a holdout set (50 entries, metadata only). Each record includes fields such as task ID, split, dimension, task type, source mode, prompt, chosen and rejected responses (both structured and unstructured forms), supervised fine-tuning text, and metadata. The data originates from four modes: tracking-derived, programmatically generated, multi-LLM synthesized, and manually written. The dataset has been preprocessed to convert it into a consistent preference training format while retaining source and task metadata. It is recommended for training small preference models or conducting experiments like ORPO and DPO but is not advised for use as a broad instruction-following benchmark or for direct tuning against the holdout set. The dataset is publicly distributed under the CC-BY-4.0 license.
Tenacious Bench Path B Preference 数据集概述
基本信息
- 数据集名称: Tenacious Bench Path B Preference
- 许可证: CC-BY-4.0
- 任务类别: 文本生成、文本分类
- 语言: 英语
- 数据规模: 小于1K条样本
数据集构成
该数据集包含以下文件:
preferences_train.jsonl— 训练集preferences_dev.jsonl— 开发集preferences_held_out_metadata.json— 保留集元数据manifest.json— 顶层分割索引
样本数量分布
| 分割 | 数量 |
|---|---|
| train | 62 |
| dev | 113 |
| held_out | 50(仅以元数据形式记录) |
每条样本包含的字段
task_id— 任务IDsplit— 分割标识dimension— 维度task_type— 任务类型source_mode— 来源模式prompt— 提示文本prompt_messages— 提示消息chosen— 优选输出rejected— 拒选输出chosen_structured— 结构化优选rejected_structured— 结构化拒选sft_text— 可选的有监督微调文本chosen_chatml— ChatML格式优选rejected_chatml— ChatML格式拒选metadata— 元数据
数据收集过程
任务来源模式(四种)
- trace-derived — 从轨迹推导
- programmatic — 程序化生成
- multi-llm-synthesis — 多语言模型合成
- hand-authored — 人工编写
偏好对创建方法
- 将基准测试批准的输出作为
chosen(优选) - 生成一个可控的较差变体作为
rejected(拒选)
- 对于邮件任务:引入更差的主题前缀、删除不确定性标记或使用被禁止的销售措辞
- 对于结构化任务:将字段翻转至更差的资格判断或渠道决策
数据预处理与标注
- 将基准测试行标准化为一致的偏好训练模式
- 将提示转换为训练友好的纯字符串格式
- 保留
chosen和rejected的渲染形式与结构化形式 - 导出
sft_text用于可选的有监督微调冷启动 - 保留
source_mode和任务元数据以追溯来源
污染检测
仓库中包含相应的污染报告,通过8-gram过滤器(考虑模板)和本地嵌入代理,检查保留集与训练集和开发集的重叠情况。
推荐用途
- 训练小型偏好模型或评判模型
- 运行ORPO、DPO或SimPO风格的实验
- 回归测试销售领域的安全性和基于事实的行为
不推荐用途
- 将其视为广泛的指令遵循基准
- 直接针对密封的保留集进行调优
- 将该数据集解释为真实转化性能的衡量标准
维护优先级
- 保持基准测试与偏好导出数量与基准事实源一致
- 完成仓库工单中理想的24小时评估者重现运行
- 在密封评估协议冻结后,发布更完整的面向基准测试的Hugging Face工件
关键聚焦维度
偏好对重点关注以下业务行为:
- 基于事实的语言使用
- 弱信心处理
- 避免过度承诺
- 定价交接安全性
- 资格判断正确性
- 渠道路由行为




