conv-collab-failure-modes
收藏资源简介:
该数据集名为“双模型对话:协作结果与失败模式”,专注于研究两个大型语言模型(LLM)在对话中协作解决问题时的表现。其核心特点是不仅记录了对话的最终结果(成功或失败),还提供了关键的反事实对照数据,即标注了每个参与模型在匹配计算资源下单独解决同一问题的能力。数据集旨在探究“哪些问题单个模型无法解决,但两个模型通过对话可以解决”这一科学问题。数据集包含两种配置:outcomes(推荐配置,1191个样本,覆盖成功与失败所有案例,提供全面反事实比较字段)和default(传统配置,346个样本,聚焦失败案例)。数据基于三个核心任务构建:信息不对称算术任务、顺从性/群体思维探测任务和标准问题求解任务。研究发现协作效果受模型能力、问题难度和架构影响,适用于多智能体系统、对话AI评估等领域。
This dataset is named Dual-Model Dialogue: Collaboration Outcomes and Failure Modes, focusing on the performance of two large language models (LLMs) collaborating in dialogue to solve problems. Its core feature is not only recording the final outcome of the dialogue (success or failure) but also providing key counterfactual control data, which annotates each participating models ability to solve the same problem individually under matched computational resources. The dataset aims to explore the scientific question of which problems cannot be solved by a single model but can be solved by two models through dialogue. The dataset includes two configurations: outcomes (recommended configuration, with 1191 samples covering all success and failure cases, providing comprehensive counterfactual comparison fields) and default (traditional configuration, with 346 samples focusing on failed dialogue cases). It is built on three core tasks: information-asymmetric arithmetic tasks, compliance/groupthink probing tasks, and standard problem-solving tasks. Research finds that collaboration effectiveness is significantly influenced by model capabilities, problem difficulty, and architecture, making it suitable for fields such as multi-agent systems, dialogue AI evaluation, and failure mode analysis.
数据集概述
基本信息
- 数据集名称: Two-Model Conversation: Collaboration Outcomes & Failure Modes
- 许可证: Apache-2.0
- 任务类别: 文本生成 (text-generation)
- 语言: 英语 (en)
- 标签: 多智能体 (multi-agent)、对话 (conversation)、失败模式 (failure-modes)、LLM协作 (llm-collaboration)
数据集描述
该数据集记录了由两个大语言模型(LLM)组成的对话对,尝试共同解决一个问题。每个对话都标注了结果,并针对失败的对话标注了具体的失败模式。其核心研究目标是探索“一个LM无法单独解决,但两个LM通过对话可以解决”的问题。
配置与结构
数据集包含三个配置(configs):
-
outcomes(推荐)- 内容: 1191行数据,每行对应一个“实验设置”(任务 × 模型对 × 问题)。涵盖了成功和失败的完整情景,并包含了完整的反事实对照实验。
- 数据文件:
data/train-* - 核心特性:
- 反事实列: 包含
solo_a_correct,solo_b_correct(各模型单次生成),selftalk_a_correct,selftalk_b_correct(各模型在匹配算力下的单模型多轮对话),以及pair_correct(联合结果)。 - 控制组:
control_cell字段将结果分为四类:双方均失败、仅A成功、仅B成功、双方均成功。 - 计算预算: 精确记录了对话轮次(
pair_total_turns、pair_turns_per_model等),确保实验的可复现性。 - 标注: 包含
diversity_helped(多样性帮助标志)、failure_modes(失败模式)、judge_rationale(判断理由)和pair_transcript(完整对话记录)。
- 反事实列: 包含
- 数据规模: 训练集包含2985个样本,数据集总大小为16,762,475 bytes。
-
protocols- 内容: 3483行数据,每行对应一个详细的对话协议。
- 数据文件:
protocols/train-* - 核心特性:
- 包含
main_condition(主要条件)、conditions(所有条件)、n_conditions(条件数量)。 - 包含完整的协作对话记录(
collab_transcript)。 - 包含失败模式(
annotated_failure_mode)、判断理由(judge_rationale)等标注。
- 包含
- 数据规模: 训练集包含3483个样本,数据集总大小为17,247,416 bytes。
-
default(旧版配置)- 内容: 346行数据,仅包含失败的对话。来自信息不对称(
split)、谄媚(syco)和GSM8K任务。 - 核心特性: 为保持连续性,每条记录均包含失败模式标签。关键字段包括
task(任务类型)、condition(实验条件)、transcript(对话记录)和failure_modes(失败模式)。
- 内容: 346行数据,仅包含失败的对话。来自信息不对称(
任务与实验设置
数据集覆盖了多种任务类型和模型对尺度:
-
任务类型:
- GSM8K: 小学数学题。
- MMLU: 大规模多任务语言理解。
- CommonsenseQA: 常识推理。
- ARC: AI推理挑战。
- StrategyQA: 策略问答。
- GSM-IC: 引入无关上下文的数学题。
- MATH: 数学竞赛题。
- 信息不对称任务 (
split): 将一个数学表达式的变量值分配给两个模型,单独一个模型无法解决,必须通过对话共享信息。 - 谄媚/群体思维探测任务 (
syco): 一个模型(Alice)被私下告知一个错误答案并要求坚持,另一个模型(Bob)拥有正确答案,观察Bob是否会妥协。
-
模型对与尺度:
- 涵盖了从0.5B到32B的不同规模模型,包括Qwen2.5、Llama-3.2、gemma-2和deepmath-v1系列。
- 具体模型对如:
Qwen2.5-3B×Llama-3.2-3B,Qwen2.5-7B×Qwen2.5-7B,Qwen2.5-32B×gemma-2-27b,Qwen3-4B×deepmath-v1(数学专家)。
关键发现
- 协作是能力门控的: 在信息不对称任务中,小模型(如0.5B)的协作准确率极低(0.025),而7B模型可以完全解决(1.0)。小模型失败的原因是伙伴无法识别自己掌握的线索正是缺失的信息,进而产生幻觉。
- 谄媚/群体思维是能力和难度的门控: 在谄媚探测任务中,弱模型(如0.5B)处理难题时,有27.5%的几率会采纳一个自信伙伴的错误答案;而强模型(如1.5B)则能保持稳健(2.5%)。
- 跨架构混合有时胜过同架构配对: 在3B量级的信息不对称任务中,
Qwen2.5-3B × Llama-3.2-3B的组合(准确率0.725)显著优于同架构的Qwen2.5-3B × Qwen2.5-3B(0.45)或Llama-3.2-3B × Llama-3.2-3B(0.03)。 - 综合影响: 对话在某些问题上能“拯救”失败(尤其多步数值计算),但也会“腐蚀”同样数量的问题(伙伴将正确答案讨论成错误答案),在小尺度上净效果接近零。这种“腐蚀”现象在32B尺度上消失。




