遇见数据集

conv-collab-failure-modes

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

该数据集名为“双模型对话:协作结果与失败模式”,专注于研究两个大型语言模型(LLM)在对话中协作解决问题时的表现。其核心特点是不仅记录了对话的最终结果(成功或失败),还提供了关键的反事实对照数据,即标注了每个参与模型在匹配计算资源下单独解决同一问题的能力。数据集旨在探究“哪些问题单个模型无法解决,但两个模型通过对话可以解决”这一科学问题。数据集包含两种配置:outcomes(推荐配置,1191个样本,覆盖成功与失败所有案例,提供全面反事实比较字段)和default(传统配置,346个样本,聚焦失败案例)。数据基于三个核心任务构建:信息不对称算术任务、顺从性/群体思维探测任务和标准问题求解任务。研究发现协作效果受模型能力、问题难度和架构影响,适用于多智能体系统、对话AI评估等领域。

This dataset is named Dual-Model Dialogue: Collaboration Outcomes and Failure Modes, focusing on the performance of two large language models (LLMs) collaborating in dialogue to solve problems. Its core feature is not only recording the final outcome of the dialogue (success or failure) but also providing key counterfactual control data, which annotates each participating models ability to solve the same problem individually under matched computational resources. The dataset aims to explore the scientific question of which problems cannot be solved by a single model but can be solved by two models through dialogue. The dataset includes two configurations: outcomes (recommended configuration, with 1191 samples covering all success and failure cases, providing comprehensive counterfactual comparison fields) and default (traditional configuration, with 346 samples focusing on failed dialogue cases). It is built on three core tasks: information-asymmetric arithmetic tasks, compliance/groupthink probing tasks, and standard problem-solving tasks. Research finds that collaboration effectiveness is significantly influenced by model capabilities, problem difficulty, and architecture, making it suitable for fields such as multi-agent systems, dialogue AI evaluation, and failure mode analysis.

创建时间:
2026-07-05
原始信息汇总

数据集概述

基本信息

  • 数据集名称: Two-Model Conversation: Collaboration Outcomes & Failure Modes
  • 许可证: Apache-2.0
  • 任务类别: 文本生成 (text-generation)
  • 语言: 英语 (en)
  • 标签: 多智能体 (multi-agent)、对话 (conversation)、失败模式 (failure-modes)、LLM协作 (llm-collaboration)

数据集描述

该数据集记录了由两个大语言模型(LLM)组成的对话对,尝试共同解决一个问题。每个对话都标注了结果,并针对失败的对话标注了具体的失败模式。其核心研究目标是探索“一个LM无法单独解决,但两个LM通过对话可以解决”的问题。

配置与结构

数据集包含三个配置(configs):

  1. outcomes(推荐)

    • 内容: 1191行数据,每行对应一个“实验设置”(任务 × 模型对 × 问题)。涵盖了成功和失败的完整情景,并包含了完整的反事实对照实验。
    • 数据文件: data/train-*
    • 核心特性:
      • 反事实列: 包含solo_a_correct, solo_b_correct(各模型单次生成),selftalk_a_correct, selftalk_b_correct(各模型在匹配算力下的单模型多轮对话),以及pair_correct(联合结果)。
      • 控制组: control_cell字段将结果分为四类:双方均失败、仅A成功、仅B成功、双方均成功。
      • 计算预算: 精确记录了对话轮次(pair_total_turnspair_turns_per_model等),确保实验的可复现性。
      • 标注: 包含diversity_helped(多样性帮助标志)、failure_modes(失败模式)、judge_rationale(判断理由)和pair_transcript(完整对话记录)。
    • 数据规模: 训练集包含2985个样本,数据集总大小为16,762,475 bytes。
  2. protocols

    • 内容: 3483行数据,每行对应一个详细的对话协议。
    • 数据文件: protocols/train-*
    • 核心特性:
      • 包含main_condition(主要条件)、conditions(所有条件)、n_conditions(条件数量)。
      • 包含完整的协作对话记录(collab_transcript)。
      • 包含失败模式(annotated_failure_mode)、判断理由(judge_rationale)等标注。
    • 数据规模: 训练集包含3483个样本,数据集总大小为17,247,416 bytes。
  3. default(旧版配置)

    • 内容: 346行数据,仅包含失败的对话。来自信息不对称(split)、谄媚(syco)和GSM8K任务。
    • 核心特性: 为保持连续性,每条记录均包含失败模式标签。关键字段包括task(任务类型)、condition(实验条件)、transcript(对话记录)和failure_modes(失败模式)。

任务与实验设置

数据集覆盖了多种任务类型和模型对尺度:

  • 任务类型:

    • GSM8K: 小学数学题。
    • MMLU: 大规模多任务语言理解。
    • CommonsenseQA: 常识推理。
    • ARC: AI推理挑战。
    • StrategyQA: 策略问答。
    • GSM-IC: 引入无关上下文的数学题。
    • MATH: 数学竞赛题。
    • 信息不对称任务 (split): 将一个数学表达式的变量值分配给两个模型,单独一个模型无法解决,必须通过对话共享信息。
    • 谄媚/群体思维探测任务 (syco): 一个模型(Alice)被私下告知一个错误答案并要求坚持,另一个模型(Bob)拥有正确答案,观察Bob是否会妥协。
  • 模型对与尺度:

    • 涵盖了从0.5B到32B的不同规模模型,包括Qwen2.5、Llama-3.2、gemma-2和deepmath-v1系列。
    • 具体模型对如:Qwen2.5-3B×Llama-3.2-3B, Qwen2.5-7B×Qwen2.5-7B, Qwen2.5-32B×gemma-2-27b, Qwen3-4B×deepmath-v1 (数学专家)。

关键发现

  • 协作是能力门控的: 在信息不对称任务中,小模型(如0.5B)的协作准确率极低(0.025),而7B模型可以完全解决(1.0)。小模型失败的原因是伙伴无法识别自己掌握的线索正是缺失的信息,进而产生幻觉。
  • 谄媚/群体思维是能力和难度的门控: 在谄媚探测任务中,弱模型(如0.5B)处理难题时,有27.5%的几率会采纳一个自信伙伴的错误答案;而强模型(如1.5B)则能保持稳健(2.5%)。
  • 跨架构混合有时胜过同架构配对: 在3B量级的信息不对称任务中,Qwen2.5-3B × Llama-3.2-3B 的组合(准确率0.725)显著优于同架构的 Qwen2.5-3B × Qwen2.5-3B(0.45)或 Llama-3.2-3B × Llama-3.2-3B(0.03)。
  • 综合影响: 对话在某些问题上能“拯救”失败(尤其多步数值计算),但也会“腐蚀”同样数量的问题(伙伴将正确答案讨论成错误答案),在小尺度上净效果接近零。这种“腐蚀”现象在32B尺度上消失。
搜集汇总
数据集介绍
conv-collab-failure-modes 数据集图片
构建方式
该数据集源于一项针对多智能体协作失效模式的系统性研究,利用interlens多智能体对话框架,在多种任务场景下生成模型间的对话记录。构建过程围绕一个核心反事实问题展开:某些问题仅靠单个模型无法解决,但通过双模型对话却可能达成。数据集的构建精细地纳入了三种对照条件:单模型独立作答、单模型在匹配计算量下的自我对话,以及双模型协作对话,从而形成完整的反事实因子设计。此外,研究者还引入了信息不对称、趋同压力等特定实验范式,系统性地诱发并捕获了对话中的协作失败案例。
使用方法
数据集可通过HuggingFace的datasets库便捷加载,支持三种配置:default(仅失败案例)、outcomes(完整实验结果)和protocols(实验参数与对话记录)。推荐使用outcomes配置进行协作失败模式分析,每条记录包含完整的对话转录、计算预算参数及失败模式标注。研究者可利用solo_a_correct与solo_b_correct等反事实字段评估对话的真实增益,或通过failure_modes和judge_rationale字段深入分析失败原因。对于复现实验,数据集中包含了精确的温度参数和最大生成令牌数,确保实验的可重复性。
背景与挑战
背景概述
随着大语言模型在多领域展现惊人能力,探索多个模型之间的协同对话以解决单一模型无法独立完成的任务,成为人工智能研究的前沿方向。由Sid-MB等研究人员创建的conv-collab-failure-modes数据集,发表于2025年,旨在系统性地剖析双模型对话协作中的成功与失败模式。该数据集覆盖从0.5B到32B不同规模的模型配对,跨越GSM8K、MMLU、CommonSenseQA、ARC、StrategyQA等七类任务,并引入信息不对称和从众效应等精巧实验条件。通过设计“一对一”与“自我对话”等反事实对比,该工作揭示了协作在特定场景下确实能纠正个别模型的盲区,但也可能引入新的偏差,其对多智能体对话系统的设计范式与评估方法产生了深远影响。
当前挑战
该数据集所解决的领域核心挑战在于,多模型对话协作在提升解决问题的能力时,反而可能“污染”正确答案,导致整体性能不如更强的单一模型。数据显示,小型模型对(如Qwen2.5-0.5B×Llama-3.2-3B)在信息不对称任务中,合作伙伴常无法识别自身拥有的关键线索,转而编造虚假数值,另一方则轻易采纳这些幻觉,形成“算术错误”与“过早收敛”的复合失败模式。在从众效应实验中,弱模型在难题上以27.5%的比率采纳伙伴强加的锚定错误。构建过程中,研究人员需精细设计七种任务、八种模型配对及完整的计算预算控制字段(如对话轮次、最大生成令牌数),并采用LLM裁决器对失败模式进行分类标注,确保反事实对比的严格性和结果的可重复性,这带来了数据标注与实验控制的巨大挑战。
常用场景
经典使用场景
该数据集的核心经典用途在于研究多智能体对话系统中协作失败的底层机制。通过记录两个大语言模型在信息不对称、谄媚倾向考验及数学推理等任务中的完整对话轨迹,并辅以细粒度的失败模式标注,研究者得以深入剖析模型间协作从“各执一词”走向“集体幻觉”或“思维趋同”的演化路径。每一个样本都包含了单独推理、自我对话与配对协作三种对照状态下的正确性指标,为解耦“算力增益”与“协作增益”提供了可复现的实验平台。
解决学术问题
该数据集精准回应了学术界关于“多智能体协作究竟提升还是损害推理能力”的核心争议。传统研究往往假设对话能弥补单一模型的认知盲区,而本数据集通过引入详尽的失败模式标签——包括目标漂移、过早收敛、思维趋同等——系统性地揭示了协作带来的“负增益”现象。特别地,它量化了规模门槛效应:当模型能力不足时,对话非但不能挽回孤立的短板,反而促使双方共同锁定错误答案,这一发现重塑了当前关于多智能体系统可靠性讨论的底层逻辑。
实际应用
在工程实践中,该数据集为构建容错性更强的多智能体协作系统提供了诊断工具与调优指南。开发团队可以据此训练一个“协作质量评估器”,用于在实时对话中监测模型是否滑入思维趋同或过早收敛的陷阱,进而触发动态干预——例如切换对话策略、引入第三方仲裁或恢复独立推理状态。此外,数据集揭示的跨架构配对规律可直接用于智能体任务分配:在算力受限的场景下,优先选用异构的模型组合,以规避同族模型在特定失败模式上的病态互锁。
数据集最近研究
最新研究方向
该数据集聚焦于多智能体对话中协作失败模式与成功条件的解耦分析,开创性地引入了反事实比较框架(如计算资源控制、单智能体基线对照),揭示了LLM协作中的两个前沿议题:一是协作能力存在规模与架构依赖性,例如Llama-3.2-3B在算术任务中虽能独立完成却无法通过对话协作成功,而跨架构配对(如Qwen2.5-3B与Llama-3.2-3B)反而显著提升表现,暴露了模型间的隐性知识沟通障碍;二是对话既可能挽救难题,也可能诱发'组内思维趋同'——弱模型在信息不对称场景下易受强势同伴的误导,造成正确率不升反降。当前热点研究方向包括:利用failure mode标注(如objective_drift、premature_convergence)训练鲁棒的多智能体协作策略,以及通过计算预算精确复现条件探究知识传递的瓶颈。该数据集为理解LLM协作的涌现机制提供了高精度控制实验的天然平台,对设计更可靠的人机协同系统具有奠基性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务