遇见数据集

2026.RA.Fairness-Counterfactual-Pairs

收藏
Hugging Face2026-08-12 更新2026-08-13 收录
官方服务:

资源简介:

该数据集名为 2026.RA.Fairness-Counterfactual-Pairs,来源于五项私人信息谈判场景,旨在提供动作级别的反事实对比对,用于研究多智能体谈判中的公平性、动机和信息效应。每个数据样本对应一个(episode, turn, counterfactual_type)元组,包含 LLM 实际采取的动作(rejected_action)和一个可计算理想智能体在同一决策点应采取的动作(chosen_action),两者均为结构化动作(atype, offer_id, deal),非自然语言。数据集共 52,084 行,其中 41,269 行(79%)存在分歧,即反事实智能体有不同的动作。这些行来自 13,021 个不同的(episode_id, turn_idx)决策点,每个决策点根据反事实类型最多贡献一行。数据来源包括两个策略:41,132 行来自 Claude Opus(thinking on,原始五臂研究),10,952 行来自 Qwen3-32B(thinking off,专为该模型添加的 on-policy 数据)。两者在相同的 24 个固定游戏银行上运行,可一一对应。数据集包含四种反事实类型:fairness_oracle(信息泄漏)、fairness_private(无信息泄漏)、oracle_omniscient(信息泄漏)、rational_private(无信息泄漏),构成 2x2 设计(信息 x 目标)。字段包括状态完备信息(如 issues, own_sheet, offers, standing_offer_id, round, min_accept, deadline, n_parties)以及 counterfactual_value、table_optimum、protocol_version、turn_token_budget、diverges、experiment-name 等。适用任务包括偏好学习、反事实推理、多智能体谈判分析、公平性研究等。注意:Claude Opus 行对除 Opus 外的所有模型均为 off-policy;Qwen3-32B 行对该模型为 on-policy,应单独过滤使用。存在重要勘误:部分源臂(one_oracle 和 all_oracle)的强制最终投票存在协议错误,导致相关行中的 oracle_omniscient 类型的 chosen_action 在特定投票轮次中可能不可靠。此外,信息泄漏的行(如 oracle_omniscient 和 fairness_oracle)不能用于诚实模仿,因为模型看不到隐藏信息。协议版本(protocol_version)和代币预算(turn_token_budget)是关键的过滤键,不同版本不能混合。

The dataset named 2026.RA.Fairness-Counterfactual-Pairs originates from five-party private-information negotiation scenarios, designed to provide action-level counterfactual comparisons for studying fairness, motivation, and information effects in multi-agent negotiations. Each data sample corresponds to a tuple (episode, turn, counterfactual_type), containing the actual action taken by an LLM (rejected_action) and a computable action that an ideal agent would take at the same decision point (chosen_action), both represented as structured actions (atype, offer_id, deal) rather than natural language. The dataset contains 52,084 rows, of which 41,269 rows (79%) exhibit divergence, meaning the counterfactual agent takes a different action. These rows originate from 13,021 distinct decision points (episode_id, turn_idx), with each decision point contributing at most one row per counterfactual type. Data sources include two strategies: 41,132 rows from Claude Opus (thinking on, original five-arm study) and 10,952 rows from Qwen3-32B (thinking off, on-policy data added specifically for that model). Both run on the same 24 fixed game banks and can be matched one-to-one. The dataset includes four counterfactual types: fairness_oracle (information leakage), fairness_private (no information leakage), oracle_omniscient (information leakage), and rational_private (no information leakage), forming a 2x2 design (information x goal). Fields include complete state information (e.g., issues, own_sheet, offers, standing_offer_id, round, min_accept, deadline, n_parties) as well as counterfactual_value, table_optimum, protocol_version, turn_token_budget, diverges, experiment-name, etc. Applicable tasks include preference learning, counterfactual reasoning, multi-agent negotiation analysis, and fairness research. Note: Claude Opus rows are off-policy for all models except Opus itself; Qwen3-32B rows are on-policy for that model and should be filtered separately. There is an important erratum: some source arms (one_oracle and all_oracle) have a protocol error in the forced final vote, causing the chosen_action of oracle_omniscient type in related rows to be unreliable in certain voting rounds. Additionally, information leakage rows (e.g., oracle_omniscient and fairness_oracle) cannot be used for honest imitation because the model cannot see hidden information. The protocol version (protocol_version) and turn token budget (turn_token_budget) are critical filtering keys; different versions should not be mixed.

创建时间:
2026-08-08
原始信息汇总

数据集概述:2026.RA.Fairness-Counterfactual-Pairs

数据集简介

该数据集包含来自五方私有信息谈判的动作级对比对。在每一轮对话中,记录了LLM实际采取的动作(rejected_action)与一个可计算的理想智能体在同一决策点上应采取的动作(chosen_action)。两者均为结构化动作({atype, offer_id, deal}),而非自然语言。

  • 总行数:52,084行,其中41,269行(79%)存在分歧(即反事实智能体会采取不同动作)。
  • 独立决策点:13,021个不同的 (episode_id, turn_idx) 组合。每个决策点最多为每种请求类型贡献一行。
  • 语言:英语(en)
  • 标签:谈判(negotiation)、多智能体(multi-agent)、偏好对(preference-pairs)、公平性(fairness)、纳什谈判(nash-bargaining)、在线策略(on-policy)

数据来源与策略

数据集包含来自两种策略的回合,两者的用途有显著差异:

  1. Claude Opus 回合(41,132行):

    • 来源:anthropic:claude-opus-5(开启思考)
    • 这是原始五项研究的数据
    • 对于除Claude Opus以外的任何模型都是离线策略(off-policy)——对Opus以外的模型进行训练是误设的
  2. Qwen3-32B 回合(10,952行):

    • 来源:Qwen/Qwen3-32B(关闭思考)
    • 对Qwen3-32B是在线策略(on-policy)——专门为弥补离线策略差距而生成
    • 生成条件与GRPO rollout配置一致(关闭思考)
    • 120个回合(24个游戏实例 × 5个种子),2,738轮对话,运行成本约$11.40
    • 质量指标:0/2,738次虚构尝试,120/120个回合完成,95.80%的解析成功率

重要:两种策略在相同的24个冻结游戏库上进行五方私有信息谈判,因此可以在 (instance_id, episode_seed) 上一对一配对。

反事实类型

类型 行数 信息泄漏
fairness_oracle 13,021
fairness_private 13,021
oracle_omniscient 13,021
rational_private 13,021

rational_privatefairness_private目标函数不同;*_oracle 变体与其私有对应变体仅信息不同。这个2x2设计是刻意为之。

实验设置

实验名称 行数 策略 表格组成
five_seat_private_v1__all_llm 8,660 Opus 五个Claude Opus席位(参考表格)
five_seat_private_v1__one_oracle 8,536 Opus 四个Opus席位+一个全知自私席位
five_seat_private_v1__one_rational 8,512 Opus 四个Opus席位+一个私有信息贝叶斯席位
fivepriv_opus_fairness_v2__one_fairness_algorithmic 7,984 Opus 四个Opus席位+一个私有信息公平席位
fivepriv_opus_fairness_v2__one_fairness_oracle 7,440 Opus 四个Opus席位+一个全知公平席位
2026.RA.Qwen3-32B-OnPolicy-FiveSeat 10,952 Qwen3-32B 五个Qwen3-32B席位(关闭思考),与all_llm对应

协议版本

  • five-seat-private-v1:冻结协议——每轮2,048个token(动作轮)和2,560个token(强制最终投票),无覆盖。
  • five-seat-uncapped-turn<N>-v1:使用--turn-max-tokens <N>运行的协议。
  • 重要turn_token_budget 字段与版本标签分离。在冻结版本内,Opus策略以16,384的有效预算运行,而开源权重策略以2,048/2,560运行——配对前必须检查此字段。

注意:来自不同协议版本的行不能合并。预算提升会改变每轮保留的内容,混淆策略效果与预算效果。

主要勘误(2026-08-10)

one_oracleall_oracle 策略臂携带损坏的选票:全知最佳响应策略在强制最终投票中投给了其估值最高的活跃提议,而非协议指定的提议。修复提交(ca20157)日期晚于数据集中所有回合。

对行数据的影响

  • 行数据本身不受影响(是各代理行为的忠实记录)
  • one_oracleall_llm 的功利得分差异为 −0.068 [−0.136, −0.001](而非−0.412)
  • all_oracle 关闭概率为 1.000(而非0.875)
  • +0.389目标交换对比被夸大,不得引用
  • "信息放大动机"的声明已撤回
  • oracle_omniscient 类型在 one_oracleall_oracle 分片上的强制最终投票轮中的 chosen_action 应视为可疑
  • 其他所有策略臂均无问题——在9,589个重新导出的回合中0个不匹配

训练注意事项

  1. 逐轮模仿自私的预言机在该项目中反追踪结果——oracle_omniscient 用于测量而非作为训练目标。
  2. information_leaky = true 的行无法被诚实地模仿——模型在提示中看不到隐藏记分表,训练它会学会自信猜测。
  3. fairness_private 是新颖的目标,但未经训练测试——它只看到LLM所见的数据,优化表格的归一化纳什福利。建议与其匹配对照 rational_private 进行比较。
  4. 没有推理理由(rationales),这是刻意设计——P4通道测得95.5%的逐轮信号是风格而非实质。
  5. 不要混合两种策略臂而不加标注——混合语料库混淆了"从自身错误中学习"与"学习模仿Opus"。

规模提示

p4_pairs 定义下,Qwen3-32B 策略臂为519对(约为Opus行的1.2%)。这是正确的在线策略语料库,但规模较小。实际用途是评估集或带强正则化的DPO臂。增加规模的经济杠杆是在同一冻结游戏库上增加更多种子(每6个回合约6.1分钟)。

搜集汇总
数据集介绍
2026.RA.Fairness-Counterfactual-Pairs 数据集图片
构建方式
该数据集源自五方私有信息谈判的多智能体实验,记录了大语言模型(LLM)在每一决策点的实际行为与可计算理想智能体的反事实行为。数据构建采用结构化动作(atype, offer_id, deal)而非自然语言,每个数据条目对应一个(决策点,反事实类型)组合,共计52,084行,涵盖13,021个独立决策点。数据来源包括Claude Opus(开启思考)和Qwen3-32B(关闭思考)两种策略,均基于同一冻结的24场博弈库生成,确保一一对应。反事实类型按信息可得性和目标函数构成2×2设计,包括信息泄漏的全知目标、私有信息的自利目标,以及公平目标等变体。
特点
数据集的核心特色在于其状态完备性与可重渲染性,每个决策点的完整状态(如issue、own_sheet、offers等)字段足以重构任意模型的输入格式。反事实动作基于可计算智能体的真实全信息目标生成,并附带公平遗憾值(counterfactual_value与table_optimum之差)。特别地,数据集区分了on-policy与off-policy样本,其中Qwen3-32B部分为自身行为生成的在线策略数据,而Opus部分为离线数据,适用于不同训练目的。此外,非分歧样本被保留,以提供基线率,避免误导性统计。
使用方法
使用本数据集时,必须注意其协议版本和token预算字段,不同协议版本或预算的样本不可混合。对于偏好学习,建议筛选on-policy样本(实验名称为2026.RA.Qwen3-32B-OnPolicy-FiveSeat),避免使用off-policy的Opus数据训练其他模型,因其可能引入非匹配行为的偏差。此外,filter掉信息泄漏的样本(information_leaky=true),因模型无法获取隐藏信息,训练此类反事实行为将导致幻觉。推荐使用fairness_private与rational_private作为匹配的对比组,以评估公平目标的优化效果。数据集不包含推理文本,旨在避免风格污染,适合用于DPO等偏好优化方法。
背景与挑战
背景概述
该数据集诞生于2026年,由Siddharth等研究人员在理性智能体研究框架下构建,聚焦于多智能体协商场景中公平性与策略行为的量化分析。其核心研究问题在于:当引入一个可计算的理想智能体(或称为'神谕')进入由大语言模型主导的五方私密信息谈判时,该智能体的目标函数(自利最大化或整体福利最大化)如何影响谈判结果,以及如何通过动作级对比对(counterfactual pairs)来度量这种影响。数据集包含52,084行数据,覆盖13,021个决策点,并创新性地引入了离线策略与在线策略的区分(如Qwen3-32B的在线策略数据),为偏好学习与对齐研究提供了独特的资源。该数据集在发布后即对多智能体强化学习及LLM对齐领域产生重要影响,其关于'神谕'目标函数切换效应的结论(后经勘误修正)引发了对评价基准可靠性的深刻讨论,推动了该领域对实验严谨性的重视。
当前挑战
该数据集面临的挑战多维且深刻。首先,领域层面,多智能体私密信息谈判本身具有高度复杂性,'公平'概念难以统一度量(如纳什福利、基尼系数等指标间的权衡),而构建可计算的'理想智能体'作为反事实基准本身就涉及信息不对称与目标冲突的难题。其次,数据构建过程中,遇到了协议版本不一致的问题:不同回合预算(turn_token_budget)会显著影响模型行为,而跨版本混用会导致虚假的对比结果;同时,数据集中包含信息泄漏的样本(如oracle类型),若不加筛选地用于训练,会诱导模型依赖不存在的信息,学习错误的猜测策略。更严峻的是,勘误显示部分实验臂因协议投票规则缺陷产生了'废票'(spoiled ballot),导致原始结论(如客观性切换效应)被夸大,需要重新评估;此外,跨策略的对比(如Opus与Qwen3-32B)因思考模式不同而混杂,难以分离模型差异与模式差异,使得数据集在使用时需高度警惕其内部约束与局限。
常用场景
经典使用场景
该数据集构建于五方私有信息谈判场景,通过将大语言模型在每一决策点的真实行为与可计算理想智能体的反事实动作进行配对,形成了动作级对比学习语料。其核心使用场景在于偏好对齐与策略优化,研究者可借助反事实对训练模型向特定目标(如公平性、理性自利)靠拢,尤其适用于基于DPO等偏好优化算法的强化学习训练。数据集的细粒度结构化动作设计与状态完备性,使其能够灵活适配不同模型提示格式,为多智能体谈判的行为模仿与策略修正提供了严谨的监督信号。
解决学术问题
该数据集直面多智能体谈判中信息不对称与目标异质性带来的学术挑战,系统性地揭示了模型行为与理想策略之间的偏差,为量化谈判策略的效率损失提供了基准。针对公平性目标,引入了仅基于私有信息的Nash福利优化反事实,开辟了在有限信息条件下追求集体福利的新路径。同时,数据集的on-policy与off-policy划分,清晰分离了策略学习中的归因混淆,有效解决了模型错误迁移与信息泄漏训练伪相关等关键问题,推动了谈判智能体从简单模仿到目标导向推理的研究范式转变。
衍生相关工作
该数据集衍生出一系列相关研究,包括基于反事实对比的偏好学习算法、针对信息泄漏的稳健训练方法,以及多智能体谈判中的公平性干预策略。研究者基于其结构化标签,开发了评估谈判策略效果的模拟框架,并探索了目标函数(自利vs.集体福利)对谈判结果的影响。此外,数据集的on-policy变体促进了针对特定模型的定制化对齐技术,而反事实类型的2x2设计(目标×信息)激发了关于信息完备性与行为动机交互作用的深入分析,为多智能体强化学习的理论进展提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务