controlling-reasoning-models-privacy-outputs
收藏资源简介:
该数据集包含论文《Controllable Reasoning Models are Private Thinkers》中描述的实验中产生的原始模型生成结果(推理轨迹和最终答案)。数据集汇总了以下内容的输出:两个模型家族(Qwen 3和Phi 4)、多个模型尺寸(1.7B–14B)、每个模型的五个变体(基线、RT-IF优化、FA-IF优化、整体-IF优化和提出的分阶段解码方法)、四个基准测试(IFEval、Math-IF、PasswordEval和PEEP)以及每个检查点和基准测试的两个随机种子。对于每个评估示例,数据集存储了完整的推理轨迹(RT)和最终答案(FA),以及标识基准实例和生成变体的元数据。这些输出是计算论文中报告的所有指令遵循、隐私和效用指标的基础。主要用途是重现和扩展论文中的分析,包括重新计算指令遵循指标(IF-RT、IF-FA)、重新计算PasswordEval和PEEP上的隐私和效用指标,以及对RT和FA进行额外的定性或定量分析。建议将其用作评估和分析资源,而非训练数据集。生成设置遵循论文中描述的实验设置,包括使用vLLM进行高效推理、大多数模型使用4位量化加载(通过Unsloth或bitsandbytes)、每个模型和变体在所有基准测试上运行两个种子并汇总结果为均值±标准差。分阶段解码通过首先生成RT(使用针对IF-RT优化的LoRA权重),然后切换到针对IF-FA优化的LoRA权重生成最终答案来实现。
数据集概述
数据集描述
本数据集包含论文《Controllable Reasoning Models are Private Thinkers》中所述实验所产生的原始模型生成内容(推理轨迹和最终答案)。它汇总了以下内容的输出:
- 两个模型系列:Qwen 3 和 Phi 4。
- 多个模型规模(1.7B–14B)。
- 每个模型的五个变体(基线、RT-IF优化、FA-IF优化、整体-IF优化以及提出的分阶段解码方法)。
- 四个基准测试:IFEval、Math-IF、PasswordEval 和 PEEP。
- 每个检查点和基准测试的两个随机种子。
对于每个评估示例,数据集存储了完整的推理轨迹(位于思考标记之间)和最终答案,以及标识生成该输出的基准测试实例和模型变体的元数据。这些输出是计算论文中报告的所有指令遵循、隐私和效用指标的基础。
预期用途
- 主要用途:通过以下方式复现和扩展论文中的分析:
- 重新计算指令遵循指标(IF-RT, IF-FA)。
- 在 PasswordEval 和 PEEP 上重新计算隐私和效用指标。
- 对推理轨迹和最终答案进行额外的定性或定量分析。
- 推荐用法:作为评估和分析资源。不建议用作训练数据集。
生成设置
生成遵循 paper/sections/experimental_setup.tex 和 paper/appendix/malformed_outputs.tex 中描述的设置:
- 使用 vLLM 进行推理以提高效率。
- 大多数模型使用 4位量化(通过 Unsloth 或 bitsandbytes)加载,除非另有说明。
- 对于每个模型和变体:
- 在所有基准测试上进行评估。
- 每个基准测试运行两个种子,并将结果汇总为平均值±标准差。
- 分阶段解码通过以下方式实现:
- 首先使用为 IF-RT 优化的 LoRA 权重生成推理轨迹。
- 然后切换到为 IF-FA 优化的 LoRA 权重来生成最终答案。
引用
bibtex @misc{puerto2026controllablereasoningmodelsprivate, title={Controllable Reasoning Models Are Private Thinkers}, author={Haritz Puerto and Haonan Li and Xudong Han and Timothy Baldwin and Iryna Gurevych}, year={2026}, eprint={2602.24210}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2602.24210}, }



