遇见数据集

LLMCoherence_Var_100

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

本数据集是MINT实验室关于大型语言模型在参数化结果阶梯上偏好一致性研究的实验档案。数据集包含100个经过验证的7层阶梯(从T1到T7),每个阶梯在12个价值类别内变化一个与选择相关的属性。这些阶梯在16个不同的语言模型上进行了评估,包括GPT-5.4系列、Opus 4.6、Nemotron-3 Super、GLM-4.5系列、Llama 3.1 8B等模型,部分模型支持推理模式开关。数据集主要用于评估模型偏好的一致性,通过两个核心实验实例:1)阶梯内所有层级对的A/B选择测试局部排序一致性;2)每个阶梯层级与30个固定比较语句的对比测试,用于计算胜率曲线并评估严格单调性、同位回归R²和Jonckheere-Terpstra显著性。数据集包含两个主要部分:data/目录存放规范的实验输入文件(涵盖01-06管道阶段),outputs/目录包含所有16个论文模型的完整运行负载和派生分析结果(约3.3GB)。该数据集设计为复现和审计用途,而非独立的训练数据集,需配合相关代码库使用。

This dataset is an experimental archive from the MINT Lab for studies on preference consistency of Large Language Models (LLMs) along parameterized outcome ladders. The dataset contains 100 validated 7-level ladders (ranging from T1 to T7), where each ladder varies one choice-relevant attribute across 12 value categories. These ladders were evaluated on 16 distinct language models, including the GPT-5.4 series, Opus 4.6, Nemotron-3 Super, GLM-4.5 series, Llama 3.1 8B, and other models; some models support toggling inference modes. The dataset is primarily used to evaluate model preference consistency through two core experimental setups: 1) Local ranking consistency tests via A/B choice trials for all level pairs within a single ladder; 2) Comparative tests between each ladder level and 30 fixed comparative statements, which are used to calculate win rate curves and assess strict monotonicity, pooled regression R², and Jonckheere-Terpstra significance. The dataset comprises two main components: The data/ directory stores standardized experimental input files covering pipeline stages 01 to 06, while the outputs/ directory contains full run outputs and derived analysis results for all 16 paper-reported models, with a total size of approximately 3.3 GB. This dataset is intended for reproduction and auditing purposes, rather than serving as a standalone training dataset, and must be used in conjunction with the corresponding codebase.

创建时间:
2026-06-15
原始信息汇总

数据集概述:LLM Preference Coherence — 100 validated parametric ladders

基本信息

  • 任务类别:文本分类(text-classification)
  • 语言:英语(en)
  • 标签:llm-evaluation, preference-coherence, utility, forced-choice, preference-elicitation, mint-lab
  • 数据规模:小于1K条数据
  • 所属机构:MINT Lab (Johns Hopkins University / Australian National University)

数据集描述

该数据集伴随MINT Lab关于LLM偏好一致性(preference coherence)研究,针对参数化结果阶梯(parametric outcome ladders)进行实验。每个阶梯是一个7层量表(T1→T7),在某个价值类别内变化一个与选择相关的属性。经过裁判模型质量审计后,100个阶梯覆盖12个类别,在16个主体模型上进行了评估。

实验设计

实例 任务 每阶梯查询数 测试内容
实例1 — 阶梯内 所有层级对A/B选择(两种方向) 42 局部阶梯排序
实例2 — 跨阶梯 每个层级与30个固定比较语句×20次试验 4,200 胜率曲线→严格单调性、等渗R²、JT显著性
  • 采用强制选择提示,温度参数设为0
  • 正效价阶梯:更高层级 = 更多良好属性;负效价阶梯:更高层级 = 更少危害。两种情况下T1最不值得选择,T7最值得选择。

数据集结构

data/ — 输入数据(刺激与审计)

包含150个文件,按实验流水线顺序编号的子文件夹:

  • 01_source_outcomes/:来源结果池
  • 02_category_filtering/:类别筛选输出
  • 03_outcome_screening/:筛选后的候选结果
  • 04_ladder_generation/:生成的阶梯候选
  • 05_ladder_validation/:包含最终验证的100个阶梯定义(phase6b_variations_pruned_final.json)及各类审计文件
  • 06_forced_choice_inputs/:每个阶梯的比较语句文件

outputs/ — 模型运行与分析

包含2,758个文件(约3.3 GB),为16个模型分别建立子目录,每个模型目录包含:

within_ladder/(实例1)

  • summary.json:总体准确率、每阶梯准确率、解析错误计数
  • input.jsonl / output.jsonl:API请求与模型响应
  • cost_log.json:API成本日志

ladder_vs_comparison_statements/(实例2)

  • phase6b_variations_prune_*/results.json:每阶梯原始试验结果
  • phase6b_variations_prune_*/reasoning_traces.jsonl:推理通道内容(支持推理的模型)
  • coherence_test/:聚合一致性指标(单调性、等渗R²、JT等)
  • pred_utility_test/:预测效用测试输出(AUC、排列检验统计量)

受评估的模型

共16个模型,包括:GPT-5.4系列(nano/mini/std,含推理模式)、Opus 4.6、Nemotron-3 Super、GLM-4.5 Hybrid/Base、Llama 3.1 8B、Ministral 3B、Mistral Small 2603等。

使用说明

可通过Hugging Face CLI下载数据集: bash huggingface-cli download MINTLABJHUANU/LLMCoherence_Var_100 --repo-type dataset --local-dir .

下载后配合代码仓库 llm_coherence 使用,可验证追踪输入并重新生成论文图表。

许可信息

采用MIT许可证发布。

搜集汇总
数据集介绍
LLMCoherence_Var_100 数据集图片
构建方式
LLMCoherence_Var_100数据集由约翰霍普金斯大学与澳大利亚国立大学的MINT Lab精心构建,旨在系统评估大语言模型在参数化结果阶梯上的偏好一致性。研究团队首先从12个价值类别中筛选出510个源结果,经过类别过滤、结果筛查与阶梯生成后,最终通过法官模型质量审计,确定了100个经过验证的7级阶梯(T1至T7),每个阶梯在一个价值类别内变化一项与选择相关的属性。每个阶梯被设计为二选一的强制选择提示,测试温度设定为0,以确保输出的确定性。实验涵盖两个实例:阶梯内所有层级对的偏好排序与跨阶梯的胜率曲线测试,通过严格单调性、等渗R²及Jonckheere-Terpstra显著性检验量化一致性。
特点
该数据集的核心特色在于其精细的架构设计与多维度评估能力。100个阶梯跨越12个价值类别,每个阶梯包含7个层级,正价阶梯中越高层级代表更多优质属性,负价阶梯则对应更少危害,T1为最不优选而T7为最优选。16个被试模型覆盖从GPT-5.4系列到Llama 3.1 8B、Ministral 3B等不同规模与架构,部分模型支持推理模式开关,实现跨模型一致性对比。数据集提供完整的实验输入与输出档案,包含超过2,758个模型运行负载与衍生分析结果,支持阶梯内准确率、跨阶梯单调性、预测效用测试等多元指标的微观复现与宏观审计。
使用方法
使用LLMCoherence_Var_100数据集时,用户需通过HuggingFace CLI将数据克隆至本地,并配合官方代码仓库(llm_coherence)使用。下载完成后,在代码仓库根目录依次运行验证脚本与报告生成脚本,即可利用下载的输出数据重新生成论文中的图表与表格。数据目录按实验流水线顺序编号,从源结果池到最终验证阶梯定义清晰可溯;输出目录按模型键分组,内含阶梯内与阶梯对比两部分的原始请求、模型响应、成本日志及聚合指标,为研究者提供从微观查询到宏观一致性度量的全链路复现能力。
背景与挑战
背景概述
LLMCoherence_Var_100数据集由约翰霍普金斯大学与澳大利亚国立大学联合成立的MINT实验室于近年创建,旨在系统评估大语言模型在参数化结果阶梯上的偏好一致性。该研究聚焦于一个核心哲学与工程交叉问题:LLM在构建多层次价值尺度时,能否在内部保持逻辑连贯的排序偏好。通过精心设计的100个七级阶梯,覆盖12个价值类别,并在16个代表性模型上展开实验,该数据集为理解LLM的偏好结构及其稳定性提供了前所未有的量化工具。其影响力在于,它不仅揭示了模型在局部排序与全局一致性方面的能力差异,还为可解释人工智能与价值对齐研究树立了新的评测基准。
当前挑战
该数据集所应对的领域挑战根植于LLM偏好一致性的量化难题:传统方法难以捕捉模型在细微属性变化下的偏好翻转与逻辑矛盾。构建过程中,研究者面临多重挑战——从510个原始结果中筛选出181个候选,再经阶梯生成与严格验证,最终仅保留100个高质量阶梯,涉及复杂的标准设定与人工审核。此外,为确保评测的鲁棒性,实验需设计42次阶梯内两两比较与4200次跨阶梯对比,并在零温度设定下平衡测试强度与计算成本,同时处理模型推理启闭状态下的行为变异,这些均对实验设计与数据质量提出了极高要求。
常用场景
经典使用场景
LLMCoherence_Var_100数据集的核心用途在于系统性评估大语言模型在参数化结果阶梯上的偏好一致性。该数据集精心设计了100个七级阶梯,涵盖12个价值类别,通过强制选择范式测试模型在阶梯内和跨阶梯场景中的偏好排序是否满足严格单调性。研究者可利用该数据集验证模型是否能够在逐步变化的属性维度上保持一致的偏好方向,尤其适用于分析不同模型架构和推理机制对偏好一致性的影响。
实际应用
在实际应用中,该数据集可用于构建和筛选具有更高偏好理性水平的大语言模型,支持在需要稳定和可预测价值判断的部署场景中的应用,例如个性化推荐系统中的用户偏好建模、医疗咨询中的风险效益权衡,以及法律决策中的案例评估。通过在开发阶段纳入一致性测试,开发者能够提前识别并修正模型在复杂偏好判断中的缺陷,从而提升模型在辅助人类决策时的可靠性和可信赖度。
衍生相关工作
该数据集衍生了针对不同模型的偏好一致性基准评估研究,例如对GPT系列、GLM系列、Llama等16种模型的系统比较分析。相关工作中,研究者利用该数据集揭示了推理机制(如链式思维)对偏好一致性的影响规律,并开发了基于单调性指标和相关性检验的量化评价框架。此外,该数据集还激发了关于价值阶梯构建方法论的后续探索,包括如何自动化生成并验证具有内在一致性的比较属性序列,推动了偏好诱导技术在大语言模型评估中的标准化应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务