遇见数据集

AdamJovine/LISTEN-benchmark

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

LISTEN多目标选择基准是一个用于评估大型语言模型(LLM)在用户偏好引导下从具有多个数值和分类属性的大规模候选集中选择最佳选项能力的基准数据集。该数据集包含四个场景:考试安排(4,938个候选,基于冲突、聚类和延迟惩罚评分)、芝加哥到纽约航班(903个候选,包含结构化中转/时长/价格列)、伊萨卡到雷斯顿航班(216个候选,涉及多种承运商/中转组合)和耳机产品(77个候选,包含技术规格如驱动单元大小、电池、主动降噪和评论)。每个场景都提供了候选集、文档化的偏好陈述和人工策划的可接受“获胜”行集合。此外,数据集还包括五个独立的人类重新排名数据(rerank_h1至rerank_h5),用于在论文中衡量LISTEN与人类评分者之间的一致性。数据集主要用于通过归一化平均排名(NAR)等指标评估LLM在多目标选择任务中的性能,并支持学术研究。

The LISTEN Multi-Objective Selection Benchmark is a benchmark for evaluating how well a large language model (LLM) can elicit a users preferences and select a top option from a large candidate set with many numeric and categorical attributes. The benchmark contains four scenarios: Exam Scheduling (4,938 candidates, scored on conflict, clustering, and lateness penalties), Flights CHI→NYC (903 candidates, with structured layover/duration/price columns), Flights Ithaca→Reston (216 candidates, featuring varied carrier/stop combinations), and Headphones (77 candidates, with technical specs such as driver size, battery, ANC, and reviews). Each scenario includes a candidate set, a documented preference statement, and a small human-curated set of acceptable winning rows (human_sol). It also includes five independent human re-rankings (rerank_h1 to rerank_h5) used in the paper to measure agreement between LISTEN and human raters. The dataset is primarily used to assess LLM performance in multi-objective selection tasks through metrics like Normalized Average Rank (NAR) and supports academic research.

提供机构:
AdamJovine
搜集汇总
数据集介绍
AdamJovine/LISTEN-benchmark 数据集图片
构建方式
LISTEN-benchmark是一个专为评估大语言模型在多目标选择任务中偏好 elicitation 能力而设计的基准数据集。其构建基于四个真实场景:考试日程安排、芝加哥至纽约航班选择、伊萨卡至雷斯顿航班选择以及耳机产品筛选。每个场景均包含一个候选集(候选数量从77至4938不等)、一份明确记录的偏好声明,以及一小部分由人工精心标注的可接受“获胜”行(human_sol)。此外,五位独立标注者对模型生成的前20名候选进行了重新排序,形成五个重排序子集(rerank_h1至rerank_h5),用于衡量模型输出与人类判断的一致性。数据以CSV格式存储,通过HuggingFace的datasets库按配置名称加载。
使用方法
使用LISTEN-benchmark时,首先通过datasets库加载指定场景的配置(如exam、flights_chi_nyc等),获取训练数据。然后,将偏好声明文本与候选集作为输入提供给待评估的大语言模型,要求其返回一个前K个最优选项的短列表。评估时,利用对应场景的人工重排序数据,计算模型输出候选在人类排序中的平均排名,并归一化至[0,1]区间,数值越低表示性能越优。此外,可借助GitHub仓库中的一致性分析脚本,计算随机线性效用函数的最大值落在human_sol中的比例,作为数据集的补充诊断指标。代码实现细节和完整偏好声明均可在附带的GitHub仓库中找到。
背景与挑战
背景概述
LISTEN-benchmark是由Adam S. Jovine、Tinghan Ye等研究人员于2026年在IJCAI-ECAI会议上提出的多目标选择基准数据集。该数据集旨在评估大语言模型(LLM)在用户偏好 elicitation 和从包含大量数值与类别属性的候选集中筛选最优项的能力。研究团队来自康奈尔大学等机构,聚焦于将LLM应用于个性化决策场景,如考试日程安排、航班选择和耳机推荐。这一基准填补了LLM在多目标优化与用户偏好交互中的评估空白,为研究LLM的决策对齐能力提供了标准化测试平台,推动了人工智能在复杂选择任务中的实用性探索。
当前挑战
该数据集面临的挑战包括:1)领域问题挑战:多目标选择中用户偏好常隐含冲突(如价格与质量),LLM需从自然语言偏好描述中推断复杂效用函数,并与人类判断对齐;2)构建挑战:候选集规模差异大(77至4938个选项),需设计涵盖多种属性维度的场景以模拟真实决策;3)评估挑战:引入人类重排(rerank)作为黄金标准,但标注者间存在偏好分歧,需设计如归一化平均排名(NAR)的鲁棒指标来量化LLM与人类的一致性,同时确保基准的公平性与可复现性。
常用场景
经典使用场景
LISTEN基准测试集为评估大语言模型在多目标选择任务中的偏好 elicitation 能力提供了标准化的实验平台。其经典使用范式要求模型在接收到用户偏好描述和候选集合后,从数百至数千个包含数值与类别属性的候选项中遴选出最优的Top-K短名单。涵盖考试时间表编排、航班行程规划、耳机产品筛选等四个真实场景,每个场景都配有人工标注的偏好陈述与获胜选项,从而系统性地检验模型对多维属性权衡的能力。
解决学术问题
该数据集精准填补了当前大语言模型评估体系中关于多属性决策量化验证的空白,解决了传统偏好 elicitation 研究中缺乏标准化多目标基准的问题。通过引入归一化平均排名和一致性诊断等评价指标,为量化模型输出与人类偏好之间的吻合度提供了可复现的度量手段。其意义在于推动大语言模型超越简单的文本生成任务,向具备理性决策能力的智能体方向演进,为人机价值对齐和个性化推荐算法研究奠定了方法论基础。
实际应用
在实际应用中,LISTEN基准可直接服务于智能旅行规划系统,帮助用户从海量航班组合中筛选出在时长、价格、中转次数等多维约束下的最优方案。在消费电子产品领域,能够辅助电商平台构建基于用户偏好的个人化产品推荐引擎,从复杂的技术参数中精确匹配消费者需求。此外,该数据集还支持教育管理系统中的考试时间表自动优化,权衡课程冲突密度与时间分布松散度之间的矛盾性目标。
数据集最近研究
最新研究方向
LISTEN基准数据集聚焦于多目标选择场景下大语言模型的用户偏好诱导能力评估,其研究前沿紧扣LLM在复杂决策任务中的实用化进程。该数据集通过考试日程安排、航班选择与耳机推荐四个典型场景,构建了包含大量数值及类别属性的候选集,并引入人类重排标注,以标准化平均秩(NAR)为核心指标量化LLM输出的对齐度。当前热点在于借助预训练语言模型模拟用户偏好,推动从单目标排序向多目标权衡决策的范式转变,为信息检索、推荐系统及自动谈判等应用提供了可信的评估工具。此外,该基准在IJCAI-ECAI 2026上发表,标志着LLM在辅助理性决策方向迈出了关键一步,其公开的代码与MIT许可亦促进了跨学科研究的可持续协同。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务