遇见数据集

UXBench

收藏
arXiv2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

UXBench是由香港理工大学与腾讯联合创建的首个以用户为中心的AI助手体验评估基准数据集,其核心目标是通过真实用户反馈信号来系统评估模型的偏好对齐与对话生成能力。该数据集从主流中文AI助手超过7万条交互日志中精心提取而成,涵盖了8个核心场景、83个细分领域以及多样化的失败模式,共计包含7400个高质量测试实例,能够紧密反映真实用户交互的分布特征与复杂性。数据集的构建过程采用了一个严谨的多阶段数据处理流水线,通过分析用户显式反馈(如点赞/点踩)与隐式行为信号(如重复提问、快速略过等)来获取可靠的地面真值标签,从而将主观用户体验转化为可观测、可扩展的建模目标。UXBench主要应用于人工智能对话系统的用户体验优化领域,旨在解决传统基准测试在评估用户感知效用和交互质量方面的不足,推动模型开发从单纯的能力提升转向以用户为中心的场景化体验优化,为构建更符合人类偏好的AI助手提供科学的评估框架与数据支撑。

UXBench is the first user experience-centric AI assistant evaluation benchmark jointly developed by the Yuanbao Team from The Hong Kong Polytechnic University and Tencent. It aims to systematically evaluate models' preference alignment and dialogue generation capabilities via real user feedback signals. This dataset consists of 7,400 test instances, which are carefully screened from over 700,000 interaction logs from mainstream Chinese AI assistants. It covers 8 scenarios, 83 domains and diverse failure modes, boasting a large scale and strong alignment with real user distribution. The construction of this dataset adopts an end-to-end data pipeline that integrates explicit feedback and implicit behavioral signals, and a rigorous multi-stage quality audit mechanism is designed to ensure annotation reliability. This dataset is primarily used to evaluate the capabilities of AI assistants in predicting user feedback, generating high-quality responses, failure recovery and other aspects. It is committed to promoting user-centric model optimization and experience enhancement, providing a key benchmark to address the gap between traditional evaluation methods and real user experience.

创建时间:
2026-06-08
原始信息汇总

数据集概述:UXBench

UXBench 是一个以用户为中心的大型语言模型(LLM)基准测试数据集,其核心特点是基于真实的用户反馈信号构建。该数据集源自腾讯元宝(Yuanbao)产品中超过 70,000 条“赞”(thumbs-up)和“踩”(thumbs-down)对话记录。

核心目标

UXBench 旨在将 LLM 的评估标准从纯粹的能力(Capabilities)扩展至用户感知的实用性(User-Perceived Utility),以衡量 AI 助手的用户体验。

任务与规模

UXBench 定义了三个核心评估任务,共包含 7,400 条测试样本,覆盖 8 种交互场景和 83 个领域。

任务 名称 样本量 描述 评估指标
Task 1 UX Judge (UX 判断) 2,000 评估模型能否正确分类一个回答是“好”还是“坏”。包含 1,000 条差评对话(10 个失败维度)和 1,000 条好评对话(8 个成功模式)。 Avg-Acc = (Good-Acc + Bad-Acc) / 2
Task 2 UX Eval (UX 评估) 4,900 要求模型基于用户查询和对话历史生成一个令人满意的回复。 Good% (由 GRM 评分)
Task 3 UX Recovery (UX 恢复) 500 要求模型在用户明确表达不满后,修复一次失败的交互。 Recovery Rate (Good%)
总计 7,400

数据来源与隐私

  • 数据来源:数据集源自“腾讯元宝优化计划”,用户自愿提供交互日志以协助服务改进。
  • 内容警告:因数据反映真实用户交互,可能包含冒犯性语言、亵渎、暴力或其他敏感内容。
  • 隐私声明:数据集可能包含源于真实用户的信息。使用者不得用于识别、再识别、联系、追踪或推断任何个人身份,并需遵守所有适用的隐私、数据保护和研究伦理要求。

许可协议

  • 许可类型:仅限研究使用。
  • 主要限制:禁止重新分发、禁止创建衍生数据集、禁止商业用途。

访问与使用

  • 数据集地址:https://huggingface.co/datasets/mengze-hong/UXBench
  • 项目主页与排行榜:https://mengze-hong.github.io/UXBench
  • 相关论文:https://arxiv.org/abs/2606.09570

可通过以下代码快速加载测试集:

python from datasets import load_dataset

bad = load_dataset("mengze-hong/UXBench", "task1_judge_bad", split="test") good = load_dataset("mengze-hong/UXBench", "task1_judge_good", split="test") t2 = load_dataset("mengze-hong/UXBench", "task2_eval", split="test") t3 = load_dataset("mengze-hong/UXBench", "task3_recovery", split="test")

搜集汇总
数据集介绍
UXBench 数据集图片
构建方式
UXBench的构建源于对一个主流中文AI助手中超过70,000条真实用户交互日志的深度挖掘。通过提取约400K对话轮次中的显式反馈信号(如点赞与点踩)以及隐式用户行为信号(包括重复、改述、浏览后跳过、抱怨和关闭),形成了包含7,400个测试实例的数据集。整个数据流水线采用自动化端到端设计,涵盖去标识化、安全过滤、行为信号提取及基于多智能体系统的测试用例生成,最后由大语言模型与人工专家双重验证以确保质量。数据集设计涵盖了8个交互场景、83个细分子领域,并系统性地归纳了10种失败类型与8种成功维度,充分反映了真实世界用户交互的多样性与复杂性。
使用方法
围绕用户体验建模,UXBench定义了三个层层递进的评估任务。首先,UX Judge任务要求模型基于对话历史、用户查询及助手的回答,生硬地判断用户是否满意,以此测试模型感知交互质量的能力。其次,UX Eval任务针对模型生成的回答进行评估,采用基于生成式奖励模型的评分器来判断其能否引发正面用户体验。最富挑战性的是UX Recovery任务,该任务将在用户已表达不满和抱怨的场景下,考察模型是否具备通过恰当的对话策略修复受损交互的能力。评价时推荐采用基于真实反馈训练的点式生成式奖励模型进行评分,因其在准确性及抗家族偏见上显著优于常规的LLM-as-a-Judge方法。
背景与挑战
背景概述
随着人工智能助手服务亿万用户,超越通用模型能力的用户体验评估变得至关重要。UXBench由香港理工大学与腾讯元宝团队于2026年共同创建,是首个基于真实用户反馈信号、以用户为中心的基准测试。该基准测试从主流中文AI助手的超过70K交互日志中提取了7,400个测试实例,覆盖8种场景、83个领域及多种失败模式,旨在评估偏好对齐与对话生成,填补了现有大语言模型基准忽视用户感知效用与交互质量的空白,推动了以用户为中心的评估新范式。
当前挑战
UXBench面临的挑战主要包括:一、现有用户体验研究多植根于人机交互领域,依赖人类参与评估,难以规模化;用户体验的细粒度量化虽具可解释性,却无法被穷尽定义或完全操作化,用户的负面反馈常是即时反应而非分解思考。二、从构建过程看,从超过70K交互日志中提取高可靠性的反馈信号极具挑战,显式反馈信号极为稀疏,隐式行为信号(如滑过、重述)易被误读;多阶段数据流水线需确保去隐私、质量审核及信号保真度,同时应对持续更新的动态基准构建需求,避免数据污染与过拟合风险。
常用场景
经典使用场景
UXBench最经典的使用场景在于对AI助手的用户体验进行自动化评估。该基准利用来自真实用户交互日志的反馈信号,构建了三个相互关联的任务:UX Judge(预测用户满意度)、UX Eval(评估生成回复的用户体验)与UX Recovery(在交互失败后恢复用户满意度),从而系统性地衡量模型在感知、生成与修复环节中的用户体验表现。其独特之处在于以用户行为信号而非人工标注作为真值,实现了可规模化、可复现的客观评估。
解决学术问题
UXBench有效回应了学界长期以来在用户体验评估中面临的两大关键难题:一是缺乏可靠的可扩展性标注信号,二是现有LLM基准过度关注认知能力而忽视用户感知的交互质量。通过引入基于真实反馈信号的二元行为标签,该基准将主观的用户体验转化为可建模目标,解决了传统人工评估成本高、偏差大的问题。其发现——前沿模型普遍存在系统性正偏置、AI判断者自身偏好偏差,以及能力提升与用户满意度之间的弱扩展关系——为推进以用户为中心的模型校准研究提供了关键切入点和实证依据。
实际应用
在实际应用中,UXBench为AI产品团队提供了一套可部署的用户体验评估工具箱。通过训练基于真实反馈的生成式奖励模型(GRM),企业可以在不依赖人工评审的前提下,持续监控对话系统在失败查询、冗长回复和情感冷漠等不良交互中的表现。该基准已被用于评估包括Gemini、GPT、Claude、DeepSeek在内的二十余种前沿模型,揭示了模型在不同交互场景中的用户满意度差异,为产品迭代、回复策略优化及用户留存方案的设计提供了数据驱动的决策支持。
数据集最近研究
最新研究方向
UXBench作为首个以真实用户反馈信号为锚点的用户中心基准,正引领AI助手评估从通用能力导向转向用户体验深度对齐的前沿浪潮。该研究揭示,即便最先进的26个大语言模型在预测用户不满(BAD准确率中位数仅约37%)和从交互失败中恢复时表现显著薄弱,暴露出系统性的正向偏差与自我偏好。尤为关键的是,用户感知到的效用与模型在传统基准上的性能提升呈现弱缩放趋势,暗示单纯的参数扩展与能力跃迁未必能转化为可感知的交互体验改善。这一发现与行业对AI产品长期留存率的焦虑不谋而合——例如,主流AI助手日均服务数百万用户,但极少有自动化手段能精准捕捉“用户为何点击不喜欢”背后的微妙摩擦。UXBench通过界定三大核心任务——UX判别、UX评估与UX恢复,并验证基于野外反馈信号训练的生成式奖励模型(GRM)可有效对齐人类判断(人-GRM一致性达83.3%),实质性地推动了从静态后验问卷向可扩展、可自动化用户体验评估范式的转型。
相关研究论文
  • 1
    UXBench: Benchmarking User Experience in AI Assistants香港理工大学·元宝团队; 腾讯 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务