遇见数据集

UXBench

收藏
github2026-06-09 更新2026-06-11 收录
官方服务:

资源简介:

UXBench是首个基于真实用户反馈信号构建的用户中心化LLM基准,源自腾讯元宝的7万+点赞/点踩对话。它评估LLM在三个UX任务(Judge、Eval、Recovery)上的表现,涵盖8个交互场景和83个领域,旨在将LLM基准从能力评估扩展到用户感知效用。

UXBench is the first user-centric LLM benchmark constructed based on real user feedback signals. It is derived from over 70,000 conversations with like or dislike feedback from Tencent Yuanbao, and evaluates LLMs on three UX tasks: Judge, Eval and Recovery. The benchmark covers 8 interaction scenarios and 83 domains, aiming to extend LLM benchmarks from capability evaluation to user-perceived utility.

创建时间:
2026-05-23
原始信息汇总

UXBench 数据集概述

UXBench 是首个以用户为中心的大语言模型基准,基于腾讯元宝(Tencent Yuanbao)70,000 多条用户点赞与点踩的真实对话构建,旨在将 LLM 评估从单纯的能力评测扩展到用户感知的实用性。

基本任务

UXBench 定义了三个评估任务,共 7,400 条测试样本,覆盖 8 种交互场景83 个领域

任务 名称 规模 描述 评估指标
Task 1 UX Judge 2,000 判断响应的好坏(其中1,000条差评含10个失败维度,1,000条好评含8个成功模式) Avg-Acc = (Good-Acc + Bad-Acc) / 2
Task 2 UX Eval 4,900 多轮对话响应生成 Good%(由GRM评分)
Task 3 UX Recovery 500 修复失败的交互,在用户明确抱怨后生成修复性回复 Recovery Rate(Good%)

数据来源

  • 数据来源于腾讯元宝优化计划,参与用户自愿提供交互日志用于服务改进
  • 原始数据为 70,000+ 条点赞与点踩的真实对话
  • 最终构建的测试集包含 7,400 条测试实例

数据集下载

数据集托管于 HuggingFace,包含四个子集:

  • task1_judge_bad(1,000条差评判断样本)
  • task1_judge_good(1,000条好评判断样本)
  • task2_eval(4,900条评估样本)
  • task3_recovery(500条修复样本)

许可证与使用限制

  • 研究用途仅限
  • 禁止重新分发
  • 禁止创建衍生数据集
  • 禁止商业用途
  • 使用时需遵守相关隐私、数据保护和研究伦理规定
  • 数据集可能包含冒犯性语言、脏话、暴力或其他敏感内容

引用信息

如需引用,请参考 arXiv 论文:UXBench: Benchmarking User Experience in AI Assistants,论文链接为 https://arxiv.org/abs/2606.09570。

搜集汇总
数据集介绍
UXBench 数据集图片
构建方式
在人工智能助手日益渗透日常生活的背景下,如何衡量其真实用户体验成为关键课题。UXBench作为首个以用户为中心的LLM基准测试,基于腾讯元宝70万条真实用户点赞与点踩对话构建。其构建过程遵循六阶段流水线:首先从原始交互日志中提取用户反馈信号,随后进行去重与质量过滤,再经由挖掘智能体识别失败模式与成功模式,通过评判智能体对五维度进行评分,接着开展全面扫描以确保样本覆盖8种交互场景与83个领域,最终抽样生成包含7,400个测试实例的黄金测试集,覆盖判断、评估与恢复三大任务。
使用方法
使用UXBench进行模型评估需经过简明的部署流程。用户首先从Hugging Face下载四个测试子集,通过Python的datasets库一键加载。随后配置OpenAI API密钥,安装项目依赖后即可运行评估脚本,支持指定模型名称与配置文件,并可选择干燥运行模式仅处理前10个样本以快速验证。评估结果涵盖三大任务的指标得分,最终可通过FastAPI可视化仪表盘在本地启动交互式排行榜,便于研究者直观对比不同模型在各任务上的用户体验表现。
背景与挑战
背景概述
随着大语言模型在各类智能助手中的广泛部署,用户对其交互体验的期待日益增长。然而,现有评估体系多聚焦于模型在标准学术基准上的能力表现,忽视了用户在使用过程中感知到的实际效用与满意度。为填补这一评估空白,香港理工大学与腾讯等机构的研究人员于2026年联合构建了UXBench数据集。该数据集首创性地以用户为中心,基于腾讯元宝优化计划中超过7万条真实点赞与点踩对话记录,系统性地定义了三大用户体验评估任务,涵盖8种交互场景与83个领域。UXBench的出现将大语言模型的评估范式从能力导向拓展至用户感知效用导向,为智能助手的成功部署提供了更具现实意义的标准。
当前挑战
UXBench所应对的核心挑战在于现有基准未能有效衡量模型在实际交互中产生的用户体验。传统指标如准确率或困惑度难以捕捉用户对回答的满意程度、失败恢复能力等主观且多维度的效用特征。为此,UXBench通过设计判别、生成与修复三类任务,模拟用户从不满到投诉的完整交互闭环,并引入点对质量评分模型实现自动化评估。在数据构建层面,从70万条不均衡的原始用户反馈中提炼高质量测试集面临重大困难,包括信号稀疏性、噪声过滤、标注一致性维护以及隐私保护。研究者开发了六阶段流水线,结合去重、质量筛选与多智能体协作标注,并采取严格的匿名化与合规措施,最终生成7400个测试实例,既确保了数据的真实性与代表性,也保障了伦理与隐私的合规要求。
常用场景
经典使用场景
在大规模语言模型(LLM)驱动的智能助手迅速渗透日常生活的背景下,UXBench作为首个以用户为中心、扎根于真实反馈信号的基准测试,开创性地将评估视角从模型能力转向用户感知效用。该数据集基于腾讯元宝70万条点赞与点踩对话,构建了三大任务:UX Judge(判断回复是否为用户所满意)、UX Eval(生成高满意度回复)与UX Recovery(修复失败交互)。这三大任务覆盖8种交互场景与83个领域,共计7400个测试实例,为精准衡量AI助手在真实使用中的用户体验提供了系统化评测框架。研究者可借此深入理解模型在不同场景下的用户偏好差异,进而推动以用户价值为导向的模型优化与设计迭代。
解决学术问题
UXBench的发布直面了现有LLM评测体系中忽视用户实际体验的学术瓶颈。传统基准测试如MMLU、HellaSwag等虽能衡量模型的知识广度与推理能力,却无法揭示模型回复在真实用户眼中的“好坏”。UXBench通过引入Good-Acc与Bad-Acc双维度平均精度的度量体系,解决了模型对用户满意与不满回复的判别失衡问题。尤为重要的是,其构建的失败恢复任务(UX Recovery)首次将交互修复能力纳入系统评测,填补了学术领域对智能助手容错与补救机制研究的空白。这一基准不仅推动了交互质量评估从能力本位向体验本位的范式迁移,还为后续研究提供了可复现、可扩展的标准化评估工具,深刻影响了人机交互与自然语言处理的交叉研究方向。
实际应用
在实际应用中,UXBench为AI助手的部署与迭代提供了直接可操作的数据支撑。产品团队可利用UX Judge任务精准识别用户不满的热点维度,例如回复不准确、语气不当或信息冗余,从而定向优化模型在敏感场景下的表现。UX Eval任务则能辅助模型在客服、教育、健康咨询等高交互密度领域中生成更具共情力与实用性的回复,提升用户粘性与满意度。尤其值得关注的是UX Recovery任务,其通过模拟用户明确投诉后的交互修复场景,为电商售后、心理咨询等易发冲突的对话系统提供了关键性故障恢复能力评估,助力企业降低客诉率并提升服务韧性。这些应用场景正推动智能助手从“能回答”向“会沟通”的质的飞跃。
数据集最近研究
最新研究方向
在大语言模型能力评估日益深入的背景下,UXBench开创性地将评测焦点从模型自身的能力边界转向用户感知的实用价值,标志着AI助手评估范式从技术本位向用户体验本位的重大跃迁。该数据集基于腾讯元宝70万条真实用户点赞与点踩对话日志,构建了涵盖判断、评估、修复三大用户体验任务的评测体系,横跨8类交互场景与83个领域。前沿研究方向聚焦于利用GRM评分模型对模型生成回复进行细粒度用户满意度量化,以及探索在用户明确投诉后的对话修复能力,这些工作直接回应了当前AI助手部署中用户留存率与满意度提升的核心痛点。UXBench的提出不仅推动了学术界对AI助手实用价值的量化研究,也为产业界优化人机交互体验提供了可复现的基准框架,其影响辐射至对话系统评估标准重构与用户中心设计理念的落地实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务