UXBench
收藏资源简介:
UXBench是由香港理工大学与腾讯联合创建的首个以用户为中心的AI助手体验评估基准数据集,其核心目标是通过真实用户反馈信号来系统评估模型的偏好对齐与对话生成能力。该数据集从主流中文AI助手超过7万条交互日志中精心提取而成,涵盖了8个核心场景、83个细分领域以及多样化的失败模式,共计包含7400个高质量测试实例,能够紧密反映真实用户交互的分布特征与复杂性。数据集的构建过程采用了一个严谨的多阶段数据处理流水线,通过分析用户显式反馈(如点赞/点踩)与隐式行为信号(如重复提问、快速略过等)来获取可靠的地面真值标签,从而将主观用户体验转化为可观测、可扩展的建模目标。UXBench主要应用于人工智能对话系统的用户体验优化领域,旨在解决传统基准测试在评估用户感知效用和交互质量方面的不足,推动模型开发从单纯的能力提升转向以用户为中心的场景化体验优化,为构建更符合人类偏好的AI助手提供科学的评估框架与数据支撑。
UXBench is the first user experience-centric AI assistant evaluation benchmark jointly developed by the Yuanbao Team from The Hong Kong Polytechnic University and Tencent. It aims to systematically evaluate models' preference alignment and dialogue generation capabilities via real user feedback signals. This dataset consists of 7,400 test instances, which are carefully screened from over 700,000 interaction logs from mainstream Chinese AI assistants. It covers 8 scenarios, 83 domains and diverse failure modes, boasting a large scale and strong alignment with real user distribution. The construction of this dataset adopts an end-to-end data pipeline that integrates explicit feedback and implicit behavioral signals, and a rigorous multi-stage quality audit mechanism is designed to ensure annotation reliability. This dataset is primarily used to evaluate the capabilities of AI assistants in predicting user feedback, generating high-quality responses, failure recovery and other aspects. It is committed to promoting user-centric model optimization and experience enhancement, providing a key benchmark to address the gap between traditional evaluation methods and real user experience.
数据集概述:UXBench
UXBench 是一个以用户为中心的大型语言模型(LLM)基准测试数据集,其核心特点是基于真实的用户反馈信号构建。该数据集源自腾讯元宝(Yuanbao)产品中超过 70,000 条“赞”(thumbs-up)和“踩”(thumbs-down)对话记录。
核心目标
UXBench 旨在将 LLM 的评估标准从纯粹的能力(Capabilities)扩展至用户感知的实用性(User-Perceived Utility),以衡量 AI 助手的用户体验。
任务与规模
UXBench 定义了三个核心评估任务,共包含 7,400 条测试样本,覆盖 8 种交互场景和 83 个领域。
| 任务 | 名称 | 样本量 | 描述 | 评估指标 |
|---|---|---|---|---|
| Task 1 | UX Judge (UX 判断) | 2,000 | 评估模型能否正确分类一个回答是“好”还是“坏”。包含 1,000 条差评对话(10 个失败维度)和 1,000 条好评对话(8 个成功模式)。 | Avg-Acc = (Good-Acc + Bad-Acc) / 2 |
| Task 2 | UX Eval (UX 评估) | 4,900 | 要求模型基于用户查询和对话历史生成一个令人满意的回复。 | Good% (由 GRM 评分) |
| Task 3 | UX Recovery (UX 恢复) | 500 | 要求模型在用户明确表达不满后,修复一次失败的交互。 | Recovery Rate (Good%) |
| 总计 | 7,400 |
数据来源与隐私
- 数据来源:数据集源自“腾讯元宝优化计划”,用户自愿提供交互日志以协助服务改进。
- 内容警告:因数据反映真实用户交互,可能包含冒犯性语言、亵渎、暴力或其他敏感内容。
- 隐私声明:数据集可能包含源于真实用户的信息。使用者不得用于识别、再识别、联系、追踪或推断任何个人身份,并需遵守所有适用的隐私、数据保护和研究伦理要求。
许可协议
- 许可类型:仅限研究使用。
- 主要限制:禁止重新分发、禁止创建衍生数据集、禁止商业用途。
访问与使用
- 数据集地址:https://huggingface.co/datasets/mengze-hong/UXBench
- 项目主页与排行榜:https://mengze-hong.github.io/UXBench
- 相关论文:https://arxiv.org/abs/2606.09570
可通过以下代码快速加载测试集:
python from datasets import load_dataset
bad = load_dataset("mengze-hong/UXBench", "task1_judge_bad", split="test") good = load_dataset("mengze-hong/UXBench", "task1_judge_good", split="test") t2 = load_dataset("mengze-hong/UXBench", "task2_eval", split="test") t3 = load_dataset("mengze-hong/UXBench", "task3_recovery", split="test")

- 1UXBench: Benchmarking User Experience in AI Assistants香港理工大学·元宝团队; 腾讯 · 2026年




