UXBench
收藏资源简介:
UXBench是首个基于真实用户反馈信号构建的用户中心化LLM基准,源自腾讯元宝的7万+点赞/点踩对话。它评估LLM在三个UX任务(Judge、Eval、Recovery)上的表现,涵盖8个交互场景和83个领域,旨在将LLM基准从能力评估扩展到用户感知效用。
UXBench is the first user-centric LLM benchmark constructed based on real user feedback signals. It is derived from over 70,000 conversations with like or dislike feedback from Tencent Yuanbao, and evaluates LLMs on three UX tasks: Judge, Eval and Recovery. The benchmark covers 8 interaction scenarios and 83 domains, aiming to extend LLM benchmarks from capability evaluation to user-perceived utility.
UXBench 数据集概述
UXBench 是首个以用户为中心的大语言模型基准,基于腾讯元宝(Tencent Yuanbao)70,000 多条用户点赞与点踩的真实对话构建,旨在将 LLM 评估从单纯的能力评测扩展到用户感知的实用性。
基本任务
UXBench 定义了三个评估任务,共 7,400 条测试样本,覆盖 8 种交互场景和 83 个领域:
| 任务 | 名称 | 规模 | 描述 | 评估指标 |
|---|---|---|---|---|
| Task 1 | UX Judge | 2,000 | 判断响应的好坏(其中1,000条差评含10个失败维度,1,000条好评含8个成功模式) | Avg-Acc = (Good-Acc + Bad-Acc) / 2 |
| Task 2 | UX Eval | 4,900 | 多轮对话响应生成 | Good%(由GRM评分) |
| Task 3 | UX Recovery | 500 | 修复失败的交互,在用户明确抱怨后生成修复性回复 | Recovery Rate(Good%) |
数据来源
- 数据来源于腾讯元宝优化计划,参与用户自愿提供交互日志用于服务改进
- 原始数据为 70,000+ 条点赞与点踩的真实对话
- 最终构建的测试集包含 7,400 条测试实例
数据集下载
数据集托管于 HuggingFace,包含四个子集:
task1_judge_bad(1,000条差评判断样本)task1_judge_good(1,000条好评判断样本)task2_eval(4,900条评估样本)task3_recovery(500条修复样本)
许可证与使用限制
- 研究用途仅限
- 禁止重新分发
- 禁止创建衍生数据集
- 禁止商业用途
- 使用时需遵守相关隐私、数据保护和研究伦理规定
- 数据集可能包含冒犯性语言、脏话、暴力或其他敏感内容
引用信息
如需引用,请参考 arXiv 论文:UXBench: Benchmarking User Experience in AI Assistants,论文链接为 https://arxiv.org/abs/2606.09570。





