遇见数据集

TRIVIAROOMQA

收藏
arXiv2026-07-23 更新2026-07-27 收录
数据链接:
官方服务:

资源简介:

TRIVIAROOMQA是由法国国家信息与自动化研究所创建的跨语言知识评测基准,旨在评估大语言模型在日常文化、长尾知识及多语言理解方面的能力。该数据集共包含8640道法语选择题(其中3300道为六种欧洲语言的平行问题),覆盖288个细分主题和24个广泛类别,数据来源于人类设计的开放式知识问答平台。数据集通过人工撰写和平台收集构建,每个问题均标注难度级别、时空元数据等丰富注释。该基准主要用于揭示模型在学术知识外的日常文化认知缺陷,助力提升模型在娱乐、新闻、流行文化等现实场景中的知识覆盖与多语言一致性。

TRIVIAROOMQA is a cross-lingual knowledge evaluation benchmark developed by the Institut National de Recherche en Informatique et en Automatique (INRIA) of France, designed to assess the capabilities of large language models (LLMs) in daily cultural cognition, long-tail knowledge and multilingual understanding. This dataset comprises 8640 French multiple-choice questions in total, with 3300 of them being parallel questions across six European languages, covering 288 subdivided topics and 24 broad categories. The dataset is built upon data sourced from human-curated open knowledge Q&A platforms, and constructed via both manual question writing and platform data collection. Each question is annotated with rich annotations including difficulty level, spatiotemporal metadata and other relevant details. This benchmark is primarily used to reveal the daily cultural cognitive deficits of LLMs beyond academic knowledge, and help enhance the knowledge coverage and multilingual consistency of models in real-world scenarios such as entertainment, news and popular culture.

创建时间:
2026-07-23
搜集汇总
数据集介绍
TRIVIAROOMQA 数据集图片
构建方式
TRIVIAROOMQA的构建源于OpenQuizzDB平台上原本为人类竞赛设计的问答资源,经过精心筛选与清洗,形成了两个核心子集:一个包含3300道平行题目的多语种子集,覆盖六种欧洲语言(英、法、意、西、德、荷),另一个是包含5340道题目的纯法语子集,总计8640道法语题目。每道题目均配备四个选项、一条简短注释以及三级难度标注(初级、确认、专家),此外还借助Llama-70B-Instruct自动生成了地理区域与时间跨度的元数据标注,从而实现了对知识类型、语言、难度、地域和时间的多维度精细刻画。
特点
该数据集最显著的特点在于其专注于评估大语言模型在日常文化、长尾知识与跨语言情境下的表现,而非传统的学术或百科知识。其题目覆盖288个主题与24个宽泛类别,涵盖历史、地理、流行文化、音乐、电影、新闻等领域,尤其突显了模型在流行文化与当代话题上的薄弱环节。数据集提供了并行多语对照的能力,使得同一知识点在不同语言下的模型表现可被直接比较,从而揭示知识获取的跨语言不一致性。此外,人工难度标注与模型实际表现的对比表明,人类在困难主题上表现出渐进式的下降,而模型则表现为全难度层面的低迷,这一差异为理解模型知识边界提供了独特视角。
使用方法
使用TRIVIAROOMQA时,推荐采用基于条件对数似然的评估方式,将题目作为提示输入,从四个候选项中选择得分最高的答案,从而规避自由文本生成带来的规范化问题。数据集提供了两个评估任务:TRIVIAROOMQA-MULTI用于跨语言一致性分析,TRIVIAROOMQA-FRENCH用于细粒度分类、难度、时间与地理维度的深入剖析。研究者可利用LM Evaluation Harness库便捷地复现评估流程,并可采用零样本设定或结合聊天模板进行对比实验。该基准特别适用于诊断模型的参数化知识缺口,并可作为检索增强生成或工具调用系统的测试床。
背景与挑战
背景概述
TRIVIAROOMQA是由法国国家信息与自动化研究所(INRIA Paris)的Anna Mosolova与Djamé Seddah于2026年提出的多语言常识知识评测基准。该数据集旨在弥补现有学术型基准(如MMLU、TriviaQA)在评估大语言模型(LLMs)日常文化知识与长尾事实记忆方面的不足,聚焦于人类问答场景中常见的琐事型问题。数据集包含3,300道平行六语言选择题(英、法、意、西、德、荷)及5,340道法语独立题,覆盖288个主题与24个粗粒度类别,并标注了难度等级、时空元数据。通过对30个开源LLMs的评估,该研究揭示了模型在百科类知识(如历史、地理)上的优势与在流行文化类知识(如名人、影视、新闻)上的显著短板,为多语言事实知识的一致性研究提供了关键分析工具。
当前挑战
TRIVIAROOMQA所解决的领域挑战在于现有基准无法有效捕捉LLMs在日常文化知识与长尾事实上的脆弱性:主流评测多聚焦于学术推理与英文语料,忽视了对流行文化、当代事件及地域性知识的考察。构建过程中面临的核心挑战包括:1) 从OpenQuizzDB平台筛选并人工校验大量琐事问题,确保跨语言平行翻译的语义一致性与文化适切性;2) 对288个主题进行细粒度分类与难度标注,并利用Llama-70B自动生成时空元数据,需平衡自动标注的噪声与趋势分析的精度;3) 覆盖六种欧洲语言且确保数据集在预训练语料中的低重叠率(如OpenQuizzDB在FineWeb2中仅出现214次),避免数据泄露对评测公正性的干扰。
常用场景
经典使用场景
在自然语言处理与人工智能研究的广阔疆域中,TRIVIAROOMQA以其独特的设计理念,成为评估大语言模型(LLM)日常知识与文化常识掌握程度的标杆性基准。该数据集最经典的使用场景在于对模型在非学术、非百科全书式知识上的表现进行精细剖析。研究者利用其涵盖288个主题、包含三个难度等级的多选题,系统性地考察模型在处理流行文化、娱乐新闻、区域特色等接地气的‘冷知识’时的能力,从而弥补了MMLU等传统学术基准在评估日常知识储备方面的固有盲区。
衍生相关工作
TRIVIAROOMQA的开创性工作已激发了一系列卓有成效的后续研究。其构建思路直接启示了针对特定语言或文化区域(如法语区、拉丁美洲)的细粒度知识基准的诞生,推动了对LLM在多语言环境下知识一致性瓶颈的深入探讨。此外,该数据集被视为评估检索增强生成系统在‘开放域问答’任务上效能的有力工具,催生了关于如何利用外部知识库弥补模型参数化知识不足的经典研究。更为重要的是,它带动了关于模型训练数据中长尾信息分布与模型性能之间关系的新一轮探讨,为优化数据配比、提升模型对低频知识的学习效率提供了宝贵的实验土壤。
数据集最近研究
最新研究方向
TRIVIAROOMQA的提出标志着大语言模型评测从学术化、百科式的知识基准,向日常化、文化扎根的长尾知识领域纵深拓展。该数据集以人类真实竞猜题库为蓝本,跨越六种欧洲语言与288个主题,不仅揭示了模型在历史、地理等密集型知识领域表现优异,更精准定位了其在流行文化、娱乐新闻、区域风物等“常识盲区”上的系统性缺陷。尤为关键的是,研究发现模型对同一知识的跨语言访问存在不一致性,且对当代与地域性知识的掌握显著弱于时效性久远的问题,这为理解参数化知识的语言依赖性与时空分布偏差提供了实证。该工作推动了评测范式从单一准确率向细粒度主题、难度、语言与地域多维解析的转型,对提升模型的文化包容性与知识覆盖均衡性具有深远意义。
相关研究论文
  • 1
    When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs法国国家信息与自动化研究所·巴黎 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务