遇见数据集

RUMBA (Russian User Memory Benchmark)

收藏
arXiv2026-07-23 更新2026-07-27 收录
官方服务:

资源简介:

RUMBA是由DAIMLD机构创建的首个专注于俄语长时对话记忆评估的基准数据集,旨在解决现有基准在俄语领域缺失及对记忆交互行为覆盖不足的问题。该数据集包含85个带时间戳的用户-助手对话,共计1,543个标注问答对,对话平均长度约34万字符,数据来源于人工编写的多样化用户交互场景,并融入了俄语社会文化特征。其创建过程涉及多阶段设计,由26名贡献者参与,通过精细的语义、数量和时间性三维分类法构建。该数据集主要应用于评估语言模型在长期对话中的记忆存储、更新、推理及遗忘等能力,为开发可靠的俄语对话系统提供诊断工具。

RUMBA is the first benchmark dataset focused on evaluating long-form conversational memory in Russian, created by the DAIMLD institution. It aims to address the gaps in existing benchmarks for the Russian language domain and their insufficient coverage of memory interaction behaviors. This dataset includes 85 timestamped user-assistant conversations, totaling 1,543 annotated question-answer pairs, with an average conversation length of approximately 340,000 characters. The data is derived from diverse manually authored user interaction scenarios and incorporates Russian socio-cultural characteristics. Its development involves a multi-stage design process with 26 contributors, and it is constructed using a refined three-dimensional taxonomy covering semantics, quantity, and temporality. This dataset is primarily used to evaluate the capabilities of language models in long-term conversations, including memory storage, updating, reasoning, and forgetting, providing a diagnostic tool for developing reliable Russian conversational systems.

提供机构:
DAIMLD
创建时间:
2026-07-23
原始信息汇总

数据集概述

数据集名称: RUMBA (Russian User Memory Benchmark)

数据集地址: https://huggingface.co/datasets/ai-forever/RUMBA


1. 核心目标与设计

RUMBA 是一个长期对话记忆基准测试,用于评估语言模型和记忆系统如何回答关于长跨度、多轮对话的问题。它测试系统是否能够检索、整合并推理分布在长时间对话历史中的证据。

该数据集主要用于评估,而非模型训练。可用于比较:

  • 全上下文长上下文模型
  • 检索增强生成系统
  • 显式长期记忆框架

2. 数据集规模

指标 数值
对话数量 85 个(含独特用户)
对话轮次 4,031 次
话语总数 36,558 条
问答对 1,543 个(已标注)
语言版本 俄语 (ru) 和英语 (en),结构与问题结构匹配

3. 数据集结构

使用扁平 JSONL 格式存储,每行为一个独立的问答示例,包含回答该问题所需的完整对话历史。

核心字段

  • 对话与会话字段

    • conversation_idx: 源对话的数字标识符
    • user_id: 合成用户标识符
    • conversation: 完整的、多轮对话历史,每个会话包含:
      • session_idx: 会话索引
      • session_datetime: 会话时间戳
      • conversation: 话语列表(每个包含 rolemessage 字段)
  • 问题与标注字段

    • id: 唯一标识符(格式:<conversation_idx>|q<question_idx>
    • question: 从用户视角提出的基准问题
    • question_date: 提问时间戳(用于解读相对日期、时间推理)
    • answer: 参考答案
    • category: 三个维度的标注(语义类型、会话范围、时间性),例如 DateExtraction, single, temporal
    • subcategory / subsubcategory: 类别特定子类型(可选)
    • text_temporal_expression: 证据中的时间表达类型标签(explicit_teimplicit_teno_te
    • evidence: 支持回答问题所需的证据会话索引列表

类别维度详解

  • 语义类型:包括提取型(如 StaticUserUpdatingInfoDateExtraction)、推理型(如 SocialRelationshipArithmeticTemporalCommonsense)、以及弃权型(Abstention)。
  • 会话范围single(证据在一个会话内)或 multi(需要跨会话组合证据)。
  • 时间性atemporal(无需时间信息)或 temporal(需时间定位)。

4. 任务与评估

  • 支持任务:长期对话记忆评估、长上下文问答、检索增强记忆系统、跨多轮对话的时间推理。
  • 评估指标:F1 分数、RUMBA 专用指标(rumba_metric)。
  • 使用方式:可通过 LightEval 任务配置或 HuggingFace datasets 库加载。

5. 加载方式

使用 LightEval

python memorybench_qa = LightevalTaskConfig( name="rumba", prompt_function=memorybench_prompt, hf_repo="ai-forever/RUMBA", hf_subset="ru", # or "en" hf_avail_splits=["test"], evaluation_splits=["test"], metrics=[Metrics.f1_score, Metrics.rumba_metric], stop_sequence=[" "], )

使用 HuggingFace datasets

python from datasets import load_dataset

ds_ru = load_dataset("ai-forever/RUMBA", "ru", split="test") ds_en = load_dataset("ai-forever/RUMBA", "en", split="test")

本地加载 JSONL

python from datasets import load_dataset

ds_ru = load_dataset("json", data_files="rumba-ru.jsonl", split="train") ds_en = load_dataset("json", data_files="rumba-en.jsonl", split="train")


6. 语言与许可

  • 语言:俄语(主要版本)和英语(用于跨语言比较)
  • 许可:MIT 许可证
  • 标签:memory、long-context、conversational-memory、llm-evaluation、russian、temporal-reasoning、question-answering、retrieval-augmented-generation

7. 引用信息

bibtex @misc{shevtsova2026rumbarussianusermemory, title={RUMBA: Russian User Memory Benchmark}, author={Elizaveta Shevtsova and Inna Glebkina and Mark Baushenko and Pavel Gulyaev and Alena Fenogenova}, year={2026}, eprint={2607.21447}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2607.21447}, }

搜集汇总
数据集介绍
RUMBA (Russian User Memory Benchmark) 数据集图片
构建方式
RUMBA数据集的构建过程严谨而系统,首先由26名贡献者依据精细设计的问题分类法,实时创作带有时间戳的用户-助手对话,其中用户话语由人工撰写以确保自然性,助手响应则由专为俄语优化的GigaChat Max模型生成。随后,经过跨验证、LLM辅助证据标注及最终三方独立审核等多阶段质量控制流程,确保问答对的准确性与对话逻辑的一致性。此外,为了支持跨语言诊断,通过自动翻译辅以人工验证的方式,创建了与俄语版本对齐的英语子集。
特点
该数据集最显著的特点在于其多维正交的分类体系,将记忆问题按语义操作、量化范围(单轮/多轮)和时间性三大轴进行精细标注,尤其创新性地将时间推理作为独立维度,并显式支持遗忘场景,从而超越了传统基准中扁平化的分类局限。对话内容深度融入了俄语社会文化特征,包括惯用语和时态表达,且用户话语由人工撰写,避免了合成对话的偏差。平均约34万字符的超长上下文长度,为评估模型在多轮交互中的检索、整合与推理能力提供了极具挑战性的测试环境。
使用方法
数据集提供了两阶段的标准评估流程。在'添加'阶段,记忆系统将对话数据按用户独立处理并构建内部存储;在'评估'阶段,系统针对每个问题检索最相关的记忆片段,连同时间戳一并输入答案生成模型,并利用LLM作为评判器,通过一个固定的提示模板对生成答案与参考答案进行对比打分。该流程同时支持基于检索增强生成(RAG)的记忆系统和完整上下文基线,并提供了统一的代码库以标准化评测工作,允许在不同语言和记忆方法之间进行公平且可复现的比较。
背景与挑战
背景概述
随着大型语言模型被日益广泛地部署为对话助手,其跨会话保留用户长期记忆的能力变得至关重要。然而,现有记忆评测基准多聚焦于英文场景,且依赖聚合检索指标,未能捕捉长距离上下文、时间信息与推理之间的复杂交互。为填补这一空白,由俄罗斯DAIMLD团队于2026年提出的RUMBA(Russian User Memory Benchmark)应运而生,成为首个专为评估俄语对话系统长期记忆能力而设计的基准。该基准由Elizaveta Shevtsova等研究者主导创建,其核心研究问题在于如何细粒度地评测模型在跨会话场景下的记忆保留、时间推理与多步整合能力。RUMBA不仅提供了包含时间戳的用户-助手对话及精细分类的问答对,还同步发布了对齐的英语子集,为跨语言诊断与可复现性研究奠定了坚实基础,对推动多语言对话记忆评测领域的发展具有重要影响力。
当前挑战
RUMBA所面临的挑战主要体现在多个层面。其一,在领域问题层面,现有记忆基准多囿于简单的召回或检索任务,缺乏对长期对话记忆行为的完整覆盖,例如记忆更新、信息过时与主动遗忘等复杂情景。RUMBA需设计更全面的分类体系,涵盖语义提取与时间推理等多种记忆操作,以解决评测维度单一的问题。其二,在基准构建过程中,团队面临显著挑战:需在合成数据基础上引入人工撰写的用户轮次以增强自然性,同时确保对话中时间信息的显式与隐式表达能够被精细标注;此外,俄语数据集的构建还需融入俄罗斯特有的社会文化特征与语言错误,以贴近真实交互场景,而英语版本的生成则依赖机器翻译与人工校验的复杂流程,以保证语义与逻辑的一致性。
常用场景
经典使用场景
在大语言模型日益成为智能对话助手的背景下,长期记忆能力成为其核心瓶颈之一。RUMBA基准数据集专为评估俄语对话系统中的持久性记忆而设计,其最经典的用法是作为诊断工具,衡量模型在多轮、多会话交互中的记忆检索、时间推理与跨会话信息整合能力。通过细粒度的分类学框架,研究者能够系统性地考察模型在单会话与多会话场景下的表现差异,从而揭示记忆机制在真实交互中的优势与局限。
衍生相关工作
RUMBA的发布催生了多项重要的衍生研究脉络。在评估方法论层面,其正交分类框架启发了后续工作对记忆行为更细致的解耦分析,如LongMemEval-V2扩展了多智能体场景下的时效性诊断。在模型开发方面,数据集揭示了显式与隐式时间表达间的巨大性能鸿沟,直接推动了面向俄语的时间感知推理模型与语义嵌入增强方案的研究。此外,memOS等记忆操作系统在RUMBA上的性能表现,加速了模块化记忆架构的迭代,使遗忘机制与跨会话证据整合等核心挑战被纳入下一代可解释对话系统的设计蓝图。
数据集最近研究
最新研究方向
在大型语言模型长程对话记忆评估领域,RUMBA数据集突破了传统英语中心基准的局限,首次为俄语场景构建了细粒度、多维度的记忆评测框架。当前前沿研究聚焦于记忆机制中时间推理与跨会话信息整合的深度耦合,RUMBA通过引入正交轴分类法(语义、数量、时间性),精准刻画了模型在显式与隐式时间表达、遗忘指令响应、多步推理等复杂场景下的行为差异。该数据集不仅揭示了现有长上下文模型在隐式时间证据处理上的显著脆弱性(准确率下降超20%),更推动了记忆增强系统从简单检索向结构化记忆认知的范式转型。其跨语言对齐设计为多语言代理的生态化评估提供了标准化基准,对构建具备文化感知能力、能动态维护用户记忆的对话智能体具有里程碑式意义。
相关研究论文
  • 1
    RUMBA: Russian User Memory BenchmarkDAIMLD · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务