pi-llm-bench
收藏资源简介:
该数据集用于评估语言模型(LLMs)在处理多轮上下文干扰任务时的能力。数据集包含两种配置:随机更新的 'core' 和顺序更新的 'sequential_additional'。数据集通过模拟对同一键进行多次更新,并要求模型返回每个键的最新值,来测试LLMs的上下文干扰和记忆能力。此外,数据集还包括了如何使用该数据集来评估模型的示例代码。
This dataset is developed to evaluate the performance of Large Language Models (LLMs) when tackling multi-turn contextual interference tasks. The dataset includes two configurations: randomly updated "core" and sequentially updated "sequential_additional". It tests the contextual interference resilience and memory capabilities of LLMs by simulating multiple updates to the same key and prompting the model to return the latest value for each key. Additionally, the dataset provides sample code demonstrating how to use it to evaluate language models.
PI-LLM Bench 数据集概述
数据集基本信息
- 许可证: MIT
- 语言: 英语
- 任务类别: 问答
- 标签: 大语言模型、记忆、检索、上下文干扰、长上下文
数据集配置
核心配置(core)
- 描述: 随机化更新(键值对中的键被打乱顺序),推荐作为主要/SOTA比较设置。在最高压力层级下,所有测试模型(截至2025年5月)都无法可靠恢复最终值
- 数据文件: core.parquet(测试集)
顺序附加配置(sequential_additional)
- 描述: 非随机化——清晰严格的顺序块;证明短上下文(5k-8k token)已经可以对大多数大语言模型产生强烈的上下文干扰。即使使用这种格式良好的数据,许多模型的性能仍然迅速下降
- 数据文件: sequential_additional.parquet(测试集)
核心研究内容
数据集基于键值更新范式设计,通过多次更新相同键的值,测试模型检索每个键最新值的能力。该范式隔离了共指干扰,无需极长干扰上下文。
关键发现
- 所有测试的大语言模型(从早期0.1B到现代600B+模型)都无法可靠检索最新值
- 随着每个键的更新次数(N)增加,准确率呈对数线性下降
- 答案分布从value_1到value_N,随着N增加,答案越来越偏向value_1
- 人类在此任务上接近完美准确率(99%+),显著优于所有大语言模型
实验维度
实验1:更新次数(exp_updates)
- 测试不同更新次数(1到400次)对检索准确率的影响
实验2:并发键数(exp_keys)
- 测试并发键数量增加对检索准确率的影响
- 提供两种设置:固定更新350次和固定更新125次
实验3:值长度(exp_valuelength)
- 测试值长度增长对检索准确率的影响
- 提供两种设置:固定更新20次和固定更新4次
顺序模式特点
在非随机化顺序模式下:
- 大多数现代大语言模型(所有<600B)在仅50-100次更新后就混淆最新值与早期值
- 性能呈现阶梯式失败模式:在达到模型特定阈值前保持接近完美,之后迅速降至接近零
- 即使输入较短(5-8k token,远小于任何大语言模型的上下文窗口),模型仍然失败
相关资源
- 演示网站: https://sites.google.com/view/cog4llm
- 研究论文: https://arxiv.org/abs/2506.08184
- OpenAI MRCR数据集: https://huggingface.co/datasets/openai/mrcr
- DeepMind MRCR论文: https://arxiv.org/pdf/2409.12640v2
数据集文件
- core.parquet: 主数据集(随机化更新),推荐作为主要比较设置
- sequential_additional.parquet: 顺序模式(非随机化,严格的按键顺序更新块),对人类简单但对许多大语言模型仍具挑战性
评估方法
提供完整的Python评估代码,包括:
- 数据集下载和加载
- 模型响应生成
- 响应解析和准确率计算
- 按实验分组的结果统计
理论基础
基于认知科学中的主动干扰(Proactive Interference, PI)范式,这是研究人类工作记忆的基础方法。该测试直接测量干扰(不仅仅是上下文长度)如何限制记忆和检索能力。




