LLMs-First-Task
收藏资源简介:
PI-LLM数据集用于评估大型语言模型(LLM)的工作记忆和上下文干扰能力。数据集由多个键值对组成,其中相同的键会被更新多次,模型需要为每个键检索最后一个值。由于早期信息会干扰最近信息的检索,因此数据集对LLM来说具有挑战性。README文件详细介绍了数据集的结构、评估任务以及使用各种SOTA LLMs观察到的结果。它还包括有关数据集规模、上下文长度的影响以及与认知科学的联系的信息。文件还提供了一个快速入门指南,用于使用数据集评估模型,以及一个使用AUC评分的更高级评估方法。
The PI-LLM dataset is designed to evaluate the working memory and contextual interference capabilities of Large Language Models (LLMs). The dataset consists of multiple key-value pairs, where the same key is updated multiple times, and models are required to retrieve the final corresponding value for each key. Since earlier information can interfere with the retrieval of recent information, this dataset poses significant challenges for LLMs. The README file elaborates on the dataset structure, evaluation tasks, and observed results from various state-of-the-art (SOTA) LLMs. It also covers details regarding the dataset scale, the impact of context length, and its connections to cognitive science. Additionally, the document provides a quick start guide for evaluating models using this dataset, as well as a more advanced evaluation method that employs AUC scores.
数据集概述
基本信息
- 名称: PI-LLM
- 许可证: MIT
- 语言: 英语
- 任务类别: 问答
- 标签: 大语言模型、记忆、检索、上下文干扰、长上下文
数据集配置
-
核心配置 (core)
- 描述: 随机化更新(键值对中的键被打乱)。推荐作为主要/SOTA比较设置。在最高压力层级,所有测试模型(截至2025年5月)都无法可靠恢复最终值。
- 数据文件: core.parquet
-
顺序附加配置 (sequential_additional)
- 描述: 非随机化——清晰严格的顺序块;证明短上下文(5k-8k token)已经可以对大多数大语言模型产生强烈的上下文干扰。即使使用这种格式良好的数据,许多模型的性能仍然迅速下降。
- 数据文件: sequential_additional.parquet
任务描述
键值更新范式:模型看到的内容格式为:
Key1: Value_1 Key1: Value_2 ...... Key1: Value_N
问题:Key1的当前值(最后一个值)是什么?
预期答案:Key1的当前值是Value_N。
关键发现
- 所有测试的SOTA大语言模型(包括GPT5、Grok4、DeepSeek、Gemini 2.5PRO、Mistral、Llama4等)都无法可靠检索Value_N
- 随着N值增加,答案分布从value_1到value_N,且答案越来越偏向value_1
- 人类在此任务上表现接近完美(99%+准确率),而所有大语言模型都以相同方式失败
实验维度
- 更新次数实验 (exp_updates): 随着每个键的更新次数(N)增加,大语言模型混淆早期值与最新值
- 并发键数实验 (exp_keys): 随着并发键数量增加,大语言模型的抗干扰能力和检索准确率呈对数线性下降
- 值长度实验 (exp_valuelength): 随着值长度增长,检索准确率呈对数线性下降
数据集规模
- 更新次数N从1到400
- 最多46个键组(key1到key46)组合在一起
- 所有值都不同,便于准确测量模型回答与正确答案的距离
应用场景
该数据结构常见于许多数据处理任务,如:
- 金融数据跟踪
- 健康监测(如血压读数序列)
- 光标位置跟踪
- 需要跟踪最新值的任何场景
相关资源
- 论文: https://arxiv.org/abs/2506.08184
- 演示网站: https://sites.google.com/view/cog4llm
- OpenAI MRCR数据集: https://huggingface.co/datasets/openai/mrcr
- DeepMind MRCR论文: https://arxiv.org/pdf/2409.12640v2
评估方法
提供完整的Python评估代码,包括:
- 基础准确率计算
- AUC评分(对数基1.5加权)
- 响应解析功能
- 实验结果分组分析
数据集已集成到Moonshot AI(Kimi)的内部基准测试框架中,用于评估大语言模型/代理的跟踪能力和上下文干扰。




