遇见数据集

knowledge-cutoff

收藏
github2026-07-11 更新2026-07-13 收录
官方服务:

资源简介:

一个用于估计语言模型有效知识截止点的基准数据集,通过精心挑选的跨月份真实世界事件来探测模型的实际知识范围。数据集设计避免了可预测事件泄漏、模型回避回答、虚构和过度预测以及日期泄漏等失效模式,包含低/中可预测性事件、控制组(存活名人)和虚假事件,以准确评估模型的知识衰减曲线。

A benchmark dataset for estimating the effective knowledge cutoff of language models, which probes the actual knowledge scope of models through carefully selected real-world events spanning multiple months. This dataset is designed to avoid failure modes such as predictable event leakage, model evasive answering, hallucinations, overprediction, and date leakage. It includes low/medium predictability events, control groups (living celebrities), and fabricated events, enabling accurate evaluation of the model's knowledge decay curve.

创建时间:
2026-07-10
原始信息汇总

数据集概述

名称:knowledge-cutoff
地址:https://github.com/apoorvumang/knowledge-cutoff
用途:评估语言模型的有效知识截止日期(即模型实际了解世界信息的时间点,通常晚于其宣称的截止日期)。

核心方法

  • 使用一组涵盖近期各月份的真实世界事件对模型进行探查。
  • 对每个月份,统计模型回答正确的事件数量。
  • 知识掌握程度随着接近真实时间地平线而衰减,通过按月曲线反映模型世界知识的结束点。

设计防御机制

数据集设计旨在避免四种误导性评估失败模式:

  1. 可预测事件泄露虚假“知识”:例如,模型可能通过选举前民调预测选举结果。因此,每个事件被标注predictability(低/中/高),曲线仅基于低/中可预测事件(如暗杀、突然死亡、意外辞职等不可预测事件)计算。
  2. 回避不等于无知:模型说“截至我的上次更新,我不知道”不应算作错误。评分采用三分制correct(正确)/ incorrect(错误且自信——最强的知识过期信号)/ abstain(弃权)。
  3. 虚构与过度预测:数据集包含**control_alive(在世名人)和fake_event**(未发生事件)行,用于检测模型是否总是猜测“死亡”或虚构事件。
  4. 日期泄露:提示中从不提及当前日期,系统提示也不暗示这是时效性测试,防止模型据此推断答案或策略性回避。

评估指标

  • 衰减而非断崖:训练数据在截止日期附近逐渐稀疏。
  • 报告完整曲线外加两个截止估计值:
    • last_above:最后一个高于阈值的月份
    • crossover:最后一个高于阈值且之后不再出现的月份

数据集文件

  • 位置data/events.jsonl,每行一个事件。
  • 字段说明
字段 含义
category 事件类别:death(死亡)、office_change(职务变更)、control_alive(在世对照)、fake_event(虚假事件)
predictability 可预测性:low(低,最佳信号)→ high(高)
question_direct / expected_direct 开放式探测问题 + 真实答案(供评判模型使用)
mcq_question / mcq_choices / mcq_answer 多项选择探测问题、选项、正确答案
regionsource 区域(美国/国际)、来源URL

使用方式

  • 两种探测模式
    • --probe direct:开放式问题,由LLM评判(默认评判模型为claude-opus-4-8)。
    • --probe mcq:4选1强制选择,依据字母确定性评分。
    • 两者结合可获取更准确结果:direct可能低估(模型知道但不主动说出),mcq可能高估(猜测)。
  • 逐步执行命令
    • kc eval --model <模型名> --probe directmcq
    • 可分步:kc runkc gradekc score

扩展模型

models.yaml中添加条目。支持OpenAI兼容端点(kind: openai)和Anthropic模型(kind: anthropic)。API密钥通过环境变量读取。

许可证

  • 许可协议:Creative Commons Attribution 4.0 International (CC BY 4.0)
    (https://creativecommons.org/licenses/by/4.0/)
搜集汇总
数据集介绍
knowledge-cutoff 数据集图片
构建方式
Knowledge-cutoff基准数据集旨在精准估计大语言模型的实际知识截止时间,而非其宣称的截止日期。构建时,团队精心挑选了近数月内发生的真实世界事件,每个事件均标注了可预测性等级(低/中/高),仅保留低与中可预测性事件用于分析,以规避模型基于训练前信息猜测答案的风险。数据集包含死亡、职位变动、控制活体与虚假事件四种类别,并采用三值评分体系:正确、错误(自信错误)与弃权,以区分无知与谨慎回避。此外,还设计控制活体行与虚假事件行,用于检测模型是否过度编造或机械猜测,确保评估结果的可靠性。
特点
该数据集的核心特性在于其精细的防护机制,系统性地排除了常见评估陷阱。通过剥离高可预测性事件,基准避免了模型因统计规律而“预知”答案的假象;三值评分方案则清晰区分了模型的知识边界与策略性回避。控制活体与虚假事件行作为完整性校验,确保模型的回答是基于真实知识而非随机猜测。数据集呈现的是知识衰减曲线而非陡峭断崖,并给出两个关键估计点:“last_above”(最新可信月份)与“crossover”(知识彻底消失的转折点),为语言模型的实际知识范围提供了多维度的透视。
使用方法
使用本数据集需通过命令行工具kc进行完整评估流程。首先运行kc validate校验数据完整性,接着以kc eval --model <模型名> --probe direct或mcq执行单次评估。direct模式以开放式提问配合LLM裁判评分,mcq模式则提供四选一强制选择。两者分别从保守与激进角度估算知识边界,构成真实能力范围的上下界。用户也可分步执行:kc run生成原始回答,kc grade调用裁判模型打分,kc score输出月度准确率曲线与截止时间估计。配置文件models.yaml支持通过环境变量管理API密钥,兼容OpenAI与Anthropic接口,方便集成新模型。
背景与挑战
背景概述
知识截止日期(Knowledge Cutoff)是衡量大语言模型实际世界知识时效性的关键指标。该数据集由Apoorv Uman等研究者在2025年前后创建,旨在揭示语言模型声称的知识截止日期与其真实掌握的知识边界之间的差距。传统上,模型往往宣称具备某个时间点的知识截止能力,但实际上,其对于近期不可预测事件的知识掌握程度常显著早于该声明。该数据集通过构建涵盖近期多个月份的真实世界事件集合,对模型进行逐月评估,从而精准描绘其知识衰减曲线。这一基准的提出,极大推动了语言模型知识时效性评估的标准化与精细化。
当前挑战
该基准在构建过程中面临多重挑战。首先,如何区分模型基于预训练数据中的预测性模式做出的正确回答与其真实知识是核心难题,为此设计了按可预测性(低/中/高)标签过滤的事件体系。其次,模型常以『以我最后一次更新』等措辞规避回答,这类回避行为不能简单判定为错误,因而引入了三值评分体系(正确/错误/弃权)。第三,模型可能通过系统性胡编乱造产生虚假正确率,故设置了对照生还人物与虚构事件检查。最后,避免日期泄露也是一大设计巧思,提示中从不透露当前日期,防止模型推理作答。
常用场景
经典使用场景
在大型语言模型(LLM)的评估与安全部署领域,knowledge-cutoff基准数据集被广泛应用于精确测量模型实际知识截止日期,而非其宣称的静态时间点。研究者通过向模型提出一系列跨越近期月份的真实世界事件(如暗杀、突发辞职、选举爆冷等不可预测事件),逐月统计模型回答的正确率,从而绘制出随训练数据临近截止日期而逐渐衰减的知识曲线。这一过程有效规避了模型因基于训练数据的预测性推理(如根据民调结果猜测选举胜者)而表现出的虚假“知识”,或通过“据我所知”等回避性语言掩盖无知的行为。该数据集最经典的使用场景是作为模型知识时效性的诊断工具,帮助学界和工业界理解模型的世界知识究竟何时“过时”,从而为模型更新、检索增强生成(RAG)策略设计以及下游任务可靠性评估提供关键依据。
衍生相关工作
knowledge-cutoff数据集自发布以来,已催生了多个方向的高价值衍生工作。在基准层面,研究者借鉴其对抗可预测事件和规避回答的设计哲学,拓展出针对特定领域(如医学、法律)的时序知识评测集,同时结合多语言事件库评估不同语言下模型知识衰退模式的差异。在方法论层面,该数据集的衰减曲线模型被改进为基于连续时间戳的概率框架,将逐月离散测量升级为连续时间点知识概率分布估计,并通过贝叶斯方法融合不同可预测性事件的信号以降低抽样噪声。在应用层面,基于该基准衍生的“知识截止日历”工具被集成到模型训练框架中,能够在训练过程中动态监控每轮迭代后模型对新事件知识的记忆与遗忘行为,开创了“知识时效性正则化”训练策略——即在损失函数中引入对截止日期附近事件识别能力保持的正则项,从根源上缓解模型训后知识迅速衰退的顽疾。
数据集最近研究
最新研究方向
面对大型语言模型所宣称的训练数据截止日期与实际所掌握的世界知识存在偏差的窘境,该数据集开创性地提出了‘有效知识截止日’这一评估范式。研究聚焦于通过精心策划的、具有低可预测性的真实世界事件(如突发暗杀、意外辞职等)来精准探测模型的知识边界,并创新性地引入了三重评分体系(正确/错误/回避)以区分真正的无知与策略性回避。这一前沿方向不仅揭示了模型知识随时间的自然衰减曲线,而非理想化的突变边界,还通过控制组(健在人物、虚构事件)有效规避了记忆泄漏与凭空捏造带来的评估污染。其影响超越简单的基准测试,为理解模型训练数据的时间梯度效应提供了全新视角,并促使社区重新审视现有知识截止声明的可信度,推动了关于模型事实时效性与可靠性评估的严谨辩论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务