遇见数据集

Dr-CiK

收藏
github2026-07-03 更新2026-07-19 收录
数据链接:
官方服务:

资源简介:

Dr-CiK是一个用于评估智能体能否从嘈杂文档语料库中检索与预测相关的上下文、过滤干扰项、将检索到的上下文提炼为预测有用的证据,并基于该证据进行预测的基准数据集。每个任务包括历史时间序列、实体元数据、目标描述以及包含支持文档和干扰文档的文档语料库。数据集包含279个任务、10,342个文档,分为公开开发集和隐藏测试集。

Dr-CiK is a benchmark dataset for evaluating whether AI Agents can retrieve context relevant to predictions from noisy document corpora, filter out distractors, distill the retrieved context into useful evidence for prediction, and make predictions based on such evidence. Each task comprises historical time series, entity metadata, target descriptions, and a document corpus that includes both supporting documents and distractor documents. The dataset contains 279 tasks and 10,342 documents, and is divided into a public development set and a hidden test set.

创建时间:
2026-06-30
原始信息汇总

数据集概述

Dr-CiK: A Testbed for Foresight-Driven Agents 是一个用于评估智能体在时间序列预测中自主检索、过滤和利用外部上下文信息能力的基准测试。由 ServiceNow Research 发布。

  • 核心目标:测试智能体能否从包含干扰项的文档语料库中检索预测相关的上下文,排除无关内容,提炼有效证据,并基于证据进行预测。
  • 核心思想:现实中的时间序列预测不仅依赖历史数据,还需从异构、嘈杂的信息源中主动发现外部上下文。现有基准通常假定支持性上下文已提供,Dr-CiK 移除了这一假设。
  • 任务构成:每个任务包含一段历史时间序列及真实延续值;实体/元数据及目标描述;一个包含支持性文档和干扰性文档的语料库;以及用于评估的真实证据(gt_evidence)。
  • 干扰物分类:每个任务包含五种干扰物子类型(confoundernoisytimeseriesprofiletemporal),每种恰好5篇干扰文档。

数据集规模

项目 数量
任务总数 279
支持性文档 3,367
干扰性文档 6,975
文档总数 10,342
  • 任务来源:199个合成任务,80个人工编写任务。
  • 数据拆分
    • 开发集(公开):199个合成任务,包含未来值与真实证据。
    • 测试集(隐藏):80个人工编写任务,未来值与真实证据被隐藏。

数据获取与使用

  • 完整数据集:托管于 Hugging Face,数据集标识符为 ServiceNow/Dr-CiK
  • 代码仓库:提供项目着陆页、小型示例样本及提交说明。
  • 快速加载:可使用 datasets 库加载 tasksdocumentstask_documents 配置。
  • 本地探索:可通过仓库 sample/ 目录下的 load_sample.py 无依赖运行示例。

数据模式

每个任务 JSON 包含:

  • benchmark_idsplitoriginreasoning_hops
  • showcase:实体、画像及时间序列变量元数据
  • task_metadata:频率、预测长度、季节性周期、目标描述
  • series:历史时间戳、历史值、未来时间戳、未来值
  • documents:文档列表,每个文档包含 document_idcontentrole(支持性/干扰性)、subtype(干扰子类型或 null)、path
  • annotations.gt_evidence:真实证据片段({id, evidence}

评估与排行榜

  • 官方排行榜:基于隐藏测试集(80个人工任务)进行评分,由维护者验证。
  • 提交方式:参与者提交模型输出,经官方评分工具验证后发布可信条目。
  • 提交指南:详见 SUBMISSION.md

许可协议

  • 许可证:Creative Commons Attribution 4.0 International License (CC BY 4.0)。

引用

bibtex @article{tang2026dr, title={Dr-CiK: A Testbed for Foresight-Driven Agents}, author={Tang, Yihong and Williams, Andrew Robert and Ashok, Arjun and Zheng, Vincent Zhihao and Sun, Lijun and Drouin, Alexandre and Laradji, Issam H and Marcotte, {E}tienne and Zantedeschi, Valentina}, journal={arXiv preprint arXiv:2605.27904}, year={2026} }

搜集汇总
数据集介绍
Dr-CiK 数据集图片
构建方式
Dr-CiK数据集旨在评估具备前瞻性推理能力的智能体在复杂文档环境中进行时间序列预测的表现。构建时,每个任务需搭配一条历史时间序列及其真实未来延续值,并辅以一个包含支持性与干扰性文档的Markdown语料库。其中,支持性文档蕴含预测所需的关键证据,而干扰性文档则细分为混淆因子、噪声、时间序列、画像及时间五种子类型,每种子类型恰好包含五篇文档。数据集共包含279个任务,衍生自3,367篇支持性文档与6,975篇干扰性文档,总计10,342篇文档。任务来源方面,199个为合成生成,80个为人工撰写,并据此划分为公开的开发集与隐藏的测试集,后者仅保留时间序列及文档数据,但刻意隐藏真实未来值与证据标注,以确保评估的严谨性。
特点
该数据集的核心特色在于其精心设计的干扰性文档分类体系,从混淆因子、噪声、时间序列、画像及时间共五个维度模拟现实世界信息检索中的真实噪声。这种多元化的干扰类型迫使智能体必须具备超越简单模式匹配的深度推理能力,从而在拥挤的文档空间中主动筛除无关信息,精准定位并提炼支撑预测的证据。此外,数据集提供层级化的标注信息,包括证据跨度标注及多跳推理需求,能够细致衡量智能体在检索、过滤、提炼与预测四个阶段的表现。公开与隐藏测试集的划分,结合官方维护的排行榜机制,为不同方法的公平比较提供了坚实且可验证的基础。
使用方法
研究者可通过Hugging Face数据集库便捷加载Dr-CiK的全部数据,使用`load_dataset`函数分别调取`tasks`、`documents`及`task_documents`三个配置。每个任务JSON包含完整的时间序列、文档语料库、元数据及可选的真实证据标注。智能体需依次完成文档检索、干扰项排除、证据提取及未来值预测等步骤。数据集中提供了一个不含外部依赖的样本读取脚本`load_sample.py`,便于快速上手。对于正式评估,官方建议将预测输出提交至项目仓库,由维护者基于隐藏测试集进行独立打分,确保结果的可信度与可复现性。
背景与挑战
背景概述
在时序预测领域,现实世界中的预测任务往往不仅依赖于历史观测值,还需要从海量异构且充满噪声的外部文档中主动挖掘相关上下文信息。然而,现有基准通常假设支持性上下文已经给定,这严重低估了真实场景的复杂性。为此,ServiceNow Research团队于2026年发布了Dr-CiK(Foresight-Driven Agents测试平台),由Yihong Tang、Valentina Zantedeschi等研究者构建。该数据集包含279个任务,涉及3367篇支持文档和6975篇干扰文档,并细分为合成与人工撰写两类。其核心研究问题在于评估智能体能否从嘈杂的文档语料库中检索预测相关上下文、过滤干扰项、提炼可用于预测的证据,并基于此生成准确预测。Dr-CiK的提出为上下文辅助的时序预测研究设立了更具挑战性的新标杆,推动了前瞻性智能体的发展。
当前挑战
Dr-CiK所面临的挑战首先体现在领域问题上:现有方法大多假设支持性上下文已直接提供,而Dr-CiK要求智能体自主完成从文档检索到证据提炼再到预测的完整链条,这一过程需同时抵御五类干扰文档(混淆因素、噪声、时序干扰、画像干扰、时间干扰)的干扰,对智能体的鲁棒性与推理能力构成严峻考验。在构建过程中,团队面临的主要挑战包括如何设计真实且多样的干扰文档分类体系以模拟实际应用中的信息噪声,如何确保合成任务与人类撰写任务在难度与分布上的一致性,以及如何在不泄露答案的前提下构建可评估的隐藏测试集。此外,279个任务中仅199个公开标签,80个隐藏任务的评估需依赖官方维护者,这使得公平、可复现的在线排行榜成为一项工程与评价上的重大挑战。
常用场景
经典使用场景
在时间序列预测领域,传统方法往往依赖干净的历史数据与显式提供的上下文信息,然而现实场景中预测所需的外部知识常隐藏于异构噪声文档之中。Dr-CiK数据集由此应运而生,它创造性地将文献检索、证据蒸馏与数值预测相结合,构建了一个深度研究驱动的预测测试环境。每个测试任务不仅包含历史时间序列与目标描述,还配备了一个由支持文档与多种干扰文档(包括混杂、噪声、时序、画像和时序相关型)共同构成的文档语料库。智能体必须自主从嘈杂的文档空间中检索相关证据,精准过滤干扰信息,提炼出可用于预测的关键数据,并在此基础上完成对未来值的推断。这一设计精准模拟了分析师在真实世界中搜集信息并形成预判的认知过程,为评估智能体的前瞻性推理能力提供了全新的实验范式。
实际应用
在产业实践中,无论是供应链需求预测、能源负荷预估还是宏观经济趋势研判,分析师均需从内部报告、行业新闻、政策文件等异构信息源中提取前瞻性线索。Dr-CiK所描绘的任务场景正好映射了此类实际决策流程。通过引入该基准,企业可对自动化决策系统进行压力测试,评估其在信息噪声环境中识别关键信号的能力,进而优化从数据采集到预测输出的全链条智能体系统。该数据集尤其适用于需要高可靠性的领域,例如金融风暴预警、公共卫生事件传播预测等,在这些场景中,忽略一条关键信息可能导致巨大的决策失误。因此,Dr-CiK为构建具有鲁棒性的企业级预测智能体提供了可复用的测试与评分基础设施,推动了从实验室研究到产业落地的桥梁构建。
衍生相关工作
作为一项开创性的测试平台,Dr-CiK从其发布伊始便催生了一系列值得关注的衍生工作。其中,研究者们基于其任务架构探索了多种检索增强生成策略在时间序列预测中的应用,系统的分析了信息检索质量与预测精度之间的因果关系。部分工作围绕干扰文档的抵抗机制展开,提出了专门用于过滤时序误导信息的对比学习框架。此外,该数据集中的隐藏测试集与排行榜机制还激励了跨团队协作,推动了可验证、可复现的预测智能体竞赛文化。更广泛而言,Dr-CiK所定义的“深度研究”式预测范式也为后续其他序列决策领域的基准设计提供了方法论参考,促进了将检索、推理与预测融为一体的统一评估体系的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务