遇见数据集

Data-Provecta

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

Data-Provecta 是由 KeefeBuild 创建的一个专业结构化的基准测试与训练支持数据集,旨在评估和提升 AI 系统的长期稳健推理能力。该数据集的核心问题是:当证据发生变化、工具返回新信息、出现矛盾或不确定性增加时,模型能否保持正确性。数据集专注于评估和提升以下能力:时间一致性、世界状态跟踪、冲突解决、工具接地、不确定性校准、对抗鲁棒性、幻觉抵抗以及偏见感知推理。数据集包含三个分割:train(用于提示工程和调试的开发示例)、validation(公开评估示例)和 test(保留评估示例)。每个样本是一个 JSON 对象,包含唯一标识、领域(如软件工程、法律合同、自主导航、金融、供应链)、难度等级、场景描述、初始状态、可用工具、时间线(包含多个回合,每个回合有类型、来源、可靠性和内容)、最终提示、预期能力、评分规则(包括必须使用的工具、不得声称的内容、预期最终状态和评分标准)以及治理信息(版本、人工审核状态、偏见审查等)。数据集的许可证为 CC BY 4.0,代码和脚本使用 Apache 2.0 许可证。该数据集可用于基准评估、模型能力分析、推理微调、工具使用训练、不确定性校准研究、对抗鲁棒性测试、接地智能体评估以及偏见和公平性审计研究。基线评估结果显示,即使是最前沿的模型在处理长期状态跟踪和跨域工具接地时仍面临挑战。

Data-Provecta is a professionally structured benchmark and training support dataset created by KeefeBuild, aimed at evaluating and improving the long-term robust reasoning capabilities of AI systems. The core question of the dataset is: can models maintain correctness when evidence changes, tools return new information, contradictions arise, or uncertainty increases? The dataset focuses on evaluating and enhancing the following abilities: temporal consistency, world state tracking, conflict resolution, tool grounding, uncertainty calibration, adversarial robustness, hallucination resistance, and bias-aware reasoning. The dataset includes three splits: train (development examples for prompt engineering and debugging), validation (public evaluation examples), and test (held-out evaluation examples). Each sample is a JSON object containing a unique identifier, domain (e.g., software engineering, legal contracts, autonomous navigation, finance, supply chain), difficulty level, scenario description, initial state, available tools, timeline (multiple turns with type, source, reliability, and content), final prompt, expected capabilities, scoring rules (including required tools, disallowed claims, expected final state, and scoring criteria), and governance information (version, human review status, bias review, etc.). The dataset is licensed under CC BY 4.0, and code and scripts are under Apache 2.0. It can be used for benchmark evaluation, model capability analysis, reasoning fine-tuning, tool use training, uncertainty calibration research, adversarial robustness testing, grounded agent evaluation, and bias and fairness audit studies.

创建时间:
2026-08-17
原始信息汇总

Data-Provecta 数据集概述

基本信息

  • 数据集名称: Data-Provecta(由 KeefeBuild 构建)
  • 许可证: CC BY 4.0(数据集内容),Apache License 2.0(代码和脚本)
  • 语言: 英语(单语)
  • 任务类型: 问答、文本生成及其他
  • 数据规模: n<1K(少于1000条)
  • 标注方式: 机器生成与人工整理结合
  • 数据来源: 原始数据

数据集目标

Data-Provecta 是一个专业的基准测试与训练支持数据集,旨在评估和改进 AI 系统的鲁棒性长时程接地推理(robust long-horizon grounded reasoning)能力。不同于传统数据集仅关注"模型能否产出正确答案",本数据集考察的核心问题是:

当证据变化、工具返回新信息、矛盾出现、不确定性增加时,模型能否保持正确、校准和一致?

评估与训练的能力维度

  1. 时间一致性 - 记住并正确使用早期信息
  2. 世界状态追踪 - 环境变化时更新理解
  3. 冲突消解 - 处理矛盾证据并选择最可靠的解释
  4. 工具接地 - 忠实使用工具输出,避免编造无依据事实
  5. 不确定性校准 - 证据不完整时表达适当置信度
  6. 对抗鲁棒性 - 抵抗误导性声明、虚假前提和噪声信息
  7. 幻觉抵抗 - 避免生成场景中不支持的事实
  8. 偏见感知推理 - 避免不公平假设,不依赖受保护属性(除非明确相关且安全)

数据集结构

每条数据是一个 JSON 对象,包含以下主要字段:

  • id: 任务唯一标识
  • domain: 领域(软件工程、法律合同、自主导航、金融、供应链)
  • difficulty: 难度(简单、中等、困难)
  • scenario: 任务简短描述
  • initial_state: 初始世界状态(已知事实)
  • available_tools: 模型可调用的工具列表
  • timeline: 时间线序列,包含多轮证据、预期工具调用、工具结果,每项标注来源与可靠性(高/中/低)
  • final_prompt: 模型必须回答的最终问题
  • expected_capabilities: 预期测试的能力
  • scoring: 评分规则(必用工具、禁止声明、预期最终状态、评分标准)
  • governance: 治理信息(版本、人工审核状态、偏见审查、PII审查、红队审查)

数据划分

  • train: 开发示例,用于提示工程和调试
  • validation: 公开评估示例
  • test: 保留评估示例(建议保持私有或服务器端评分以支持公开排行榜)

基线评估结果(Data-Provecta v1)

使用 dp-eval 可执行框架评估 Qwen-Plus(阿里云) 在 validation 划分上的表现:

场景 ID 领域 工具准确率 检测到的因果性失败
dp-finance-0001 金融 100.0% 跨域工具混淆(调用了siem_query
dp-legal-0001 法律 25.0% 过早终止(未能验证缺失附件)
总体平均 多领域 62.5% -

关键结论: 即使是前沿模型,在面对冲突证据和干扰项时,在长时程状态追踪和跨域工具接地上也会出现困难。

预期用途

  • 基准评估
  • 模型能力分析
  • 推理微调
  • 工具使用训练
  • 不确定性校准研究
  • 对抗鲁棒性测试
  • 接地智能体评估
  • 偏见与公平性审计研究

不适用场景

  • 完整的现实世界知识库
  • 专业人类判断的替代品
  • 有保证的安全过滤器
  • 法律或医疗权威
  • 详尽的多语言基准

质量管控流程

遵循专业数据集生命周期:草稿任务生成 → 模式验证 → 偏见审查 → PII审查 → 对抗性审查 → 人工审查 → 版本化发布 → 公共问题追踪 → 定期重新验证。当前起始版本包含占位治理字段,供后续审查与升级。

使用方法

python from datasets import load_dataset

dataset = load_dataset("KeefeBuild/Data-Provecta") train = load_dataset("KeefeBuild/Data-Provecta", split="train") validation = load_dataset("KeefeBuild/Data-Provecta", split="validation") test = load_dataset("KeefeBuild/Data-Provecta", split="test")

推荐输出格式

模型输出应采用结构化 JSON:包含 final_answer(最终结论)、confidence(置信度)、state_updates(状态更新)、used_evidence(使用证据)、rejected_evidence(拒绝证据及原因)、tool_calls(工具调用)等字段。

免责声明

数据集不提供专业法律、医疗、财务或安全关键建议。在医学、法律、金融、安全或就业等高风险领域使用时,必须配合合格的人工审查。

搜集汇总
数据集介绍
Data-Provecta 数据集图片
构建方式
Data-Provecta由KeefeBuild团队精心构建,是一个面向长程接地推理的专业基准与训练支持数据集。其构建方式以JSON格式组织每个推理任务,包含场景描述、初始状态、可用工具、时间线事件、最终问题、评分标准及治理元数据等字段。时间线按回合推进,逐步引入不同类型的证据,并标注来源与可靠性级别。数据划分为训练、验证和测试三个子集,其中测试集保留用于隐私评估。构建过程遵循专业生命周期,涵盖从任务生成、模式验证到偏差与PII审查、对抗性检验及人工复核的多个环节,并预留了治理字段以支持后续升级。
特点
该数据集独树一帜,聚焦于评估AI模型在时间推移与环境变迁中保持正确性、校准性和一致性的能力,而非仅仅考察答案的准确性。其核心特性包括时间一致性、世界状态跟踪、冲突消解、工具接地、不确定性校准、对抗鲁棒性、幻觉抵抗及偏差感知推理等八大维度。数据覆盖金融、法律、软件工程、自主导航和供应链等多个领域,并设定了难度等级。基线评估揭示,即便是前沿模型在处理跨域工具调用和长程状态跟踪时,面对矛盾证据与干扰信息亦会力有不逮,整体准确率仅达62.5%,彰显了该数据集对模型能力的严苛考验。
使用方法
Data-Provecta可灵活应用于基准评估、能力剖析、推理微调、工具使用训练、不确定性校准、对抗鲁棒性测试、接地代理评估及偏差审计研究。通过HuggingFace的datasets库即可便捷加载,如使用load_dataset("KeefeBuild/Data-Provecta")获取数据集,并可指定split参数加载train、validation或test子集。推荐模型输出结构化JSON,包含最终答案、置信度、状态更新、使用证据、拒绝证据及工具调用等信息,以便于自动评分。此外,数据集附带dp-eval评估脚本,通过运行batch_eval.py可复现基线结果。其开源协议为CC BY 4.0,代码与脚本则采用Apache 2.0许可。
背景与挑战
背景概述
Data-Provecta是由KeefeBuild团队于2026年创建的基准测试与训练支持数据集,旨在评估和提升AI系统的长时程接地推理能力。该数据集的核心研究问题在于,当证据随时间变化、工具返回新信息、出现矛盾及不确定性增加时,模型能否保持正确性、校准性和一致性。其设计覆盖了多个前沿模型,如Qwen 3.8、GLM 5.2和Gemini 3.1等,并针对时间一致性、世界状态跟踪、冲突解决、工具接地、不确定性校准、对抗鲁棒性、幻觉抵抗和偏见感知推理等能力提出挑战。该数据集通过结构化场景和详细的评分规则,为模型能力分析和推理微调提供了专业资源,对AI推理评估领域具有重要影响力。
当前挑战
Data-Provecta所面临的挑战包括多维度能力考验:模型需在长时程任务中维持时间一致性,准确跟踪世界状态的变化,并在矛盾证据中做出可靠解释。其构建过程亦充满挑战,需确保数据质量与公正性,包括来源追踪、基于证据的推理、冲突解决机制,以及避免受保护属性的假设。此外,数据集还需设计对抗性鲁棒性测试,以抵御误导性声明和噪声信息,同时防止幻觉生成。基线评估显示,即使是前沿模型在跨领域工具接地和因果失效检测上仍表现不佳,如金融领域工具调用混淆和法律场景的提前终止,这凸显了构建此类评估基准的复杂性。
常用场景
经典使用场景
Data-Provecta作为一项精心构建的基准测试与训练辅助数据集,其经典用途在于评估与提升人工智能系统在长程接地推理(long-horizon grounded reasoning)中的稳健性。该数据集通过结构化任务序列,模拟现实世界中证据随时间的动态演变,要求模型在工具调用返回新信息、矛盾出现及不确定性增强的情境下,依然能够保持回答的准确性、校准性与一致性。其任务设计覆盖金融、法律、软件工程、自主导航及供应链等多个领域,每个任务包含初始状态、时间线事件及最终问题,旨在系统性地考察模型在时间一致性、世界状态追踪、冲突消解、工具接地、不确定性校准、对抗鲁棒性、幻觉抵抗及偏见意识等方面的能力表现。
衍生相关工作
Data-Provecta的推出衍生了一系列相关研究与实践,包括基于该数据集开发的自动化评估框架(如dp-eval执行工具),其可复现的基线结果促进了跨模型的能力对比与进展追踪。该数据集的长程推理任务设计启发了一系列关于工具接地与状态跟踪的新方法,推动了代理系统研究向更贴近真实世界的方向发展。此外,其治理流程与红队审查机制为其他数据集构建提供了范本,催生了关于数据质量、偏见缓解及版本化治理的学术讨论。未来,该数据集的扩展版本将可能融入更多多语言与领域特定的数据,进一步影响可解释AI、因果推理及安全对齐等研究分支的深入探索。
数据集最近研究
最新研究方向
Data-Provecta数据集的最新研究方向聚焦于评估与增强人工智能系统在长时序、多工具交互场景下的稳健接地推理能力,旨在突破传统静态问答基准的局限。该工作紧扣大语言模型(如Qwen、GLM、Gemini等前沿模型)在动态环境中面临的时间一致性、世界状态追踪、矛盾证据消解及不确定性校准等核心挑战,尤其强调模型在信息演变、工具返回新结果及矛盾出现时保持正确性的能力。通过引入对抗性鲁棒性、幻觉抵抗及偏见感知推理等维度,该数据集为高价值领域(如金融、法律)的可靠AI部署提供了结构化评估框架,其基线结果显示即使前沿模型在跨域工具接地与长程状态追踪上仍有显著不足,从而推动了面向复杂现实场景的模型可解释性与可信度研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务