Data-Provecta
收藏资源简介:
Data-Provecta 是由 KeefeBuild 创建的一个专业结构化的基准测试与训练支持数据集,旨在评估和提升 AI 系统的长期稳健推理能力。该数据集的核心问题是:当证据发生变化、工具返回新信息、出现矛盾或不确定性增加时,模型能否保持正确性。数据集专注于评估和提升以下能力:时间一致性、世界状态跟踪、冲突解决、工具接地、不确定性校准、对抗鲁棒性、幻觉抵抗以及偏见感知推理。数据集包含三个分割:train(用于提示工程和调试的开发示例)、validation(公开评估示例)和 test(保留评估示例)。每个样本是一个 JSON 对象,包含唯一标识、领域(如软件工程、法律合同、自主导航、金融、供应链)、难度等级、场景描述、初始状态、可用工具、时间线(包含多个回合,每个回合有类型、来源、可靠性和内容)、最终提示、预期能力、评分规则(包括必须使用的工具、不得声称的内容、预期最终状态和评分标准)以及治理信息(版本、人工审核状态、偏见审查等)。数据集的许可证为 CC BY 4.0,代码和脚本使用 Apache 2.0 许可证。该数据集可用于基准评估、模型能力分析、推理微调、工具使用训练、不确定性校准研究、对抗鲁棒性测试、接地智能体评估以及偏见和公平性审计研究。基线评估结果显示,即使是最前沿的模型在处理长期状态跟踪和跨域工具接地时仍面临挑战。
Data-Provecta is a professionally structured benchmark and training support dataset created by KeefeBuild, aimed at evaluating and improving the long-term robust reasoning capabilities of AI systems. The core question of the dataset is: can models maintain correctness when evidence changes, tools return new information, contradictions arise, or uncertainty increases? The dataset focuses on evaluating and enhancing the following abilities: temporal consistency, world state tracking, conflict resolution, tool grounding, uncertainty calibration, adversarial robustness, hallucination resistance, and bias-aware reasoning. The dataset includes three splits: train (development examples for prompt engineering and debugging), validation (public evaluation examples), and test (held-out evaluation examples). Each sample is a JSON object containing a unique identifier, domain (e.g., software engineering, legal contracts, autonomous navigation, finance, supply chain), difficulty level, scenario description, initial state, available tools, timeline (multiple turns with type, source, reliability, and content), final prompt, expected capabilities, scoring rules (including required tools, disallowed claims, expected final state, and scoring criteria), and governance information (version, human review status, bias review, etc.). The dataset is licensed under CC BY 4.0, and code and scripts are under Apache 2.0. It can be used for benchmark evaluation, model capability analysis, reasoning fine-tuning, tool use training, uncertainty calibration research, adversarial robustness testing, grounded agent evaluation, and bias and fairness audit studies.
Data-Provecta 数据集概述
基本信息
- 数据集名称: Data-Provecta(由 KeefeBuild 构建)
- 许可证: CC BY 4.0(数据集内容),Apache License 2.0(代码和脚本)
- 语言: 英语(单语)
- 任务类型: 问答、文本生成及其他
- 数据规模: n<1K(少于1000条)
- 标注方式: 机器生成与人工整理结合
- 数据来源: 原始数据
数据集目标
Data-Provecta 是一个专业的基准测试与训练支持数据集,旨在评估和改进 AI 系统的鲁棒性长时程接地推理(robust long-horizon grounded reasoning)能力。不同于传统数据集仅关注"模型能否产出正确答案",本数据集考察的核心问题是:
当证据变化、工具返回新信息、矛盾出现、不确定性增加时,模型能否保持正确、校准和一致?
评估与训练的能力维度
- 时间一致性 - 记住并正确使用早期信息
- 世界状态追踪 - 环境变化时更新理解
- 冲突消解 - 处理矛盾证据并选择最可靠的解释
- 工具接地 - 忠实使用工具输出,避免编造无依据事实
- 不确定性校准 - 证据不完整时表达适当置信度
- 对抗鲁棒性 - 抵抗误导性声明、虚假前提和噪声信息
- 幻觉抵抗 - 避免生成场景中不支持的事实
- 偏见感知推理 - 避免不公平假设,不依赖受保护属性(除非明确相关且安全)
数据集结构
每条数据是一个 JSON 对象,包含以下主要字段:
- id: 任务唯一标识
- domain: 领域(软件工程、法律合同、自主导航、金融、供应链)
- difficulty: 难度(简单、中等、困难)
- scenario: 任务简短描述
- initial_state: 初始世界状态(已知事实)
- available_tools: 模型可调用的工具列表
- timeline: 时间线序列,包含多轮证据、预期工具调用、工具结果,每项标注来源与可靠性(高/中/低)
- final_prompt: 模型必须回答的最终问题
- expected_capabilities: 预期测试的能力
- scoring: 评分规则(必用工具、禁止声明、预期最终状态、评分标准)
- governance: 治理信息(版本、人工审核状态、偏见审查、PII审查、红队审查)
数据划分
- train: 开发示例,用于提示工程和调试
- validation: 公开评估示例
- test: 保留评估示例(建议保持私有或服务器端评分以支持公开排行榜)
基线评估结果(Data-Provecta v1)
使用 dp-eval 可执行框架评估 Qwen-Plus(阿里云) 在 validation 划分上的表现:
| 场景 ID | 领域 | 工具准确率 | 检测到的因果性失败 |
|---|---|---|---|
| dp-finance-0001 | 金融 | 100.0% | 跨域工具混淆(调用了siem_query) |
| dp-legal-0001 | 法律 | 25.0% | 过早终止(未能验证缺失附件) |
| 总体平均 | 多领域 | 62.5% | - |
关键结论: 即使是前沿模型,在面对冲突证据和干扰项时,在长时程状态追踪和跨域工具接地上也会出现困难。
预期用途
- 基准评估
- 模型能力分析
- 推理微调
- 工具使用训练
- 不确定性校准研究
- 对抗鲁棒性测试
- 接地智能体评估
- 偏见与公平性审计研究
不适用场景
- 完整的现实世界知识库
- 专业人类判断的替代品
- 有保证的安全过滤器
- 法律或医疗权威
- 详尽的多语言基准
质量管控流程
遵循专业数据集生命周期:草稿任务生成 → 模式验证 → 偏见审查 → PII审查 → 对抗性审查 → 人工审查 → 版本化发布 → 公共问题追踪 → 定期重新验证。当前起始版本包含占位治理字段,供后续审查与升级。
使用方法
python from datasets import load_dataset
dataset = load_dataset("KeefeBuild/Data-Provecta") train = load_dataset("KeefeBuild/Data-Provecta", split="train") validation = load_dataset("KeefeBuild/Data-Provecta", split="validation") test = load_dataset("KeefeBuild/Data-Provecta", split="test")
推荐输出格式
模型输出应采用结构化 JSON:包含 final_answer(最终结论)、confidence(置信度)、state_updates(状态更新)、used_evidence(使用证据)、rejected_evidence(拒绝证据及原因)、tool_calls(工具调用)等字段。
免责声明
数据集不提供专业法律、医疗、财务或安全关键建议。在医学、法律、金融、安全或就业等高风险领域使用时,必须配合合格的人工审查。





