遇见数据集

MRF-2026 Reproducibility Data

收藏
github2026-08-27 更新2026-08-31 收录
官方服务:

资源简介:

该仓库包含三个预印本的复现数据,每个包含聚合的滚动结果、验证脚本和元数据,采用CC BY 4.0许可。

This repository contains replication data for three preprints, each including aggregated rolling results, validation scripts, and metadata, licensed under CC BY 4.0.

创建时间:
2026-08-27
原始信息汇总

数据集概述

该数据集由蒙大拿研究基金会(Montana Research Foundation)发布,名称为"Reproducibility data",旨在为预印本论文提供可复现的实验数据。数据集遵循 CC BY 4.0 许可协议,包含 3 个数据包(bundle)和 760 次运行记录(rollouts)。

数据集结构

数据集按预印本论文组织,每个实验目录对应一篇论文,位于 experiments/ 目录下。每个数据包包含以下内容:

  • records/:每个实验单元的 JSONL 文件,每行对应一次运行记录,仅包含聚合字段(种子、实验组、配置、得分、通过标记、令牌数、轮次),不包含原始对话、任务文本、诱导规则或金丝雀标记。
  • dataset.json:论文报告的聚合计算结果。
  • verify.py:自包含的验证脚本,仅从 records/ 重新计算各单元通过率和置信区间。
  • CITATION.cff:实验引用信息,包含其在 Zenodo 上独立的 DOI。
  • zenodo.json:用于生成 DOI 的 Zenodo 沉积元数据。
  • README.mdWITHHELD.mdLICENSE(CC BY 4.0)、MANIFEST.sha256

数据包详情

数据包 测量内容 运行次数
MRF-2026-01-acceptance-gauntlet 任务接受度和种子校准 120
MRF-2026-02-held-out-confidence 代理在保留标准下的自我认知 240
MRF-2026-03-track-label 能力标签对代理努力程度的影响 400

数据可用性说明

  • 任务族、原始代理对话和保留评分数据因污染控制而被扣留,每个数据包的 WITHHELD.md 中提供了相关信息。
  • 论文的 LaTeX 源码和图表脚本随预印本发布,不在此仓库中;本仓库仅包含实验数据及其验证器。

使用方式

在每个数据包目录下运行以下命令即可验证结果:

cd <bundle> && python3 verify.py

输出的通过率和置信区间应与论文一致。

发布与引用

每个实验作为独立记录存入 Zenodo,拥有独立的 DOI。发布时,DOI 会写入对应实验的 CITATION.cff 和匹配预印本的 mrfdoi 字段。引用时应依据各实验自身的 CITATION.cff,仓库级别没有统一的 DOI。

搜集汇总
数据集介绍
MRF-2026 Reproducibility Data 数据集图片
构建方式
该数据集遵循严格的科学可复现性原则,以预印本为核心,为每篇论文构建独立的实验目录。数据构建过程强调隔离与完整,每个实验包内包含聚合层面的逐次运行记录(records/*.jsonl),涵盖随机种子、实验臂、配置参数、评分、通过标准、令牌计数及交互轮次等关键字段,但刻意剔除原始代理转录、任务文本及诱导规则,以防范数据污染风险。此外,每个实验包配备自包含的验证脚本verify.py,仅基于记录文件重新计算论文中的核心指标,并附带CITATION.cff、Zenodo投递元数据及完整清单文件,确保数据可验证性与学术引用规范性。
使用方法
使用者可通过克隆仓库并进入特定实验目录,执行`python3 verify.py`即可验证论文报告中的通过率与置信区间,实现从数据到结论的无缝复核。每个实验包的元数据文件(如dataset.json)直接对应该论文的聚合结果,而CITATION.cff提供了规范的引用格式,便于学术引用。由于原始任务内容和代理交互记录被有意保留,使用者应结合论文描述理解数据边界,并在自身研究中选择性地利用聚合字段进行二次分析或方法对比。
背景与挑战
背景概述
MRF-2026 Reproducibility Data数据集由蒙大拿研究基金会(Montana Research Foundation)于2026年创建,旨在为人工智能代理(agent)行为实验提供可复现的数据基础。该数据集包含三个子实验(MRF-2026-01至03),分别探讨任务接受度与种子校准、代理在保留标准下的自我认知,以及能力标签对代理努力程度的影响,共涵盖760次rollout。每个子实验均附带独立的验证脚本(verify.py),确保论文中的核心指标可由原始数据重新计算。该数据集的发布遵循CC BY 4.0许可,并计划通过Zenodo为每个子实验分配独立DOI,以增强学术引用和可追溯性。其研究聚焦于AI代理的可信度与自我评估机制,对AI安全与可解释性领域具有重要参考价值。
当前挑战
该数据集面临的挑战集中于两层面:首先,在领域问题层面,它服务于AI代理行为实验的可复现性研究,需解决代理在复杂任务中表现不稳定、自我评估偏差以及标签诱导行为变化等核心难题,这些问题的存在限制了代理在实际应用中的可靠性与透明度;其次,在构建过程中,数据集的原始代理轨迹、任务文本及保留评分数据因污染控制而被刻意隐藏,仅提供聚合字段,这要求验证脚本必须能在不接触敏感信息的前提下准确复现论文结论,同时需确保各子实验的指标(如通过率、置信区间)与论文严格一致,对数据完整性和验证流程的严密性提出了极高要求。
常用场景
经典使用场景
该数据集专为复现科学实验设计,其核心使用场景在于为研究者提供独立、可校验的聚合实验数据及验证脚本,以重算论文报告中的关键指标。每个实验包(bundle)包含逐次运行的聚合记录(如得分、通过率、token计数、轮次等),并通过verify.py脚本从原始记录中重新计算每单元的通过率和置信区间,确保数据与论文结果的一致性。典型应用包括验证智能体在不同任务族上的接受度、校准种子参数、评估智能体在保留标准下的自我认知能力,以及探究能力标签对智能体努力程度的影响。这种设计使得研究者无需接触原始轨迹或任务内容,即可对实验结果进行独立复现和交叉验证,极大提升了科学发现的可靠性和透明度。
解决学术问题
该数据集直面可复现性危机,解决了学术研究中实验结果难以独立验证的痛点。通过提供自包含的聚合数据与可执行验证脚本,它使得论文中的核心结论可被他人独立重算,仅凭公开的聚合数据即可确认通过率、置信区间等关键统计量,从而降低了因数据造假或计算错误导致的不可复现风险。其意义在于建立了一套去中心化的数据发布规范,将数据与论文分离,并赋予每个实验独立的DOI,促进了科学成果的长期保存与引用。这一做法强化了研究的可审计性,对推动开放科学、提升科研诚信具有深远影响。
实际应用
在实际应用中,该数据集适用于智能体评估、强化学习实验的元分析,以及大型语言模型(LLM)的基准测试。研究团队可利用这些数据快速比对不同算法/配置下的智能体表现,尤其适用于那些无法获取完整轨迹但需要统计聚合结果的下游任务。数据集的模块化结构(每个实验独立)支持跨实验的二次分析,例如对不同任务族的接受度进行对比,或评估模型在保留数据上的置信度校准。此外,其与Zenodo平台的集成使得数据可以自动归档和分发,极大便利了学术交流与合作,为领域内大规模比较研究提供了坚实的实证基础。
数据集最近研究
最新研究方向
在人工智能安全与可信赖性研究领域,MRF-2026可复现性数据集的发布标志着对智能体行为可验证性探索的重要进展。该数据集围绕任务接受度、代理自知识以及能力标签对努力程度的影响这三个前沿课题,构建了包含760次rollout的标准化实验框架。其核心创新在于通过分离聚合数据与原始轨迹,在严格防止数据污染的前提下,提供了自包含的验证脚本,确保每项研究成果的可复现性。这一设计理念呼应了当前AI领域对研究透明度与可重复性危机的广泛关注,为智能体评估设立了新基准。尤其值得关注的是,其对代理自我认知能力的度量方法,为开发更可靠的自主系统提供了实证基础,具有深远的理论与应用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务