遇见数据集

Agent-Native Research Artifacts (ARA) Benchmark Collection

收藏
github2026-07-09 更新2026-07-13 收录
官方服务:

资源简介:

该仓库收集了32个Agent-Native Research Artifacts (ARAs),这是一种机器可读、以可重复性为先的研究论文替代格式。每个ARA将研究论文分解为四个基础层,使人类和智能体都能阅读声明、运行代码、检查证据并重放研究探索过程(包括死胡同)。

This repository collects 32 Agent-Native Research Artifacts (ARAs), a machine-readable, reproducibility-first alternative format for research papers. Each ARA decomposes a research paper into four foundational layers, enabling both humans and AI agents to read claims, execute code, verify evidence, and replay the entire research exploration process, including dead ends.

创建时间:
2026-07-09
原始信息汇总

数据集概述

该仓库收集了 32 个 Agent-Native Research Artifacts (ARA),这是一组以机器可读、可复现为优先的论文替代格式。每个 ARA 将一篇研究论文分解为四个基础层,使得人类和智能体都能阅读论文声明、运行代码、检查证据,并重放研究的实际探索过程(包括失败的路径)。

ARA 结构

每个 ARA 工件的目录结构如下:

层级 路径 内容
摘要 PAPER.md 论文的人类可读概述。
认知层 logic/ 包含 claims.md(声明,附有可证伪标准和证明指针)、concepts.mdexperiments.mdproblem.mdrelated_work.md,以及 solution/ 子目录下的 algorithm.mdarchitecture.mdconstraints.mdheuristics.md
工件层 src/ 可运行代码、配置文件和 environment.md
证据层 evidence/ 包含 figures/tables/,每个都与所支持的声明相关联。
轨迹层 trajectory.html 自包含的交互式查看器:左侧为可点击的过程图,右侧为每一步的详细展开,将每一步与对应的声明、结果和代码链接起来。
跟踪层 trace/ 包含 exploration_tree.yaml(研究 DAG 源)和 exploration_tree.html(仅树状视图)。

如何浏览

  • 阅读任意目录下的 artifacts/<benchmark>/<name>/PAPER.md 获取概述,然后深入 logic/evidence/ 目录。
  • 在浏览器中打开工件的 trajectory.html 文件,可逐步重放研究过程:左侧为过程图(包括死胡同分支),右侧为每步详细展开(显示该步骤所做的事情、关联的声明、结果和代码指针)。由于 GitHub 会内联显示 HTML 源码,需克隆仓库或下载文件以查看渲染后的页面。

数据集构成

仓库包含以下四个子集:

Paperbench (23 个)

工件 论文标题
adaptive-pruning APT: Adaptive Pruning and Tuning of Pretrained Language Models for Efficient Training and Inference
all-in-one All-in-one Simulation-Based Inference (Simformer)
bam Batch and Match: Black-Box Variational Inference with a Score-Based Divergence
bbox BBox-Adapter: Lightweight Adapting for Black-Box Large Language Models
bridging-data-gaps Efficient Transfer Learning in Diffusion Models via Adversarial Noise
fre Unsupervised Zero-Shot Reinforcement Learning via Functional Reward Encodings
ftrl Fine-Tuning RL Models is Secretly a Forgetting Mitigation Problem
lbcs Refined Coreset Selection: Minimal Coreset Size under Model Performance Constraints
lca-on-the-line LCA-on-the-Line: Benchmarking Out-of-Distribution Generalization with Class Taxonomies
mechanistic-understanding A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO
pinn Challenges in Training PINNs: A Loss Landscape Perspective
rice RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation
robust-clip Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Vision-Language Models
sample-specific-masks Sample-specific Masks for Visual Reprogramming-based Prompting
sapg SAPG: Split and Aggregate Policy Gradients
self-composing-policies Self-Composing Policies for Scalable Continual Reinforcement Learning
self-expansion Self-Expansion of Pre-trained Models with Mixture of Adapters for Continual Learning
semantic-self-consistency Semantic Self-Consistency: Enhancing Language Model Reasoning via Semantic Weighting
sequential-neural-score-estimation Sequential Neural Posterior Score Estimation (NPSE)
stay-on-topic-with-classifier-free-guidance Stay on Topic with Classifier-Free Guidance
stochastic-interpolants Stochastic Interpolants with Data-Dependent Couplings
test-time-model-adaptation Test-Time Model Adaptation with Only Forward Passes (FOA)
what-will-my-model-forget What Will My Model Forget? Forecasting Forgotten Examples in Language Model Refinement

ReBench (5 个)

工件 论文标题
rebench-fix_embedding Fix Embedding (RE-Bench task)
rebench-nanogpt_chat_rl nanoGPT Chat RL (RE-Bench task)
rebench-restricted_mlm Restricted-Architecture MLM (RE-Bench task)
rebench-rust_codecontests Rust CodeContests Inference (RE-Bench task)
rebench-triton_cumsum Triton Cumsum Kernel (RE-Bench task)

Speedrun (1 个)

工件 论文标题
nanogpt-speedrun NanoGPT Speedrun

Extra (3 个)

工件 论文标题
andes Andes: Defining and Enhancing Quality-of-Experience in LLM-Based Text Streaming Services
venn Venn: Resource Management for Collaborative Learning Jobs
expbench EXP-Bench: Can AI Conduct AI Research Experiments?

来源与质量

每个 ARA 均根据源论文及其附带的代码汇编而成,内容(声明、图表、表格)均追溯到原始论文。其中一部分还通过了 SEAL 的结构和跨层验证。这些工件是用于研究和评估目的的重构,权威结果请参考原始论文及其许可协议。

基准说明

paperbenchrebenchspeedrun 中的工件对应于 ARA 评估基准,而 extra 工件是基准之外额外的完整 ARA。

许可协议

内容采用 Creative Commons Attribution 4.0 International (CC BY 4.0) 许可协议发布。

搜集汇总
数据集介绍
Agent-Native Research Artifacts (ARA) Benchmark Collection 数据集图片
构建方式
在科学研究日益依赖计算可复现性的时代,传统PDF论文的静态格式已难以满足自动化验证与知识挖掘的需求。Agent-Native Research Artifacts (ARA) Benchmark Collection通过将32篇研究论文解构为机器可读的多层制品,为智能体与人类研究者架起了一座桥梁。每个ARA制品均从源论文及其配套代码出发,构建了包含摘要层、认知层、制品层、证据层、轨迹层和追踪层的六层结构化表示,其中认知层细化为问题定义、算法描述、实验设计等原子化组件,证据层则将图表与结论严格对应,而轨迹层以有向无环图忠实记录了包含死胡同在内的完整研究探索路径。所有内容均经过SEAL结构与跨层验证,确保信息溯源的可靠性。
特点
该基准集合的核心突破在于将学术论文转化为可交互、可验证、可重演的知识载体。每个ARA制品的轨迹视图以流程地图与逐步骤下钻相结合的方式,立体呈现研究工作流,其中每个操作步骤都关联到所支持的结论、产生的实证结果和使用的代码片段。认知层不仅记录算法与架构,还明确标注了结论的可证伪性标准与证据指针,为自动化推理提供了形式化基础。制品库涵盖论文基准、RE-Bench、Speedrun及额外制品四类子集,覆盖从语言模型剪枝到强化学习遗忘缓解的广泛研究主题,且所有图表与表格均建立可追溯到源论文的引用链条。
使用方法
使用者可以直接浏览任意制品的PAPER.md文件获取论文概览,随后深入logic/目录查阅形式化的逻辑结构或进入evidence/目录核实支撑结论的图表证据。通过克隆仓库到本地后打开trajectory.html文件,即可在浏览器中按步骤重放研究过程,左侧流程地图显示包含失败分支的完整探索树,右侧下钻面板展示每一步的具体操作内容、关联结论与代码指针。对于希望进行自动分析的研究者,还能通过解析exploration_tree.yaml中记录的研究DAG数据,结合evidence/内的结构化证据文件进行批量验证与跨论文的模式挖掘。
背景与挑战
背景概述
在人工智能研究日益依赖可复现性与自动化验证的背景下,Agent-Native Research Artifacts (ARA) Benchmark Collection 数据集应运而生,由相关研究团队于近期创建,旨在解决学术论文中实验过程与结果难以被智能体直接解析和复现的核心痛点。该数据集将32个研究论文转化为结构化、机器可读的构件,涵盖摘要、认知逻辑、可运行代码、实验证据及探索轨迹五大层次,从而为跨领域的研究评估提供标准化基准。其引入的“轨迹”层尤其创新,完整记录了研究探索的决策路径与失败分支,切中了当前AI研究评估中真实过程被隐藏的普遍问题,对推动自动化科研评估系统的发展具有里程碑式的影响力。
当前挑战
该数据集面临的挑战首先体现在领域层面:传统论文格式以PDF为主,缺乏对智能体友好的结构化表示,导致自动化复现、跨论文比对和精细误差追踪极为困难;同时,研究过程中的试错与死胡同常被省略,使得机器学习模型难以从真实的探索逻辑中学习策略。在构建过程中,挑战尤为艰巨:每个构件需从原始论文及代码中手工提取并对齐认知层(如声明、假设、实验约束)与可执行代码,确保证明链条的严谨性与跨层一致性;此外,对不同研究领域的论文(如强化学习、大规模语言模型、视觉表征等)进行统一层次化拆解,要求构建者具备深度领域知识,且部分论文代码缺失或环境依赖复杂,进一步增加了构件完整性与可执行性的保障难度。
常用场景
经典使用场景
在人工智能与科学研究的交汇处,ARA基准集合为智能体驱动的学术研究提供了一种标准化的可复现性框架。其经典使用场景在于,研究者能够利用这些精密构建的制品,系统性地评估和比较不同智能体在完整研究流程中的表现——从理解论文摘要、解析问题定义与假设,到执行实验代码、验证结果,乃至回溯完整的研究探索轨迹。这套包含32个制品的集合,覆盖了语言模型剪枝、强化学习、扩散模型迁移等前沿领域,使得智能体研究不再是孤立的代码测试,而是在一个结构化的、端到端的研究环境中进行能力验证。
衍生相关工作
ARA基准集合的诞生催生了一系列富有启发性的衍生研究工作。其四层解构范式启发了后续学者对于可复现性框架的重新思考,例如将认知逻辑层中的声明-证据映射关系引入到自动化文献综述与知识图谱构建任务中。基于轨迹层的研究过程记录格式,研究人员开发了能够从失败路径中提取有效反例的训练策略,用于增强智能体的决策鲁棒性。此外,由Paperbench、ReBench和Speedrun子集构成的评估体系,已有研究者将其作为基础框架,扩展出面向特定领域如生物医学或材料科学的定制化基准,形成了从通用到专用的智能体能力评估生态。
数据集最近研究
最新研究方向
Agent-Native Research Artifacts (ARA) Benchmark Collection的最新研究方向聚焦于构建一种机器可读、以可重现性为核心的论文替代范式,通过将学术论文解构为摘要、认知逻辑、可运行代码、证据及研究轨迹四层结构,推动人工智能代理对科学文献的深度理解与自动化验证。该数据集紧密关联当前AI领域对自主科研代理能力的迫切需求,尤其是大语言模型驱动的智能体在实验复现、假设检验与知识发现中的表现评估。ARA的出现标志着从静态PDF论文向动态、可交互、可追溯研究工件的转变,有望重塑学术交流与科研协作的基础设施,为构建可验证、可迭代的自动化科研生态系统提供关键基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务