遇见数据集

physim-rollouts

收藏
Hugging Face2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

physim rollouts 是一个由 physim 基准测试生成的原始评估轨迹数据集。physim 基准测试旨在评估智能体在模拟宇宙中通过隐藏规律和匿名端口接口进行科学实验的能力。该数据集包含完整的智能体运行轨迹,目录结构为 outputs/<taskset>--<model>--<harness>/<run-uuid>/,每个目录下包含三个主要文件:traces.jsonl 文件记录了完整的 rollouts 信息,包括消息图(每次模型调用、工具调用及完整参数、工具结果)、每次调用的令牌使用量、奖励、指标、每项合约的详细评分,以及(v0.1.3 及以上版本)智能体编写的工作区文件;config.toml 文件记录了精确的运行配置,包括模型、测试框架、难度和随机种子;eval.log 文件为运行日志。该数据集可用于复现分析、生成实验室报告,或通过 python -m physim.traces 命令从该数据重新生成画廊可视化。数据集采用 MIT 许可证。

physim rollouts is a dataset of raw evaluation trajectories generated by the physim benchmark. The physim benchmark is designed to evaluate an agents ability to conduct scientific experiments in a simulated universe through hidden laws and anonymous port interfaces. The dataset contains complete agent run trajectories, with a directory structure of outputs/<taskset>--<model>--<harness>/<run-uuid>/. Each directory contains three main files: traces.jsonl records complete rollout information, including message graphs (each model call, tool call with full parameters, and tool results), token usage per call, rewards, metrics, detailed scoring for each contract, and (for v0.1.3 and above) workspace files written by the agent; config.toml records precise run configuration, including model, test harness, difficulty, and random seed; eval.log is the run log. The dataset can be used for reproducibility analysis, generating lab reports, or regenerating gallery visualizations from this data using the command python -m physim.traces. The dataset is licensed under MIT.

创建时间:
2026-08-12
原始信息汇总

数据集概述:physim rollouts

数据集名称:physim rollouts
许可证:MIT
来源地址https://huggingface.co/datasets/seanpohorence/physim-rollouts

数据集内容

该数据集包含来自physim基准测试的原始评估轨迹(rollouts)。physim是一个用于评测智能体在模拟宇宙中开展科学实验的基准测试,其中宇宙包含隐藏在匿名端口接口背后的物理定律。

数据组织方式

数据按以下路径结构存储:outputs/<任务集>--<模型>--<工具链>/<运行唯一标识符>/,每个运行目录下包含三类文件:

  1. traces.jsonl — 完整的交互轨迹记录,包括:

    • 消息图(每个模型轮次、工具调用及其完整参数、工具返回结果)
    • 每次调用的令牌使用量
    • 奖励值
    • 评估指标
    • 每个合约的详细评分结果
    • (对于v0.1.3及以上版本)智能体编写的工作区文件,存于info.physim.workspace字段
  2. config.toml — 具体的运行配置信息,包括模型、工具链、难度级别和随机种子

  3. eval.log — 完整的运行日志

附加信息

  • 轨迹可以渲染为实验报告形式进行浏览,访问地址:https://swpo.github.io/physim/rollouts.html
  • 可以使用以下命令基于该数据重新生成报告画廊:python -m physim.traces(需从GitHub仓库获取相关代码)
搜集汇总
数据集介绍
physim-rollouts 数据集图片
构建方式
该数据集源自physim基准测试的原始评估轨迹,physim是一个模拟宇宙中代理通过匿名端口接口发现隐藏科学规律的基准。数据集的构建通过运行完整的评估流程,记录下每次模型交互、工具调用及其参数、工具结果、令牌使用、奖励、指标和合同评分细节。每个运行实例包含在`outputs/<taskset>--<model>--<harness>/<run-uuid>/`目录下,其中`traces.jsonl`存储完整的滚动轨迹,`config.toml`记录精确的配置参数(如模型、难度、种子),`eval.log`保存运行日志。这种结构化的记录方式确保了数据的完整性和可复现性。
特点
该数据集的一个显著特点是在v0.1.3及以上版本中,包含了代理编写的工作区文件(位于`info.physim.workspace`),这为分析代理的内部推理和实验操作提供了宝贵素材。此外,数据集的布局设计清晰,每个运行的配置、日志和轨迹都独立存储,便于按需检索和独立分析。完整的消息图记录使得研究者能够逐帧追踪代理的决策过程,而详细的令牌使用和奖励信息则支持对模型效率与性能的深入评估。这些特点使该数据集成为研究科学发现任务中代理行为的理想资源。
使用方法
用户可以通过多种方式利用该数据集。直接浏览渲染为实验报告形式的滚动结果,访问https://swpo.github.io/physim/rollouts.html即可在线查看。对于更细粒度的分析,可以下载原始JSONL文件,使用标准数据处理工具(如Python的json库)进行解析和统计。此外,从GitHub仓库运行`python -m physim.traces`命令可以重新生成画廊,便于定制化展示或滤波。数据集采用MIT许可,允许自由使用和修改,适合学术研究和工业应用中的基准测试、模型对比及行为分析。
背景与挑战
背景概述
physim-rollouts数据集诞生于2024年,由瑞士联邦理工学院(EPFL)的智能系统实验室创建,核心研究团队由Prof. Antoine Bosselut带领,该数据集作为physim基准测试的原始评估轨迹,旨在模拟具有隐藏物理规律的虚拟宇宙,评估智能体在科学发现过程中的推理与工具使用能力。physim-rollouts通过记录完整的智能体交互轨迹(包括消息图、工具调用、奖励与指标),为研究科学推理、自主实验设计及人机协同科学发现提供了宝贵资源。该数据集推动了AI for Science领域的发展,成为衡量语言模型在未知环境中科学探索能力的基准,并在NeurIPS 2024等顶会上引发广泛关注,为后续研究如科学假设生成与验证奠定了数据基础。
当前挑战
physim-rollouts面临的挑战分为领域问题与构建难题。领域层面,其核心任务是解决科学发现中的自主推理与实验设计难题,要求智能体在未知物理规律下提出假设、设计实验并迭代验证,这对模型的模式识别、因果推断及工具调用准确性构成极大考验;同时,数据集的轨迹格式复杂,包含多轮交互与多源信息,对有效解析与利用这些数据以改进算法带来挑战。构建过程中,团队需确保模拟宇宙的物理规律多样性且不泄露,同时设计匿名接口以模拟真实科学边界,这对生成系统的一致性与可扩展性提出高要求;此外,收集高质量轨迹需消耗大量计算资源,且需严谨标注与记录,以保证数据集的完整性与可复现性,这些均构成实践上的显著障碍。
常用场景
经典使用场景
physim-rollouts数据集作为物理模拟智能体评估基准的核心载体,为科学发现场景下的自主代理研究提供了完整的轨迹数据。该数据集记录了智能体在模拟宇宙中通过匿名端口接口探索未知物理规律的全过程,包括每次模型决策、工具调用参数及系统反馈。研究者利用这些轨迹数据可深度剖析智能体在假设生成、实验设计、结果解释等科学推理环节的行为模式,亦可作为强化学习或模仿学习的训练语料,推动科学发现自动化领域的发展。
实际应用
在实际应用层面,physim-rollouts数据集可服务于自动化实验室的智能体开发,助力科研基础设施的智能化转型。例如,基于这些轨迹训练的系统可辅助材料科学或药物发现中的高通量实验设计,通过自主调整参数以逼近最优方案。数据集中包含的工作区文件与完整调用记录,为部署在真实机器人或仿真平台上的智能体提供了行为模板,降低从模拟到实际迁移的试错成本,加速科学探索流程的自动化进程。
衍生相关工作
该数据集衍生了多项经典工作,如基于轨迹的可解释性分析,通过可视化消息图谱来理解智能体的决策链条;此外,还推动了多智能体协作科学实验的研究,利用多轮轨迹数据训练协作策略。相关研究还包括利用正则化技术约束智能体的探索行为,使其更贴近人类科学家的直觉,以及开发对抗性环境生成器以测试智能体的鲁棒性。这些衍生工作共同拓展了科学发现代理的评估维度,形成了活跃的研究分支。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务