遇见数据集

CongLab-Research/LabHorizon-Protocol-Conditioned-Planning

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是LabHorizon项目的Level 2部分,专注于协议条件下的长视野实验室动作序列规划。每个数据示例包含真实世界的实验上下文、规划目标、协议派生的约束条件、可用输入以及动作池。目标是生成具有参数和中间依赖关系的长视野实验动作序列。任务围绕“协议条件动作预测”设计,要求模型利用协议上下文选择有效动作,保持长范围顺序,保留数值和分类参数,并在动作之间传递中间产物。数据集包含3,000个训练样本和200个测试样本,输入包括上下文、目标、约束、可用输入和动作池,输出为黄金实验动作序列。评估指标包括动作序列相似性、参数准确性和最终得分。数据集旨在促进实验室自动化中的长视野规划和真实世界协议对齐研究。

--- license: MIT许可证 task_categories: - 文本生成 language: - 英语 pretty_name: LabHorizon 协议条件规划 size_categories: - 1000<n<10000 tags: - 实验室 - 协议条件动作预测 - 长视界规划 - 动作池 --- <div align="center"> <div style="font-size: 2em; font-weight: bold;"> LabHorizon 协议条件规划 </div> </div> <div align="center"> <img src="./assets/stanford_logo.png" width="15%" alt="logo"> </div> <div align="center"> [![Website](https://img.shields.io/badge/%F0%9F%9A%80%20Website-LabHorizon-00c2a8)](https://conglab-research.github.io/LabHorizon/)&nbsp; ![arXiv](https://img.shields.io/badge/arXiv-即将上线-b31b1b?logo=arxiv&logoColor=white)&nbsp; [![GitHub](https://img.shields.io/badge/GitHub-LabHorizon-000000?logo=github&logoColor=white)](https://github.com/CongLab-Research/LabHorizon)&nbsp; [![HF Level 1](https://img.shields.io/badge/%F0%9F%A4%97%20Dataset-Level%201%203D%20Assets-blue)](https://huggingface.co/datasets/CongLab-Research/LabHorizon-3D-Asset-Perception)&nbsp; [![HF Level 2](https://img.shields.io/badge/%F0%9F%A4%97%20Dataset-Level%202%20Planning-purple)](https://huggingface.co/datasets/CongLab-Research/LabHorizon-Protocol-Conditioned-Planning) **用于协议条件长视界实验室动作序列规划的Level 2数据** </div> --- <p align="center"> <img src="https://raw.githubusercontent.com/CongLab-Research/LabHorizon/main/assets/terser.png" alt="LabHorizon实验室资产预览图" width="100%"> </p> ## 🔎 数据集概览 本数据集为LabHorizon的**Level 2**子集。每个样本均包含真实实验上下文、规划目标、协议衍生约束、可用输入项与动作池(Action Pool)。任务目标为生成带参数与中间依赖关系的长视界实验动作序列。 本任务围绕**协议条件动作预测**设计:模型需依托协议上下文选择合法动作、维持长程动作顺序、保留数值与分类参数,并在动作间传递中间产物。 点击**Website**徽章可打开公开的LabHorizon探索工具,其中展示了典型的Level 2测试样本,包含卡片式约束、可用输入卡片、可展开的动作池卡片,以及类图形式的标准动作序列。 ## 📰 最新动态 - **2026-05-29:** 发布首个LabHorizon训练+AI智能体(AI Agent)结果。`Qwen3.6-35B-A3B(trained+agents)`的Level 2最终得分达到0.4532。 - **2026-05-28:** 更新了Level 2的公开网站演示,新增覆盖质粒DNA纯化与S-Trap蛋白质组学纯化步骤的真实测试样本。当前网站已支持以卡片形式展示约束与可用输入、以可展开卡片展示动作池,并以类图式步骤结构呈现标准动作序列。 - **2026-05-28:** 在Hugging Face平台发布LabHorizon Level 2协议条件规划数据集,包含3000个训练样本、200个测试样本、真实实验上下文、动作池与标准长视界实验动作序列。 ## ✨ 核心亮点 <table> <tr> <td align="center" width="25%">🧭<br/><b>协议上下文</b><br/><sub>真实实验场景窗口</sub></td> <td align="center" width="25%">🧰<br/><b>动作池(Action Pool)</b><br/><sub>可复用实验室动作函数</sub></td> <td align="center" width="25%">🧪<br/><b>长视界规划(Long-Horizon Planning)步骤</b><br/><sub>带依赖关系的结构化动作序列</sub></td> <td align="center" width="25%">🌳<br/><b>AST指标(抽象语法树,Abstract Syntax Tree)</b><br/><sub>动作顺序与参数校验</sub></td> </tr> </table> ## 🗂️ 数据集卡片 | 属性 | 取值 | |:---|:---| | 项目 | LabHorizon | | 层级 | Level 2:协议条件规划 | | 任务 | 长视界实验动作序列生成 | | 输入 | 上下文、目标、约束、可用输入、动作池 | | 目标 | 标准实验动作序列 | | 评估指标 | 动作序列相似度、参数准确率、最终得分 | | 训练集 | 3000个样本 | | 测试集 | 200个样本 | | 语言 | 英语 | ## 🏆 排行榜 直接提示词结果在当前`v20260510-repaired`版本的200个样本Level 2测试集上。表格按**最终得分**降序排列。 | 排名 | 模型 | 最终得分 | 动作序列相似度 | 参数准确率 | |:---:|:---|---:|---:|---:| | 🥇 | Gemini 3.1 Pro Preview | 0.3263 | 0.3195 | 0.3331 | | 🥈 | Grok 4.3 | 0.3244 | 0.3339 | 0.3148 | | 🥉 | Kimi K2.6 | 0.3150 | 0.2845 | 0.3456 | | 4 | Gemini 3.5 Flash | 0.3039 | 0.2686 | 0.3391 | | 5 | Qwen3.7 Max | 0.3003 | 0.2905 | 0.3102 | | 6 | Claude Opus 4.7 | 0.2737 | 0.2619 | 0.2856 | | 7 | GPT-5.4 | 0.2715 | 0.2191 | 0.3239 | | 8 | Qwen3.6 35B-A3B | 0.2534 | 0.2585 | 0.2483 | | 9 | Qwen3.6 Plus | 0.2526 | 0.2264 | 0.2787 | | 10 | MiMo V2.5 | 0.2491 | 0.2269 | 0.2713 | | 11 | GLM 5.1 | 0.2413 | 0.2307 | 0.2519 | | 12 | Qwen3.5 35B-A3B | 0.2391 | 0.2385 | 0.2398 | | 13 | GPT-5.5 | 0.2276 | 0.2092 | 0.2459 | | 14 | DeepSeek V4 Pro | 0.2135 | 0.1927 | 0.2342 | | 15 | Qwen3.5 9B | 0.1315 | 0.1359 | 0.1271 | ## 🧠 训练信号 本数据集包含3000个Level 2训练样本,涵盖真实协议上下文、动作池与标准实验动作序列。在我们的初始系统结果中,`Qwen/Qwen3.6-35B-A3B`在完整的6000样本LabHorizon训练集上完成训练,并结合了Actor-Simulator-Selector框架。 下表将我们的训练+AI智能体系统与同一场景下的强基线直接提示词大语言模型(Large Language Model, LLM)进行了对比,最优结果位于表格末行。 | 系统 | 动作序列相似度 | 参数准确率 | 最终得分 | |:---|---:|---:|---:| | Gemini 3.1 Pro Preview | 0.3195 | 0.3331 | 0.3263 | | Grok 4.3 | 0.3339 | 0.3148 | 0.3244 | | Kimi K2.6 | 0.2845 | 0.3456 | 0.3150 | | GPT-5.5 | 0.2092 | 0.2459 | 0.2276 | | Qwen3.6-35B-A3B(trained+agents) | **0.4485** | **0.4580** | **0.4532** | 该结果验证了LabHorizon中的**可优化学习循环**。一个成功的训练+AI智能体案例涉及患者来源肿瘤类器官的制备:系统保留了两条平行样本分支、重复执行`100 x g, 5 min, 4 C`离心操作、针对分支调整冷培养基体积,并在冰上完成病毒分装解冻。这直接验证了**长视界规划**与**真实协议对齐**能力,因为模型需要在整个序列中维持多样本、状态转换与数值约束的一致性。 剩余的错误案例同样具有参考价值:在Golden Gate热循环仪场景中,训练+AI智能体系统生成了可解析的动作,但错误地将热循环仪程序拆分为独立的孵育调用,并修改了所需的设备状态顺序。这表明训练可以提升模型对动作池的熟悉度与解析能力,但完整的协议条件规划仍需要更强的全局状态控制与推理时校验。 ## 🧾 数据架构 | 列名 | 数据类型 | 含义 | |:---|:---|:---| | `id` | 字符串 | 稳定的公开标识符,例如`LabHorizon-L2-test-000001`。 | | `context` | 字符串 | 本地协议窗口对应的实验上下文。 | | `goal` | 字符串 | 规划目标。 | | `constraints` | 字符串列表 | 协议衍生的约束与参数要求。 | | `available_inputs` | 字符串 | 规划前可用的原材料、样本或测量结果。 | | `action_pool_names` | 字符串列表 | 可用动作池函数的名称。 | | `action_pool` | 字符串 | 描述可用实验室动作的Python函数定义。 | | `gold_action_sequence` | 字符串 | 标准长视界实验动作序列。 | ## 🧑‍💻 示例用法 python from datasets import load_dataset dataset = load_dataset("CongLab-Research/LabHorizon-Protocol-Conditioned-Planning") sample = dataset["test"][0] print(sample["id"]) print(sample["context"]) print(sample["action_pool"]) print(sample["gold_action_sequence"]) ## 📏 评估方法 使用LabHorizon GitHub仓库中的官方评估代码: bash git clone https://github.com/CongLab-Research/LabHorizon cd LabHorizon python -m pip install -r requirements.txt cp .env.example .env 克隆本数据集后运行: bash python -m evaluation.level2.evaluate --data-root /path/to/data --split test --model openai/gpt-5.4 --output results/level2_gpt54.jsonl 模型的输出可以为自然语言,但评估器会从Python fenced代码块或赋值式函数调用中提取结构化动作序列。 ## 📐 评估指标 | 指标 | 含义 | |:---|:---| | `Action Sequence Similarity` | 衡量预测动作序列是否符合标准动作顺序。 | | `Parameter Accuracy` | 校验对齐动作的参数键、参数值、原始输入、生成变量与依赖映射关系。 | | `Final Score` | 动作序列相似度与参数准确率的平均值。 | 官方评估器使用Python抽象语法树(AST)解析赋值语句、函数调用、关键字参数、字面量值与变量引用。这使得动作拓扑与依赖错误得以显性化,而非将输出视为纯文本。 ## 🔗 与LabHorizon的关联 LabHorizon包含两个协同数据集: | 层级 | 数据集 | 角色 | |:---|:---|:---| | Level 1 | [LabHorizon-3D-Asset-Perception](https://huggingface.co/datasets/CongLab-Research/LabHorizon-3D-Asset-Perception) | 多视图实验室资产感知与下一步动作预测。 | | Level 2 | 本数据集 | 基于协议上下文与动作池的长视界实验动作序列规划。 | ## 📜 引用信息 即将上线...

提供机构:
CongLab-Research
搜集汇总
数据集介绍
CongLab-Research/LabHorizon-Protocol-Conditioned-Planning 数据集图片
构建方式
LabHorizon-Protocol-Conditioned-Planning 数据集由斯坦福大学实验室构建,专注于协议对齐的长程实验规划。其构建流程始于真实实验协议的窗口选择,将这些协议转化为具体的规划目标和约束条件,并与可复用的实验室动作模板进行配对。随后,通过引入参数和抽象动作树依赖关系,生成黄金标准的实验动作序列。整个过程中,质量控制的严格筛选确保了数据的可靠性,包括对难度、黄金序列一致性及AST可解析性的校验;自动验证器则进一步检查动作池模式的完整性、数据泄漏、解析可行性与变量依赖关系,最终形成包含3,000个训练样本和200个测试样本的高质量数据集。
特点
该数据集的核心特点在于其对实验室协议对齐的长程规划任务的深度支持。每个样本均提供真实的实验背景、规划目标、协议衍生的约束条件、可用输入以及一个动作池,模型需据此生成包含参数和中间依赖的连续动作序列。其独特之处在于采用抽象语法树(AST)作为度量工具,不仅评估动作序列的顺序相似性,更严格校验参数准确性,包括参数键值、原材料、生成变量及依赖映射,使得动作拓扑与依赖关系的错误得以显式呈现。此外,数据集的难度设置与真实实验场景高度吻合,如并行样本分支的保留和精确数值参数的调整,直接考验模型在复杂多步骤操作中的全局状态控制能力。
使用方法
使用该数据集时,用户可通过 Hugging Face 的 datasets 库直接加载,调用 load_dataset 函数获取训练与测试拆分。数据集以 JSON 格式提供,包含上下文、目标、约束、可用输入、动作池名称及定义、以及黄金动作序列等字段。评估环节需使用官方提供的代码库,通过命令行工具对模型预测进行评测,模型输出以 Python 代码块或函数调用形式呈现,随后由基于 AST 的评估器计算 L2 动作序列相似性、参数准确性和最终得分。此外,该数据集支持进一步的模型训练与智能体框架集成,例如结合 Actor-Simulator-Selector 架构,在训练后的模型基础上通过仿真与选择机制提升规划性能,实现优化学习闭环。
背景与挑战
背景概述
在实验室自动化与智能科研领域,将自然语言协议转换为可执行的实验操作序列是长期悬而未决的难题。为此,斯坦福大学CongLab研究团队于2026年5月发布了LabHorizon-Protocol-Conditioned-Planning数据集,作为LabHorizon项目的第二层级,专注于协议对齐的长时域规划任务。该数据集包含3000个训练样本与200个测试样本,每个样本提供真实的实验上下文、规划目标、协议约束、可用输入及可复用的动作池,要求模型生成带有参数和中间依赖关系的长序列实验操作。通过引入基于抽象语法树的评估指标,该数据集系统性地度量动作顺序与参数准确性,成为首个面向实验室场景的协议条件化规划基准,为推动科研自动化中的智能决策研究提供了关键数据支撑。
当前挑战
该数据集所解决的领域挑战在于,当前大语言模型在长时域实验规划中难以同时满足协议约束、动作顺序逻辑和参数精度,例如在肿瘤类器官制备任务中,模型需保持多分支样本流程、重复离心步骤、分支特异体积调整等多个维度的一致性。构建过程中,团队面临三重挑战:一是从真实实验室协议中提取可计算的约束与目标,需将非结构化的自然语言转化为结构化规划要素;二是设计含变量依赖与中间产物传递的可解析动作池,确保序列的拓扑正确性;三是通过自动验证器实现动作池模式检查、数据泄漏检测、解析性与变量依赖校验,以保障3000余条训练样本的质量和一致性。
常用场景
经典使用场景
LabHorizon-Protocol-Conditioned-Planning数据集的核心应用场景聚焦于协议对齐的长时序实验动作预测,为智能体在真实实验室环境中自主编排复杂操作序列提供标准化基准。该数据集以实际实验窗口为背景,将协议约束、可用输入与预定义动作池有机结合,要求模型生成带有参数依赖与中间产物的结构化实验步骤。这一任务不仅考验模型对科学协议逻辑的深层理解,更检验其在多步骤、多分支场景下维持状态一致性与动作拓扑正确性的能力,堪称实验室自主规划领域的里程碑式评测平台。
解决学术问题
该数据集精准回应了智能体在实验科学中面临的三大核心学术难题:协议遵守、长程依赖与参数保真。长期以来,现有模型在零样本场景下难以将抽象协议转化为可执行动作序列,尤其在必须管理并发样本分支、保持中间产物传递可靠性的情境中表现乏力。LabHorizon通过引入协议约束卡片、动作池定义与AST解析评估体系,系统性地量化了模型在动作顺序相似度、参数准确率及综合评分方面的表现,为理解与提升智能体在结构化科学任务中的规划能力开辟了新路径。
衍生相关工作
基于LabHorizon-Protocol-Conditioned-Planning数据集,研究者已催生出多项开创性工作。最具代表性的是Actor-Simulator-Selector智能体框架,其中经过数据微调的Qwen3.6模型作为动作执行器,结合Gemini 3.1 Pro扮演仿真器与选择器角色,在L2最终得分上较直接提示方法提升近40%。该框架通过模拟协议状态演化并筛选最优动作序列,显著增强了长时序规划中状态控制与协议对齐能力。此外,该数据集还推动了基于LoRA的高效微调方法,以及面向实验动作序列的AST解析评估工具链的发展,形成了一套完整的实验室智能体研究与评测生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务