CongLab-Research/LabHorizon-Protocol-Conditioned-Planning
收藏资源简介:
该数据集是LabHorizon项目的Level 2部分,专注于协议条件下的长视野实验室动作序列规划。每个数据示例包含真实世界的实验上下文、规划目标、协议派生的约束条件、可用输入以及动作池。目标是生成具有参数和中间依赖关系的长视野实验动作序列。任务围绕“协议条件动作预测”设计,要求模型利用协议上下文选择有效动作,保持长范围顺序,保留数值和分类参数,并在动作之间传递中间产物。数据集包含3,000个训练样本和200个测试样本,输入包括上下文、目标、约束、可用输入和动作池,输出为黄金实验动作序列。评估指标包括动作序列相似性、参数准确性和最终得分。数据集旨在促进实验室自动化中的长视野规划和真实世界协议对齐研究。
--- license: MIT许可证 task_categories: - 文本生成 language: - 英语 pretty_name: LabHorizon 协议条件规划 size_categories: - 1000<n<10000 tags: - 实验室 - 协议条件动作预测 - 长视界规划 - 动作池 --- <div align="center"> <div style="font-size: 2em; font-weight: bold;"> LabHorizon 协议条件规划 </div> </div> <div align="center"> <img src="./assets/stanford_logo.png" width="15%" alt="logo"> </div> <div align="center"> [](https://conglab-research.github.io/LabHorizon/)  [](https://github.com/CongLab-Research/LabHorizon) [](https://huggingface.co/datasets/CongLab-Research/LabHorizon-3D-Asset-Perception) [](https://huggingface.co/datasets/CongLab-Research/LabHorizon-Protocol-Conditioned-Planning) **用于协议条件长视界实验室动作序列规划的Level 2数据** </div> --- <p align="center"> <img src="https://raw.githubusercontent.com/CongLab-Research/LabHorizon/main/assets/terser.png" alt="LabHorizon实验室资产预览图" width="100%"> </p> ## 🔎 数据集概览 本数据集为LabHorizon的**Level 2**子集。每个样本均包含真实实验上下文、规划目标、协议衍生约束、可用输入项与动作池(Action Pool)。任务目标为生成带参数与中间依赖关系的长视界实验动作序列。 本任务围绕**协议条件动作预测**设计:模型需依托协议上下文选择合法动作、维持长程动作顺序、保留数值与分类参数,并在动作间传递中间产物。 点击**Website**徽章可打开公开的LabHorizon探索工具,其中展示了典型的Level 2测试样本,包含卡片式约束、可用输入卡片、可展开的动作池卡片,以及类图形式的标准动作序列。 ## 📰 最新动态 - **2026-05-29:** 发布首个LabHorizon训练+AI智能体(AI Agent)结果。`Qwen3.6-35B-A3B(trained+agents)`的Level 2最终得分达到0.4532。 - **2026-05-28:** 更新了Level 2的公开网站演示,新增覆盖质粒DNA纯化与S-Trap蛋白质组学纯化步骤的真实测试样本。当前网站已支持以卡片形式展示约束与可用输入、以可展开卡片展示动作池,并以类图式步骤结构呈现标准动作序列。 - **2026-05-28:** 在Hugging Face平台发布LabHorizon Level 2协议条件规划数据集,包含3000个训练样本、200个测试样本、真实实验上下文、动作池与标准长视界实验动作序列。 ## ✨ 核心亮点 <table> <tr> <td align="center" width="25%">🧭<br/><b>协议上下文</b><br/><sub>真实实验场景窗口</sub></td> <td align="center" width="25%">🧰<br/><b>动作池(Action Pool)</b><br/><sub>可复用实验室动作函数</sub></td> <td align="center" width="25%">🧪<br/><b>长视界规划(Long-Horizon Planning)步骤</b><br/><sub>带依赖关系的结构化动作序列</sub></td> <td align="center" width="25%">🌳<br/><b>AST指标(抽象语法树,Abstract Syntax Tree)</b><br/><sub>动作顺序与参数校验</sub></td> </tr> </table> ## 🗂️ 数据集卡片 | 属性 | 取值 | |:---|:---| | 项目 | LabHorizon | | 层级 | Level 2:协议条件规划 | | 任务 | 长视界实验动作序列生成 | | 输入 | 上下文、目标、约束、可用输入、动作池 | | 目标 | 标准实验动作序列 | | 评估指标 | 动作序列相似度、参数准确率、最终得分 | | 训练集 | 3000个样本 | | 测试集 | 200个样本 | | 语言 | 英语 | ## 🏆 排行榜 直接提示词结果在当前`v20260510-repaired`版本的200个样本Level 2测试集上。表格按**最终得分**降序排列。 | 排名 | 模型 | 最终得分 | 动作序列相似度 | 参数准确率 | |:---:|:---|---:|---:|---:| | 🥇 | Gemini 3.1 Pro Preview | 0.3263 | 0.3195 | 0.3331 | | 🥈 | Grok 4.3 | 0.3244 | 0.3339 | 0.3148 | | 🥉 | Kimi K2.6 | 0.3150 | 0.2845 | 0.3456 | | 4 | Gemini 3.5 Flash | 0.3039 | 0.2686 | 0.3391 | | 5 | Qwen3.7 Max | 0.3003 | 0.2905 | 0.3102 | | 6 | Claude Opus 4.7 | 0.2737 | 0.2619 | 0.2856 | | 7 | GPT-5.4 | 0.2715 | 0.2191 | 0.3239 | | 8 | Qwen3.6 35B-A3B | 0.2534 | 0.2585 | 0.2483 | | 9 | Qwen3.6 Plus | 0.2526 | 0.2264 | 0.2787 | | 10 | MiMo V2.5 | 0.2491 | 0.2269 | 0.2713 | | 11 | GLM 5.1 | 0.2413 | 0.2307 | 0.2519 | | 12 | Qwen3.5 35B-A3B | 0.2391 | 0.2385 | 0.2398 | | 13 | GPT-5.5 | 0.2276 | 0.2092 | 0.2459 | | 14 | DeepSeek V4 Pro | 0.2135 | 0.1927 | 0.2342 | | 15 | Qwen3.5 9B | 0.1315 | 0.1359 | 0.1271 | ## 🧠 训练信号 本数据集包含3000个Level 2训练样本,涵盖真实协议上下文、动作池与标准实验动作序列。在我们的初始系统结果中,`Qwen/Qwen3.6-35B-A3B`在完整的6000样本LabHorizon训练集上完成训练,并结合了Actor-Simulator-Selector框架。 下表将我们的训练+AI智能体系统与同一场景下的强基线直接提示词大语言模型(Large Language Model, LLM)进行了对比,最优结果位于表格末行。 | 系统 | 动作序列相似度 | 参数准确率 | 最终得分 | |:---|---:|---:|---:| | Gemini 3.1 Pro Preview | 0.3195 | 0.3331 | 0.3263 | | Grok 4.3 | 0.3339 | 0.3148 | 0.3244 | | Kimi K2.6 | 0.2845 | 0.3456 | 0.3150 | | GPT-5.5 | 0.2092 | 0.2459 | 0.2276 | | Qwen3.6-35B-A3B(trained+agents) | **0.4485** | **0.4580** | **0.4532** | 该结果验证了LabHorizon中的**可优化学习循环**。一个成功的训练+AI智能体案例涉及患者来源肿瘤类器官的制备:系统保留了两条平行样本分支、重复执行`100 x g, 5 min, 4 C`离心操作、针对分支调整冷培养基体积,并在冰上完成病毒分装解冻。这直接验证了**长视界规划**与**真实协议对齐**能力,因为模型需要在整个序列中维持多样本、状态转换与数值约束的一致性。 剩余的错误案例同样具有参考价值:在Golden Gate热循环仪场景中,训练+AI智能体系统生成了可解析的动作,但错误地将热循环仪程序拆分为独立的孵育调用,并修改了所需的设备状态顺序。这表明训练可以提升模型对动作池的熟悉度与解析能力,但完整的协议条件规划仍需要更强的全局状态控制与推理时校验。 ## 🧾 数据架构 | 列名 | 数据类型 | 含义 | |:---|:---|:---| | `id` | 字符串 | 稳定的公开标识符,例如`LabHorizon-L2-test-000001`。 | | `context` | 字符串 | 本地协议窗口对应的实验上下文。 | | `goal` | 字符串 | 规划目标。 | | `constraints` | 字符串列表 | 协议衍生的约束与参数要求。 | | `available_inputs` | 字符串 | 规划前可用的原材料、样本或测量结果。 | | `action_pool_names` | 字符串列表 | 可用动作池函数的名称。 | | `action_pool` | 字符串 | 描述可用实验室动作的Python函数定义。 | | `gold_action_sequence` | 字符串 | 标准长视界实验动作序列。 | ## 🧑💻 示例用法 python from datasets import load_dataset dataset = load_dataset("CongLab-Research/LabHorizon-Protocol-Conditioned-Planning") sample = dataset["test"][0] print(sample["id"]) print(sample["context"]) print(sample["action_pool"]) print(sample["gold_action_sequence"]) ## 📏 评估方法 使用LabHorizon GitHub仓库中的官方评估代码: bash git clone https://github.com/CongLab-Research/LabHorizon cd LabHorizon python -m pip install -r requirements.txt cp .env.example .env 克隆本数据集后运行: bash python -m evaluation.level2.evaluate --data-root /path/to/data --split test --model openai/gpt-5.4 --output results/level2_gpt54.jsonl 模型的输出可以为自然语言,但评估器会从Python fenced代码块或赋值式函数调用中提取结构化动作序列。 ## 📐 评估指标 | 指标 | 含义 | |:---|:---| | `Action Sequence Similarity` | 衡量预测动作序列是否符合标准动作顺序。 | | `Parameter Accuracy` | 校验对齐动作的参数键、参数值、原始输入、生成变量与依赖映射关系。 | | `Final Score` | 动作序列相似度与参数准确率的平均值。 | 官方评估器使用Python抽象语法树(AST)解析赋值语句、函数调用、关键字参数、字面量值与变量引用。这使得动作拓扑与依赖错误得以显性化,而非将输出视为纯文本。 ## 🔗 与LabHorizon的关联 LabHorizon包含两个协同数据集: | 层级 | 数据集 | 角色 | |:---|:---|:---| | Level 1 | [LabHorizon-3D-Asset-Perception](https://huggingface.co/datasets/CongLab-Research/LabHorizon-3D-Asset-Perception) | 多视图实验室资产感知与下一步动作预测。 | | Level 2 | 本数据集 | 基于协议上下文与动作池的长视界实验动作序列规划。 | ## 📜 引用信息 即将上线...




