遇见数据集

stackexchange-superuser-sandboxes-verified

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该数据集是一个包含10,000个任务的Harbor任务二值数据集,专为智能代理和强化学习场景设计。数据来源于Super User StackExchange网站上关于Linux/Windows桌面系统、硬件配置、存储管理和终端用户系统管理的计算机使用问题。每个任务包含path(路径字符串)和task_binary(gzip压缩包)两个核心字段,遵循Harbor/TaskTrove任务规范。数据集基于DCAgent/stackexchange-superuser-sandboxes-skywork-response重新打包,完整保留了原始任务指令文件(instruction.md)和统一的Ubuntu 24.04沙盒环境。关键特性在于集成了LLM-judge验证器系统(移植自OpenThoughts-Agent框架),替代了原有的奖励模型验证器。验证器在运行时读取代理生成的响应文件(/app/response.txt)和包含任务指令及评分标准的验证数据(/tests/verifier_data.json),通过litellm接口调用LLM法官(默认使用GPT-4o-mini)进行多维度评估,将0.0-1.0的奖励分数写入日志文件。验证过程需要配置OPENAI_API_KEY环境变量(通过task.toml文件传递),并可选择性地覆盖法官模型。评分标准全面覆盖技术响应的正确性、解决方案的完整性、操作的安全性和回答的相关性四个维度,专门用于评估现实世界桌面及系统管理场景的请求处理质量。该数据集适用于文本生成、智能代理训练、强化学习评估和LLM法官系统开发等任务。

This Harbor task binary dataset comprises 10,000 tasks, tailored for AI Agent and reinforcement learning scenarios. The dataset is sourced from computer usage questions related to Linux/Windows desktop systems, hardware configuration, storage management, and end-user system administration on the Super User StackExchange website. Each task includes two core fields: `path` (path string) and `task_binary` (gzip-compressed archive), adhering to the Harbor/TaskTrove task specification. The dataset is repackaged based on the DCAgent/stackexchange-superuser-sandboxes-skywork-response repository, fully retaining the original task instruction file (instruction.md) and the standardized Ubuntu 24.04 sandbox environment. Its key feature is the integration of the LLM-judge validator system, which is ported from the OpenThoughts-Agent framework, replacing the original reward model validator. During runtime, the validator reads the agent-generated response file (/app/response.txt) and the verification data containing task instructions and scoring criteria (/tests/verifier_data.json), invokes the LLM judge via the litellm interface (GPT-4o-mini is used by default) for multi-dimensional evaluation, and writes the reward score ranging from 0.0 to 1.0 into the log file. The validation process requires configuring the OPENAI_API_KEY environment variable (passed via the task.toml file), and the judge model can be optionally overridden. The scoring criteria comprehensively cover four dimensions: correctness of technical responses, completeness of solutions, operational safety, and answer relevance, and are specifically designed to evaluate the quality of request processing in real-world desktop and system administration scenarios. This dataset is applicable to tasks such as text generation, AI Agent training, reinforcement learning evaluation, and LLM judge system development.

提供机构:
LAION eV
创建时间:
2026-07-19
原始信息汇总

数据集概述:laion/stackexchange-superuser-sandboxes-verified

  • 许可证:Apache-2.0
  • 任务类别:文本生成(text-generation)
  • 标签:agent, harbor, reinforcement-learning, llm-judge

数据集内容

  • 规模:包含10,000个任务(binary task data)。
  • 数据列path(字符串类型)和 task_binary(gzip tar格式)。
  • 任务来源:基于 StackExchange 平台 Super User 板块的问题,涵盖 Linux/Windows 桌面操作、硬件、存储、终端用户系统管理等真实计算机使用场景。
  • 任务架构:遵循标准的 Harbor / TaskTrove 任务模式。
  • 数据来源与处理:从 DCAgent/stackexchange-superuser-sandboxes-skywork-response 重新打包而来;保留了原始的 instruction.md 文件和共享的 ubuntu:24.04 环境。

验证机制

  • 验证器:每个任务沙箱自带一个基于 LLM(大型语言模型)的评判验证器,源自 OpenThoughts-Agent 的 data.nemotron_gym 框架(具体文件为 verifiers/llm_judge.py),替代了原始的 Skywork 奖励模型验证器。
  • 验证流程:在验证时,脚本 tests/test_state.py 会读取 Agent 生成的 /app/response.txt 以及 /tests/verifier_data.json(包含任务指令和适配的评分准则)。随后通过 litellm 调用 LLM 评判模型(默认为 openai/gpt-4o-mini),并将评分(0.0 到 1.0 之间的奖励值)写入 /logs/verifier/reward.txt
  • 运行要求:在实验阶段需要设置 OPENAI_API_KEY 环境变量(通过 task.toml[verifier].env 配置传播给验证容器),并可通过 JUDGE_MODEL 参数覆盖默认评判模型。

评分准则

  • 针对真实世界的桌面/系统管理请求,从 正确性、完整性、安全性、相关性 四个维度进行分级评分。
搜集汇总
数据集介绍
stackexchange-superuser-sandboxes-verified 数据集图片
构建方式
该数据集源自Stack Exchange社区中Super User板块的问答内容,专注于Linux与Windows桌面环境、硬件、存储及终端用户系统管理等实际计算任务。原始数据由DCAgent/stackexchange-superuser-sandboxes-skywork-response提供,经重新封装后保留了instruction.md指令文件及统一的ubuntu:24.04沙箱环境。构建过程中,原有的Skywork奖励模型验证器被替换为基于OpenThoughts-Agent框架的LLM评判验证器,每个任务的沙箱内集成了`tests/test_state.py`脚本,通过读取agent生成的`/app/response.txt`以及包含任务指令与评分标准的`/tests/verifier_data.json`文件,调用litellm支持的LLM模型(默认使用`openai/gpt-4o-mini`)进行自动评分,最终将0.0至1.0之间的奖励值写入`/logs/verifier/reward.txt`中。
特点
该数据集共包含10,000个任务,以`path`字符串和`task_binary`压缩包形式存储,遵循Harbor/TaskTrove标准任务模式。其核心特色在于采用LLM作为评判者进行自动化验证,取代传统基于规则或小型奖励模型的评估方式,显著提升了对复杂桌面与系统管理任务完成度的评判精度。评分维度涵盖正确性、完整性、安全性与相关性四大方面,确保代理行为在真实世界场景中的实用性与可靠性。数据集的沙箱环境基于Ubuntu 24.04,提供了高度一致的仿真运行平台,便于研究者复现与对比不同代理策略的表现。
使用方法
使用该数据集时,需先配置好OpenAI API密钥(`OPENAI_API_KEY`),并通过`task.toml`文件的`[verifier].env`字段将密钥传递至验证容器;默认验证模型为`openai/gpt-4o-mini`,用户亦可设置`JUDGE_MODEL`环境变量覆盖之。任务执行过程中,agent需依据任务描述在沙箱环境中操作,并将最终结果写入`/app/response.txt`;随后验证阶段由`tests/test_state.py`调用LLM评判器对输出进行评分,生成奖励值供强化学习或评估使用。该数据集兼容Harbor框架的加载与训练流程,研究者可直接将其集成至OpenThoughts-Agent或类似系统中进行基于语言模型评判的代理学习实验。
背景与挑战
背景概述
随着大型语言模型在复杂任务执行能力上的飞速发展,如何构建可靠且可验证的智能体(Agent)行为评估基准,已成为当前强化学习与具身智能领域亟待突破的关键瓶颈。在此背景下,由LAION社区主导、基于OpenThoughts-Agent框架,于2025年构建的stackexchange-superuser-sandboxes-verified数据集应运而生。该数据集从著名的Super User StackExchange社区中精选了10,000个关于Linux/Windows桌面操作、硬件管理、存储配置及终端用户系统管理的真实问题,并创新性地引入LLM评判器替代原有的奖励模型,实现了对智能体回答在正确性、完整性、安全性和相关性上的多维度客观评分。该工作不仅为计算机使用场景下的智能体训练提供了标准化任务池,更推动了从人工标注向自动化、可复现评估范式的转变,对强化学习智能体训练与评估领域具有深远影响。
当前挑战
当前数据集面临的核心挑战集中于三个层面。其一,所解决的领域问题在于,现有的智能体基准测试多依赖静态人工规则或简单匹配,难以覆盖真实世界中系统管理员工作的复杂性和开放性,例如处理多步骤的硬件排错或权限配置,而本数据集通过社区驱动的真实问答和LLM评判机制,试图弥合模拟环境与真实桌面操作间的鸿沟。其二,构建过程中遇到的挑战体现在:将非结构化的StackExchange问答转化为具备可执行沙箱环境的标准化任务,需大量人工干预以适配容器化环境;同时,将Skywork奖励模型替换为基于LLM的评判器,面临评判标准不一致、LLM偏见引入以及API调用延迟与成本控制等技术难点。其三,在运行时要求使用商业API密钥,对研究者的经济成本和模型审计的透明度构成制约,且LLM评判器对任务指令和评分准则的语义敏感性,可能导致同一任务在不同评判模型下分数波动,影响了评估的鲁棒性。
常用场景
经典使用场景
stackexchange-superuser-sandboxes-verified 数据集专为基于 Linux/Windows 桌面、硬件、存储及终端系统管理员场景的智能体(Agent)任务设计。其经典用途是作为计算机操作任务的标准化评测基准,借助从 Super User StackExchange 社区提取的真实用户提问,构建出 10,000 个二进制判断任务。每个任务提供完整的 Ubuntu 24.04 沙箱环境,允许智能体在其中执行命令、操作文件系统,并输出响应。通过集成 LLM 评判系统,该数据集能够自动评估智能体在正确性、完整性、安全性与相关性四个维度上的表现,从而成为强化学习与行为克隆研究中不可或缺的测试平台。
解决学术问题
该数据集精准回答了学术界在智能体学习领域长期面临的真实指令泛化与安全对齐难题。传统基准测试多基于合成任务或静态问答,难以反映终端用户实际遇到的操作需求。此数据集通过来源于 Super User 的高质量社区问答,提供具有足够多样性与复杂性的系统管理任务,使研究者能够系统评估模型在文档理解、命令执行、错误诊断与操作安全性等方面的综合能力。其内置的 LLM 评判机制进一步解决了开放式任务自动评估的瓶颈,为大规模智能体训练中的奖励建模与偏好学习提供了可靠且可复现的评测方案。
衍生相关工作
此数据集衍生出了一系列在智能体学习与系统运维交叉领域的重要研究工作。基于其任务格式与 LLM 评判框架,研究者提出了诸如 Harbor 任务仓库规范和 TaskTrove 标准架构,推动了专用智能体评测体系的发展。相关工作包括基于强化学习的桌面操作策略优化、多步骤任务分解与规划、以及基于语言模型的安全行为约束研究。此外,由于数据集内嵌了来自 OpenThoughts-Agent 的 verifier 接口,它已成为许多后续研究用于对比不同奖励模型与评判策略效果的基线数据源,深刻影响了智能体泛化能力的评估方法学。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务