遇见数据集

stackexchange-unix-sandboxes-verified

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

laion/stackexchange-unix-sandboxes-verified是一个包含10,000个计算机使用任务的数据集,专为Harbor/TaskTrove任务框架设计。它基于Unix & Linux StackExchange的实际问题构建,涵盖shell命令、CLI工具、文件系统和Linux/BSD系统管理等主题。数据集从DCAgent/stackexchange-unix-sandboxes-skywork-response重新打包而来,保留了原始的任务指令文件(instruction.md)和共享的ubuntu:24.04运行环境,但将原有的Skywork奖励模型验证器替换为LLM法官验证器。每个任务包含两列数据:path(字符串类型)和task_binary(gzip压缩包格式)。核心特点是每个任务沙箱都集成了从OpenThoughts-Agent框架移植的LLM法官验证器(verifiers/llm_judge.py)。在验证阶段,系统读取代理生成的/app/response.txt文件以及/tests/verifier_data.json文件(包含任务指令和适配的评分标准),通过litellm调用LLM法官(默认使用openai/gpt-4o-mini模型)进行评估,最终将0.0-1.0的奖励分数写入/logs/verifier/reward.txt。使用该数据集需要配置OPENAI_API_KEY(通过task.toml中的[verifier].env设置传播到验证器容器),并可通过JUDGE_MODEL环境变量覆盖默认的法官模型。评分标准围绕Unix/Linux shell请求的正确性、完整性、安全性和相关性四个维度制定。数据集适用于文本生成、智能体开发、强化学习以及LLM评估等任务场景。

laion/stackexchange-unix-sandboxes-verified is a dataset containing 10,000 computer usage tasks, specifically designed for the Harbor/TaskTrove task framework. It is built based on real-world problems from Unix & Linux StackExchange, covering topics such as shell commands, CLI tools, file systems, and Linux/BSD system management. The dataset is repackaged from DCAgent/stackexchange-unix-sandboxes-skywork-response, retaining the original task instruction files (instruction.md) and the shared ubuntu:24.04 runtime environment, but replacing the original Skywork reward model verifier with an LLM judge verifier. Each task includes two columns of data: path (string type) and task_binary (gzip compressed format). The core feature is that each task sandbox integrates an LLM judge verifier (verifiers/llm_judge.py) ported from the OpenThoughts-Agent framework. During the verification phase, the system reads the agent-generated /app/response.txt file and the /tests/verifier_data.json file (containing task instructions and adapted scoring criteria), then evaluates via litellm calling the LLM judge (default using the openai/gpt-4o-mini model), ultimately writing a reward score of 0.0-1.0 to /logs/verifier/reward.txt. Using this dataset requires configuring OPENAI_API_KEY (propagated to the verifier container via [verifier].env settings in task.toml), and the default judge model can be overridden via the JUDGE_MODEL environment variable. Scoring criteria are formulated around four dimensions: correctness, completeness, safety, and relevance of Unix/Linux shell requests. The dataset is suitable for tasks such as text generation, agent development, reinforcement learning, and LLM evaluation.

提供机构:
LAION eV
创建时间:
2026-07-20
原始信息汇总

数据集概述:laion/stackexchange-unix-sandboxes-verified

该数据集是一个面向文本生成任务(text-generation)的二进制任务集合,专注于Unix/Linux系统管理的计算机使用场景。

基本信息

  • 许可协议: Apache-2.0
  • 任务类别: 文本生成(text-generation)
  • 标签: agent, harbor, reinforcement-learning, llm-judge
  • 数据集规模: 包含10,000个任务

数据来源与格式

  • 数据源自 Unix & Linux StackExchange 社区的问题,主题涵盖shell脚本、CLI工具、文件系统和Linux/BSD系统管理。
  • 数据重新打包自 DCAgent/stackexchange-unix-sandboxes-skywork-response,保留了原始 instruction.md 和共享的 ubuntu:24.04 环境。
  • 数据格式采用 Harbor / TaskTrove 任务schema,包含两个字段:
    • path(字符串)
    • task_binary(gzip tar 文件)

验证机制

  • 数据集使用LLM评估器(LLM judge)替代了原始的Skywork奖励模型。
  • 每个任务的沙箱环境包含一个来自OpenThoughts-Agent data.nemotron_gym 框架的LLM-judge验证器(verifiers/llm_judge.py)。
  • 验证流程:
    1. 在验证时,tests/test_state.py 读取agent生成的 /app/response.txt/tests/verifier_data.json(包含任务指令和评分标准)。
    2. 通过 litellm 调用LLM judge(默认模型为 openai/gpt-4o-mini)。
    3. 将0.0-1.0的奖励值写入 /logs/verifier/reward.txt

使用要求

  • 运行验证需要设置环境变量 OPENAI_API_KEY,该变量会通过 task.toml 中的 [verifier].env 传播到验证器容器。
  • 可选地,可以通过 JUDGE_MODEL 环境变量覆盖默认的LLM模型。

评估标准

LLM judge的评分基于以下四个维度:

  • 正确性(correctness)
  • 完整性(completeness)
  • 安全性(safety)
  • 相关性(relevance)
搜集汇总
数据集介绍
stackexchange-unix-sandboxes-verified 数据集图片
构建方式
该数据集源自Unix & Linux StackExchange社区中的技术问答,专注于计算机使用任务,涵盖Shell命令、CLI工具、文件系统及Linux/BSD系统管理等领域。原始数据来自DCAgent/stackexchange-unix-sandboxes-skywork-response,经重新打包后保留了instruction.md文件及共享的ubuntu:24.04沙箱环境。原本依赖Skywork奖励模型进行验证,现已被替换为基于大语言模型(LLM)的裁判机制。每个任务的沙箱环境内置了从OpenThoughts-Agent框架迁移的LLM裁判验证器,通过tests/test_state.py读取代理的响应文件及任务指令与评分标准,调用litellm默认使用gpt-4o-mini模型进行评估,生成介于0.0至1.0之间的奖励分数。
特点
本数据集包含一万个任务样本,采用Harbor任务格式,具备path与task_binary两个关键字段。其突出特点在于引入LLM裁判作为奖励模型,替代了传统的自动验证手段,从而能够对Unix/Linux Shell请求的正确性、完整性、安全性和相关性进行多维度综合评估。每个任务均在统一的Ubuntu 24.04沙箱中执行,高度模拟真实系统管理场景。数据集遵循Apache-2.0开源许可,适用于文本生成、强化学习及智能体训练等方向,尤其适合需要细粒度奖励信号的研究场景。
使用方法
使用该数据集前需配置OpenAI API密钥,因为在验证阶段将通过litellm调用默认的gpt-4o-mini模型进行LLM裁判评估。用户可通过task.toml中的[verifier].env传递OPENAI_API_KEY至验证容器,并选择性设置JUDGE_MODEL覆盖默认模型。在推理时,智能体需将响应写入/app/response.txt,验证器将读取该文件并结合预置的评分标准进行打分,最终奖励分数写入/logs/verifier/reward.txt。该数据集可直接加载至Harbor框架中用于强化学习或智能体训练,支持通过标准Harbor工具进行任务获取与评估。
背景与挑战
背景概述
在自然语言处理与智能体系统交叉融合的前沿领域,基于大规模指令数据集的强化学习训练已成为提升语言模型工具使用能力的核心途径。该stackexchange-unix-sandboxes-verified数据集由LAION团队于近期构建,源自Unix & Linux StackExchange平台上的实际技术问答,旨在为计算机操作任务(如shell指令、CLI工具、文件系统管理及Linux/BSD系统运维)提供高质量的沙箱验证环境。研究团队将原始问答重新封装为符合Harbor / TaskTrove规范的二元任务格式,并引入基于GPT-4o-mini的LLM裁判替代传统奖励模型,从而在10,000个任务规模上实现了对智能体操作正确性与安全性的自动化评估。该数据集因其真实领域任务来源与标准化验证流程,对推动面向计算机操作的语言智能体研究具有重要参考价值。
当前挑战
当前数据集面临的核心挑战集中在两个层面。在领域问题层面,计算机操作任务要求智能体不仅理解自然语言指令,还需精确执行复杂shell命令、管理文件系统并处理多步骤系统运维场景,这对模型的工具调用能力与鲁棒性提出了极高要求。在数据集构建层面,验证过程依赖于OpenAI API的外部调用,这带来了运行成本、密钥安全性与模型版本一致性等工程挑战;此外,LLM裁判的评分标准(正确性、完整性、安全性、相关性)是否在不同任务间保持公平客观,以及沙箱环境在Ubuntu 24.04上的可重复性,均是亟需解决的关键问题。
常用场景
经典使用场景
在智能体与强化学习领域,该数据集被广泛用于训练和评估基于文本生成指令的计算机操作智能体。研究人员将Unix与Linux StackExchange上的真实用户问题转化为可执行的沙盒任务,要求智能体在Ubuntu 24.04环境中完成诸如shell命令执行、CLI工具调用、文件系统操作及系统管理等典型场景。通过提供标准化的任务描述与验证框架,该数据集成为衡量智能体在真实Linux环境下自主操作能力的经典基准,尤其适合用于行为克隆、强化学习微调以及基于大语言模型的指令跟随能力测试。
解决学术问题
该数据集系统性地解决了计算机操作智能体研究中长期存在的两大挑战:缺乏真实场景验证环境和任务评判标准主观化。通过将社区问答转化为可复现的沙盒任务,并引入基于大语言模型评判的自动评估机制,研究者得以量化智能体在正确性、完整性、安全性及相关性四个维度的表现。这一设计有效消除了传统人工评估中的偏差,推动了从简单对话理解到复杂环境交互的范式转变,为构建自主操作系统代理提供了可度量的性能基准,进而促进了强化学习与语言模型在系统管理领域的交叉融合。
衍生相关工作
基于该数据集衍生出的里程碑工作包括OpenThoughts-Agent框架中集成的系统命令推理与验证模块,其创新性地将大语言模型评判机制引入计算机操作任务的自动评估。后续研究者在此基础上提出了分层强化学习方案,通过沙盒环境反馈优化智能体的长期规划能力。另有工作探索了多智能体协作场景,让多个智能体分别负责命令解析、环境检测与结果验证,显著提升了复杂系统任务的完成成功率。此外,数据集的沙盒标准化格式被TaskTrove项目采纳,成为其任务架构的核心参考,推动了计算机操作基准的统一化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务