遇见数据集

stackexchange-overflow-sandboxes-verified

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

该数据集是一个Harbor任务二进制数据集,包含10,000个任务,每个任务由`path`(字符串路径)和`task_binary`(gzip压缩包)两列构成,遵循Harbor/TaskTrove任务模式规范。数据来源于Stack Overflow的编程问题,覆盖任何编程语言或框架,主题涉及调试、API、算法等计算机使用任务。数据集是从`DCAgent/stackexchange-overflow-sandboxes-skywork-response`重新打包而成,用LLM法官替换了原有的Skywork验证器,同时保留了`instruction.md`文件和共享的`ubuntu:24.04`环境。每个任务沙箱内置一个从OpenThoughts-Agent `data.nemotron_gym`框架移植的LLM-judge验证器(`verifiers/llm_judge.py`),在验证阶段通过`litellm`调用LLM法官(默认使用`openai/gpt-4o-mini`模型),根据正确性、完整性、清晰度和相关性等评分标准对编程问答进行评估,并输出0.0到1.0之间的奖励分数。使用数据集进行试验时需要提供`OPENAI_API_KEY`,可通过`task.toml`配置文件中的`[verifier].env`设置环境变量,并可选地通过`JUDGE_MODEL`覆盖模型选择。该数据集适用于文本生成、代理系统、强化学习和LLM评估等任务场景。

This dataset is a Harbor task binary dataset containing 10,000 tasks, each consisting of two columns: `path` (string path) and `task_binary` (gzip-compressed archive), following the Harbor/TaskTrove task pattern specification. This dataset is sourced from programming questions on Stack Overflow, covering all programming languages and frameworks, with topics including debugging, APIs, algorithms and other computer-related programming tasks. It is repackaged from `DCAgent/stackexchange-overflow-sandboxes-skywork-response`, where the original Skywork verifier was replaced with an LLM judge, while retaining the `instruction.md` file and the shared `ubuntu:24.04` environment. Each task sandbox embeds an LLM-judge verifier ported from the OpenThoughts-Agent `data.nemotron_gym` framework, located at `verifiers/llm_judge.py`. During the validation phase, the LLM judge is invoked via `litellm`, with the default model being `openai/gpt-4o-mini`, which evaluates programming question-answer pairs against scoring criteria including correctness, completeness, clarity and relevance, and outputs a reward score ranging from 0.0 to 1.0. To run experiments with this dataset, an `OPENAI_API_KEY` must be provided. This can be configured via the `[verifier].env` field in the `task.toml` configuration file, and the default model can be optionally overridden using the `JUDGE_MODEL` environment variable. This dataset is applicable to task scenarios such as text generation, agent systems, reinforcement learning and LLM evaluation.

提供机构:
LAION eV
创建时间:
2026-07-20
原始信息汇总

数据集概述:laion/stackexchange-overflow-sandboxes-verified

  • 许可证:Apache-2.0
  • 任务类别:文本生成(text-generation)
  • 标签:agent, harbor, reinforcement-learning, llm-judge

数据集描述

该数据集是Harbor任务的二进制数据集(包含10,000个任务),遵循Harbor/TaskTrove任务格式:

  • path(字符串)和 task_binary(gzip tar 格式)

任务来源与构建

  • 任务内容:来自 Stack Overflow 的计算机使用编程问题,涵盖多种语言/框架,包括调试、API、算法等。
  • 来源:从 DCAgent/stackexchange-overflow-sandboxes-skywork-response 重新打包,替换了Skywork验证器,改用LLM评判器。
  • 环境文件:保留 instruction.md 和共享的 ubuntu:24.04 环境。

验证机制

  • LLM评判器:每个任务沙盒内嵌了从OpenThoughts-Agent框架移植的LLM-judge验证器(verifiers/llm_judge.py)。
  • 验证流程
    • 调用 tests/test_state.py 读取代理的 /app/response.txt/tests/verifier_data.json(包含任务指令和评分标准)。
    • 通过 litellm 调用LLM评判器(默认模型为 openai/gpt-4o-mini)。
    • 输出 0.0 到 1.0 的奖励值至 /logs/verifier/reward.txt
  • 运行时要求
    • 必须设置 OPENAI_API_KEY 以进行评判。
    • 可通过 JUDGE_MODEL 环境变量覆盖默认的评判模型(环境变量通过 task.toml 中的 [verifier].env 传递给验证器容器)。

评分标准

LLM评判器基于以下维度对编程问答进行评分:

  • 正确性(correctness)
  • 完整性(completeness)
  • 清晰度(clarity)
  • 相关性(relevance)
搜集汇总
数据集介绍
stackexchange-overflow-sandboxes-verified 数据集图片
构建方式
该数据集源自DCAgent/stackexchange-overflow-sandboxes-skywork-response,针对Stack Overflow平台上的编程问答内容进行重新包装与验证。原始数据中的Skywork验证器被替换为基于大语言模型的裁判系统(LLM judge),保留了原有的指令文件(instruction.md)与共享的Ubuntu 24.04沙盒环境。每个任务沙盒内部集成了从OpenThoughts-Agent框架移植的LLM裁判验证器,通过读取智能体生成的响应文件与预置的验证数据,调用litellm接口(默认使用openai/gpt-4o-mini)进行评分,最终输出0.0至1.0的奖励值。整个过程需在运行时提供OPENAI_API_KEY,并可通过JUDGE_MODEL参数指定评估模型。
使用方法
使用该数据集时,用户需在运行时配置OPENAI_API_KEY环境变量,该变量将通过任务配置文件自动传递至验证器容器。用户可选择通过JUDGE_MODEL参数自定义评估所用的语言模型。每个任务在沙盒中执行后,验证器会读取智能体生成的响应文件与任务指令及评分标准,调用指定的LLM进行评判,最终将奖励值写入日志文件。该数据集适用于文本生成、智能体行为优化及基于强化学习的反馈系统开发,可无缝接入Harbor框架进行实验与迭代。
背景与挑战
背景概述
该数据集由LAION团队于近期创建,旨在利用Stack Overflow平台上的编程问题(涵盖调试、API调用、算法设计等多个维度)构建一套面向计算机使用任务的评测基准。其核心研究问题聚焦于如何将大型语言模型(LLM)作为评判者(LLM judge)来替代传统规则验证器,以更灵活地评估智能体在复杂编程问答场景中的表现。通过从现有数据集迁移并重构,该资源为强化学习与智能体训练提供了10,000个标准化任务,推动了Harbor/TaskTrove任务架构在开放研究中的应用,对代码合成、自主编程及LLM风险评估领域具有潜在影响力。
当前挑战
该数据集主要面临两大挑战:其一,所解决的领域问题在于编程智能体任务的自动化评估困难——传统静态测试无法有效衡量回答的正确性、完整性与清晰度,而基于LLM的评判虽灵活,却受限于评估模型本身的偏差与一致性。其二,构建过程中需重点解决数据迁移与验证器适配问题,包括将原Skywork验证器替换为LLM judge后,需确保`instruction.md`与共享环境`ubuntu:24.04`的兼容性,同时协调`litellm`调用默认`gpt-4o-mini`时的API密钥依赖及模型微调开销,以维持评测任务的稳定与可复现性。
常用场景
经典使用场景
在智能体与强化学习交叉的研究领域中,stackexchange-overflow-sandboxes-verified数据集常被用于构建和评估基于LLM的编程辅助智能体。研究者通过该数据集提供的7,000个来自Stack Overflow的编程问答任务,模拟真实世界中的软件开发者工作流。每个任务都封装在一个标准化的Ubuntu沙箱环境中,配备由LLM Judge驱动的自动化验证器,使得智能体在完成编程调试、API调用或算法实现等任务后,能够获得一个0到1之间的连续奖励信号,从而支持高效的强化学习训练与评估。
解决学术问题
该数据集精准地回应了当前智能体研究中的核心痛点——如何在复杂、开放式的编程场景中对智能体的表现进行可靠且自动化的评估。传统的静态测试集往往难以捕捉真实编程任务中的多解性和评判维度,而本项目采用LLM Judge作为验证器,从正确性、完整性、清晰度和相关性四个维度对智能体的输出进行综合评分,显著提升了评估的鲁棒性与语义理解能力。这一范式为解决智能体训练中奖励稀疏、反馈噪声大等经典难题提供了切实可行的方案,推动了基于高保真模拟环境的LLM训练方法论的发展。
实际应用
在工业实践中,该数据集展现出显著的实用价值,尤其适用于构建企业级自动化代码审查系统和智能编程助手。例如,开发团队可以利用该数据集训练一个能够自主诊断并修复软件缺陷的AI Agent,其核心能力来源于数据集中丰富的调试类问答样例。同时,由于每个任务都配备了标准化的沙箱环境与可调用的LLM Judge接口,该数据集成为了快速原型验证和对比不同智能体架构(如ReAct、Plan-and-Solve)的理想基准平台,极大地降低了从研究到工程落地的迁移成本。
数据集最近研究
最新研究方向
当前,基于语言模型的智能体研究正从静态基准测试向动态、可验证的交互式环境演进。stackexchange-overflow-sandboxes-verified数据集应运而生,它从Stack Overflow真实编程问题中提炼出10,000个计算机使用任务,覆盖调试、API调用、算法实现等多维度场景,为强化学习与LLM-judge驱动的智能体训练提供了高质量的沙盒环境。该数据集的核心突破在于引入LLM法官作为验证器,取代传统的Skywork验证方法,实现了对智能体解决方案在正确性、完整性、清晰度与相关性上的自动化评分。这一设计紧密关联OpenThoughts-Agent框架,推动了基于Nemotron-gym范式的智能体学习,尤其适用于需要开放性回答的编程问答场景。通过标准化的instruction.md与共享的ubuntu:24.04环境,该数据集降低了实验复现的门槛,为构建可靠、可泛化的编程智能体奠定了数据基础,代表了智能体研究向真实世界任务迁移的重要一步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务