stackexchange-overflow-sandboxes-verified
收藏资源简介:
该数据集是一个Harbor任务二进制数据集,包含10,000个任务,每个任务由`path`(字符串路径)和`task_binary`(gzip压缩包)两列构成,遵循Harbor/TaskTrove任务模式规范。数据来源于Stack Overflow的编程问题,覆盖任何编程语言或框架,主题涉及调试、API、算法等计算机使用任务。数据集是从`DCAgent/stackexchange-overflow-sandboxes-skywork-response`重新打包而成,用LLM法官替换了原有的Skywork验证器,同时保留了`instruction.md`文件和共享的`ubuntu:24.04`环境。每个任务沙箱内置一个从OpenThoughts-Agent `data.nemotron_gym`框架移植的LLM-judge验证器(`verifiers/llm_judge.py`),在验证阶段通过`litellm`调用LLM法官(默认使用`openai/gpt-4o-mini`模型),根据正确性、完整性、清晰度和相关性等评分标准对编程问答进行评估,并输出0.0到1.0之间的奖励分数。使用数据集进行试验时需要提供`OPENAI_API_KEY`,可通过`task.toml`配置文件中的`[verifier].env`设置环境变量,并可选地通过`JUDGE_MODEL`覆盖模型选择。该数据集适用于文本生成、代理系统、强化学习和LLM评估等任务场景。
This dataset is a Harbor task binary dataset containing 10,000 tasks, each consisting of two columns: `path` (string path) and `task_binary` (gzip-compressed archive), following the Harbor/TaskTrove task pattern specification. This dataset is sourced from programming questions on Stack Overflow, covering all programming languages and frameworks, with topics including debugging, APIs, algorithms and other computer-related programming tasks. It is repackaged from `DCAgent/stackexchange-overflow-sandboxes-skywork-response`, where the original Skywork verifier was replaced with an LLM judge, while retaining the `instruction.md` file and the shared `ubuntu:24.04` environment. Each task sandbox embeds an LLM-judge verifier ported from the OpenThoughts-Agent `data.nemotron_gym` framework, located at `verifiers/llm_judge.py`. During the validation phase, the LLM judge is invoked via `litellm`, with the default model being `openai/gpt-4o-mini`, which evaluates programming question-answer pairs against scoring criteria including correctness, completeness, clarity and relevance, and outputs a reward score ranging from 0.0 to 1.0. To run experiments with this dataset, an `OPENAI_API_KEY` must be provided. This can be configured via the `[verifier].env` field in the `task.toml` configuration file, and the default model can be optionally overridden using the `JUDGE_MODEL` environment variable. This dataset is applicable to task scenarios such as text generation, agent systems, reinforcement learning and LLM evaluation.
数据集概述:laion/stackexchange-overflow-sandboxes-verified
- 许可证:Apache-2.0
- 任务类别:文本生成(text-generation)
- 标签:agent, harbor, reinforcement-learning, llm-judge
数据集描述
该数据集是Harbor任务的二进制数据集(包含10,000个任务),遵循Harbor/TaskTrove任务格式:
- 列:
path(字符串)和task_binary(gzip tar 格式)
任务来源与构建
- 任务内容:来自 Stack Overflow 的计算机使用编程问题,涵盖多种语言/框架,包括调试、API、算法等。
- 来源:从
DCAgent/stackexchange-overflow-sandboxes-skywork-response重新打包,替换了Skywork验证器,改用LLM评判器。 - 环境文件:保留
instruction.md和共享的ubuntu:24.04环境。
验证机制
- LLM评判器:每个任务沙盒内嵌了从OpenThoughts-Agent框架移植的LLM-judge验证器(
verifiers/llm_judge.py)。 - 验证流程:
- 调用
tests/test_state.py读取代理的/app/response.txt和/tests/verifier_data.json(包含任务指令和评分标准)。 - 通过
litellm调用LLM评判器(默认模型为openai/gpt-4o-mini)。 - 输出 0.0 到 1.0 的奖励值至
/logs/verifier/reward.txt。
- 调用
- 运行时要求:
- 必须设置
OPENAI_API_KEY以进行评判。 - 可通过
JUDGE_MODEL环境变量覆盖默认的评判模型(环境变量通过task.toml中的[verifier].env传递给验证器容器)。
- 必须设置
评分标准
LLM评判器基于以下维度对编程问答进行评分:
- 正确性(correctness)
- 完整性(completeness)
- 清晰度(clarity)
- 相关性(relevance)




