stackexchange-codereview-sandboxes-verified
收藏资源简介:
该数据集名为laion/stackexchange-codereview-sandboxes-verified,是一个Harbor任务二进制数据集,专为文本生成和代理任务设计,特别适用于强化学习场景。数据集包含10,000个任务,每个任务由path(字符串类型)和task_binary(gzip压缩的tar格式)两列组成,遵循标准的Harbor/TaskTrove任务模式。数据来源于StackExchange的Code Review板块,其中用户提交工作代码供审查,数据集从DCAgent/stackexchange-codereview-sandboxes-skywork-response重新打包而来,用LLM评判器替换了原有的Skywork验证器,同时保留了任务指令文件instruction.md和共享的ubuntu:24.04环境。每个任务都集成了一个LLM评判验证器,该验证器基于OpenThoughts-Agent框架的verifiers/llm_judge.py实现。在验证过程中,系统会读取代理生成的/app/response.txt文件以及/tests/verifier_data.json(包含任务指令和适配的评分标准),通过litellm调用LLM评判器(默认使用openai/gpt-4o-mini模型)进行评估,并将一个0.0到1.0之间的奖励分数写入/logs/verifier/reward.txt。使用该数据集需要提供OPENAI_API_KEY,该密钥通过task.toml中的环境变量配置传递给验证器容器,用户还可以通过JUDGE_MODEL可选参数覆盖默认的LLM模型。评分标准涵盖代码审查的多个维度,包括正确性、洞察力、可操作性和相关性。该数据集适用于训练和评估强化学习代理、模拟代码审查任务以及开发基于LLM的自动评判系统。
数据集概述
- 数据集名称: laion/stackexchange-codereview-sandboxes-verified
- 许可证: Apache-2.0
- 任务类别: 文本生成 (text-generation)
数据集内容
该数据集包含 10,000 个任务,属于 Harbor 任务二元分类数据集。每个任务包含两列:
path(字符串类型)task_binary(gzip tar 格式)
数据来源与构建
- 任务来自 Code Review StackExchange 帖子,内容为用户提交工作代码以寻求审查。
- 数据从
DCAgent/stackexchange-codereview-sandboxes-skywork-response重新打包,将原有的 Skywork 验证器替换为 LLM 法官。 - 保留了
instruction.md和共享的ubuntu:24.04环境。
验证机制
每个任务的沙箱都附带一个 LLM 法官验证器,该验证器源自 OpenThoughts-Agent 的 data.nemotron_gym 框架(位于 verifiers/llm_judge.py)。
在验证时:
tests/test_state.py读取代理生成的/app/response.txt以及/tests/verifier_data.json(包含任务指令和改编的评分标准)。- 通过
litellm调用 LLM 法官(默认模型为openai/gpt-4o-mini)。 - 输出一个 0.0 到 1.0 之间的奖励值,写入
/logs/verifier/reward.txt。
注意事项:在试验时需要设置 OPENAI_API_KEY,该密钥通过 task.toml 的 [verifier].env 传递到验证器容器中。也可以通过 JUDGE_MODEL 可选地覆盖默认模型。
评分标准
评分标准涵盖四个维度:正确性 (correctness)、洞察力 (insight)、可操作性 (actionability)、相关性 (relevance)。




