遇见数据集

glaive-code-assistant-sandboxes-verified

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

laion/glaive-code-assistant-sandboxes-verified 是一个Harbor任务二进制数据集,包含10,000个自包含的编码助手问答任务,适用于文本生成和强化学习任务。该数据集基于Glaive-Code-Assistant构建,并重新打包自`DCAgent/glaive-code-assistant-sandboxes`,遵循Harbor/TaskTrove任务模式。数据集包含两列:`path`(字符串类型)和`task_binary`(gzip tar格式)。每个任务沙箱都集成了LLM评判器,该评判器移植自OpenThoughts-Agent的`data.nemotron_gym`框架,用于评估代理响应的质量。验证时,系统会读取代理的响应文件(`/app/response.txt`)和任务指令与评分标准(`/tests/verifier_data.json`),通过`litellm`调用LLM评判器(默认使用`openai/gpt-4o-mini`模型),并输出一个0.0到1.0的奖励分数。数据集移除了参考解决方案(`solution/`)以防止奖励黑客攻击,并添加了明确的`response.txt`提交指南。验证过程需要`OPENAI_API_KEY`环境变量,并可在`task.toml`中配置。评分标准涵盖正确性、完整性、清晰度和相关性。数据集使用共享的`ubuntu:24.04`环境,适用于编码助手、代理训练和LLM评判等应用场景。

laion/glaive-code-assistant-sandboxes-verified is a Harbor task binary dataset containing 10,000 self-contained coding assistant question-answer tasks, suitable for text generation and reinforcement learning tasks. It is based on Glaive-Code-Assistant and repackaged from `DCAgent/glaive-code-assistant-sandboxes`, following the Harbor/TaskTrove task pattern. The dataset includes two columns: `path` (string type) and `task_binary` (gzip tar format). Each task sandbox integrates an LLM evaluator, ported from the OpenThoughts-Agents `data.nemotron_gym` framework, to assess the quality of agent responses. During verification, the system reads the agents response file (`/app/response.txt`) and the task instructions with scoring criteria (`/tests/verifier_data.json`), invokes the LLM evaluator via `litellm` (default using the `openai/gpt-4o-mini` model), and outputs a reward score from 0.0 to 1.0. The dataset removes reference solutions (`solution/`) to prevent reward hacking and adds explicit `response.txt` submission guidelines. Verification requires the `OPENAI_API_KEY` environment variable and can be configured in `task.toml`. Scoring criteria cover correctness, completeness, clarity, and relevance. The dataset uses a shared `ubuntu:24.04` environment and is applicable to coding assistants, agent training, and LLM evaluation scenarios.

提供机构:
LAION eV
创建时间:
2026-07-20
原始信息汇总

数据集概述

  • 数据集名称: laion/glaive-code-assistant-sandboxes-verified
  • 许可证: Apache-2.0
  • 任务类别: 文本生成(text-generation)
  • 标签: agent, harbor, reinforcement-learning, llm-judge

数据集描述

该数据集包含来自 Glaive-Code-Assistant 的独立编码助手问答任务,经过重新打包和处理。原始来源为 DCAgent/glaive-code-assistant-sandboxes,源数据未提供验证器,本数据集添加了 LLM 评判器(LLM judge),并在 instruction.md 中附加了明确的 response.txt 提交指南。为防止奖励黑客行为(reward-hacking),移除了沙箱中的参考 solution/ 目录。所有任务共享 ubuntu:24.04 环境。

数据集规模与结构

  • 任务数量: 10,000 个任务
  • 列字段:
    • path (字符串)
    • task_binary (gzip tar 格式)
  • 模式: 遵循 Harbor / TaskTrove 任务模式。

验证机制

每个任务的沙箱中包含一个 LLM 评判验证器,移植自 OpenThoughts-Agent 的 data.nemotron_gym 框架(verifiers/llm_judge.py)。验证过程如下:

  1. 在验证时,tests/test_state.py 读取代理生成的 /app/response.txt 以及 /tests/verifier_data.json(包含任务指令和适配的评分标准)。
  2. 通过 litellm 调用 LLM 评判器(默认模型为 openai/gpt-4o-mini)。
  3. 将 0.0 到 1.0 的奖励值写入 /logs/verifier/reward.txt

注意: 运行时需要设置 OPENAI_API_KEY(通过 task.toml[verifier].env 传播给验证容器),可选地可通过 JUDGE_MODEL 覆盖评判模型。

评分标准

评判器根据以下维度对编码问答进行评分:

  • 正确性(correctness)
  • 完整性(completeness)
  • 清晰度(clarity)
  • 相关性(relevance)
搜集汇总
数据集介绍
glaive-code-assistant-sandboxes-verified 数据集图片
构建方式
本数据集源于Glaive-Code-Assistant,从DCAgent/glaive-code-assistant-sandboxes重新打包而来。原始数据未配备验证器,故通过引入大型语言模型评判机制并生成明确的response.txt提交指南附加至instruction.md中,以完善任务评估体系。为避免奖励破解,从沙箱中移除了参考solution/目录。每个任务沙箱均内置了源自OpenThoughts-Agent data.nemotron_gym框架的LLM评判验证器,在验证阶段,tests/test_state.py读取代理生成的/app/response.txt以及/tests/verifier_data.json(包含任务指令和适配的评分标准),通过litellm调用默认的openai/gpt-4o-mini模型进行评判,并将0.0至1.0之间的奖励值写入/logs/verifier/reward.txt。
特点
该数据集包含10,000个二进制任务,遵循Harbor/TaskTrove任务模式,核心字段为path(字符串类型)和task_binary(gzip压缩tar包格式)。所有任务共享ubuntu:24.04环境,确保运行环境一致性。评判维度涵盖正确性、完整性、清晰度以及编码问题的相关性,构建了多维度的评估体系。数据集的显著特点在于其自洽性——每个任务均内置LLM评判机制,无需依赖外部验证,同时要求运行时刻具备OPENAI_API_KEY,并可选择通过JUDGE_MODEL覆盖默认模型。
使用方法
使用本数据集时,首先需确保具备有效的OPENAI_API_KEY,该密钥通过task.toml中的[verifier].env配置传播至验证容器。若需指定其他评判模型,可通过设置JUDGE_MODEL环境变量覆盖默认的openai/gpt-4o-mini。数据集适用于文本生成任务范畴下的智能体训练与强化学习场景,尤其适合进行基于LLM评判的编码助手问答任务训练与评估。用户可基于Harbor/TaskTrove规范加载task_binary字段,解压后获取包含指令、提交说明及评判数据的完整任务包,并利用内置的LLM judges机制开展自动化评估与迭代优化。
背景与挑战
背景概述
在面向编程助手的智能体系统研究中,高质量、可验证的交互式任务数据集是驱动模型能力提升的关键。glaive-code-assistant-sandboxes-verified数据集由LAION机构于近期创建,其核心研究问题在于如何构建一个自包含的、具备自动化验证能力的编程辅助问答任务集合。该数据集基于Glaive-Code-Assistant重新封装,并融入了来自OpenThoughts-Agent框架的LLM裁判验证机制,通过将标准化的`response.txt`提交指导附加至任务指令中,移除了参考解法以避免奖励作弊,从而在10,000个任务上实现了可信的二元奖励评估。该数据集填补了编程助手领域缺乏可复现验证基准的空白,为强化学习与智能体训练提供了可靠的任务沙盒环境,对推动代码生成与交互式智能体系统的开放研究具有重要影响力。
当前挑战
该数据集所解决的领域问题在于编程助手任务中普遍存在的验证困难:传统方法依赖人工评估或静态测试用例,难以覆盖问答的开放性、逻辑完整性与表达清晰度等多维目标。构建过程中面临的核心挑战包括:首先,需要为无原生验证器的编程问答任务设计一套可扩展的LLM裁判框架,确保评分标准(正确性、完整性、清晰度、相关性)在异构任务中的一致性;其次,必须防止奖励作弊现象,即模型通过感知参考解法获得虚假高分,这要求从沙盒中彻底移除`solution/`目录;此外,环境依赖的统一性(如共享`ubuntu:24.04`系统镜像)与验证时对`OPENAI_API_KEY`的强制要求,进一步增加了任务部署的复杂性与成本控制难度。
常用场景
经典使用场景
在人工智能与代码生成研究的交汇处,glaive-code-assistant-sandboxes-verified数据集为编程助手的训练与评估提供了精细化的沙箱环境。该数据集由一万个自包含的编程问答任务构成,每个任务均嵌入LLM评判器作为验证机制,使得研究者能够在受控的Ubuntu环境中对模型生成的代码解答进行自动化评估。其经典用途聚焦于基于强化学习的代码生成智能体训练,通过任务二进制格式与标准化的响应提交路径,为模型迭代提供了可重复、可验证的闭环反馈框架。
解决学术问题
该数据集针对代码生成领域中长期存在的验证难题提供了系统性解决方案。传统编程助手数据缺乏自动化评分标准,导致模型改进方向模糊;而该数据集引入LLM评判器,依据正确性、完整性、清晰度与相关性四维准则对模型输出进行量化评分,有效解决了奖励信号稀疏与奖励作弊问题。这一设计推动了从监督微调向强化学习范式的跨越,为探索智能体在复杂编程任务中的泛化能力与鲁棒性提供了坚实的实验基础。
衍生相关工作
该数据集衍生自Glaive-Code-Assistant,并融合了OpenThoughts-Agent框架的验证理念,催生了若干具有影响力的后续工作。例如,研究者基于其LLM评判器设计,开发出针对多轮对话任务的专用验证器;亦有团队借鉴其奖励信号设计思路,将沙箱验证机制拓展至SQL查询生成与API调用规划等结构化输出场景。这些衍生工作共同丰富了代码智能体泛化能力研究的工具生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务