遇见数据集

stackexchange-tezos-sandboxes-verified

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该数据集名为laion/stackexchange-tezos-sandboxes-verified,是一个包含10,000个任务的Harbor任务二进制数据集,遵循规范的Harbor/TaskTrove任务模式。数据集中的计算机使用任务源自Tezos StackExchange的问题,涵盖Tezos节点/面包师操作、加密货币/区块链概念、钱包和智能合约等相关主题。该数据集是DCAgent/stackexchange-tezos-sandboxes-skywork-response的重新打包版本,保留了原有的instruction.md和共享的ubuntu:24.04环境。每个任务沙箱都集成了从OpenThoughts-Agent框架移植的LLM-judge验证器,用于替代原始的Skywork奖励模型验证器。在验证阶段,系统会读取代理的响应文件以及包含任务指令和适应性评分标准的验证数据,通过litellm调用LLM法官(默认使用openai/gpt-4o-mini)进行自动评估,并将0.0-1.0范围的奖励分数写入日志文件。数据集使用需要配置OPENAI_API_KEY环境变量,其评分标准专门针对Tezos/区块链节点操作员请求,评估维度包括正确性、完整性、相关性和操作稳健性。

The dataset named laion/stackexchange-tezos-sandboxes-verified is a Harbor task binary dataset containing 10,000 tasks, following the standardized Harbor/TaskTrove task pattern. The computer usage tasks in the dataset are derived from questions on Tezos StackExchange, covering topics such as Tezos node/baker operations, cryptocurrency/blockchain concepts, wallets, and smart contracts. This dataset is a repackaged version of DCAgent/stackexchange-tezos-sandboxes-skywork-response, retaining the original instruction.md and the shared ubuntu:24.04 environment. Each task sandbox integrates an LLM-judge validator transplanted from the OpenThoughts-Agent framework, replacing the original Skywork reward model validator. During the verification phase, the system reads the agents response files along with verification data containing task instructions and adaptive scoring criteria, automatically evaluates them by calling an LLM judge (defaulting to openai/gpt-4o-mini) via litellm, and writes reward scores in the range of 0.0-1.0 to log files. Dataset usage requires configuring the OPENAI_API_KEY environment variable, and its scoring criteria are specifically designed for Tezos/blockchain node operator requests, with evaluation dimensions including correctness, completeness, relevance, and operational robustness.

提供机构:
LAION eV
创建时间:
2026-07-19
原始信息汇总

数据集概述:laion/stackexchange-tezos-sandboxes-verified

  • 许可证:Apache-2.0
  • 任务类别:文本生成(text-generation)
  • 标签:agent、harbor、reinforcement-learning、llm-judge

数据集内容

  • 包含 10,000 个任务,遵循 Harbor / TaskTrove 任务模式。
  • 每个任务包含两个列:path(字符串类型)和 task_binary(gzip tar 格式)。
  • 任务来源于 Tezos 相关的 StackExchange 问题,涵盖 Tezos 节点/烘焙者操作、加密货币/区块链概念、钱包、合约等主题。
  • 数据从 DCAgent/stackexchange-tezos-sandboxes-skywork-response 重新打包而来,保留了 instruction.md 和共享的 ubuntu:24.04 环境。

验证机制

  • 每个任务的沙箱环境内置了一个 LLM 评判验证器,该验证器移植自 OpenThoughts-Agent 的 data.nemotron_gym 框架(verifiers/llm_judge.py),替代了原 Skywork 奖励模型验证器。
  • 验证时,tests/test_state.py 读取 agent 的 /app/response.txt 以及 /tests/verifier_data.json(包含任务指令和适配的评分标准),通过 litellm 调用 LLM 评判(默认模型为 openai/gpt-4o-mini),并将 0.0 到 1.0 之间的奖励写入 /logs/verifier/reward.txt
  • 运行时需要设置 OPENAI_API_KEY,该密钥通过 task.toml[verifier].env 传播至验证器容器;可通过 JUDGE_MODEL 可选覆盖评判模型。

评分标准(Tezos 主题)

  • 针对 Tezos/区块链节点运营者的请求,从以下四个维度进行评分:
    • 正确性(correctness)
    • 完整性(completeness)
    • 相关性(relevance)
    • 操作合理性(operational soundness)
搜集汇总
数据集介绍
stackexchange-tezos-sandboxes-verified 数据集图片
构建方式
该数据集源自Tezos StackExchange上的社区问答内容,围绕Tezos节点与烘焙操作、加密货币与区块链概念、钱包及智能合约等主题,提取出约10,000条计算机使用任务。这些任务被重新封装自`DCAgent/stackexchange-tezos-sandboxes-skywork-response`数据集,保留了原始的`instruction.md`指令文件和共享的`ubuntu:24.04`沙箱环境。每个任务沙箱中嵌入了基于LLM的评判验证器(verifier),该验证器从OpenThoughts-Agent的`data.nemotron_gym`框架移植而来,替代了原有的Skywork奖励模型验证器。在验证时,`tests/test_state.py`读取代理生成的`/app/response.txt`及`/tests/verifier_data.json`(包含任务指令和适配的评分准则),通过`litellm`调用LLM评判模型(默认使用`openai/gpt-4o-mini`),并最终将0.0至1.0之间的奖励值写入`/logs/verifier/reward.txt`。
特点
该数据集采用Harbor任务格式,以`path`(字符串)和`task_binary`(gzip压缩的tar包)两列存储,符合Harbor/TaskTrove的标准任务模式。每个任务均以Tezos区块链节点操作员的实际请求为背景,具有很强的领域专业性与实用性。验证环节采用LLM评判机制,评分维度涵盖正确性、完整性、相关性和操作合理性,确保对代理行为进行多角度评估。此外,数据集在验证时依赖于外部评判模型,要求运行时设置`OPENAI_API_KEY`,并可通过环境变量`JUDGE_MODEL`灵活切换评判模型,提升了评估的灵活性与可扩展性。
使用方法
用户可以通过加载HuggingFace数据集库中的`laion/stackexchange-tezos-sandboxes-verified`来获取该数据集,每条数据包含任务路径和压缩的tar文件。使用时需搭建基于Harbor框架的沙箱环境,并在配置文件中指定验证器的环境变量,特别是必须设置`OPENAI_API_KEY`以启用LLM评判功能。亦可自行指定`JUDGE_MODEL`来替换默认的评判模型。启动后,代理将在Ubuntu 24.04环境中执行任务,验证器自动读取其输出并与评测准则对比,生成最终奖励分数。该数据集适合用于强化学习中的奖励建模、基于LLM的智能体任务训练与评估等场景。
背景与挑战
背景概述
该数据集由LAION机构于近年创建,专注于基于Tezos区块链的计算机使用任务,来源于StackExchange平台上的技术问答。核心研究问题在于如何通过强化学习与大型语言模型(LLM)裁判机制,评估智能体在处理Tezos节点操作、加密货币概念及智能合约等任务中的表现。数据集整合自DCAgent的先前版本,并引入OpenThoughts-Agent框架的LLM裁判验证器,替代原有的Skywork奖励模型,从而提升评判的灵活性与准确性。作为Harbor任务二进制数据集的一部分,它推动了基于LLM的智能体在特定领域任务中的评估研究,对Agent训练与基准测试具有显著影响力。
当前挑战
该数据集面临的挑战包括:1)领域问题层面,需解决Tezos区块链节点操作、加密货币交易及合约执行等专业任务的自动评估难题,现有通用评估标准难以捕获操作正确性、完整性与相关性等细粒度指标;2)构建过程中,原始数据源自StackExchange问答,转换为标准化沙箱任务需保证环境一致性(基于ubuntu:24.04)与指令可复现性,同时依赖LLM裁判机制(默认gpt-4o-mini)引入外部API密钥需求与模型依赖风险,导致评估过程对OpenAI服务的强耦合性。
常用场景
经典使用场景
在智能体与强化学习的交叉领域中,stackexchange-tezos-sandboxes-verified数据集被广泛用于构建与评估基于大语言模型的自主代理系统。该数据集包含了从Tezos区块链StackExchange社区提炼的约一万个计算机操作任务,涵盖Tezos节点与面包师操作、加密货币与区块链概念、钱包及智能合约等核心主题。这些任务被封装为标准化的Harbor/TaskTrove任务架构,每个任务配备了一个完整的Ubuntu 24.04沙箱环境、详细的指令文件(instruction.md)以及一个基于大语言模型的裁判验证器。研究者可借此训练代理在真实区块链运维场景中执行多步操作,例如配置节点参数、部署合约或诊断网络故障,并通过LLM裁判对代理输出的正确性、完整性、相关性与操作稳健性进行自动化评分,从而推动智能体在复杂、动态的计算机环境中实现可靠的自主决策。
解决学术问题
该数据集精准回应当前人工智能领域的两大核心学术挑战:其一,如何弥合大语言模型从文本理解到实际工具操作之间的鸿沟,Telegram StackExchange问答提供了丰富的、有据可查的真实用户需求,使代理学习能够从理论走向实践;其二,如何构建可扩展且可复现的智能体评估框架。通过引入基于GPT-4o-mini等先进模型的LLM裁判替代传统的奖励模型验证器,数据集创新性地解决了自动化评分中的主观性与泛化性问题,使不同研究团队的实验结果具有可比性。此外,Tezos特有的区块链环境为用户研究代理在去中心化、高安全性要求下的错误恢复与容错机制提供了独特的实验平台,对推动可信自主系统的理论发展具有深远意义。
衍生相关工作
基于该数据集已衍生出一系列具有影响力的研究工作。在OpenThoughts-Agent框架的基础上,研究者借鉴其Harbor任务范式和LLM裁判验证机制,将Tezos特定任务扩展至更广泛的计算机使用场景,催生了如TaskTrove等大规模任务集合,为通用自主代理的预训练与微调提供了标准化数据源。同时,该数据集促进了对LLM裁判可靠性、一致性及偏差的系统性研究,相关论文探讨了不同裁判模型(如Claude、Gemini)在不同区块链任务上的评分差异,推动了评估方法论的发展。此外,一些团队利用该数据集中的奖励信号进行基于强化学习的代理策略优化,验证了LLM裁判提供的连续奖励值在训练稳健策略中的有效性,从而为将大语言模型从对话助手升级为真正的行动代理开辟了新的路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务