遇见数据集

sft-repro-thinking-step630-nemotron-terminal-step1888-openthoughts-tblite-2026-08-13

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集包含对 `laion/sft-repro-thinking-step630-nemotron-terminal-step1888` 模型在 OpenThoughts-TBLite 基准上进行 300 次试验的完整评估结果。所有试验均使用 Terminus-2 框架,尝试次数为 3,温度 0.6,上下文窗口为 24,576 输入令牌 + 8,192 输出令牌。数据集中包含每个试验的轨迹、验证器输出、FineStore 表、聚合统计文件以及启动记录。敏感信息(如终端令牌和凭证)已被替换为明确的删除标记,替换记录保存在 `redaction-report.json` 中。可用的评估指标包括尝试/完成次数(300/300)、可评分率(86.33%)、总奖励(0.1449)、可评分试验平均奖励(0.1678)等。该数据集可用于复现分析、评估方法研究或作为 agentic 评估的基准。

This dataset contains the complete evaluation results of 300 trials on the OpenThoughts-TBLite benchmark for the `laion/sft-repro-thinking-step630-nemotron-terminal-step1888` model. All trials were conducted using the Terminus-2 framework, with 3 attempts, temperature 0.6, and a context window of 24,576 input tokens + 8,192 output tokens. The dataset includes trajectories, validator outputs, FineStore tables, aggregated statistics files, and launch records for each trial. Sensitive information (such as terminal tokens and credentials) has been replaced with explicit deletion markers, with replacement records saved in `redaction-report.json`. Available evaluation metrics include attempts/completions (300/300), scoreable rate (86.33%), total reward (0.1449), average reward per scoreable trial (0.1678), and others. This dataset can be used for reproducibility analysis, evaluation method research, or as a benchmark for agentic evaluations.

提供机构:
LAION eV
创建时间:
2026-08-13
原始信息汇总

数据集概述:laion/sft-repro-thinking-step630-nemotron-terminal-step1888-openthoughts-tblite-2026-08-13

数据集简介

该数据集是 Nemotron Terminal SFT 复现评估工件(Harbor 工件树),用于记录 300 次 OpenThoughts-TBLite 评估试验的完整结果。被评估的检查点模型为 laion/sft-repro-thinking-step630-nemotron-terminal-step1888,该模型基于 Grug 阶段二思维检查点,在 Nemotron Terminal 语料上训练了 1,888 步。

评估结果

指标 数值
尝试 / 完成次数 300 / 300
可进行 Verifier 评分 259 (86.33%)
所有尝试的聚合奖励 0.1449016619
可评分试验的平均奖励 0.1678397628
满分奖励试验数 39
非零奖励试验数 49
上下文管理基础设施错误 39

内容与结构

  • 存档内容:所有试验结果、轨迹、验证器输出、FineStore 表、聚合文件以及启动记录。
  • 安全处理:签名 Iris 端点令牌和凭证形状的任务夹具内容在发布前被替换为显式的删除标记。
  • 审计文件:redaction-report.json 记录了每次替换的形状和文件位置,但不保留原始机密文本。

溯源信息

  • 运行标识20260812-200420-sft-repro-thinking-step630-nemotron-terminal-step1888-openthoughts-tblite-terminus2-control-a40b
  • 基础数据集open-thoughts/OpenThoughts-TBLite@main
  • 评估框架:Terminus-2
  • 每任务尝试次数:3
  • 采样温度:0.6
  • 上下文长度:24,576 输入 + 8,192 输出 tokens
  • 组件版本:Marin 505d4d799bdf9777aedc03945d0ae0f050460013、Harbor 24e5e67ac93d21c1a2202d6906f6093e0a57b86c、Evalchemy 5ef8b1604a535d04798f3424daa3fe4facd9bf32

许可证与任务

  • 许可证:Apache-2.0
  • 任务类别:文本生成(text-generation)
  • 标签:agentic-evaluation、harbor、terminus-2、openthoughts-tblite

附加资源

精确的训练启动器、导出驱动、模型/评估配置、启动记录及分析源码可参阅 复现源码 gist

搜集汇总
数据集介绍
sft-repro-thinking-step630-nemotron-terminal-step1888-openthoughts-tblite-2026-08-13 数据集图片
构建方式
该数据集源于对laion/sft-repro-thinking-step630-nemotron-terminal-step1888检查点在OpenThoughts-TBLite基准上的系统性评估,旨在复现Nemotron Terminal监督微调流程。检查点以Grug第二阶段思维模型为起点,在Nemotron Terminal语料库上持续训练1888步。评估依托Terminus-2测试框架,对300项任务各进行3次尝试,采样温度设定为0.6,上下文窗口为24576个输入token与8192个输出token。全部试次结果、轨迹、验证器输出及FineStore表格均被完整归档,发布前对签名令牌与凭证型任务夹具内容实施了脱敏标记,并由redaction-report.json记录替换形态与位置。
特点
该数据集以高保真复现评估为核心特征,涵盖300次完整尝试,其中可验证评分的试次达259项,占比86.33%。聚合奖励为0.1449016619,可评分试次的平均奖励为0.1678397628,获得满额奖励的试次有39项,非零奖励试次为49项,另有39次因上下文管理基础设施错误而终止。归档内容不仅包含试次结果与轨迹,还保留了验证器输出、FineStore表格、聚合文件及启动记录,并附有脱敏报告以标注敏感信息的替换情况。复现所需的训练启动器、导出驱动、模型与评估配置、启动记录及分析源码均通过外部gist公开,为后续研究提供了完整的可追溯链路。
使用方法
研究者可通过HuggingFace仓库获取完整的Harbor工件树,结合复现源gist中提供的训练启动器、导出驱动、模型与评估配置及分析源码,在本地或集群环境中重建评估流程。使用时需参照Provenance中记录的运行标识、数据集版本、测试框架Terminus-2、每任务尝试次数、采样温度及上下文长度等参数,确保评估条件一致。对于涉及敏感信息的任务夹具,应依据redaction-report.json的标记理解脱敏后的数据形态,避免直接使用被替换的令牌或凭证内容。该数据集适用于监督微调复现、智能体评估方法比较以及训练检查点行为分析等场景。
背景与挑战
背景概述
面向智能体执行复杂终端任务的评估体系正逐步成为检验大语言模型实际部署能力的关键环节。LAION研究团队于2026年发布的sft-repro-thinking-step630-nemotron-terminal-step1888-openthoughts-tblite数据集,源于对Nemotron Terminal语料库中训练1888步所得检查点的系统性复现评估。该数据集以OpenThoughts-TBLite为任务基准,借助Terminus-2测试框架对300项终端交互任务进行三次独立尝试,旨在量化监督微调模型在真实终端环境中的任务完成度与奖励表现。其核心贡献在于公开完整的测试轨迹、验证器输出及脱敏记录,为智能体评估的可复现性研究提供了透明化范本,对推动终端自动化领域的基准标准化具有参考意义。
当前挑战
在终端智能体评估领域,核心难题在于任务环境的复杂性与不可逆性——终端命令的执行往往伴随状态变更,且失败路径难以自动回滚,这对模型的规划鲁棒性和错误恢复能力构成严峻考验。本数据集构建过程中同样面临多重挑战:验证器仅能覆盖86.33%的可评分任务,其余任务因输出格式或环境异常无法纳入量化评估;39次试验因上下文管理基础设施错误而失败,暴露出长序列交互中状态维护的技术瓶颈;此外,敏感端点令牌与任务固定装置中的凭据信息需在公开前进行脱敏处理,同时保留替换标记的形态与位置记录,以平衡数据开放性与安全性要求。这些挑战共同指向终端智能体评估在可靠性、可扩展性与隐私保护方面的待解难题。
常用场景
经典使用场景
在智能体评测领域,对训练后模型在终端任务上的泛化能力进行系统性复现与验证,构成了该数据集最为经典的使用场景。研究者以OpenThoughts-TBLite基准为试验场,借助Terminus-2评测框架,对经Nemotron Terminal语料训练1888步的检查点执行300次试验,每项任务重复尝试三次,在温度0.6、上下文窗口24576输入与8192输出令牌的设定下,完整记录轨迹、验证器输出与聚合奖励,从而形成可追溯、可审计的评测证据链。
解决学术问题
该数据集直面智能体研究中长期存在的可复现性危机与评测透明度不足问题,通过完整保存试验结果、轨迹、验证器输出、FineStore表格及启动记录,为学术界提供了审视训练配方与评测结论之间因果关系的实证基础。其86.33%的可验证率与0.1678的平均奖励,揭示了奖励信号稀疏、上下文管理基础设施错误频发等深层挑战,促使研究者重新思考智能体训练中信用分配与鲁棒性评估的方法论,对推动该领域从单一指标报告走向全链路开放科学具有深远意义。
衍生相关工作
以该数据集为基石,后续研究涌现出多条经典工作脉络:围绕Grug阶段-2思维检查点的持续预训练与指令微调复现实验,针对Terminus-2评测框架的上下文管理鲁棒性改进,以及基于OpenThoughts-TBLite的奖励建模与验证器校准研究。这些工作共同拓展了智能体评测的可复现范式,并催生了面向终端任务的红队测试、错误分类学与细粒度信用分配等衍生方向,持续丰富着该领域的知识图谱。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务