遇见数据集

marin-qwen36-nemosci-terminus2-b200-parity-artifacts

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

本数据集名为“Marin Qwen3.6 and Nemosci Terminus-2 parity artifacts”,采用Apache-2.0许可证。它包含了Qwen3.6-35B-A3B和Nemosci Qwen3-32B两个模型在CoreWeave GB200 GPU上进行的Terminus-2 parity评估的去重Harbor输出、轨迹、操作证据和分析结果。数据按模型和基准测试分别打包为六个.tar.zst压缩文件,每个文件均提供SHA-256校验和以确保完整性。公开版本已脱敏处理,移除了临时Iris端点能力令牌、基准生成的私钥及类似密钥的基准测试夹具,但保留了试验奖励、异常、配置和轨迹结构。提取压缩文件需使用命令:tar --use-compress-program=unzstd -xf <文件名>.tar.zst。本数据集可用于分析模型在特定硬件上的parity评估结果、复现评估过程或进行进一步的基准测试研究。

This dataset is named "Marin Qwen3.6 and Nemosci Terminus-2 parity artifacts" and is licensed under Apache-2.0. It contains deduplicated Harbor outputs, trajectories, operational evidence, and analysis results of Terminus-2 parity evaluations for two models: Qwen3.6-35B-A3B and Nemosci Qwen3-32B, conducted on CoreWeave GB200 GPUs. The data is packaged into six .tar.zst compressed files, each grouped by model and benchmark, with SHA-256 checksums provided for integrity verification. The public version has been sanitized, removing temporary Iris endpoint capability tokens, private keys generated for benchmarks, and similar key-like benchmark fixtures, while retaining trial rewards, anomalies, configurations, and trajectory structures. To extract the compressed files, use the command: tar --use-compress-program=unzstd -xf <filename>.tar.zst. This dataset can be used to analyze parity evaluation results of models on specific hardware, reproduce the evaluation process, or conduct further benchmark studies.

提供机构:
LAION eV
创建时间:
2026-08-01
原始信息汇总

数据集概述

内容说明

该数据集包含了在 CoreWeave GB200 GPU 上对 Qwen3.6-35B-A3B 和 Nemosci Qwen3-32B 两个模型进行的三项 Terminus-2 一致性评估的去重 Harbor 输出、轨迹、操作证据和分析结果

数据组织

数据按模型和基准测试分别打包,共包含 7 个压缩归档文件(.tar.zst 格式),每个归档文件均提供 SHA-256 校验值以确保完整性。具体归档如下:

归档文件 用途
qwen3.6-dev-set-v2.tar.zst Qwen3.6 模型的开发集评估结果
qwen3.6-swebench.tar.zst Qwen3.6 模型的 SWE-bench 评估结果
qwen3.6-terminal-bench-2.tar.zst Qwen3.6 模型的 Terminal-Bench 2 评估结果
nemosci-dev-set-v2.tar.zst Nemosci 模型的开发集评估结果
nemosci-swebench.tar.zst Nemosci 模型的 SWE-bench 评估结果
nemosci-terminal-bench-2.tar.zst Nemosci 模型的 Terminal-Bench 2 评估结果
analysis-and-metadata.tar.zst 综合分析及元数据

使用方法

解压归档文件的命令示例: bash tar --use-compress-program=unzstd -xf qwen3.6-dev-set-v2.tar.zst

内容处理与关联资源

  • 公开导出已删除短暂的 Iris 端点能力令牌、基准测试生成的私钥及关键测试文件等敏感信息。
  • 保留了试验奖励、异常、配置和轨迹结构等核心评估数据。
  • 六个源 Harbor 策略单独发布于关联数据集:laion/marin-qwen36-nemosci-terminus2-b200-parity-configs
搜集汇总
数据集介绍
marin-qwen36-nemosci-terminus2-b200-parity-artifacts 数据集图片
构建方式
在模型能力持续攀升、基准评测却常因复现性不足而遭受质疑的背景下,该数据集通过规范化流程构建。评测以Qwen3.6-35B-A3B与Nemosci Qwen3-32B为对象,在CoreWeave GB200 GPU上执行三组Terminus-2平行比较,覆盖dev-set-v2、SWE-bench与Terminal-Bench-2等任务。原始Harbor输出经过跨运行去重,删减临时性Iris端点能力令牌、基准生成的私钥及类密钥装置,同时完整保留逐试验奖励、异常、配置与轨迹结构,并按模型与基准分别打包为独立归档,附以SHA-256校验值以确保完整性。
使用方法
使用者可借助tar与unzstd解压各归档,按模型与基准定位相应数据,并比对SHA-256以验证文件未被篡改。分析时可联合读取轨迹、奖励、异常与配置,并结合独立发布的策略仓库复现评测设置。针对不同研究目标,可选用dev-set-v2进行快速验证,或采用SWE-bench与Terminal-Bench-2开展更具挑战性的评估。在引用该数据集时,应遵循apache-2.0许可,并注意已脱敏字段不予恢复,以维持公开导出版本的一致性与合规性。
背景与挑战
背景概述
随着大语言模型在代码生成与终端交互领域的持续演进,模型评估的标准化与可复现性成为推动研究进展的关键环节。该数据集由LAION团队构建,聚焦于Qwen3.6-35B-A3B与Nemosci Qwen3-32B两个模型在CoreWeave GB200 GPU上的Terminus-2平行性评估,涵盖开发集、SWE-bench与Terminal-Bench-2三项基准测试,并完整保留了去重后的Harbor输出、轨迹记录与操作证据。其核心研究问题在于验证不同模型配置在统一硬件与评测框架下的行为一致性,为模型能力比较与系统稳定性分析提供实证基础,对开源模型评测体系的规范化具有积极意义。
当前挑战
该数据集所应对的领域问题在于终端交互与代码生成任务的评估长期缺乏跨模型、跨配置的严格对照,难以区分模型能力差异与评测环境波动。构建过程中需解决多重技术挑战:其一,确保两个模型在相同硬件与评测策略下运行,排除因GPU架构或推理框架差异引入的偏差;其二,对Harbor输出进行去重与轨迹结构化处理,同时在不破坏评测语义的前提下剔除临时能力令牌与私钥等敏感信息;其三,维持奖励信号、异常记录与配置元数据的完整性,使平行性评估结论具备可审计性与可复现性。
常用场景
经典使用场景
在大规模语言模型评测与可复现研究领域,该数据集提供了Qwen3.6-35B-A3B与Nemosci Qwen3-32B在CoreWeave GB200 GPU上运行Terminus-2平价评测的完整Harbor输出、轨迹与操作证据,涵盖dev-set-v2、SWE-bench与Terminal-Bench-2三个基准。研究者可依据逐模型、逐基准独立打包的归档,精确复现推理路径、异常记录与奖励信号,从而在统一硬件与软件配置下横向比较两个模型的终端交互能力,构成模型平价评测的经典实践范式。
解决学术问题
该数据集直面模型评测中长期存在的可复现性危机与证据链缺失问题:不同研究往往因硬件差异、配置漂移或轨迹不完整而难以互证结论。通过发布去重后的Harbor输出、轨迹结构、配置及操作证据,并附带SHA-256校验与公开策略配置,它为模型能力比较提供了透明、可审计的实证基础,显著缓解了评测结果不可复现、异常处理不透明等学术痛点,对推动终端智能体研究的严谨化具有方法学意义。
实际应用
在工程实践中,该数据集可用于终端智能体与代码生成模型的部署前验证,帮助团队在GB200级加速器上评估Qwen3.6-35B-A3B与Nemosci Qwen3-32B在真实命令行任务中的成功率、异常模式与资源消耗。公开导出去除了临时端点令牌与基准私钥,同时保留奖励、异常与配置信息,使工业界能够在合规前提下开展回归测试、故障归因与模型选型,支撑自动化运维与软件工程智能体的落地决策。
数据集最近研究
最新研究方向
在大语言模型评估领域,基于智能体轨迹的基准测试日益成为衡量模型真实编程与终端操作能力的关键范式。该数据集聚焦于Qwen3.6-35B-A3B与Nemosci Qwen3-32B在CoreWeave GB200 GPU上针对Terminus-2的三项对等评估,涵盖开发集v2、SWE-bench及Terminal-bench-2,提供去重后的Harbor输出、轨迹与操作性证据。这一工作呼应了当前对可复现、透明化模型对比的迫切需求,尤其在高性能计算硬件上验证模型一致性。其意义在于为开源社区提供细粒度诊断资源,推动智能体鲁棒性研究,并促进跨模型、跨基准的公平比较,对代理式AI的评估标准化具有参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务