遇见数据集

IDA-TRAIN-V2-mlperf-squad-gb10-results

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

本数据集为SQuAD v1.1(Stanford Question Answering Dataset)的一个子集,包含87,599个训练问答对,用于机器阅读理解任务。数据集中的每个样本包含一个问题和一段上下文文本,模型需要从上下文中抽取答案片段。该数据集在MLPerf基准测试中用于训练和评估模型。

This dataset is a subset of SQuAD v1.1 (Stanford Question Answering Dataset), containing 87,599 training question-answer pairs for the machine reading comprehension task. Each sample in the dataset consists of a question and a context passage, from which the model is required to extract the answer span. The dataset is used for training and evaluating models in the MLPerf benchmark.

创建时间:
2026-08-24
原始信息汇总

数据集概述

该数据集为 IDA-TRAIN-V2 MLPerf SQuAD v1.1 GB10 Results,基于 SQuAD v1.1 问答数据集,包含 87,599 个训练问答对。硬件平台为 NVIDIA GB10(Blackwell 架构,sm_121a),引擎配置采用 CUDA 架构 121ascalar_flashlegacy_bf16,优化器为 lion

1. IDA 家族训练结果(仅含指标,不含权重)

系列 架构 隐藏层尺寸 层数 头数 词表大小 阶段 最终损失 墙钟时间(秒) 微步数 已见 tokens tokens/秒 步/秒 毫秒/步 跳过的优化步 梯度范数 计算量(PFLOPS)
edge ida_lattice 384 8 6 32000 成功 10.161242 642.088 131 34,340,864 53,483.11 0.204 4901.44 0 23.44128 12.1
ai ida_lattice 2048 16 8 32000 成功 9.064909 9140.247 261 34,209,792 3,742.76 0.029 35020.1 0 17.526943 12.1
swift ida_lattice 128 4 4 32000 成功 10.314787 290.743 261 68,419,584 235,326.63 0.898 1113.96 0 8.867636 12.1

2. 外部开源模型(完整权重与指标另存于各模型仓库)

模型 仓库 架构 隐藏层尺寸 层数 头数 词表大小 阶段 最终损失 墙钟时间(秒) 微步数 优化步数 已见 tokens tokens/秒 步/秒 毫秒/步 跳过的优化步 梯度范数
gpt2 KissTheHabit/IDA-TRAIN-V2-mlperf-squad-gpt2 ida_lattice 768 12 12 50257 成功 0.6002 1707.868 2156 539 17,661,952 10,341.52 1.262 792.15 None None
qwen2.5-0.5b KissTheHabit/IDA-TRAIN-V2-mlperf-squad-qwen2.5-0.5b ida_lattice 896 24 14 151936 原生冒烟完成 8.685278 2226.2875 2113 529 17,309,696 7,775.14 0.949 1053.61 415 112,485,984.0
smollm2-135m KissTheHabit/IDA-TRAIN-V2-mlperf-squad-smollm2-135m ida_lattice 576 30 9 49152 原生冒烟完成 7.449804 1295.808 2149 538 17,604,608 13,585.82 1.658 602.98 342 235,793,360.0

3. 各模型附带仓库

每个模型仓库均包含原始 Hugging Face 检查点、原生转换后的检查点、打包的原生输入以及完整的训练输出文件。

  • GPT-2: KissTheHabit/IDA-TRAIN-V2-mlperf-squad-gpt2
  • Qwen2.5-0.5B: KissTheHabit/IDA-TRAIN-V2-mlperf-squad-qwen2.5-0.5b
  • SmolLM2-135M: KissTheHabit/IDA-TRAIN-V2-mlperf-squad-smollm2-135m

4. MLPerf 日志

每个运行目录均包含由原生引擎的 MLPerf 风格遥测写入器生成的 mlperf_log.txttraining_metrics.jsonl 文件。

搜集汇总
数据集介绍
IDA-TRAIN-V2-mlperf-squad-gb10-results 数据集图片
构建方式
IDA-TRAIN-V2-mlperf-squad-gb10-results数据集依托SQuAD v1.1问答基准,在NVIDIA GB10(Blackwell,sm_121a)硬件平台上,采用CUDA架构121a、scalar_flash、legacy_bf16及lion优化器引擎配置构建。训练过程基于IDA系列模型(edge、ai、swift)及外部开放模型(如GPT-2、Qwen2.5-0.5B、SmolLM2-135M),通过MLPerf风格遥测记录器生成训练日志与指标,涵盖最终损失、训练时长、吞吐量等参数。各外部模型对应独立制品仓库,内含原始HuggingFace检查点、原生转换检查点、打包原生输入及完整训练输出,确保训练过程可复现与审计。
使用方法
用户可通过访问HuggingFace数据集页面获取汇总指标表,或直接进入各模型制品仓库(如KissTheHabit/IDA-TRAIN-V2-mlperf-squad-gpt2等)下载完整权重与训练产物。每个运行目录内的mlperf_log.txt和training_metrics.jsonl可用于分析训练曲线与性能瓶颈。对于模型训练研究,可加载原生转换检查点或打包输入进行复现实验;对于基准比较,可参考表格中的最终损失、吞吐量等字段。数据集还支持MLPerf风格遥测解析,便于集成至自动化评估流水线。
背景与挑战
背景概述
随着大规模语言模型在自然语言理解任务中的广泛应用,高效且可复现的训练基准成为推动领域发展的关键基础设施。IDA-TRAIN-V2-mlperf-squad-gb10-results数据集由相关研究团队于近期构建,旨在基于SQuAD v1.1的87,599条训练问答对,在NVIDIA GB10(Blackwell架构,sm_121a)硬件上系统评测多种规模模型的训练性能与收敛行为。该数据集涵盖IDA家族三个席位及GPT-2、Qwen2.5-0.5B、SmolLM2-135M等外部开放模型,提供完整的训练指标、检查点与MLPerf风格遥测日志,为硬件加速器评估、训练效率比较及可复现研究提供了标准化参考,对推动绿色AI与边缘智能训练具有潜在影响力。
当前挑战
该数据集所应对的领域问题在于,如何在异构硬件上以统一、可比的指标衡量语言模型训练效率,同时兼顾不同参数规模与架构的适配性。构建过程中面临多重挑战:硬件层面需针对Blackwell架构的CUDA 121a指令集与scalar_flash内核进行深度调优,以保证数值稳定性与吞吐率;模型层面需在词表规模差异巨大(32,000至151,936)的条件下维持训练收敛,并处理梯度范数剧烈波动与优化器跳过等问题;此外,跨模型检查点转换、原生输入打包及MLPerf遥测日志的标准化生成,均要求严格的工程一致性与可复现性,为数据集构建带来了显著的系统性挑战。
常用场景
经典使用场景
在自然语言理解与机器阅读 comprehension 研究领域,SQuAD v1.1 长期被视作抽取式问答任务的基准标尺。IDA-TRAIN-V2-mlperf-squad-gb10-results 数据集以该基准的 87,599 条训练问答对为核心语料,在 NVIDIA GB10 硬件平台上系统性地记录了 IDA 系列模型(edge、ai、swift)以及 GPT-2、Qwen2.5-0.5B、SmolLM2-135M 等外部开放模型的完整训练轨迹。此类场景的经典用法在于,研究者借助统一的 MLPerf 风格遥测日志与逐模型产物仓库,对多种架构在相同数据分布下的收敛行为、吞吐效率与优化稳定性进行横向对照,从而将问答任务的训练过程从单一精度指标拓展为涵盖计算效率与资源消耗的多维评测范式。
解决学术问题
该数据集直面大规模语言模型训练中可复现性与跨架构可比性不足的学术困境。传统问答研究常受限于硬件差异、超参数披露不完整与中间状态缺失,难以对训练动态进行细粒度归因。通过公开每轮微步数、跳过优化器更新次数、梯度范数、每秒 token 处理量及墙钟时间等核心指标,该数据集为探究学习率调度、优化器选择(如 lion)与批次规模之间的耦合关系提供了实证基础。其意义在于将模型训练从黑箱式的精度汇报推进至可审计、可复现的工程科学层面,为高效训练策略的学术争鸣与理论验证构筑了可靠的数据底座。
实际应用
在工业级自然语言处理系统的研发与部署中,该数据集展现出显著的实践指引价值。工程团队可依据其记录的 GB10 平台吞吐数据与损失收敛曲线,为边缘设备、中等规模服务器及高性能计算集群分别选择适配的 IDA 模型规格(如 edge、ai、swift),从而在延迟、显存占用与问答准确率之间取得平衡。同时,外部开放模型的全权重产物与原生转换检查点为迁移学习、领域微调及推理引擎适配提供了即用型起点,使问答系统的原型验证周期大幅缩短,并为 MLPerf 基准测试的合规性提交提供了标准化日志模板。
数据集最近研究
最新研究方向
面向MLPerf训练基准的端侧与边缘大模型效能评估正成为高效人工智能研究的关键议题。IDA-TRAIN-V2-mlperf-squad-gb10-results数据集依托NVIDIA GB10(Blackwell架构)平台,系统记录了IDA晶格系列模型在SQuAD v1.1问答任务上的完整训练遥测数据,涵盖从1.28亿至20.48亿参数规模的边缘、AI与敏捷三类配置。该数据集创新性地引入MLPerf风格遥测记录,同时开放GPT-2、Qwen2.5-0.5B及SmolLM2-135M等外部开源模型的完整权重与转换后原生检查点,为跨架构训练效率对比提供了稀缺的实证资源。其核心价值在于揭示低精度bf16训练与Lion优化器在异构硬件上的收敛特性与吞吐规律,对推动边缘智能部署、绿色AI训练基准标准化以及开源模型复现性研究具有显著的支撑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务