遇见数据集

albedo_training

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

duel_corpus 是一个从 SN97 决斗工件中提取的信用分配监督微调(SFT)数据集。其核心思想是利用裁判在评估整个轨迹时提供的引用(81%的裁判解释中命名了满足每个问题的候选输出块),作为每轮奖励信号,无需额外计算成本。数据集通过多步骤流水线构建:从原始工件(400个工件,5.93 GB,19,811个评分样本)开始,经过转向提取(506,201个转向)、目标选择、验证,最终生成清洁版本(4,664行,22,762个训练转向)。输出格式兼容 sft/data.py,包含完整的 messages 列表,其中助理转向若应接收梯度则标记为 train: true,其余作为上下文。每行还携带 train_meta(每轮权重、标签、is_recovery、cmd_kind),以便在训练时重新加权。数据统计显示,转向信用分布不均:显示文件内容(cat -n、sed -n、cat)的转向平均信用较高(0.866-1.350),而 find/ls/pytest 等较低;信用呈前加载特征,前三轮决定了样本胜负;暴露偏差显著,一次失败命令导致下一轮预期信用降低约40%。最终构建的数据集包含24,472个训练转向(验证后22,762个),命令混合偏向显示命令(51%),标签包括 grounding(35.6%)、explore(29.6%)、claims(20.9%),以及2,841个恢复转向。此外,还构建了逃逸集(sft_escape_v1.jsonl),从转向级别选择在坏状态(前一轮失败或重复)后获得裁判信用的转向,以提供摆脱困境的训练数据,其中73.7%来自被第二阶段筛选拒绝的样本。最终组合数据集 sft_final_v1.jsonl 包含18,643行,36,741个梯度承载转向。为进一步覆盖决斗工件之外的区域(转向16之后),从 mini-coder 数据集中提取了逃逸(6,820行)和完成(16,000行)转向,最终混合数据集 sft_final_v2.jsonl 包含41,463行,59,561个梯度承载转向,1.69 GB,分为四种混合:credit(11.2%)、escape_duel(33.7%)、escape_mini(16.4%)、finish_mini(38.6%),每行携带 mix 标识以便调整比例。数据集还配套了无需裁判的本地评分器,通过特征化问题并拟合分类器来预测裁判评分,在保留集上达到每问题准确率0.771、每侧得分 Pearson 相关系数0.727、MAE 0.140。该数据集适用于训练终端环境中的命令执行模型,特别是学习如何通过信用分配获得高分,以及从失败命令中恢复并最终完成提交。

duel_corpus is a credit assignment supervised fine-tuning (SFT) dataset extracted from SN97 duel artifacts. It leverages citations provided by judges when evaluating entire trajectories (81% of judge explanations name candidate output chunks that satisfy each question) as per-round reward signals without additional computational cost. The dataset is constructed through a multi-step pipeline: starting from raw artifacts (400 artifacts, 5.93 GB, 19,811 scored samples), undergoing step extraction (506,201 steps), target selection, validation, and finally producing a clean version (4,664 rows, 22,762 training steps). The output format is compatible with sft/data.py, containing a complete messages list where assistant steps that should receive gradients are marked with train: true, and the rest serve as context. Each row also carries train_meta (per-round weight, label, is_recovery, cmd_kind) for reweighting during training. Data statistics show uneven step credit distribution: steps displaying file contents (cat -n, sed -n, cat) have higher average credit (0.866-1.350), while find/ls/pytest have lower; credit exhibits a front-loading feature where the first three rounds determine the samples win/loss; exposure bias is significant, with one failed command reducing expected credit in the next round by about 40%. The final constructed dataset contains 24,472 training steps (22,762 after validation), with command mix biased toward display commands (51%), labels including grounding (35.6%), explore (29.6%), claims (20.9%), and 2,841 recovery steps. Additionally, an escape set is constructed by selecting steps that receive credit after a bad state to provide training data for escaping difficult situations. The final combined dataset sft_final_v1.jsonl contains 18,643 rows, 36,741 gradient-bearing steps. To further cover areas beyond duel artifacts, escape and finishing steps from the mini-coder dataset are extracted, producing the final mixed dataset sft_final_v2.jsonl with 41,463 rows, 59,561 gradient-bearing steps, 1.69 GB, divided into four mixes: credit (11.2%), escape_duel (33.7%), escape_mini (16.4%), finish_mini (38.6%), each row carrying a mix identifier for proportional adjustment. The dataset also comes with a judge-free local scorer that predicts judge ratings by featurizing problems and fitting a classifier, achieving per-question accuracy of 0.771, per-side score Pearson correlation of 0.727, and MAE 0.140 on a held-out set. This dataset is suitable for training command execution models in terminal environments, particularly learning to achieve high scores through credit assignment and to recover from failed commands to complete submissions.

创建时间:
2026-09-07
原始信息汇总

数据集详情总结

数据集概述

本数据集是一个基于SN97对决(duel)工件的信用分配SFT(监督微调)训练数据集,主要目标是通过分析智能体在终端环境中的完整操作轨迹,识别哪些操作步骤真正获得了评判员的信用认可,从而训练模型在类似场景中采取更有效的行动策略。

核心来源与构建流程

  • 原始数据来源:200次评估运行产生的400个工件,共5.93 GB,包含19,811个评分样本
  • 中间处理:经多个脚本逐步构建,从506,201个回合中筛选出有效训练数据
  • 最终成果sft_final_v2.jsonl,包含41,463行59,561个梯度训练回合,总大小1.69 GB

数据核心特征

信用分配发现

  • 命令类型差异显著:显示文件内容的命令(如cat -nsed -ncat)获得的信用是探索类命令(find/ls/pytest)的5-7倍
  • 信用前置效应明显:第1回合平均信用为1.523,第15回合降至0.186,前三个回合是赢得样本的关键
  • 暴露偏差:19.2%的回合获得失败观察,失败后的下一个回合获得信用的概率仅为18.8%(基线为30.3%)

四类数据混合

混合类型 行数 占比 回合窗口 用途
credit 4,664 11.2% 1-16 展示什么操作能赢得评判员信用
escape_duel 13,979 33.7% 1-16 从失败命令中恢复(同策略)
escape_mini 6,820 16.4% 5-32 打破重复运行状态
finish_mini 16,000 38.6% 17-32 在32回合内坚持到提交

逃逸集(Escape Set)

特别值得关注的是escape_duelescape_mini

  • escape_duel:包含13,979行,其中73.7%来自第二阶段筛选拒绝的侧面,98.3%紧跟在失败观察之后,专门用于训练模型在困境中脱身
  • escape_mini:从mini-coder数据集挖掘,包含6,820行恢复数据,是duel语料库的28倍,其中41.3%超过第16回合,覆盖了duel工件未能覆盖的后期窗口

本地评分器(无评判员的替代方案)

数据集中还包含一个基于梯度提升的本地评分模型,用于在没有LLM评判员的情况下评估轨迹质量:

  • 逐问题准确率:0.771;AUC:0.849
  • 逐侧得分相关性:皮尔逊相关系数0.727,平均绝对误差0.140
  • 成对样本中选优准确率:70.0%
  • 循环检测:与验证器自身的loop_check完全一致
  • 灾难性标志(得分<0.35):精确率0.820,召回率0.384

使用限制:单样本得分误差为0.207,需要至少500-1000个配对样本才能可靠区分0.025的差距;单样本分数和相近模型的排名不可信赖。

质量门控

  • 源侧面需满足:得分≥0.85、非循环、重复命令比率≤0.45、最大命令运行≤3
  • 训练回合必须包含恰好一个bash代码块,无未闭合的<think>标记
  • 训练回合中的命令不得重复
  • 100%的训练回合通过分词验证,标签跨度能精确解码回助手内容
  • 中位序列长度为7,798-9,110个标记,仅escape_duel有2.0%超出32,768限制

覆盖目标

该数据集针对两类典型失败模式:

  • 循环失败(10例中占5例):通过escape_mini(6,820个,41%超过截止点)和escape_duel覆盖
  • 32回合内无提交或无编辑(10例中占2例):通过finish_mini(16,000个,含8,776个提交回合)覆盖
搜集汇总
数据集介绍
albedo_training 数据集图片
构建方式
albedo_training数据集源自SN97对决工件的深度挖掘,其构建核心在于将裁判对完整轨迹的评判分解为逐轮奖励信号。具体而言,数据采集自200次评估运行,通过四级流水线作业:首先利用harvest_all.py获取原始对决工件,继而以build_turn_corpus.py将400份工件解析为超过50万轮的回合数据,随后通过select_targets.py依据裁判引用机制筛选出高价值训练样本,最终经validate.py严格校验,产出包含22,762个训练回合的精炼语料。该流程可断点续跑,确保了构建的可复现性与鲁棒性。值得注意的是,数据构建引入了独特的基于命令类型的信用分配机制,将裁判引用作为免费且细粒度的奖励代理,从而在无需额外GPU开销的前提下实现了对每轮行为的精准标注。
特点
该数据集的显著特征在于其精细化的信用标注与对失败情境的深度覆盖。语料中每个训练轮次均附有train: true标记,并携带丰富的train_meta元信息,包括逐轮信用权重、行为标签及恢复标志,便于训练时灵活重加权。统计揭示出关键的分布规律:展示文件内容的命令(如cat -n)其平均信用得分是低级探索命令(find/ls)的5至7倍,且信用呈强烈前置分布,前三轮即决定样本胜负。此外,数据集显式捕捉了暴露偏差,系统性地收录了失败观测后的恢复性转向(escape)轨迹,这些数据来自被传统过滤标准剔除的低分样本,却恰恰构成了模型学习脱困能力的宝贵素材。最终混合语料横跨对决与mini-coder两种数据源,覆盖1至32轮的宽广行为窗口,实现了对循环失败、提交缺失等核心缺陷的定向弥补。
使用方法
数据集设计为sft/data.py的即插即用格式,每行包含完整的messages列表,其中需施加梯度的助手回合被标记为train: true,其余作为上下文保留,以模拟真实推理状态。使用者可直接基于混入比例(mix字段)进行训练重加权,而无需重构数据。针对模型评估,数据集额外配套了免裁判的本地评分器(local_scorer),该评分器基于梯度提升树对轨迹-问题对进行特征化与分类,其预测分数在样本量超过500时可可靠区分对决胜负,尤其擅长精确检测循环行为,并能在提交前以82%的精确度预警模型崩溃样本。推荐使用流程为:先在500至1000条生成轨迹上运用本地评分器进行预筛选与诊断,再结合选定的混入比例执行微调训练。
背景与挑战
背景概述
albedo_training数据集诞生于对智能体轨迹学习范式的深刻反思与创新实践之中,由SN97项目团队于近期构建,旨在破解强化学习与监督微调在智能体任务中面临的信用分配难题。该数据集巧妙利用对决(duel)评估机制中裁判关于整个轨迹的解答,其中81%的说明明确指向满足各问题的候选输出块,这一引用信息成为每个回合唯一的奖励信号,无需额外标注成本。其核心研究问题是:在不依赖昂贵人工标注的前提下,如何从非完美轨迹中提取细粒度的回合级信用,从而训练模型识别高效命令行为模式并避免低效操作。该工作通过构建包含41,463行、59,561个梯度回合的大规模语料库,并配套无裁判本地评分器,为智能体强化学习领域提供了宝贵的训练资源和新的方法论视角,对提升模型在终端交互任务中的决策能力具有显著推动力。
当前挑战
albedo_training数据集面临的挑战多层面且深刻。从领域问题看,智能体学习的核心难点在于轨迹级奖励稀疏且缺乏回合级反馈,导致模型难以掌握有效行为策略,类似于ImageNet之前图像分类缺乏大规模标注数据的问题,此处则表现为对决评估中‘展示文件内容’类指令的信用远高于‘查找/列出’及‘测试’类,而后者占据21.6%的回合,资源浪费显著。此外,信用前重后轻(首回合信用1.523,第15回合降至0.186)及暴露偏差(19.2%回合出现失败观察,失败后下一回合信用期望损失约40%)制约模型鲁棒性。构建过程中,挑战在于从噪声数据中清洗高质量信号:需严格过滤低分、循环及重复命令的轨迹样本,同时保留‘陷入困境后成功逃脱’的珍贵材料,这类样本在原始数据中仅占16.8%。最终需要平衡不同来源数据的比例,避免mini-coder风格数据淹没对决材料,确保数据多样性且不引入偏差。
常用场景
经典使用场景
albedo_training数据集源于SN97对战评估的200次运行,构建了具有信用分配标注的指令微调语料,其核心在于利用裁判对完整轨迹整体的评判中引用的候选输出块,作为每轮奖励信号。该数据集经典使用场景聚焦于提升代码生成与命令行交互智能体的强化学习与监督微调效果,尤其在需要模型学习从失败中恢复的复杂任务环境中,提供了包含结构化负面反馈的轨迹样本,支持对模型进行精细化训练,使其具备根据执行状态调整策略的能力。
实际应用
在工业级命令行接口(CLI)自动化与智能运维场景中,该数据集支持开发自适应故障诊断与修复系统,可提升模型在检测命令失败后快速切换策略的鲁棒性。实际应用中,它能显著降低AI在交互式终端任务中的无效操作率,提高终端命令执行成功率,并助力构建无监督失败模式监测工具,用于生产环境的任务调度与资源管理,以及智能编程助手的回合级错误恢复建议。
衍生相关工作
该数据集促进了多项衍生研究:基于信用分配理论构建的局部代理评分器,实现了无需外部裁判的模型性能预测;后续进展包括将恢复轨迹挖掘(如mini_coder中的逃脱集)与完成轨迹结合,形成覆盖多回合长窗口的混合训练集;此外,激励了循环检测、失败前状态特征提取等领域的发展,为模型生成质量评估提供了低成本高精度的替代方案。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务