遇见数据集

affine-harness

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

该数据集来自 Affine(netuid 120)子网的验证者发布,由两部分构成:1) turn 语料库(corpus/turns.jsonl),包含 18,384 个对话轮次(截至 2026-08-08),用于模型训练;2) 已发布的决斗转储(evals/),包含 79 个对决记录及索引文件,用于评分验证和回溯测试。数据涵盖了教师模型和挑战者模型在每轮对决中的 logprobs、margin 等评分指标,支持两阶段筛选流程(预筛选和完整对决),用于评估候选模型能否获得奖励。数据集还提供了训练数据生成脚本(distill_data.py),可从教师模型或决斗转储中采样指定数量的轮次生成训练样本。该数据集适用于 Affine 子网上的模型训练、筛选和性能评估。

This dataset is released by the validator of the Affine (netuid 120) subnet, consisting of two parts: 1) turn corpus (corpus/turns.jsonl), containing 18,384 conversation turns (as of 2026-08-08), used for model training; 2) published duel dumps (evals/), containing 79 duel records and index files, used for scoring validation and backtesting. The data covers scoring metrics such as logprobs and margin for teacher and challenger models in each round of duels, supporting a two-stage filtering process (pre-filtering and full duel) to evaluate whether candidate models can receive rewards. The dataset also provides a training data generation script (distill_data.py), which can sample a specified number of turns from the teacher model or duel dumps to generate training samples. This dataset is suitable for model training, screening, and performance evaluation on the Affine subnet.

创建时间:
2026-08-09
原始信息汇总

Affine SN120 挖矿筛选工具数据集

数据集概述

该数据集是Affine网络(网元120)的两阶段预筛选工具,用于避免在从未获得过冠军的检查点上浪费资源。基于链上验证数据(2026-08-08),每个热键只有一次提交机会,完全配对赛条件为margin > 3·se> 0.02,271个提交中仅4个曾被接受。

核心原理

排名公式为S = Λ2 + w·clip(L1lift, ±0.1),其中:

  • Λ2需要教师的logprobs
  • L1lift完全由挑战者决定

验证器发布完整的对决转储数据,包含教师采样的(z_C, y_C)及在位王的每回合得分,因此可用单模型在2张GPU上测量ΔL1lift,其预测配对赛边距的R²为0.90。

两阶段流程

阶段 硬件 测量指标 成本
阶段1 — 筛选 2 GPU,仅候选者 ΔL1lift, r, 因果门控, 基线带 ~$5–8
阶段2 — 完整对决 8 GPU,教师+王+候选者 真实裁决 ~$33

对79个已发布对决的留一法回测显示,0.020的筛选门槛可保留两个已知冠军并剔除**92%**的竞争队伍。

关键门槛

检查项 阈值 说明
筛选门槛 margin_hat ≥ 0.020 召回率调优,提升至完整对决
提交门槛 真实对决margin ≥ 0.035 适用于8 GPU结果
校准r 0.60–0.80 所有冠军都在此范围内;r ≥ 0.9从未获胜
因果性 ≥ 0.30 硬性无效条件
基线带 ≤ 1.25 × 硬性无效条件

运行流程

  • 阶段0(离线免费):运行replay.py(必须输出95/95 exact)、analyze.pylevers.pycalibrate.pybacktest.pyselftest.py
  • 数据刷新:执行sync.py重新拉取评估转储与语料库(sha验证),每次筛选前重新同步,并指向当前王的加冕对决
  • 阶段1筛选:使用2 GPU的vLLM服务,设置--gpu-memory-utilization 0.80(0.85会在268 GiB B300上OOM),运行screen.py得出PROMOTEREJECT裁决
  • 训练阶段:从教师或转储生成数据、在现任王上训练LoRA、合并检查点、筛选后才上传

关键注意事项

  • 不要使用筛选回合进行训练:对决片段由blake2b(reveal_block_hash ‖ hotkey)从完整语料库中抽取,使用这些回合ID训练正是验证器于2026-08-06修补的RT-6记忆化通道
  • 合并陷阱merge_and_unload().save_pretrained()会丢弃此多模态检查点上的视觉塔,vLLM将拒绝加载;merge.py流式处理基础分片并对解析目标应用W += (alpha/r)·B@A,其他866个张量(含333个model.visual.*)逐字节复制
  • LoRA触及范围:检查点1,026个张量中的160个——全部40层的mlp.shared_expert.{gate,up,down}_proj,以及10个full_attention层的self_attn.{q,k,v,o}_proj;路由MoE专家和整个视觉塔不受影响
  • --plan费率是假设而非测量:错误的吞吐率估算会使账单偏差数百美元,需先运行smoke配置再重新规划

文件结构

  • evals/:已发布对决转储+index.jsonl
  • corpus/turns.jsonl:sha验证的回合语料库
  • harness/score.py:冻结的生产评分器,未修改
  • harness/chat.py, vllm_client.py:提示构造与回声评分,逐字复制
  • harness/replay.py:时代感知裁决验证
  • harness/analyze.py, levers.py:胜者分解、杠杆排序
  • harness/calibrate.py, backtest.py:预测器拟合+留一验证
  • harness/screen.py阶段1筛选
  • harness/selftest.py:无GPU的实时路径干跑

合约时代差异

23个转储早于2026-08-05/06变更,仅记录6个门控键,运行在l1_clip=0.1, r_lo=1.0, r_hi=4.0, no baseline_band, δ=0.05下。replay.py按转储检测时代,需保持该行为。

搜集汇总
数据集介绍
affine-harness 数据集图片
构建方式
本数据集affine-harness为Affine子网(netuid 120)构建的两阶段预筛选工具链,其构建基于链上已验证的合约事实:每热键仅有一次提交机会,加冕需满足margin > 3·se且> 0.02,且历史上仅有4/271次提交被接受。数据集通过离线回放(replay.py)确保评分器精确复现所有已发布裁决(95/95完全匹配),并利用验证者公开的决斗转储,恢复教师模型与国王模型的逐轮分数,从而在仅需候选模型部署于2张GPU的条件下,测量ΔL1lift等关键指标。构建过程包含同步(sync.py)以重新拉取评估转储和语料库(sha校验),以及校准(calibrate.py)和回测(backtest.py)以拟合ΔL1lift到边际的预测模型,最终通过留一法验证屏幕门阈值为0.020时能保留两个已知皇冠并剔除92%的候选。
特点
该数据集的核心特点在于其两阶段筛选机制的高效性与预测性。第一阶段的屏幕筛选仅需候选模型运行于2张GPU,成本约5-8美元,通过测量ΔL1lift(完全由挑战方计算)、相关性r、因果门和基线带,实现对配对决斗边际的高精度预测(R²=0.90)。第二阶段的全决斗虽需8张GPU(成本约33美元),但仅对通过屏幕的幸存者执行,大幅节省资源。数据集还包含严谨的防护设计,如避免在筛选轮次上训练以防记忆化(RT-6风险),以及针对多模态检查点合并的陷阱处理(如vision tower丢失问题),并提供合并工具确保参数正确累加。此外,合约两个时代的兼容性处理(replay.py按时代检测)和门控检查表(如校准r在0.60-0.80、因果性≥0.30等)进一步增强了数据集的健壮性和实用性。
使用方法
用户首先应运行Phase 0的离线分析脚本(replay.py, analyze.py, levers.py等)以确保环境正确并理解数据行为,其中replay.py必须输出95/95精确匹配才可继续。随后通过sync.py刷新输入数据,并以当前国王的加冕决斗为参考进行阶段一筛选:使用vllm serve部署候选模型(特定参数如tp=2,gpu-memory-utilization=0.80)并运行screen.py获取PROMOTE或REJECT裁定。通过筛选的候选可进入训练阶段,使用distill_data.py从教师模型生成蒸馏数据(与验证者教师强制使用字节一致),并以国王模型为基础进行LoRA微调(train_lora.py),训练后通过merge.py合并检查点(注意避免vision tower丢失)。最后通过run.py整合全流程,支持规划(--plan)、烟雾测试和正式运行,其输出为排名表,不自动上链,热键决策仍由人工执行。整个过程务必遵循门控阈值(如屏幕门≥0.020,提交门≥0.035),并仅对通过最终决斗的模型进行链上提交。
背景与挑战
背景概述
affine-harness数据集由Affine子网(netuid 120)的研究团队于2026年创建,旨在优化去中心化机器学习竞赛中的模型评估流程。该数据集的核心研究问题是如何在节省计算资源的同时,精准预测模型在正式对决中的胜率,从而避免对不可能获胜的检查点浪费资源。通过构建两阶段预筛选机制,数据集利用领域知识提炼关键预测指标,显著提升了筛选效率。其影响力体现在为去中心化训练竞赛提供了一种可复现的筛选范式,降低了参与者的算力成本,并推动了模型评估方法论的创新。
当前挑战
该数据集面临的挑战主要源于领域问题的复杂性和构建过程中的技术难点。领域层面,去中心化竞赛中的模型评估需同时处理动态变化的对手和严格的验证规则,而传统单一指标难以全面反映模型实际表现,导致筛选误差。构建过程中,团队需解决多阶段流水线中的数据同步、模型合并陷阱(如视觉塔丢失)及不同合约时期评分标准不一致等问题,还需确保训练数据与筛选数据严格分离以避免记忆化风险。此外,硬件资源限制(如GPU内存溢出)和成本估算的不确定性也构成了实际挑战,要求系统具备高鲁棒性和可恢复性。
常用场景
经典使用场景
affine-harness数据集作为去中心化机器学习网络(Bittensor子网120)中用于候选模型筛选与评估的两阶段预筛工具,其核心使用场景在于为参与者提供一种低成本、高精度的预判机制,以决定是否将算力资源投入到完整的对抗性对局中。该数据集封装了从链上验证器同步的决斗转储、语料库以及评分器代码,使得研究者能够在离线环境下复现出版的对局裁决,并通过阶段一筛选(仅需2块GPU)基于ΔL1lift等预测性指标快速剔除低潜力候选,显著降低资源浪费。其经典工作流包括数据回放验证、参数校准、留一法回测以及门控阈值设定,最终以‘PROMOTE’或‘REJECT’结论指导后续的完整对局。
解决学术问题
该数据集直面去中心化机器学习中验证成本高昂与提交策略模糊的学术难题,通过引入两阶段预筛架构,解决了在有限算力下如何高效评估候选模型能否在对抗性评判中胜出的问题。其采用代理指标ΔL1lift与配对决斗边距间的强相关性(R²=0.90),辅以因果门控和基线带约束,可剔除约92%的无效候选而保持全部已知皇冠的召回,为算力分配提供了数据驱动的决策依据。这一范式为去中心化网络中的资源优化、提交时机选择及风险评估提供了可复用的方法论,其回测与校准流程强化了结论的可信度,对新兴的密码学经济系统研究具有方法论层面的启示。
衍生相关工作
该数据集衍生了若干关键工作,包括用于预测对决边距的线性回归校准模型(calibrate.py)、基于留一法的门限优化框架(backtest.py)以及屏幕决策器(screen.py),这些工具共同构成了一个完整的预筛体系。此外,其揭示的契约时代差异(如旧对决的门控参数不同)催生了兼容不同规则时期的回放机制(replay.py),确保评估的公平性。数据集中的评分器与提示构造代码被原封复用,强调了与链上验证器保持一致的重要性,为后续研究者提供了如何安全复制和扩展子网工具链的范本,尤其在高风险的去中心化环境中,其谨慎的合并与验证策略成为可借鉴的实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务