affine-harness
收藏资源简介:
该数据集来自 Affine(netuid 120)子网的验证者发布,由两部分构成:1) turn 语料库(corpus/turns.jsonl),包含 18,384 个对话轮次(截至 2026-08-08),用于模型训练;2) 已发布的决斗转储(evals/),包含 79 个对决记录及索引文件,用于评分验证和回溯测试。数据涵盖了教师模型和挑战者模型在每轮对决中的 logprobs、margin 等评分指标,支持两阶段筛选流程(预筛选和完整对决),用于评估候选模型能否获得奖励。数据集还提供了训练数据生成脚本(distill_data.py),可从教师模型或决斗转储中采样指定数量的轮次生成训练样本。该数据集适用于 Affine 子网上的模型训练、筛选和性能评估。
This dataset is released by the validator of the Affine (netuid 120) subnet, consisting of two parts: 1) turn corpus (corpus/turns.jsonl), containing 18,384 conversation turns (as of 2026-08-08), used for model training; 2) published duel dumps (evals/), containing 79 duel records and index files, used for scoring validation and backtesting. The data covers scoring metrics such as logprobs and margin for teacher and challenger models in each round of duels, supporting a two-stage filtering process (pre-filtering and full duel) to evaluate whether candidate models can receive rewards. The dataset also provides a training data generation script (distill_data.py), which can sample a specified number of turns from the teacher model or duel dumps to generate training samples. This dataset is suitable for model training, screening, and performance evaluation on the Affine subnet.
Affine SN120 挖矿筛选工具数据集
数据集概述
该数据集是Affine网络(网元120)的两阶段预筛选工具,用于避免在从未获得过冠军的检查点上浪费资源。基于链上验证数据(2026-08-08),每个热键只有一次提交机会,完全配对赛条件为margin > 3·se且> 0.02,271个提交中仅4个曾被接受。
核心原理
排名公式为S = Λ2 + w·clip(L1lift, ±0.1),其中:
Λ2需要教师的logprobsL1lift完全由挑战者决定
验证器发布完整的对决转储数据,包含教师采样的(z_C, y_C)及在位王的每回合得分,因此可用单模型在2张GPU上测量ΔL1lift,其预测配对赛边距的R²为0.90。
两阶段流程
| 阶段 | 硬件 | 测量指标 | 成本 |
|---|---|---|---|
| 阶段1 — 筛选 | 2 GPU,仅候选者 | ΔL1lift, r, 因果门控, 基线带 | ~$5–8 |
| 阶段2 — 完整对决 | 8 GPU,教师+王+候选者 | 真实裁决 | ~$33 |
对79个已发布对决的留一法回测显示,0.020的筛选门槛可保留两个已知冠军并剔除**92%**的竞争队伍。
关键门槛
| 检查项 | 阈值 | 说明 |
|---|---|---|
| 筛选门槛 | margin_hat ≥ 0.020 |
召回率调优,提升至完整对决 |
| 提交门槛 | 真实对决margin ≥ 0.035 |
适用于8 GPU结果 |
校准r |
0.60–0.80 | 所有冠军都在此范围内;r ≥ 0.9从未获胜 |
| 因果性 | ≥ 0.30 |
硬性无效条件 |
| 基线带 | ≤ 1.25 × 王 |
硬性无效条件 |
运行流程
- 阶段0(离线免费):运行
replay.py(必须输出95/95 exact)、analyze.py、levers.py、calibrate.py、backtest.py、selftest.py - 数据刷新:执行
sync.py重新拉取评估转储与语料库(sha验证),每次筛选前重新同步,并指向当前王的加冕对决 - 阶段1筛选:使用2 GPU的vLLM服务,设置
--gpu-memory-utilization 0.80(0.85会在268 GiB B300上OOM),运行screen.py得出PROMOTE或REJECT裁决 - 训练阶段:从教师或转储生成数据、在现任王上训练LoRA、合并检查点、筛选后才上传
关键注意事项
- 不要使用筛选回合进行训练:对决片段由
blake2b(reveal_block_hash ‖ hotkey)从完整语料库中抽取,使用这些回合ID训练正是验证器于2026-08-06修补的RT-6记忆化通道 - 合并陷阱:
merge_and_unload().save_pretrained()会丢弃此多模态检查点上的视觉塔,vLLM将拒绝加载;merge.py流式处理基础分片并对解析目标应用W += (alpha/r)·B@A,其他866个张量(含333个model.visual.*)逐字节复制 - LoRA触及范围:检查点1,026个张量中的160个——全部40层的
mlp.shared_expert.{gate,up,down}_proj,以及10个full_attention层的self_attn.{q,k,v,o}_proj;路由MoE专家和整个视觉塔不受影响 --plan费率是假设而非测量:错误的吞吐率估算会使账单偏差数百美元,需先运行smoke配置再重新规划
文件结构
evals/:已发布对决转储+index.jsonlcorpus/turns.jsonl:sha验证的回合语料库harness/score.py:冻结的生产评分器,未修改harness/chat.py,vllm_client.py:提示构造与回声评分,逐字复制harness/replay.py:时代感知裁决验证harness/analyze.py,levers.py:胜者分解、杠杆排序harness/calibrate.py,backtest.py:预测器拟合+留一验证harness/screen.py:阶段1筛选harness/selftest.py:无GPU的实时路径干跑
合约时代差异
23个转储早于2026-08-05/06变更,仅记录6个门控键,运行在l1_clip=0.1, r_lo=1.0, r_hi=4.0, no baseline_band, δ=0.05下。replay.py按转储检测时代,需保持该行为。





