遇见数据集

hnet-chunking-results

收藏
Hugging Face2026-09-11 更新2026-09-12 收录
官方服务:

资源简介:

该数据集记录了H-Net动态分块机制的系列实验结果,包含34个实验目录及其详细数据和总结。每个实验回答特定研究问题(如分块分配是否均衡、学习边界先于能力、分块是否对应语言单元、分块是否为功能计算单元等),并提供量和质性结论。数据集涵盖多种实验条件:基线16.2M/22.5M参数、6000步、3个种子、单一层级;以及扩展到82.5M参数、5GB预算、更多检查点的重运行(*_spec和*_specfull)。数据模式包括CSV和JSON格式的机器可读结果,以及Markdown格式的自动报告。适用于验证动态分块相关假设、复现分析、方法论比较和可解释性研究。报告遵循预注册规范,所有效果附带空对照,边界F1携带速率匹配随机基线,跨种子报告离散度。

This dataset records a series of experimental results of the H-Net dynamic chunking mechanism, containing 34 experiment directories with detailed data and summaries. Each experiment addresses specific research questions (e.g., whether chunk allocation is balanced, whether learning boundaries precede ability, whether chunks correspond to linguistic units, whether chunks are functional computational units, etc.) and provides quantitative and qualitative conclusions. The dataset covers multiple experimental conditions: baseline 16.2M/22.5M parameters, 6000 steps, 3 seeds, single hierarchy; and extended reruns with 82.5M parameters, 5GB budget, more checkpoints (*_spec and *_specfull). Data formats include machine-readable results in CSV and JSON, and auto-generated reports in Markdown. It is suitable for validating dynamic chunking hypotheses, reproducibility analysis, methodological comparison, and interpretability research. Reports follow pre-registration norms, all effects are accompanied by null controls, boundary F1 carries rate-matched random baselines, and dispersion is reported across seeds.

创建时间:
2026-09-03
原始信息汇总

H-Net dynamic-chunking: experiment results

基本信息

  • 许可证: apache-2.0
  • 标签: dynamic-chunking, tokenization, interpretability, activation-patching, negative-results

数据集概述

  • 涵盖该研究背后的所有结果表,包括失败的实验。
  • 包含 34 个实验目录;每个目录含有一个 RESULTS.md(结论 + 注意事项)以及机器可读的 CSV/JSON。
  • 82.5M 重新运行的实验还包含自动渲染的 RESULTS_auto.md,由与试点表相同的报告脚本生成。

主要发现

实验 问题 结论
exp21_tier1_pilot 对等目标是否均衡了 chunk 分配? 每个 beta 变体均衡其目标的分母(A→B +62.1% cps;Apc→Bpc +51.9% cpc),可归因——EMA 和通用正则化控制无法复现
exp26_crystallisation 边界是否在能力之前稳定? 否——能力在前,36/36 语言-种子对;20/36 在 step 6000 前从未结晶
exp27_chunk_content 学到的 chunks 是语言学的吗? ——语素 F1 处于或低于速率匹配的随机水平;在 9/9 语言中,gold 特征相对计算特征的 AUROC 增益 ≤0.001
exp25_chunk_patching chunks 是功能性计算单元吗? ——在构造率下 aligned-minus-misaligned(0/28 单元 >2 SD),而杀死 chunk 路径的代价为 +0.34 nats/byte
exp28_difficulty_gate chunking 是否跟踪难度? 部分——边界速率是(+0.181 ± 0.057,12/12 语言);chunk 长度否(符号错误)
exp28_compute_knob 是否存在推理时计算旋钮? ——单侧;BPB 在训练阈值处最小化,两个方向都更差
exp28_mainnet_ablation chunk 网络的价值有多大? ~0.07 BPB,而非朴素离分布消融报告的 +0.51
exp24_neural_chunkers 已发布的 chunker 如何分段? Bolmo-1B 在 39.3B tokens 后以边界 F1 0.987 匹配其蒸馏教师
exp29_gate1_neural 已发布神经 chunker 的 Gate 1 已发布 H-Net 的最内层单元吸收字节不平等(Gini 0.13 vs 字节 0.24);Bolmo 传播比 BLOOM 更差
exp21_tier1_spec 对等结果能否在 3.7 倍参数和完整 5 GB 预算下幸存? 是:在约 0 BPB 代价下,chunk-Gini 为 -54% / -53%

82.5M 规模检验(spec:3 seeds x 11k steps;specfull:1 seed x 76k steps, 5 GB)

实验 82.5M 下的结论
exp26_crystallisation_{spec,specfull} 能力在前复现(在 f=0.75 时 -1793 ± 92 steps,每个 seed,A 和 B);低资源路由器在 76k steps 内从未结晶;中文反转。Probe 网格为 1000 / 4000 steps,在每个表中说明
exp27_chunk_content_{spec,specfull} 在 0.72 GB 下零结果复现;在 5 GB 下,chunks 对空白脚本变成词和字符对齐(en word F1 +0.86,AUROC 0.97),而 Devanagari/Tamil 变得更亚字符且语素保持零结果。单 seed
exp25_trajectory (+ exp25_chunk_patching_{spec,specfull}) GATE F 在从 step 256 到 76k 的每个 checkpoint 都失败:contrast-minus-null 在 ±0.01 内,对照 +0.2..0.5 的 chunk 路径控制
exp28_scale 自适应计算的负面结果不是规模伪影:主网上界平坦,旋钮单侧,难 vs 易删除与随机不可区分
exp30_chunk_geometry chunk 空间跨语言对齐性弱但高于零(+0.05 白化增益,P@1 为随机 3 倍);语言身份 100% 可解码;chunk 宽度扫描平坦。记录了白化 CKA/Procrustes 的 n_sent < d 退化
exp31_pabpe_controlled 对等感知 vs 经典 BPE,相同训练器/语料/合并:目标内 Gini 0.074 -> 0.004,目标外 0.371 -> 0.345——公平性是语言列表的属性

报告纪律

  • 全程预注册并应用:每个效应都带有零假设(视情况使用 shuffled、circular-shift、Gaussian-donor 或内容不匹配的 donor);离散度跨 seeds报告,从不跨项目合并;边界 F1 始终带有速率匹配的随机基线;FLOP 声明说明计数规则(block(T,d) = 24 d²T + 2dT²,因果减半)并使用实测 chunk 数;每个结果的两个方向都被视为可发表。
  • exp23_interp_validation 针对合成 ground truth 验证估计器,每个正向检验带一个负向控制(49/49 通过)。

局限性

  • Pilot:16.2M/22.5M 参数,6000 steps,3 seeds,一个层级阶段,仅最终 step。
  • 82.5M 重新运行(*_spec*_specfull)移除了单 checkpoint 限制(保留 21 / 30 个 checkpoint),但在 1000 / 4000-step 网格上,且 5 GB 预算只有一个 seed。全程仍为一个层级阶段。
  • 熵是字节 5-gram 代理;模型自身的预测分布从未记录。

相关资源

  • 配套模型:https://huggingface.co/AdaptiveChunking/hnet-chunking-pilots
  • 配套探针:https://huggingface.co/datasets/AdaptiveChunking/hnet-chunking-probes
搜集汇总
数据集介绍
hnet-chunking-results 数据集图片
构建方式
该数据集源自一项关于动态分块与标记化可解释性的系统性实验研究,旨在通过预注册的对照设计检验分块机制在语言模型中的功能角色。构建过程涵盖34个实验目录,每个目录包含一份RESULTS.md文件,详述实验结论与注意事项,并附有机器可读的CSV/JSON数据。82.5M参数规模的复现实验额外生成自动渲染的RESULTS_auto.md,由与试点表格相同的报告脚本产出。实验设计贯彻零假设对照原则,如 shuffled、circular-shift、Gaussian-donor 或内容失配的供体,并始终报告跨种子离散度而非项目合并值。边界F1指标均附带速率匹配的随机基线,FLOP声明明确计数规则,每项结果的双向效应均被视为可发表。
使用方法
使用者可通过HuggingFace数据集页面直接访问34个实验目录,每个目录内的RESULTS.md提供结论与注意事项,CSV/JSON文件便于程序化分析。实验数据按规模与配置分为pilot与spec/specfull两类,适用于检验分块机制的可解释性假设、复现负面结果或开展元分析。配套模型与探针分别发布于AdaptiveChunking/hnet-chunking-pilots与hnet-chunking-probes,便于扩展研究。使用时需注意试点实验仅涉及单一层级阶段与最终检查点,而82.5M复现虽缓解了单检查点局限,但仍限于1000/4000步网格与单种子5GB预算。熵为字节5-gram代理,模型自身预测分布未被记录。
背景与挑战
背景概述
在神经网络语言模型追求高效表征的进程中,动态分块(dynamic chunking)作为字节级建模与子词分词之间的折衷方案备受关注。H-Net动态分块实验结果数据集由相关研究团队创建,旨在系统检验分块机制是否真正契合语言结构或计算需求。该数据集汇集了34组实验目录,涵盖预注册的零假设对照与可复现的评测流程,核心问题聚焦于分块边界是否先于能力涌现、学习到的分块是否具备语言学意义以及分块是否构成功能性计算单元。其公开的负面结果与严格报告规范为可解释性研究提供了罕见的透明度基准,对推动分词公平性和自适应计算领域的实证研究具有重要影响力。
当前挑战
该数据集所涉领域问题在于动态分块能否在字节级序列中实现与语言结构对齐且计算高效的分段,然而实验表明分块边界并不先于能力稳定,且学习到的分块在形态素层面并未超越随机基线,挑战了分块即语言单元的直觉假设。构建过程中面临多重挑战:需在有限参数规模与步数下保证统计效力,处理多语言脚本(如天城文、泰米尔文)中分块行为的分化,并设计严格零假设对照以区分真实效应与训练动力学假象。此外,分块通路消融与对齐-错位对比的效应量微弱,如何排除尺度 artifact 并维持可解释性评估的稳健性,构成持续的方法论挑战。
常用场景
经典使用场景
在动态分词与神经语言建模的交叉领域,hnet-chunking-results数据集最为经典的使用场景是作为H-Net动态分块实验的系统性结果仓库。研究者可借助其34个实验目录中的RESULTS.md与机器可读CSV/JSON,复现或检验分块边界稳定性、分块功能单元性以及分块内容语言学属性等核心假设,尤其适用于以负结果为出发点的可解释性研究。
解决学术问题
该数据集直面动态分块研究中难以回避的可复现性与报告偏差问题,通过预注册的零假设对照、跨种子离散度报告以及速率匹配的随机基线,解决了分块分配均衡性、能力与边界结晶顺序、分块路径因果贡献等争议性学术问题。其将失败实验与成功实验并列公开,为负结果的可发表性提供了实证范例,显著增强了该领域结论的可信度。
实际应用
在实际应用中,该数据集为自适应计算与推理时动态分块策略的工程评估提供了基准。开发者可依据82.5M参数重跑结果中的BPB变化、分块Gini系数及跨语言对齐增益,判断分块网络在真实训练预算下的边际价值,从而避免高估分块模块收益,并指导分词器公平性设计与多语言场景下的分块阈值选择。
数据集最近研究
最新研究方向
在动态分块与标记化可解释性领域,hnet-chunking-results数据集以34个实验目录系统性地挑战了“块边界优先于能力”的直觉假设,最新研究聚焦于分块机制的功能性验证与负面结果的诚实披露。前沿探索围绕块单元是否构成功能性计算单元、学习到的块是否具备语言学意义,以及分块边界能否作为推理期计算旋钮等核心问题展开。实验结果表明,能力先于边界稳定化(36/36语言-种子对),块内容与语素对齐低于随机基线,且对齐-错位补丁无显著效应(0/28单元格>2SD),这些发现颠覆了传统分块假说。该数据集通过预注册报告纪律与跨种子方差分析,为可解释性研究树立了负面结果同样可发表的范式,推动了领域对分块机制本质的重新审视。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务