遇见数据集

fnbm-current-gt-motif-effects-sensitivity-20260729

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集名为'fnbm-current-gt-motif-effects-sensitivity-20260729',属于fnbm-current实验,用于评估因子化神经信念网络(FactorizedNBM)在去重后对植入手稿效应的恢复效果,并与模拟真实值进行对比。数据集包含三个配置:first_order(一阶效应)、second_order(二阶效应)和cluster_matches(聚类匹配)。主要配置first_order包含720行、27列,记录每个运行(run)在不同训练时期(epoch)下,对每个植入手稿(motif)的效应恢复情况。字段包括:运行目录名、训练时期、植入手稿索引、真实效应大小(beta_gt)、模型恢复的效应大小(beta_hat)及其标准误、匹配状态、均方误差(MSE、NMSE)等。数据集的生成基于模拟数据,通过OLS回归计算每个手稿家族聚类后每示例贡献对真实出现次数的斜率,效应大小与模拟器的beta单位相同,且对去重管道的内部规范不变。该数据集适用于评估手稿效应恢复的准确性和敏感性,以及模型贡献与真实贡献的匹配程度。

The dataset named fnbm-current-gt-motif-effects-sensitivity-20260729 belongs to the fnbm-current experiment, used to evaluate the recovery effect of implanted motifs by Factorized Neural Belief Networks (FactorizedNBM) after deduplication, and compare with simulated ground truth. The dataset contains three configurations: first_order, second_order, and cluster_matches. The main configuration first_order has 720 rows and 27 columns, recording the effect recovery of each implanted motif for each run at different training epochs. Fields include: run directory name, training epoch, implanted motif index, ground truth effect size (beta_gt), model recovered effect size (beta_hat) and its standard error, matching status, mean squared error (MSE, NMSE), etc. The dataset is generated based on simulated data, using OLS regression to calculate the slope of each example contribution to the true occurrence count after clustering by motif family. The effect size is in the same beta unit as the simulator and is invariant to the internal specification of the deduplication pipeline. This dataset is suitable for evaluating the accuracy and sensitivity of motif effect recovery, as well as the degree of matching between model contributions and true contributions.

创建时间:
2026-08-01
原始信息汇总

数据集概述:fnbm-current-gt-motif-effects-sensitivity-20260729

基本信息

  • 数据集名称:fnbm-current-gt-motif-effects-sensitivity-20260729
  • 许可证:MIT
  • 数据集大小:约 278,250 字节(下载大小约 39,493 字节)
  • 总行数:720 行(合并两个配置)
  • 总列数:27 列

数据集描述

该数据集记录了去重复处理后植入基序效应的恢复结果,并以模拟实验的真实值为基准进行评分。效应大小定义为每个基序家族在聚类后的逐样本贡献对基序真实出现次数的 OLS 斜率,其单位与模拟器的 beta 系数一致,且不受去重复流程内部尺度变换的影响。逐样本贡献的均方误差在验证集上基于中心化贡献计算。

数据配置

1. 第一阶配置(first_order)

  • 数据文件first_order/train-*.parquet
  • 用途:包含植入基序效应的恢复结果,核心评估列包括 beta_hat(恢复的效应大小)、beta_gt(植入的真实效应大小)和 nmse(标准化均方误差,主要质量指标)。

2. 第二阶配置(second_order)

  • 数据文件second_order/train-*.parquet
  • 规模:144 个样本
  • 用途:包含二阶(成对)基序效应的分析结果,记录成对基序的匹配情况、回归斜率、相关性等指标。

3. 簇匹配配置(cluster_matches)

  • 数据文件cluster_matches/train-*.parquet
  • 规模:973 个样本
  • 用途:记录簇与基序家族的匹配详情,包括匹配的 p 值、偏移、链方向以及备选匹配信息。

关键指标说明

  • beta_hat:恢复的效应大小,与 beta_gt 单位相同,且对尺度不敏感(有意不使用流程自身的 "effect" 标量)。
  • nmse:均方误差除以植入贡献的方差,1.0 表示与预测均值无异,0 表示完全恢复,是每个基序的主要质量指标。
  • matched:是否存在任何簇的共识 PWM 通过 Tomtom 匹配到该植入基序。
  • effect_gauge:去重复流程自身的效应标量,依赖尺度变换,不可与 beta_gt 直接比较,仅为连续性而报告。

生成参数

  • 脚本scripts/publish_motif_gt_eval.py
  • 模型:FactorizedNBM(fnbm_20260729)
  • 实验名称:fnbm-current
  • 运行次数:24 次
  • 训练轮次:[0, 50, 100]
  • 运行 ID:torch:15097728-15097743,15166724-15166731
  • 工件状态:final

使用代码示例

python from datasets import load_dataset

dataset = load_dataset("arushram/fnbm-current-gt-motif-effects-sensitivity-20260729", split="train") print(f"Loaded {len(dataset)} rows")

搜集汇总
数据集介绍
fnbm-current-gt-motif-effects-sensitivity-20260729 数据集图片
构建方式
本数据集源自因子化神经贝叶斯模型(FactorizedNBM)的去重后基序效应恢复实验,旨在评估模型在模拟真实标签下对植入基序效应的敏感度。构建过程依托24次独立运行,涵盖多个训练时期(0、50、100)及干预参数组合,通过对比模型预测的逐样本贡献与模拟器真实基序计数回归得到的OLS斜率,计算效应量及其标准误。数据分为first_order、second_order与cluster_matches三个配置,分别记录一阶效应、二阶交互及聚类匹配结果,每项均包含基序索引、真实效应值、恢复效应值、匹配状态、贡献相关性及归一化均方误差等关键指标,并附有运行目录、随机种子与实验臂信息,确保可追溯性与可重复性。
特点
该数据集的核心特色在于其效应量的规范不变性设计,即β_hat通过OLS回归获得,与模拟器β同单位,规避了去重管道内部尺度校准的影响,而管道自有效应标量因依赖于99.9百分位迹尺度而与β不可比,仅作连续性参考。数据集提供逐基序的质量评估指标,如NMSE(1.0表示无预测能力,0表示完全恢复)、贡献相关性(符号反映效应方向)及均值出现数(低值提示估计受限于少量信息样本),并结合聚类归属、滤波器索引及家族匹配冲突标志,支持深入诊断模型恢复失败的模式。此外,二阶配置中的交互作用分析提供了对非加性效应的敏感性探测。
使用方法
使用者可通过HuggingFace的datasets库加载数据,指定配置名(first_order、second_order或cluster_matches)与分割(train)。该数据集适用于评估基序发现与去重流程的统计效能,常用于比较不同正则化强度(如dc_penalty、l2_penalty)或随机种子下的恢复质量。分析时,应优先关注β_hat与β_gt的接近程度及NMSE值,并可利用cluster_ids与filter_ids追溯特定基序的聚类结构。需注意,effect_gauge列不可直接与β_gt比较,而应使用β_hat进行效应大小推断;对于匹配冲突的家族,建议结合family_match_conflict标志进行子集分析。
背景与挑战
背景概述
该数据集由arushram团队于2026年7月29日发布,旨在评估因子化朴素贝叶斯模型(FactorizedNBM)在去重流程后对植入基序效应的恢复能力。研究基于模拟的真实背景(simulation ground truth),通过对比模型估计的基序效应与模拟中设定的β值,系统检验了模型在不同实验设置下的可识别性与量化准确性。数据集包含first_order、second_order和cluster_matches三个配置,覆盖了从单基序到二阶交互、从聚类匹配到效应敏感性分析的多层次评估。其核心研究问题聚焦于去重管道内部规范(gauge)对效应量度的影响,提出了不依赖于内部规范、与模拟β同单位的恢复效应量(beta_hat),为转录因子结合基序的定量建模提供了新的评估基准,对计算生物学中序列模型的可解释性与可靠性研究具有重要参考价值。
当前挑战
该数据集所解决的领域问题在于,转录因子基序效应估计常受模型内部表示和聚类去重流程的干扰,导致效应量无法与真实的模拟参数直接比较。数据集通过提供规范不变的beta_hat和基于中心化贡献的MSE及NMSE指标,克服了这一瓶颈,使模型性能可与真实效应统一度量。构建过程中,挑战包括:识别聚类与多个植入基序的归属冲突(family_match_conflict),需回退至逐聚类匹配;处理低频率基序事件导致的效应估计误差(mean_occurrences极小);确保二阶交互效应的匹配与量化在模型对数量不足时的稳定性;以及消除去重管道自身的效应标量(effect_gauge)与β之间的可比性陷阱,从而维护数据评估的严谨性与可解释性。
常用场景
经典使用场景
该数据集专为模拟真实转录调控场景下的基序效应恢复评估而设计,经典使用场景聚焦于因子化朴素贝叶斯模型(FactorizedNBM)在去重处理后,对植入基序(planted motif)一阶效应的量化恢复能力。研究者可依据beta_hat、beta_hat_se及nmse等关键指标,系统评估模型在不同超参数(如交互上下文惩罚、特征L2惩罚)及随机种子下的效应估计精度与统计可靠性。此场景常被用于基准测试,对比不同去重管道或模型架构对基序效应识别的鲁棒性,从而在受控条件下验证算法的生物学可解释性。
衍生相关工作
这一数据集的发布催生了多项衍生工作,包括开发基于beta_hat的基序效应显著性检验工具、构建跨去重管道的效应尺度对齐算法,以及设计融合多基序家族信息的二阶交互效应分析(如second_order配置)。例如,研究者可基于cluster_matches配置扩展Tomtom匹配的统计框架,或利用sensitivity数据臂参数化探索基序相似性阈值对恢复精度的影响。此外,该数据集亦被用作训练代理模型的数据源,以预测不同超参数组合下的效应恢复基线,进而驱动更高效的神经架构搜索或贝叶斯优化流程。
数据集最近研究
最新研究方向
该数据集聚焦于因子化朴素贝叶斯模型(FactorizedNBM)在模拟序列数据中基序效应恢复的灵敏度与精度评估,通过去重后的基序簇贡献与真实效应量的回归比对,系统刻画了模型在低发生频率、基序相似性冲突及正则化约束下的效应量恢复能力。前沿方向包括建立与模拟器beta直接可比的不变效应度量框架,并利用基序匹配的p值与二阶交互核分析,深入探究基序间协同调控的统计可识别性。当前热点关注模型内部表征的解耦鲁棒性,即在线性混合效应回归、贡献相关性及均方误差等多维指标下验证基序效应的统计显著性,为深度序列模型的可解释性评估提供基准,对调控基因组学中顺式元件的定量解析具有方法论奠基作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务