遇见数据集

fnbm-current-gt-motif-effects-precision-20260729

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集名为 "fnbm-current-gt-motif-effects-precision-20260729",旨在评估模拟 ground truth 中植入的 motif 效应在去重后的恢复精度。效应大小定义为每个 motif 家族聚类后每个样本贡献(OLS 斜率)与 motif 真实出现次数之间的线性关系,其单位与模拟器的 beta 系数相同,且不受去重管道内部规范的影响。每个样本贡献的均方误差(MSE)是在验证集上对中心化贡献计算的。数据集包含两个配置:"first_order" 和 "cluster_matches",其中 "cluster_matches" 配置包含 1007 个训练样本。数据共有 27 个字段,包括 run(运行目录名)、epoch(训练轮次)、motif_idx(植入 motif 的索引)、beta_gt(植入的一阶效应大小)、gt_contribution_std(植入的每个样本贡献的标准差)、mean_occurrences(每个验证序列中 motif 的平均出现次数)、n_families_matched(匹配的 motif 家族数量)、family_ids(家族 ID 列表)、n_clusters(归因于该 motif 的去重簇数)、cluster_ids(簇 ID 列表)、filter_ids(卷积滤波器索引)、n_filters(滤波器数量)、family_match_conflict(家族匹配冲突标志)、effect_gauge(管道自身的效应标量,与 beta_gt 不可比)、matched(是否匹配)、beta_hat(恢复的效应大小)、beta_hat_se(标准误)、contribution_corr(Pearson 相关系数)、model_contribution_std(模型贡献的标准差)、mse(均方误差)、nmse(归一化均方误差,主要质量指标)、offset(偏移量)、count_slope_r(回归的 Pearson r)、interaction_context_dc_penalty、interaction_feature_l2_penalty、seed、arm(实验臂)。数据集通过 Hugging Face datasets 库加载,使用示例为 `load_dataset("arushram/fnbm-current-gt-motif-effects-precision-20260729", split="train")`。

The dataset is named fnbm-current-gt-motif-effects-precision-20260729 and aims to evaluate the recovery precision of implanted motif effects in simulated ground truth after deduplication. The effect size is defined as the linear relationship between the per-sample contribution (OLS slope) after clustering each motif family and the true motif occurrence count, with units identical to the simulators beta coefficients and unaffected by the deduplication pipelines internal normalization. The mean squared error (MSE) of per-sample contributions is computed on the validation set for centered contributions. The dataset includes two configurations: first_order and cluster_matches, where the cluster_matches configuration contains 1007 training samples. The data has 27 fields, including run (run directory name), epoch (training epoch), motif_idx (index of the implanted motif), beta_gt (implanted first-order effect size), gt_contribution_std (standard deviation of implanted per-sample contributions), mean_occurrences (average motif occurrences per validation sequence), n_families_matched (number of matched motif families), family_ids (list of family IDs), n_clusters (number of deduplication clusters attributed to the motif), cluster_ids (list of cluster IDs), filter_ids (convolutional filter indices), n_filters (number of filters), family_match_conflict (family match conflict flag), effect_gauge (pipeline-internal effect scalar, not comparable to beta_gt), matched (whether matched), beta_hat (recovered effect size), beta_hat_se (standard error), contribution_corr (Pearson correlation coefficient), model_contribution_std (standard deviation of model contributions), mse (mean squared error), nmse (normalized mean squared error, primary quality metric), offset (offset), count_slope_r (Pearson r of regression), interaction_context_dc_penalty, interaction_feature_l2_penalty, seed, arm (experimental arm). The dataset is loaded via the Hugging Face datasets library, using the example: `load_dataset("arushram/fnbm-current-gt-motif-effects-precision-20260729", split="train")`.

创建时间:
2026-08-01
原始信息汇总

数据集概述

基本信息

  • 数据集名称: fnbm-current-gt-motif-effects-precision-20260729
  • 许可证: MIT
  • 数据集大小: 234,540 字节(约 228 KB)
  • 样本数量: 1,007 条训练样本(README 中另有描述为 720 行,以实际数据为准)
  • 标签: fnbm-current、motif-recovery、simulation-ground-truth、precision

数据集内容

该数据集记录了去重后种植基序(motif)效应的恢复结果,并以模拟真实值(ground truth)作为评分基准。效应大小采用每个基序家族聚类后逐样本贡献对基序真实出现次数的 OLS 斜率,与模拟器的 beta 参数同单位,且不受去重流水线内部尺度影响。

数据集配置

数据集包含两个预配置(config):

配置名称 数据路径
first_order first_order/train-*.parquet
cluster_matches cluster_matches/train-*.parquet

主要字段说明

字段名 类型 描述
run large_string 运行目录名,编码网格组合信息
epoch int64 执行去重遍的训练轮次
motif_idx int64 种植基序的索引
beta_gt float64 种植的一阶效应大小
gt_contribution_std float64 种植逐样本贡献的标准差
mean_occurrences float64 每个验证序列中该基序的平均出现次数
n_families_matched int64 归因于此的基序家族数量
family_ids large_string 家族 ID 列表(逗号分隔)
n_clusters int64 归因于此基序的去重簇数量
cluster_ids large_string 簇 ID 列表(逗号分隔)
filter_ids large_string 对应卷积滤波器索引列表
n_filters int64 这些簇背后的卷积滤波器数量
family_match_conflict bool 家族簇匹配到不同种植基序时是否为真
effect_gauge float64 流水线自身效应标量(仅用于连续性,不可与 beta_gt 比较)
matched bool 是否有簇的共识 PWM 通过 Tomtom 匹配该种植基序
beta_hat float64 恢复的效应大小,与 beta_gt 同单位,尺度不变
beta_hat_se float64 beta_hat 的标准误
contribution_corr float64 模型逐样本贡献与种植 z1 之间的 Pearson 相关系数
model_contribution_std float64 模型逐样本贡献的标准差
mse float64 模型与种植逐样本贡献(均居中)之间的均方误差
nmse float64 MSE 除以种植贡献方差,主要质量指标
offset float64 模型贡献均值与种植贡献均值之差
count_slope_r float64 beta_hat 回归的 Pearson r
interaction_context_dc_penalty float64 无描述
interaction_feature_l2_penalty float64 无描述
seed int64 无描述
arm large_string 运行所属的实验组(precision 或 sensitivity)

生成参数

  • 生成脚本: scripts/publish_motif_gt_eval.py
  • 模型: FactorizedNBM (fnbm_20260729)
  • 实验名称: fnbm-current
  • 工件类型: eval_result
  • 运行次数: 24 次
  • 训练轮次: [0, 50, 100]

使用示例

python from datasets import load_dataset

dataset = load_dataset("arushram/fnbm-current-gt-motif-effects-precision-20260729", split="train") print(f"Loaded {len(dataset)} rows")

搜集汇总
数据集介绍
fnbm-current-gt-motif-effects-precision-20260729 数据集图片
构建方式
该数据集源自对因子化神经贝叶斯模型(FactorizedNBM)在去重处理后恢复植入基序效应的系统性评估,其构建基于模拟真实值(ground truth)框架。具体而言,通过脚本scripts/publish_motif_gt_eval.py生成,覆盖24次运行、3个训练周期(epoch 0、50、100),并划分精确度(precision)与灵敏度(sensitivity)两个实验臂。数据集的每一行对应一个植入基序(motif)的恢复结果,包含基序索引、真实效应大小(beta_gt)、模型恢复效应(beta_hat)、统计显著性(p值、标准误)以及去重聚类归属信息。效应大小通过最小二乘(OLS)回归计算,即模型后聚类每示例贡献对基序真实出现次数的斜率,其单位与模拟器中的beta一致,且不受去重管道的内部规范(gauge)影响。同时,数据集记录了贡献均方误差(MSE)、归一化MSE(NMSE)等质量指标,并提供了运行目录、种子等复现参数,以确保评估的透明性和可追溯性。
使用方法
该数据集可便捷地通过HuggingFace的datasets库加载使用,标准代码为:from datasets import load_dataset; dataset = load_dataset("arushram/fnbm-current-gt-motif-effects-precision-20260729", split="train")。加载后,数据集提供约1007条记录,包含27个字段,适合用于评估模型在去重后恢复植入基序效应的能力。研究者可依据NMSE字段筛选高质量恢复的基序,利用beta_hat与beta_gt的对比分析系统偏差,并通过strand、offset等字段校正贡献的加性常数。此外,数据集的配置支持first_order和cluster_matches两种子集,其中cluster_matches为默认配置,聚合了聚类匹配结果。每一列均有明确的数据类型和描述,便于直接进行统计检验或可视化分析。对于需要复现实验或深入探究去重影响的场景,生成参数中的script_name和run_id提供了完整的溯源信息。
背景与挑战
背景概述
该数据集于2026年7月29日由arushram等研究人员创建,旨在评估去重后基序效应恢复的精度,是因子化神经贝叶斯模型(FactorizedNBM)研究的一部分。其核心研究问题在于,通过模拟ground truth,验证模型在去重流程后对植入基序效应大小的恢复能力,并确保效应量度与模拟器的beta系数一致。该数据集提供了包含24次运行、不同训练时期(0、50、100)的详细评估结果,覆盖了精确度与灵敏度两个实验臂,对理解模型内部的基序归因机制、优化去重算法以及推动可解释AI在序列生物学中的应用具有重要意义。其发布为相关领域的基准测试和模型改进提供了关键参考。
当前挑战
该领域面临的核心挑战在于,从深度学习模型中准确恢复基序的因果效应,尤其是当基序序列相似或发生重复时,去重流程可能引入归因偏差,导致效应值估计失真。构建过程中,需处理内规范(gauge)依赖性问题,确保恢复的效应大小与模拟设定一致;同时,当多个基序家族匹配到不同植入基序时,归因冲突频发,需设计稳健的聚类与归因策略。此外,低出现频率的基序导致估计误差增大,如何合理量化不确定性并避免过度解读,也是构建与使用该数据集时的重要难题。
常用场景
经典使用场景
该数据集专为评估转录因子结合基序(motif)效应恢复的精度而构建,其核心场景聚焦于验证去冗余流程后,从因子化朴素贝叶斯模型(FactorizedNBM)中提取的基序效应量是否与模拟注入的真实效应(beta_gt)保持一致。研究者可借此在受控的模拟环境下,系统性地比较不同训练轮次、不同聚类策略下基序效应的恢复质量,从而深入探究模型可解释性分析的可靠性边界。
解决学术问题
此数据集解决了计算生物学中一个长期存在的关键难题:在基序去冗余和聚类后,如何以无偏且尺度不变的方式量化模型对已知调控元件的效应恢复能力。传统评估指标常受限于内部表征的规范不确定性,而该数据集通过引入与模拟器beta同量纲的OLS斜率估计(beta_hat),并辅以逐样本贡献的均方误差(NMSE)作为主质量指标,为基序效应恢复的精度评估提供了严谨的、可复现的基准,对推动可解释深度学习在基因组学中的应用具有重要的方法论意义。
实际应用
在实际应用中,该数据集可作为标准测试平台,用于诊断和优化基因调控神经网络的可解释性分析流程。研究团队可以依据其中的匹配率(matched)、效应估计误差(beta_hat与beta_gt的差异)以及贡献相关性(contribution_corr)等指标,精准定位模型或解释工具在基序识别和效应量化上的缺陷,进而指导模型架构的调整、聚类阈值的选定以及注意力权重的校准,从而在疾病风险位点解析、非编码变异效应预测等实际任务中获得更可信的调控规律。
数据集最近研究
最新研究方向
该数据集聚焦于因子化朴素贝叶斯模型(FNBM)在序列基序效应恢复任务中的精度评估,通过模拟真值框架系统校验去重后基序效应量的可复现性。前沿研究关注两点:一是效应量估计对去重流程内部规范(gauge)的鲁棒性,采用普通最小二乘回归斜率作为与模拟器β同单位的度量,确保跨流程比较的一致性与公平性;二是基序属性归因的忠实度,通过Tomtom匹配、簇追踪及族冲突标记,深入剖析多基序相似场景下归因回退的动态机制。该数据集为可解释AI在基因组学中的应用提供了精细化评估基准,助力提升模型透明度和生物学发现的可信度,其方法学创新对计算生物学中的模拟-验证范式具有重要启示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务