datause-displacement-reviewed
收藏资源简介:
该数据集是rafmacalaba/datause-displacement的Luna-reviewed子集,仅包含经过v2.3 Luna判定(band review + drop-side rescue,source == luna_review)的跨度。每个跨度带有二元标签(DATA_MENTION / NON_MENTION),以及usage_type、drop_reason、specificity等属性,并通过key(split:row:start:end)可追溯至原始判定记录。数据集包含多个配置版本:gliner_reviewed(tokenized_text、corpus、origin、language、ner、spans)、bio_reviewed(tokens、ner_tags、spans)、readable_reviewed(text、spans)、probe_reviewed、gliner_reviewed_nm和synth_reviewed。合成配置synth_reviewed由本地gemma-4-e4b-it-qat模型生成,聚焦于holdout弱跨度,共4095行、7827个跨度,其中DATA_MENTION 4447个,NON_MENTION 3380个。整体统计:训练集16468行(19681跨度,39.5%正例),验证集1741行(2006跨度,54.9%正例),holdout集2085行(2312跨度,55.3%正例),总计20294行、23999个跨度,正例占比42.3%。NON_MENTION的drop_reason分布包括production(5037)、system_registry(2311)、bookkeeping(2151)、promissory(1774)、table_artifact(1213)、ref_list(522)、availability(465)、plays_role(105)、bare_stat(87)。判定来源为gpt-5.6-luna模型,基于v2.3 TIER_SYSTEM提示,在ambiguity band和drop-side rescue上运行。数据集适用于命名实体识别、跨度分类、文本分类等任务。
This dataset is a Luna-reviewed subset of rafacalaba/datause-displacement, containing only spans that have undergone v2.3 Luna judgment (band review + drop-side rescue, source == luna_review). Each span has a binary label (DATA_MENTION / NON_MENTION), along with attributes such as usage_type, drop_reason, specificity, and can be traced back to the original judgment record via a key (split:row:start:end). The dataset includes multiple configuration versions: gliner_reviewed (tokenized_text, corpus, origin, language, ner, spans), bio_reviewed (tokens, ner_tags, spans), readable_reviewed (text, spans), probe_reviewed, gliner_reviewed_nm, and synth_reviewed. The synthetic configuration synth_reviewed was generated by a local gemma-4-e4b-it-qat model, focusing on holdout weak spans, with a total of 4095 rows and 7827 spans, including 4447 DATA_MENTION and 3380 NON_MENTION. Overall statistics: training set 16468 rows (19681 spans, 39.5% positive), validation set 1741 rows (2006 spans, 54.9% positive), holdout set 2085 rows (2312 spans, 55.3% positive), total 20294 rows and 23999 spans, with 42.3% positive examples. The drop_reason distribution for NON_MENTION includes production (5037), system_registry (2311), bookkeeping (2151), promissory (1774), table_artifact (1213), ref_list (522), availability (465), plays_role (105), bare_stat (87). The judgment source is the gpt-5.6-luna model, based on v2.3 TIER_SYSTEM prompt, running on ambiguity band and drop-side rescue. The dataset is suitable for tasks such as named entity recognition, span classification, and text classification.
数据集概述
datause-displacement-reviewed 是 rafmacalaba/datause-displacement 的一个子集,仅包含经过 v2.3 Luna 审核(带宽审查 + 丢弃侧救援,source == luna_review)的文本片段。每个片段带有二元标签及 usage_type、drop_reason、specificity 属性,并可通过 key(格式为 split:row:start:end)溯源至 extraction_analysis/band_review/ 中的审核记录。
语言:英语
许可证:MIT
任务类型:Token 分类、文本分类
配置(Configs)
| 配置名 | 主要字段 |
|---|---|
gliner_reviewed |
tokenized_text、corpus、origin、language、ner(仅保留)、spans(完整,含 key/reason/kind) |
bio_reviewed |
tokens、ner_tags(对 DATA_MENTION 和 NON_MENTION 使用 B-/I- 标签)、spans、corpus、origin、language |
readable_reviewed |
text、spans(字符偏移,含 key/reason/kind)、corpus、origin、origin_model、language |
每个配置均包含 train、val、holdout 三个数据划分。
此外,synth_reviewed 配置为合成增强数据,仅包含 train 划分。
合成增强数据(synth_reviewed)
- 来源:由本地
gemma-4-e4b-it-qat模型生成(training/synth_local.py,v2.3INVENT_SYSTEM/NEG_SYSTEM提示词)。 - 种子:聚焦于 displacement probe 的 holdout 弱片段,包括 54 个召回漏检(FN)段落和 117 个精度泄漏(FP)段落。
- 属性:每行带有
origin=gemma、corpus=synthetic,spans[]混合了真实的DATA_MENTION(生成提及 + 抽取器补充)和NON_MENTION硬负例(含drop_reason)。 - 规模:
| 配置 | 行数 | 片段数 | DATA_MENTION | NON_MENTION |
|---|---|---|---|---|
synth_reviewed |
4095 | 7827 | 4447 | 3380 |
统计信息
总体数据(不含合成集):
| 划分 | 行数 | 片段数 | DATA_MENTION | NON_MENTION | 正例占比 |
|---|---|---|---|---|---|
| train | 16468 | 19681 | 7778 | 11903 | 39.5% |
| val | 1741 | 2006 | 1101 | 905 | 54.9% |
| holdout | 2085 | 2312 | 1278 | 1034 | 55.3% |
| 总计 | 20294 | 23999 | 10157 | 13842 | 42.3% |
丢弃原因分布(NON_MENTION)
| 原因 | 数量 |
|---|---|
production |
5037 |
system_registry |
2311 |
bookkeeping |
2151 |
promissory |
1774 |
table_artifact |
1213 |
ref_list |
522 |
availability |
465 |
plays_role |
105 |
bare_stat |
87 |
数据溯源
审核标签由 gpt-5.6-luna 模型生成(使用 TIER_SYSTEM v2.3 系统提示词,运行于 training/audit_luna_batch.py),针对歧义带(refine_band.py,控制门通过率 0.83)和丢弃侧救援(rescue_drops.py,症状概率 < 0.5)执行。
- 保留的审核片段被标记为
DATA_MENTION或NON_MENTION。 usage_type(证据型/声明型)适用于提及(mentions)。drop_reason(9 个类别)适用于非提及(non-mentions)。specificity(命名/描述性/模糊)适用于所有片段。





