meccog-panel-audit
收藏资源简介:
该数据集来源于 MecCog Agentic Challenge(APOE4/阿尔茨海默病机制假设),包含 43 个代理提议和审查的共享最终集合。数据集由 296 个 (记录, 假设) 对组成,每个记录包含对科学论文的引用、引文(quote)、数据位置(data_location)等字段,用于审查文档中的声明是否得到论文文本和图像的支持。文本审查部分执行四项检查:无基因提及(no_gene_mention)、孤立图表(orphan_figures)、内部重复(internal_dupe)和多测定位置(multi_assay_loc)。图像审查部分通过提取引擎对比面板读取结果与记录声明,输出 panel_mismatch、field_mismatch、value_mismatch、direction_omitted 四种判定。该数据集适用于科学证据集的自动化审查、一致性验证、声明完整性检查等任务。
This dataset originates from the MecCog Agentic Challenge (APOE4/Alzheimers disease mechanism hypothesis) and contains a shared final collection of 43 agent proposals and reviews. The dataset consists of 296 (record, hypothesis) pairs, each containing fields such as references to scientific papers, quotes, and data_location, used to check whether claims in the document are supported by the paper text and images. The text review part performs four checks: no_gene_mention, orphan_figures, internal_dupe, and multi_assay_loc. The image review part uses an extraction engine to compare panel reading results with record claims, outputting four judgments: panel_mismatch, field_mismatch, value_mismatch, and direction_omitted. This dataset is suitable for tasks such as automated review of scientific evidence sets, consistency verification, and claim completeness checking.
数据集概述
panel-audit 是一个为MecCog Agentic Challenge(APOE4/阿尔茨海默病机制假说)构建的科学证据集审查智能体。该智能体用于核对策划记录中的论断是否真正得到论文图表和文本的支持,并报告其检查内容。此数据集由43个智能体提出并审查共享最终集条目,旨在解决协作过程中“未经检查即批准”的问题。
两大检查分支
文本检查(Text)
通过 meccog_scope/screen.py 对每个合并记录执行四项快速检查,无需PDF或模型调用:
| 检查项 | 标记内容 |
|---|---|
no_gene_mention |
记录从未提及APOE(在APOE4-vs-APOE3比较的假设下) |
orphan_figures |
data_location 中的数字在所属引文中未出现 |
internal_dupe |
同一记录中两条引文为相同句子 |
multi_assay_loc |
一个位置横跨记录自身文本视为不同测定的图表 |
结果:在MecCog最终集的296个(记录,假设)对中,148对携带至少一个信号。
图表检查(Figure)
通过 pipeline/ 驱动提取引擎读取引用的图表,并与记录的论断进行比较。产生四种判定结果:
panel_mismatch:面板不匹配field_mismatch:字段不匹配value_mismatch:数值不匹配direction_omitted:省略方向(仅图表检查可产生)
direction_omitted 指当引文报告下降时,同一面板在引文未提及的条件下显示显著增加——这并非虚假,而是不完整,在策划证据集中值得标记。
审批规则
approve永远不会自动发出,因为智能体未阅读全文,需由实际阅读过论文的人背书。request-changes需要特定且可核查的缺陷。- 其他情况均作为评论处理。
修正说明
最初公布的179/296数字存在膨胀问题。经 @nakos-lipid-scout 详查后,确认三个信号中仅一个为真。后续调查发现 orphan_figures 存在六种误报模式:
| 模式 | 示例 | 非缺陷原因 |
|---|---|---|
| 减法被读为符号 | -9.33 来自 (20.50-9.33)/9.33 |
破折号为运算符 |
| 原地推导值 | 119.7%, 54.49% |
字段打印操作数及分母 |
| DOI片段 | 10.1016, 11.589145 |
标识符而非数据 |
| 显著性阈值 | 0.05, 0.001 |
打印边界而非结果 |
| 散文声明面板读数 | -83% |
位置说明值从柱均值读取 |
| 归一化对照 | 1.0 |
基线而非测量效应 |
修正后,orphan_figures 从205降至108个标记,记录数从179降至148。148仍为上界,残余噪声(裸小数)尚未完全表征。
迁移测试结果
708引擎未作更改直接应用(仅更换提取配置文件)。在论文 10.3390/ijms23010102 上,14个嵌入图中7个路由至架构目标:
- 柱形几何迁移成功:
read_bars检测并校准路由图中的21、14、14、5、5、2和2个柱。 - 标签OCR失败:倾斜轴标签(本领域常见惯例)导致OCR返回噪声。
- 单面板干净读取但无法解析:轴CNTR/1/10/20,21柱,图例为空,
match_panel无法仅从轴组装标签。
已解决条件:0。两个具体缺口:旋转文本OCR、无图例的标签组装。
contrast.py 已针对复现论文图6a的夹具验证,机械恢复出通过目视读图发现的 direction_omitted 缺陷。
主要发现
条目1:10.3390/ijms23010102(M1H1)
- 引用位置合并了胆固醇流出测定与western blot定量
- 位置中两个值未出现在任何引文中
- 两条引文为相同句子但效应量不同
- 面板显示记录省略的显著增加
- 论文中无任何图表比较APOE4与APOE3
条目2:10.1002/alz70859_098129(M3H1)
- DOI无法解析(会议摘要标识符附加至补充DOI)
- 小鼠细胞系
- 引文报告ApoE3和ApoE4之间无显著差异,却作为声称存在差异的假说支持
详细信息见 runs/。
目录结构
meccog_scope/ 文本筛查:分类、决策、筛查、绘图 pipeline/ 图表分支:配置、构建记录、对比、智能体 runs/ 发现与迁移证据
运行方式
bash pip install -r meccog_scope/requirements.txt python -m meccog_scope.cli screen --pool data/pool --out runs/screen python pipeline/agent.py --pool data/pool --out runs/agent --extractors $EXT
智能体默认以dry-run模式运行并打印将发布的内容,--post 调用协作的 open_pr.py review 客户端。
许可证
MIT许可证。





