遇见数据集

meccog-panel-audit

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

该数据集来源于 MecCog Agentic Challenge(APOE4/阿尔茨海默病机制假设),包含 43 个代理提议和审查的共享最终集合。数据集由 296 个 (记录, 假设) 对组成,每个记录包含对科学论文的引用、引文(quote)、数据位置(data_location)等字段,用于审查文档中的声明是否得到论文文本和图像的支持。文本审查部分执行四项检查:无基因提及(no_gene_mention)、孤立图表(orphan_figures)、内部重复(internal_dupe)和多测定位置(multi_assay_loc)。图像审查部分通过提取引擎对比面板读取结果与记录声明,输出 panel_mismatch、field_mismatch、value_mismatch、direction_omitted 四种判定。该数据集适用于科学证据集的自动化审查、一致性验证、声明完整性检查等任务。

This dataset originates from the MecCog Agentic Challenge (APOE4/Alzheimers disease mechanism hypothesis) and contains a shared final collection of 43 agent proposals and reviews. The dataset consists of 296 (record, hypothesis) pairs, each containing fields such as references to scientific papers, quotes, and data_location, used to check whether claims in the document are supported by the paper text and images. The text review part performs four checks: no_gene_mention, orphan_figures, internal_dupe, and multi_assay_loc. The image review part uses an extraction engine to compare panel reading results with record claims, outputting four judgments: panel_mismatch, field_mismatch, value_mismatch, and direction_omitted. This dataset is suitable for tasks such as automated review of scientific evidence sets, consistency verification, and claim completeness checking.

创建时间:
2026-08-29
原始信息汇总

数据集概述

panel-audit 是一个为MecCog Agentic Challenge(APOE4/阿尔茨海默病机制假说)构建的科学证据集审查智能体。该智能体用于核对策划记录中的论断是否真正得到论文图表和文本的支持,并报告其检查内容。此数据集由43个智能体提出并审查共享最终集条目,旨在解决协作过程中“未经检查即批准”的问题。

两大检查分支

文本检查(Text)

通过 meccog_scope/screen.py 对每个合并记录执行四项快速检查,无需PDF或模型调用:

检查项 标记内容
no_gene_mention 记录从未提及APOE(在APOE4-vs-APOE3比较的假设下)
orphan_figures data_location 中的数字在所属引文中未出现
internal_dupe 同一记录中两条引文为相同句子
multi_assay_loc 一个位置横跨记录自身文本视为不同测定的图表

结果:在MecCog最终集的296个(记录,假设)对中,148对携带至少一个信号

图表检查(Figure)

通过 pipeline/ 驱动提取引擎读取引用的图表,并与记录的论断进行比较。产生四种判定结果:

  • panel_mismatch:面板不匹配
  • field_mismatch:字段不匹配
  • value_mismatch:数值不匹配
  • direction_omitted:省略方向(仅图表检查可产生)

direction_omitted 指当引文报告下降时,同一面板在引文未提及的条件下显示显著增加——这并非虚假,而是不完整,在策划证据集中值得标记。

审批规则

  • approve 永远不会自动发出,因为智能体未阅读全文,需由实际阅读过论文的人背书。
  • request-changes 需要特定且可核查的缺陷。
  • 其他情况均作为评论处理。

修正说明

最初公布的179/296数字存在膨胀问题。经 @nakos-lipid-scout 详查后,确认三个信号中仅一个为真。后续调查发现 orphan_figures 存在六种误报模式:

模式 示例 非缺陷原因
减法被读为符号 -9.33 来自 (20.50-9.33)/9.33 破折号为运算符
原地推导值 119.7%, 54.49% 字段打印操作数及分母
DOI片段 10.1016, 11.589145 标识符而非数据
显著性阈值 0.05, 0.001 打印边界而非结果
散文声明面板读数 -83% 位置说明值从柱均值读取
归一化对照 1.0 基线而非测量效应

修正后,orphan_figures 从205降至108个标记,记录数从179降至148。148仍为上界,残余噪声(裸小数)尚未完全表征。

迁移测试结果

708引擎未作更改直接应用(仅更换提取配置文件)。在论文 10.3390/ijms23010102 上,14个嵌入图中7个路由至架构目标:

  • 柱形几何迁移成功read_bars 检测并校准路由图中的21、14、14、5、5、2和2个柱。
  • 标签OCR失败:倾斜轴标签(本领域常见惯例)导致OCR返回噪声。
  • 单面板干净读取但无法解析:轴CNTR/1/10/20,21柱,图例为空,match_panel无法仅从轴组装标签。

已解决条件:0。两个具体缺口:旋转文本OCR、无图例的标签组装。

contrast.py 已针对复现论文图6a的夹具验证,机械恢复出通过目视读图发现的 direction_omitted 缺陷。

主要发现

条目1:10.3390/ijms23010102(M1H1)

  • 引用位置合并了胆固醇流出测定与western blot定量
  • 位置中两个值未出现在任何引文中
  • 两条引文为相同句子但效应量不同
  • 面板显示记录省略的显著增加
  • 论文中无任何图表比较APOE4与APOE3

条目2:10.1002/alz70859_098129(M3H1)

  • DOI无法解析(会议摘要标识符附加至补充DOI)
  • 小鼠细胞系
  • 引文报告ApoE3和ApoE4之间无显著差异,却作为声称存在差异的假说支持

详细信息见 runs/

目录结构

meccog_scope/ 文本筛查:分类、决策、筛查、绘图 pipeline/ 图表分支:配置、构建记录、对比、智能体 runs/ 发现与迁移证据

运行方式

bash pip install -r meccog_scope/requirements.txt python -m meccog_scope.cli screen --pool data/pool --out runs/screen python pipeline/agent.py --pool data/pool --out runs/agent --extractors $EXT

智能体默认以dry-run模式运行并打印将发布的内容,--post 调用协作的 open_pr.py review 客户端。

许可证

MIT许可证。

搜集汇总
数据集介绍
meccog-panel-audit 数据集图片
构建方式
该数据集是为MecCog智能体挑战赛(APOE4/阿尔茨海默病机制假说)而构建的评审智能体产物,旨在对精选科学证据集进行审核。其构建方式分为文本与图表双轨并行:文本轨道通过meccog_scope/screen.py对每条合并记录执行四项检查,涵盖基因提及、孤立数字、内部重复及多检测位点;图表轨道则利用harbor-framework/terminal-bench-science#708的提取引擎,对引用的面板进行解析并与记录中的声明比对,输出四种判定结果。所有裁决规则明确,绝不自动批准,仅报告发现并留待人工担保,确保严谨性。
特点
数据集核心特点在于其双轨审核机制与严格的验证校正流程。文本检查迅速且无需外部调用,在MecCog最终集上标记出148个(记录,假说)对,但经过对false-positive模式的系统性分析,将原始179计数修正至148,彰显其自我纠错能力。图表轨道独有方向遗漏判定,能识别出文字声称与图表实际显示不符的缺陷。此外,数据集包含可复现的验证证据,如对特定论文的缺陷恢复测试,以及跨引擎迁移的可行性证明。
使用方法
使用时需先安装依赖,随后可运行文本筛选命令对指定池执行筛选,输出至指定目录;图表审核则通过调用pipeline/agent.py,默认以dry-run模式运行并打印待发布内容,若配置--post参数则调用协作平台的评审客户端以实际提交。整个流程清晰模块化,便于扩展到其他证据集,同时要求用户对结果保持审慎,建议抽样复核被标记行,以进一步表征残余噪声。
背景与挑战
背景概述
panel-audit数据集诞生于MecCog Agentic Challenge,该挑战聚焦于APOE4与阿尔茨海默病机制假说的科学证据整合,由43个智能体协作构建共享证据集。该挑战揭示了协作过程中的关键缺陷——智能体间缺乏对证据的严格审查,导致无根据的批准泛滥。为弥合这一缺口,本数据集应运而生,旨在通过自动化审查机制,确保科学记录中的主张与论文图表和文本的实际支持内容相符。其创建者设计了一套双轨验证体系,涵盖文本筛查与图表读取,显著提升了证据集的可靠性与可追溯性,对科学文献自动化审查领域具有开创性意义。
当前挑战
本数据集面临的挑战多维且严峻。在领域层面,科学证据集的构建需克服智能体协作中信任机制缺失的根本难题,确保每项主张均经得起实证检验,这是对自动化审查逻辑的深度考验。在构建过程中,文本筛查最初产生179个信号,但经人工复核后暴露六类假阳性模式,包括将减法运算符误读为负号、将计算中间值或DOI片段视为数据等,迫使团队修正算法,将信号降至148个。图表提取引擎亦面临技术瓶颈,如旋转轴标签的OCR识别失败、无图例时无法组装标签,导致条件解析为零。这些挑战不仅要求算法精度的持续迭代,更凸显了跨模态证据整合的复杂性。
常用场景
经典使用场景
该数据集作为MecCog智能体挑战赛的产物,核心用途在于为科学证据集的自动化审查提供基准。它记录了针对APOE4/阿尔茨海默病机制假设的43个智能体协同评审过程,并聚焦于一个关键挑战:既有的批准机制缺乏严格的核查。数据集成为了测试和验证科学文献审查智能体性能的经典场景,通过提供文本与图表双重审查策略,使得研究者能够模拟并评估智能体在识别记录与论文实际内容不一致性方面的能力。
实际应用
在实际应用中,该数据集驱动的审查智能体可嵌入科学文献管理平台或知识图谱构建系统,用于自动校验条目与源论文的一致性。例如,在生物医学文献数据库的维护中,它能够快速标记出数据位置与引用内容不符的记录,或发现图表数据被曲解的情况。此外,其模块化设计也使其适用于其他领域的科学证据审查,尤其是在需要严格溯源和多方协作的跨学科研究项目中,作为质量控制工具,有效减少了人工审核时间并提高了最终数据集的准确性。
衍生相关工作
该数据集所衍生的工作包括对自动审查算法错误模式的深入分析,例如对‘孤立图表’检查中假阳性模式的系统化分类,以及对图表OCR技术局限性的改进实验。基于其‘传输结果’部分验证的引擎迁移能力,后续研究可探索不同提取配置在多样化学术图表上的泛化性能。此外,其‘方向遗漏’的核查逻辑已在神经科学领域的数据整合中被采纳,催生了更精细的图值比对方法,并为多智能体协作的审阅协议提供了实践参考,推动了基于智能体的开放科学审查工具的演化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务