BioMCD
收藏资源简介:
BioMCD数据集是一个大规模的基准数据集,包含13660篇撤稿文章和53411篇控制文章。数据集通过筛选Retraction Watch和PubMed数据库中的撤稿文章,并利用PubMed Central数据库获取全文,构建了正负样本集。数据集内容涵盖了健康科学领域的研究论文,旨在用于检测学术不端行为,如数据捏造、数据篡改和抄袭等。数据集的创建过程包括数据筛选、数据清洗、特征提取等步骤,最终构建了一个包含多维特征的数据集。该数据集可用于开发可扩展、可解释的工具,以保护研究诚信。
The BioMCD dataset is a large-scale benchmark dataset comprising 13,660 retracted articles and 53,411 control articles. It is developed by screening retracted articles from the Retraction Watch and PubMed databases, and retrieving full-text contents via the PubMed Central database to construct positive and negative sample sets. Covering research papers in the field of health sciences, this dataset is intended for the detection of academic misconduct including data fabrication, data tampering, and plagiarism. The dataset construction process includes steps such as data screening, data cleaning, and feature extraction, and ultimately yields a dataset with multi-dimensional features. This resource can be used to develop scalable and interpretable tools to safeguard research integrity.
BMMDetect: A Multimodal Deep Learning Framework for Comprehensive Biomedical Misconduct Detection
基本信息
- 标题: BMMDetect: A Multimodal Deep Learning Framework for Comprehensive Biomedical Misconduct Detection
- 作者: Yize Zhou, Jie Zhang, Meijie Wang, Lun Yu
- 提交日期: 2025年5月9日
- arXiv标识符: arXiv:2505.05763v1
- DOI: 10.48550/arXiv.2505.05763
- 领域: 计算机科学 > 机器学习 (cs.LG); 计算与语言 (cs.CL)
摘要
- 研究背景: 生物医学研究中的学术不端检测因现有方法的算法局限性和分析流程碎片化而具有挑战性。
- 解决方案: 提出BMMDetect,一个多模态深度学习框架,整合期刊元数据(SJR、机构数据)、语义嵌入(PubMedBERT)和GPT-4o挖掘的文本属性(方法学统计、数据异常)进行全面的手稿评估。
- 关键创新:
- 多模态融合特定领域特征以减少检测偏差;
- 定量评估特征重要性,识别期刊权威指标(如SJR指数)和文本异常(如统计异常值)为主要预测因子;
- 提供BioMCD数据集,一个包含13,160篇撤稿文章和53,411篇对照文章的大规模基准。
- 性能: BMMDetect达到74.33% AUC,比单模态基线高8.6%,并展示出在生物医学子领域中的可迁移性。
数据集
- 名称: BioMCD
- 规模: 13,160篇撤稿文章和53,411篇对照文章。
性能指标
- AUC: 74.33%
- 性能提升: 比单模态基线高8.6%。
相关链接
- PDF链接: View PDF

- 1BMMDetect: A Multimodal Deep Learning Framework for Comprehensive Biomedical Misconduct Detection武汉大学,电子科技大学,Metanovas Biotech Inc. · 2025年



