遇见数据集

pinecone/core-2020-05-10-deduplication

收藏
Hugging Face2022-10-28 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: - unknown language_creators: - unknown language: - en license: - mit multilinguality: - monolingual size_categories: - 100K<n<1M source_datasets: - unknown task_categories: - other task_ids: - natural-language-inference - semantic-similarity-scoring - text-scoring pretty_name: CORE Deduplication of Scholarly Documents tags: - deduplication --- # Dataset Card for CORE Deduplication ## Dataset Description - **Homepage:** [https://core.ac.uk/about/research-outputs](https://core.ac.uk/about/research-outputs) - **Repository:** [https://core.ac.uk/datasets/core_2020-05-10_deduplication.zip](https://core.ac.uk/datasets/core_2020-05-10_deduplication.zip) - **Paper:** [Deduplication of Scholarly Documents using Locality Sensitive Hashing and Word Embeddings](http://oro.open.ac.uk/id/eprint/70519) - **Point of Contact:** [CORE Team](https://core.ac.uk/about#contact) - **Size of downloaded dataset files:** 204 MB ### Dataset Summary CORE 2020 Deduplication dataset (https://core.ac.uk/documentation/dataset) contains 100K scholarly documents labeled as duplicates/non-duplicates. ### Languages The dataset language is English (BCP-47 `en`) ### Citation Information ``` @inproceedings{dedup2020, title={Deduplication of Scholarly Documents using Locality Sensitive Hashing and Word Embeddings}, author={Gyawali, Bikash and Anastasiou, Lucas and Knoth, Petr}, booktitle = {Proceedings of 12th Language Resources and Evaluation Conference}, month = may, year = 2020, publisher = {France European Language Resources Association}, pages = {894-903} } ```

annotations_creators: - 未知 language_creators: - 未知 language: - 英语 license: - MIT许可证 multilinguality: - 单语种 size_categories: - 100K<n<1M(数据量介于10万至100万之间) source_datasets: - 未知 task_categories: - 其他 task_ids: - 自然语言推理 - 语义相似度评分 - 文本评分 pretty_name: CORE学术文档去重数据集 tags: - 去重 --- # CORE学术文档去重数据集卡片 ## 数据集说明 - **主页:** [https://core.ac.uk/about/research-outputs](https://core.ac.uk/about/research-outputs) - **代码仓库:** [https://core.ac.uk/datasets/core_2020-05-10_deduplication.zip](https://core.ac.uk/datasets/core_2020-05-10_deduplication.zip) - **相关论文:** [《基于局部敏感哈希(Locality Sensitive Hashing)与词嵌入(Word Embeddings)的学术文档去重》](http://oro.open.ac.uk/id/eprint/70519) - **联系人:** [CORE团队](https://core.ac.uk/about#contact) - **下载数据集总大小:** 204 MB ### 数据集概览 CORE 2020去重数据集(官方文档地址:https://core.ac.uk/documentation/dataset)包含10万篇被标记为重复/非重复的学术文档。 ### 语言说明 本数据集采用英语编写,符合BCP-47标准编码`en`。 ### 引用信息 @inproceedings{dedup2020, title={基于局部敏感哈希(Locality Sensitive Hashing)与词嵌入(Word Embeddings)的学术文档去重}, author={Gyawali, Bikash与Anastasiou, Lucas与Knoth, Petr}, booktitle = {第12届语言资源与评估会议论文集(Proceedings of 12th Language Resources and Evaluation Conference)}, month = 5月, year = 2020, publisher = {法国欧洲语言资源协会(France European Language Resources Association)}, pages = {894-903} }

提供机构:
pinecone
原始信息汇总

数据集概述

基本信息

  • 名称: CORE Deduplication of Scholarly Documents
  • 语言: 英语 (en)
  • 许可证: MIT
  • 多语言性: 单语种
  • 大小: 100K<n<1M
  • 任务类别: 其他
  • 任务ID:
    • natural-language-inference
    • semantic-similarity-scoring
    • text-scoring
  • 标签: deduplication

数据集描述

  • 摘要: CORE 2020 Deduplication dataset 包含100K学术文档,标记为重复/非重复。
  • 下载大小: 204 MB

引用信息

@inproceedings{dedup2020, title={Deduplication of Scholarly Documents using Locality Sensitive Hashing and Word Embeddings}, author={Gyawali, Bikash and Anastasiou, Lucas and Knoth, Petr}, booktitle = {Proceedings of 12th Language Resources and Evaluation Conference}, month = may, year = 2020, publisher = {France European Language Resources Association}, pages = {894-903} }

搜集汇总
数据集介绍
pinecone/core-2020-05-10-deduplication 数据集图片
构建方式
CORE 2020去重数据集(pinecone/core-2020-05-10-deduplication)源自CORE学术文献聚合平台,旨在解决学术文档中重复内容的识别问题。该数据集基于2020年5月10日从CORE系统捕获的文献快照构建,利用局部敏感哈希(Locality Sensitive Hashing)与词嵌入技术相结合的方法,对大规模学术文档进行相似性检测与去重标注。通过这一混合策略,研究者从海量文献中筛选出约10万对文档,并为其标注是否为重复项,从而形成可用于训练和评估去重模型的基准数据集。
特点
该数据集的核心特色在于其专注于学术文档的去重任务,覆盖了自然语言推理、语义相似度评分及文本评分等多类下游应用场景。数据集规模介于10万至100万之间,提供约10万对已标注的文档对,每对文档均附有明确的重复或非重复标签。数据采用英文单语形式,遵循MIT开源许可协议,便于学术社区自由使用与复现。其构建方法融合了传统哈希算法与现代词嵌入技术,兼顾了去重任务中的效率与精度,为学术文献管理及信息检索领域提供了高质量的标注资源。
使用方法
该数据集的使用方式灵活多样,研究者可直接将其加载至Hugging Face框架中,通过`datasets`库调用`load_dataset('pinecone/core-2020-05-10-deduplication')`快速获取数据。数据集适用于训练和评估文本去重模型,也可用于语义相似度计算与自然语言推理任务的基准测试。用户需注意数据仅包含英文文献对,建议在学术文献去重或相似性分析的实验环境中使用。引用时请参照论文《Deduplication of Scholarly Documents using Locality Sensitive Hashing and Word Embeddings》以尊重原作者贡献。
背景与挑战
背景概述
在学术信息爆炸式增长的当下,科研文献的重复存储与索引已成为知识管理领域的重大隐患。为应对这一挑战,英国开放大学CORE团队于2020年5月发布了CORE Deduplication数据集,由Bikash Gyawali、Lucas Anastasiou和Petr Knoth主导构建。该数据集聚焦于学术文档去重这一核心研究问题,旨在通过标注10万篇学术文献的重复与非重复关系,为自然语言推理、语义相似度评分等任务提供基准。其研究依托局部敏感哈希与词嵌入技术,开创性地将高效近似检索与深度语义特征融合,显著推动了学术大数据清洗与知识图谱构建的精度。该成果发表于LREC 2020会议,已成为学术信息检索领域去重任务的重要参考标准。
当前挑战
该数据集所解决的领域挑战在于学术文献库中普遍存在的重复记录问题,如同一论文以不同版本、标题或格式分散存储,导致检索效率低下与引用统计失真。传统去重方法依赖精确匹配或简单规则,难以应对语义等价但表述迥异的复杂情形。在构建过程中,CORE团队面临两大核心难题:其一,从全球异构的开放获取仓库中采集百万级文档,需设计鲁棒的预处理流程以消除格式噪声;其二,人工标注10万对文档的重复标签成本高昂,且需确保跨学科、跨来源的标注一致性,这对标注指南的制定与质量审核提出了严苛要求。
常用场景
经典使用场景
在学术文献管理领域,海量数字资源的涌现使得重复文档的识别成为一项基础而关键的挑战。pinecone/core-2020-05-10-deduplication数据集应运而生,其核心设计用于训练和评估基于局部敏感哈希与词嵌入的学术文档去重模型。该数据集包含十万条标注为重复或非重复的学术文献对,为研究者提供了标准化的基准测试平台,从而推动高效去重算法的发展。经典使用场景涵盖大规模学术数据库的清洗、文献检索系统的优化以及知识图谱构建中的实体对齐任务,其中精准的重复检测能力直接提升数据质量与系统性能。
实际应用
在实际应用中,该数据集驱动的去重模型被广泛部署于学术搜索引擎、机构知识库及开放获取平台的日常运维中。例如,CORE系统利用基于此数据集训练的算法,成功识别并合并了来自全球数千个数据源的重复学术记录,大幅减少了用户检索时遭遇的冗余信息。此外,科研管理机构借助这些工具进行项目成果统计,确保资助产出报告的准确性;出版社则用于审核投稿库中的一稿多投行为,从而维护学术诚信。这些应用不仅提升了信息服务的用户体验,还降低了人工审核的成本与主观偏差。
衍生相关工作
该数据集催生了一系列具有影响力的衍生研究。其伴随论文提出的基于局部敏感哈希与词嵌入的混合去重方法,成为后续学术文本去重领域的基线模型。研究者在此基础上进一步探索了基于Transformer的深度语义匹配网络,以及结合元数据与全文特征的跨模态去重策略。同时,该数据集也被用于对比不同语言模型(如BERT、SciBERT)在学术文档相似度任务上的表现,推动了预训练模型在专业领域微调的发展。这些工作共同丰富了学术信息去重的技术谱系,并反向促进了数据集本身的迭代与扩展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务