MDCite: A Large-Scale Multi disciplinary Citation Context Dataset
收藏资源简介:
MDCite MDCite is a large-scale, multi-disciplinary citation context dataset designed to support research in citation-aware scholarly information retrieval.The dataset treats citation contexts local textual spans surrounding in-text citations as the primary unit of retrieval and analysis, enabling fine-grained evaluation of intent-aware retrieval, ranking, and candidate generation methods. This Zenodo record contains all data artifacts required to reproduce the MDCite dataset and its construction pipeline, as described in the accompanying Scientific data paper. Data Sources MDCite is constructed by integrating multiple large-scale scholarly data sources: 🔹 Scopus bibliographic records (2000–2024) Scopus bibliographic records are collected via the Scopus API, which provides programmatic access to journal articles, citation counts, and rich publication metadata.The Scopus API is used to retrieve article-level information for selected journals, including publication year, venue, citation counts, and persistent identifiers.These records form the foundation of the dataset and are used to identify influential papers based on citation statistics, enabling reproducible large-scale data collection over a long temporal span (2000–2024). 🔹 Web of Science (WoS) 2024 Subject Categories Web of Science (WoS) 2024 subject categories are used to group journals by scientific field and to select Top-5 Q1 journals per field.This field-aware categorization enables journal-stratified selection and controls for substantial differences in citation practices across disciplines, supporting fair and interpretable cross-field analysis. 🔹 OpenAlex API The OpenAlex API is used for: DOI resolution Citation link retrieval (i.e., identifying papers that cite selected influential works) Structured bibliographic metadata access OpenAlex provides large-scale, open citation graph infrastructure enabling efficient identification of citing papers. 🔹 Semantic Scholar Graph API Citation context spans and citation intent labels are retrieved via the Semantic Scholar Graph API. For each citing paper, the API provides: Structured citation metadata Textual spans surrounding in-text citation markers Automatically assigned citation intent labels These structured reference-linked context spans form the core citation context units in MDCite. Dataset Construction Pipeline The MDCite construction process follows a transparent and reproducible pipeline: Journal selection Journals are grouped by WoS subject categories Top-5 Q1 journals are selected per scientific field Citation-based filtering Within each selected journal, the Top 5% most-cited papers are identified independently This journal-stratified strategy avoids overrepresentation of citation-intensive fields Citation context extraction Citation contexts are extracted from papers citing the selected influential papers Each context corresponds to a textual span surrounding an in-text citation marker Citation intent classification Each citation context is automatically assigned one of seven functional citation intents:background, uses, similarities, differences, motivation, extends, future_work Dataset variants A multi-intent intermediate variant is retained for provenance A single-intent benchmark variant is released for standard IR and classification evaluation File Overview 🔹 Core Dataset Files dataset_context_intent_single.csv (1.45 GB)Single-intent benchmark version of MDCite in CSV formatEach row corresponds to one citation context Provenance: The single-intent labels were derived from the intermediate JSON artifacts in citation_context_intent_data.zip (2.29 GB), where probabilistic/multi-intent model outputs were generated. The final label field corresponds to the primary intent selected per context. dataset_context_intent_single.parquet (620 MB)Same content as above, stored in Parquet formatRecommended for large-scale indexing, retrieval, and analytics workflows citation_context_intent_data.zip (2.29 GB)Full citation context data prior to single-label filtering.Includes intermediate JSON artifacts containing probabilistic/multi-intent model outputs and structured citation context records used during dataset construction.These files represent the complete multi-intent version of MDCite before benchmark conversion. 🔹 Construction and Provenance Files Scopus_(Year_2000–2024).zip (120 MB)Bibliographic metadata collected via the Scopus API WOS_2024_Subject_categories_(Top-5_Q1_Journals_per_field)_data.zip (51 MB)Journal lists grouped by scientific field Top_5%_cited_papers_per_journal_dataset.zip (8.05 MB)Lists of Top-5% cited papers selected independently within each journal Schema of MDCite Dataset Each citation context instance includes the following fields: text — citation context text label — functional citation intent field — scientific field group_id — citing paper identifier (for document-level evaluation splits) paperId — Semantic scholar work identifier doi — Digital Object Identifier venue — publication venue year — publication year source_file — provenance identifier Dataset Statistics Citation contexts: 2,057,196 Citing papers: ~100,000 Scientific fields: 21 Publication venues: >1,000 Citation intent classes: 7 The intent distribution is highly imbalanced, reflecting real-world citation behavior rather than artificially balanced labels. Intended Use Cases MDCite is intended for: Citation-aware information retrieval Intent-aware ranking and re-ranking Candidate generation analysis Large-scale citation intent classification Scholarly search and citation analysis Baseline BM25 retrieval experiments demonstrate that MDCite naturally supports deep-retrieval evaluation, where recall improves only at larger cutoffs due to large and distributed relevance sets. Reproducibility & Licensing All files are released for research and educational use. Reproducing the full construction pipeline requires: Access to the Scopus API (institutional entitlement may be required) Access to the OpenAlex API (publicly available) Access to the Semantic Scholar Graph API (publicly available; subject to rate limits) API keys are not included in this repository and must be supplied via environment variables. The dataset is designed to support end-to-end reproducible experimentation through clear provenance tracking, intermediate artifacts, and document-level identifiers.



