遇见数据集

MAGKG

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

MAGKG公共构件数据集是一个用于分层成矿知识图谱构建的资源集合,支持基于SLM-LLM协作的框架。数据集包含多种结构化组件:1)模式定义文件,明确了实体层次结构和关系模式;2)合成边界语料库,包含40,000条完整样本和10,000条分层样本的JSONL文件,专门用于边界导向的跨度训练,并附有统计摘要;3)知识图谱来源子集,提供块级示例(包含实体、别名、有效关系和详细的文本来源信息)、扁平化三元组(关联证据文本、块文本和段落文本)、从跟踪块生成的规范图子集、边级证据表以及代表性的归一化和消歧注释;4)样本文件,提供各种数据格式的简化示例,便于快速访问和测试;5)预训练模型构件,包括边界模型检查点、配对解码阈值和模型元数据。该数据集适用于知识图谱构建、命名实体识别、关系抽取、证据追溯以及图机器学习等任务,特别面向地质学和矿床学领域的文本分析应用。

The MAGKG Public Component Dataset is a resource collection for constructing hierarchical mineralization knowledge graphs, supporting an SLM-LLM collaboration-based framework. The dataset includes multiple structured components: 1) Schema definition files, which clarify the entity hierarchy and relationship schema; 2) Synthetic boundary corpus, which consists of JSONL files containing 40,000 complete samples and 10,000 hierarchical samples, specifically designed for boundary-oriented span training, with attached statistical summaries; 3) Knowledge graph source subset, which provides block-level examples (including entities, aliases, valid relationships and detailed text source information), flattened triples (associating evidence texts, block texts and paragraph texts), canonical graph subsets generated from tracked blocks, edge-level evidence tables, and representative normalization and disambiguation annotations; 4) Sample files, which provide simplified examples in various data formats for quick access and testing; 5) Pretrained model components, including boundary model checkpoints, paired decoding thresholds and model metadata. This dataset is applicable to tasks such as knowledge graph construction, named entity recognition, relation extraction, evidence tracing, and graph machine learning, and is specifically targeted at text analysis applications in the fields of geology and mineral deposit science.

创建时间:
2026-06-23
原始信息汇总

数据集概述:MAGKG Public Artifacts

MAGKG 是一个基于 SLM-LLM 协同的层次化成矿知识图谱构建框架,该数据集为其公开的配套资源。

核心信息

  • 语言:英语
  • 许可证:Apache-2.0
  • 任务类型:Token 分类、文本分类、图机器学习
  • 标签:知识图谱、地质学、矿床、命名实体识别、关系抽取、证据追踪

数据组成

数据集包含多个配置(config),每个配置对应一个数据文件,涵盖以下主要类别:

1. 合成边界数据 (Synthetic Boundary Data)

  • synthetic_boundary_full:完整的合成边界语料,用于基于边界的跨度训练(40,000 条)。
  • synthetic_boundary_stratified:分层抽取的合成子集,包含 ID 和课程式元数据(10,000 条)。
  • synthetic_boundary_sample:供本地代码流程使用的 240 行合成边界样本。

2. 知识图谱溯源子集 (KG Provenance Subset)

  • kg_trace_chunks:包含实体、别名、模式有效关系及文档/段落/句子/块级溯源的块级示例。
  • kg_trace_triples:包含证据文本、块文本和段落文本的扁平化三元组。
  • kg_evidence_trace:从规范图中导出的边级证据表。

3. 样本数据 (Samples)

  • sample_boundary_trainsample_chunkssample_triples:紧凑格式的示例数据(位于 samples/ 目录下)。
  • 另包含 kg_trace_chunkskg_trace_triples 的副本,便于快速访问。

附带资源

  • 模式文件magkg_schema.json:MAGKG 实体层次结构和关系模式。
  • 模型文件best_model.pt(边界模型检查点)、best_thresholds.json(解码阈值)、model_metadata.json(模型元数据)。
  • 其他元数据synthetic_dataset_summary.json(合成语料统计摘要)、canonical_graph_subset.json(规范图子集)、normalization_disambiguation_notes.json(归一化与消歧说明)。

使用方式

需配合源代码仓库使用:https://github.com/Kky6/MAGKG

搜集汇总
数据集介绍
MAGKG 数据集图片
构建方式
MAGKG数据集是基于小语言模型与大语言模型协同的层次化成矿知识图谱构建框架所生成的公开产物。数据集的构建融合了地质文献的深层语义与结构化知识,通过合成边界语料库、知识图谱溯源子集与模式定义三大模块系统实现。其中,合成边界数据采用完整的跨度标注策略,生成了包含四万样本的全量语料与一万条按层次分层的课程式训练数据;知识图谱溯源子集则从文档、段落、句子到语块逐层追溯实体与关系,最终导出规范的规范图与证据表,确保了知识来源的透明性与可复现性。
使用方法
使用者可结合配套的源代码仓库对MAGKG数据集进行高效调用。通过克隆GitHub上的代码库并运行统一流程脚本,系统将自动执行模式验证、课程式边界清单构建、规范图生成与证据表导出等关键步骤。数据集在HuggingFace平台上以多个配置形式发布,涵盖全量合成边界数据、分层样本及知识图谱溯源子集,便于研究人员根据任务需求灵活加载。同时,提供的模型检查点与兼容的SciBERT跨度边界推理代码,使得微调与评估过程无缝衔接,极大降低了地学知识图谱构建的应用门槛。
背景与挑战
背景概述
MAGKG数据集由某研究团队创建,专注于构建基于小语言模型与大型语言模型协作的分层成矿知识图谱,旨在系统化整合地质学与矿床学领域的知识。该数据集发布于HuggingFace平台,依托于对地质文献中命名实体识别、关系抽取及证据追踪等任务的深入探索,为核心研究问题——即如何通过语言模型协同机制实现领域知识的精准提取与结构化——提供了关键支撑。其影响力体现在推动知识图谱在地质科学中的应用,为矿产资源勘探与成矿理论验证提供了可复现的数据基础。
当前挑战
该数据集面临的核心挑战包括:1)解决地质领域信息碎片化问题,即从非结构化的地质文献中自动识别矿床类型、矿物组合等专业实体及其复杂关系,克服传统人工构建知识图谱的效率瓶颈;2)构建过程中需处理语言模型在专业语料上的边界识别精度不足,以及跨文档证据链的连贯性验证问题;3)合成数据与真实文献的分布差异导致模型泛化困难,同时需要确保图谱中实体标准化与歧义消解的可靠性,以支持后续的知识推理与证据追溯任务。
常用场景
经典使用场景
MAGKG数据集专为地质矿产领域构建层次化知识图谱而设计,其经典使用场景聚焦于基于小语言模型与大语言模型协同的端到端知识抽取与图谱构建。具体而言,研究者利用该数据集提供的合成边界语料与实体关系标注,训练面向地质文本的命名实体识别与关系抽取模型,实现对矿床类型、成矿时代、控矿构造等复杂地质实体的精准边界识别。同时,数据集内置的篇章级证据追溯三元组,支持从科学文献中抽取可验证的知识片段,并构建具有可解释性的因果关系图谱,为地质知识的结构化表示与智能推理奠定基础。
解决学术问题
该数据集的问世有效攻克了地质学领域知识图谱构建中训练数据匮乏与专家标注成本高昂的学术瓶颈。传统地质知识抽取高度依赖人工标注,难以覆盖矿床学中细粒度的实体层级与多样化的关系类型。MAGKG通过合成数据策略与层次化模式设计,首次为矿产预测、成矿规律总结等任务提供了大规模、高覆盖率的标注语料。其解决了跨文献证据追踪与知识一致性校验的难题,使得从海量地质报告中自动抽取出符合领域本体的结构化知识成为可能,显著推动了地质人工智能在知识表示与推理方向的研究进展。
实际应用
在实际应用层面,MAGKG为矿产勘查与资源评估的智能化转型提供了关键技术支撑。基于该数据集训练的模型可自动处理地质调查报告中蕴含的知识,快速构建起包含矿床分布、成矿序列与控矿要素的数字化知识网络。该数据集支持地质工程师在区域成矿预测中实现关联查询与智能推荐,例如通过实体链接快速定位特定构造背景下的相似矿床类型。此外,从证据追溯三元组导出的可解释性图谱,能够为矿产潜力评价提供清晰的推理链条,帮助决策者理解知识间的因果逻辑,从而提升勘查部署的科学性与效率。
数据集最近研究
最新研究方向
当前,地质学知识图谱的构建正逐步迈向自动化与精细化,MAGKG数据集所引领的研究方向聚焦于小语言模型与大语言模型协同驱动的层次化矿床成因知识图谱构建。通过融合命名实体识别、关系抽取与证据溯源技术,该数据集为从海量地质文本中自动提取矿床实体及其时空关联提供了标准化基准,尤其支持边界感知的跨度训练与图结构溯源。这一前沿探索不仅呼应了智能矿产勘查领域对结构化知识库的迫切需求,还通过可追踪的证据链机制显著提升了知识图谱的可靠性与可控性,推动地质大数据从信息检索向因果推理范式跃迁,具有促进矿产资源高效评估与成矿模式深度挖掘的关键意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务