遇见数据集

myco-spore-nutrients

收藏
Hugging Face2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

本数据集为 MycoNet NutrientCards 的衍生数据集,仅包含从源文本中提取的衍生层信息,包括结构化摘要、衍生语义、分解证明以及溯源/署名信息。源文本全文未被包含在内,以确保跨境分发的合规性。数据集共包含15个字段,如 card_id、source_url、status、license_class、lang、structured_summary、derived_meaning、derived_confidence、decomposition_proof、snapshot_cid、attribution、embedding_ref、domain、domain_confidence 和 origin。数据覆盖多个领域,包括真菌学(755条)、生态学(41条)、生物学(278条)、医学(685条)、文学(49条)和通用(565条)。所有样本均来自活跃且健康的来源(living),共2373条,无垃圾来源。数据许可为 CC-BY 4.0,原始来源保留其各自许可(如公共领域或开放许可)。适用于特征提取、文本生成、结构化知识表示、生物/医学/生态等领域的信息检索与推理任务。

This dataset is a derived dataset of MycoNet NutrientCards, containing only derivative layer information extracted from the source text, including structured summaries, derived semantics, decomposition proofs, and provenance/attribution information. The full text of the source is not included to ensure compliance with cross-border distribution. The dataset contains 15 fields, such as card_id, source_url, status, license_class, lang, structured_summary, derived_meaning, derived_confidence, decomposition_proof, snapshot_cid, attribution, embedding_ref, domain, domain_confidence, and origin. The data covers multiple domains, including mycology (755 entries), ecology (41 entries), biology (278 entries), medicine (685 entries), literature (49 entries), and general (565 entries). All samples come from active and healthy sources (living), totaling 2,373 entries, with no spam sources. The data license is CC-BY 4.0, and original sources retain their respective licenses (e.g., public domain or open licenses). It is suitable for tasks such as feature extraction, text generation, structured knowledge representation, and information retrieval and reasoning in biological, medical, and ecological domains.

创建时间:
2026-08-02
原始信息汇总

数据集概述:MycoNet NutrientCards — 衍生数据集

基本信息

  • 许可证:CC-BY 4.0(仅适用于衍生内容;原始来源保留各自许可)
  • 语言:英语(en)、中文(zh)
  • 规模:n<1K(小于1000条)
  • 任务类型:特征提取、文本生成
  • 标签:科学知识、结构化数据、嵌入、真菌学、生态学、生物学、医学、文献

数据内容

本数据集为衍生数据集,包含菌网养分卡(Myco-Spore 工厂)的衍生层信息,不包含源文全文。每条数据包含15个字段:

  • card_id、source_url、status、license_class、lang
  • structured_summary(结构化摘要)
  • derived_meaning(衍生语义)
  • derived_confidence
  • decomposition_proof(分解证明)
  • snapshot_cid、attribution、embedding_ref
  • domain、domain_confidence、origin

数据存储于 data/nutrients.jsonl 文件,机器可读模式见 schema.json

域分布

数量
mycology(真菌学) 755
medicine(医学) 685
general(通用) 565
biology(生物学) 278
literature(文献) 49
ecology(生态学) 41

发现标签(非空域):mycology、ecology、biology、medicine、literature

来源分类

按来源纯度法划分:

  • living(活跃来源):2373条
  • garbage(网络垃圾/失效链接):0条

来源与出处

  • 衍生内容遵循 CC-BY 4.0 许可
  • 原始来源保留各自许可(license_class 标记为 public-domain 或 open-license)
  • 通过 source_urlattribution 保留源归属信息
  • 数据集设计旨在确保跨境分发合规安全
搜集汇总
数据集介绍
myco-spore-nutrients 数据集图片
构建方式
本数据集源自菌网养分卡(Myco-Spore 工厂),仅收录其衍生层内容。构建过程严格遵循来源纯度法,从活跃的工厂白名单与实时站点地图中筛选出2373条“活体”来源,并排除所有失效链接与网络残骸。每条记录通过结构化摘要、衍生语义、分解证明及溯源信息,将原始文献转化为合规的派生产物,原始全文刻意不纳入,确保跨境共享的合法性与安全性。
特点
该数据集以15个精细字段构成,涵盖卡片标识、来源链接、许可类别、语言、结构化摘要、衍生语义及置信度、分解证明、快照CID、归属信息、嵌入引用、领域标签及其置信度与来源纯度等级。领域分布横跨真菌学(755条)、医学(685条)、生物学(278条)、生态学(41条)及文学(49条),并辅以565条通用条目,形成多学科交叉的科学知识图谱。其派生内容采用CC-BY 4.0许可,原始来源的许可属性得到完整保留。
使用方法
数据集适用于特征提取与文本生成任务,尤其适合科学知识嵌入模型的训练与评估。用户可根据schema.json定义的机器可读结构,灵活访问衍生语义字段,构建多语言(英/中)的领域专用向量表示。由于不含原始全文,使用时需结合source_url与attribution回溯原始文献,以支持深度推理与知识验证。该数据集的许可条款允许广泛再分发,适合学术研究与跨机构协作。
背景与挑战
背景概述
该数据集由Myco-Spore工厂于近期创建,旨在为真菌学及相关领域提供结构化的科学知识衍生数据。其核心研究问题在于如何在不侵犯原始版权的前提下,通过衍生层(如结构化摘要、衍生语义和分解证明)实现知识的安全跨境共享。研究人员设计了来源纯度法(SPEC-007)和许可分类体系,确保数据来源可溯、合规。该数据集覆盖真菌学、生态学、生物学、医学和文学等多个领域,共2373条记录,为知识图谱构建、文本生成和特征提取等任务提供了高价值资源,推动了真菌学领域数据共享的规范化和国际化。
当前挑战
该数据集面临的挑战包括:首先,领域问题的挑战在于如何高效整合跨域(如医学、生态学)的异构科学知识,并确保衍生数据的语义准确性和可解释性,以满足多样化的下游任务需求;其次,构建过程中的挑战在于严格遵循版权法规,仅再分发衍生内容,避免包含源文全文,同时需维护来源溯源的完整性。此外,数据规模相对较小(<1K),可能限制模型的泛化能力,且跨语言(中英)处理增加了数据清洗和标注的复杂性。这些挑战要求持续优化数据生成流程和合规机制,以提升数据的实用性与可靠性。
常用场景
经典使用场景
该数据集作为菌物学与交叉学科知识图谱的衍生数据层,其核心应用场景在于为大规模科学文献的语义压缩与结构化重构提供标准化接口。通过将原始文献转化为包含结构化摘要、衍生语义及分解证明的JSON格式记录,它使得研究者能够在不触碰原始版权文本的前提下,高效构建跨语种(中英双语)的菌物学领域知识库。此设计特别适用于需要频繁更新知识实体、并维持严格溯源合规性的学术环境,例如生物多样性数据库的增量式构建或医真菌学文献的智能检索系统。
衍生相关工作
此数据集的设计激发了一系列衍生工作,尤其在知识蒸馏与合规共享技术栈上。基于其‘派生层’架构,研究者开发了自动化的文献精炼管道,用于从版权受限文本中提取可公开使用的语义摘要。围绕其分解证明(decomposition_proof)字段,催生了验证知识衍生链完整性的算法研究,提升了知识图谱构建的透明度。同时,其域分布统计(如mycology占比31.8%)为领域自适应预训练模型的语料均衡策略提供了基准参考,推动了面向特定科学领域的轻量化语言模型发展。
数据集最近研究
最新研究方向
该数据集聚焦于真菌学与生态医学交叉领域的前沿研究,通过衍生数据层实现知识结构的安全共享与合规分发。其研究方向涵盖菌物养分网络的语义解构、跨域生物医学信息提取以及生态网络中的动态关联分析,依托来源纯度法(SPEC-007)与域分布标签(SPEC-006b),为嵌入模型提供高置信度的结构化知识基底。当前研究热点包括将此类数据用于推进真菌在医学、生态修复及文学中的多模态知识图谱构建,以及通过去中心化内容标识(CID)确保衍生内容可溯源与跨境合作,从而促进开放科学背景下真菌学大数据的伦理化利用与全球协作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务