遇见数据集

ingredient-evidence-register

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

Vallydia 成分证据注册表是一个开放、证据分级的参考数据集,专注于化妆品和研究成分。它包含85种化合物,涵盖肽、小分子、蛋白质和混合物等类别。该数据集的核心特点是提供按具体结果划分的A-F证据等级(共456个分级结果行),而非对化合物进行单一整体评价。数据集还包含125个经过DOI验证的引用来源,为证据提供可信度支撑;246个机器可读的化妆品声称映射,区分了允许和禁止的声称;132个按地区(国际、欧盟、美国、英国)划分的法律状态行,以及19个世界反兴奋剂机构(WADA)禁用状态标识。数据集提供了化学标识符(如CAS、PubChem CID、InChIKey、SMILES),每个都带有明确的置信度和来源说明,对于无法明确匹配的21种化合物,相关字段被有意留空。此外,还包含了从高置信度SMILES生成的分子结构图像(42个2D结构)和大分子数据卡(22个)。数据集旨在解决化妆品和研究化合物市场中声称超越证据的问题,通过公开证据评估促进透明度。它适用于证据等级分类、基于证据的问答、监管声称检查以及检索增强生成等任务。数据集以多种结构化格式提供,包括规范的JSONL/JSON文件、扁平CSV表、用于分析的长表(如grades.csv, legal_status.csv)、Parquet镜像文件以及用于检索的语料库(corpus.jsonl)。数据集明确声明不包含剂量、管理或商业数据,并非医疗建议,其证据等级是Vallydia自身的评估,未经外部同行评审。使用时需注意可能存在的覆盖偏差、文献偏差以及监管数据的时效性。数据集采用CC-BY-4.0许可,要求在使用时进行署名。

The Vallydia Ingredient Evidence Registry is an open, evidence-graded reference dataset focused on cosmetic and research ingredients. It contains 85 compounds, covering categories such as peptides, small molecules, proteins, and mixtures. The core feature of the dataset is the provision of A-F evidence grades (totaling 456 graded result rows) divided by specific outcomes, rather than a single overall evaluation of compounds. The dataset also includes 125 DOI-verified citation sources to support evidence credibility; 246 machine-readable cosmetic claim mappings, distinguishing between allowed and prohibited claims; 132 legal status rows categorized by region (International, EU, US, UK), and 19 World Anti-Doping Agency (WADA) prohibited status identifiers. The dataset provides chemical identifiers (e.g., CAS, PubChem CID, InChIKey, SMILES), each with clear confidence and source annotations, with fields intentionally left blank for 21 compounds that cannot be definitively matched. Additionally, it contains molecular structure images generated from high-confidence SMILES (42 2D structures) and macromolecule data cards (22). The dataset aims to address the issue of claims exceeding evidence in the cosmetic and research compound markets by promoting transparency through open evidence assessment. It is suitable for tasks such as evidence grade classification, evidence-based question answering, regulatory claim checking, and retrieval-augmented generation. The dataset is provided in multiple structured formats, including canonical JSONL/JSON files, flat CSV tables, long tables for analysis (e.g., grades.csv, legal_status.csv), Parquet mirror files, and a corpus for retrieval (corpus.jsonl). The dataset explicitly states that it does not include dosage, administration, or commercial data, is not medical advice, and its evidence grades are Vallydias own assessments without external peer review. Users should be aware of potential coverage bias, literature bias, and the timeliness of regulatory data. The dataset uses the CC-BY-4.0 license, requiring attribution upon use.

创建时间:
2026-07-15
原始信息汇总

Vallydia Ingredient-Evidence Register 数据集详情

基本信息

  • 许可证: CC-BY-4.0
  • 语言: 英语
  • 数据集名称: Vallydia Ingredient-Evidence Register
  • 数据集大小: n<1K 条记录
  • 标签: cosmetics, skincare, ingredients, evidence, peptides, dermatology, tabular
  • 支持任务: 文本分类、问答

数据集内容

该数据集是一个基于证据评级的开放参考数据集,涵盖 85 种化妆品和研究用成分(肽类、小分子、蛋白质和混合物),由 Vallydia 发布。

核心内容

  • 证据等级评估: 针对每种成分的每个结局给出 A-F 等级,共 456 条已分级结局记录
  • DOI 验证引文: 125 条引用已解析至 DOI 并验证标题,涵盖 51 种成分
  • 化妆品声明映射: 21 种化妆品成分,共 246 条允许/禁止声明记录
  • 法律状态: 按区域(INT/EU/US/UK)共 132 条记录,含 WADA 禁用状态(19 种)
  • 化学标识符: 64 种成分有高置信度标识符(CAS、PubChem CID、InChIKey、SMILES),21 种诚实标注为空白
  • 分子结构图像: 42 张 2D 结构图像 + 22 张大分子数据卡片

证据等级说明

等级 含义
A 强有力且一致的人类证据
B 良好的人类证据,但效果较小或依赖配方
C 混合或有限的人类证据
D 弱证据——仅有机理或极小规模研究
F 未经测试/未证实,或经测试但失败
null 非功效声明行(如安全性、皮肤渗透),不强制转换为字母

数据集结构

数据集提供多种格式的表格:

主要配置与数据文件

配置名 数据文件
compounds data/parquet/compounds.parquet
grades data/parquet/grades.parquet
legal_status data/parquet/legal_status.parquet
citations data/parquet/citations.parquet
cosmetic_claims data/parquet/cosmetic_claims.parquet
identifiers data/parquet/identifiers.parquet

文件格式

  • 规范无损格式: data/compounds.jsonl(完整嵌套结构)、data/compounds.json
  • 平面表格: data/compounds.csv
  • 长/整洁表格: data/grades.csvdata/legal_status.csvdata/citations.csvdata/citations_enriched.csvdata/cosmetic_claims.csvdata/identifiers.csv
  • Parquet 镜像: data/parquet/*.parquet
  • 检索语料库: data/corpus.jsonl
  • 图像: images/structures/images/grade-cards/ 目录下的 SVG/PNG 文件

命名规范

  • 等级基于非专有名(化妆品用 INCI 名称、药品用 INN 名称)进行评定
  • 商品名仅记录在 trade_names 字段中,不参与等级评定

使用注意事项

  • 非医疗建议: 不提供剂量、给药或复溶信息
  • 等级是评估而非测量: 反映对文献基础的判断,合理专家可能有不同意见
  • 覆盖偏差: 涵盖 Vallydia 用户实际关注的化妆品活性成分和研究用肽类
  • 文献偏差: 等级继承发表文献的偏差(小样本、行业资助、发表偏倚)
  • 监管数据会过时: 法律状态反映 last_updated 字段日期

工具与访问层

  • API: 提供只读 OpenAPI 3.1 服务(FastAPI 参考实现 + Dockerfile)
  • Python 包: vallydia-register pip 包
  • npm 包: @vallydia-data/ingredient-register npm 包
  • 验证套件: build/validate_dataset.py

引用方式

  • DOI: 10.5281/zenodo.21364453
  • 引用时应使用概念 DOI,始终指向最新版本
搜集汇总
数据集介绍
ingredient-evidence-register 数据集图片
构建方式
Vallydia Ingredient-Evidence Register 是一个开放获取的文献证据分级参考数据集,涵盖85种化妆品及科研用化合物,包括肽类、小分子、蛋白质及混合物。数据集由Vallydia团队基于其维护的化合物注册表自动生成,核心构建逻辑在于对每种化合物针对不同功效结局进行独立的A至F级证据评估。分级过程综合考虑证据一致性、效应大小与质量,评估依据来源于已发表的科学文献,并由团队系统性归纳、批判性审视后完成。为保证数据完整性,该数据集同时收录了化学标识符(CAS、PubChem CID、InChIKey、SMILES)、各区域法律状态(INT/EU/US/UK)以及化妆品宣称的许可与禁止映射。数据以JSON、CSV、Parquet多格式发布,支持扁平化表格与长格式分析,并附有通过DOI验证的125条引用记录作为可信度支撑。
特点
该数据集最显著的特征在于其“按结局分级”的精细评价体系,同一化合物可能因功效维度的不同而获得从A到F截然不同的证据等级,彻底打破了传统数据库笼统概括单一成分功效的局限。数据集坚持证据透明度原则,对有疑义或无法确定的标识符及功效评价均如实留空或标注未定,杜绝过度推断。内置化妆品宣称合规映射表为行业提供机器可读的监管边界参考。此外,数据集的构建遵循非商业命名规则,所有证据等级均附着于物质的国际化妆品原料命名(INCI)或国际非专利药品名称(INN),而非品牌商标,保障了科学评价的公正性与可迁移性。
使用方法
该数据集可便捷地通过Hugging Face Datasets库加载,支持直接读取Parquet格式的分级表、化合物表及法律状态表等子集进行结构化分析。用户可轻松实现基于证据等级的化合物筛选、功效结局的细粒度查询,以及多成分间的横向对比。对于检索增强生成(RAG)场景,该数据集提供了预先生成的自然语言语料库文件,每条记录整合了化合物的身份信息、各结局分级、法律状态及注意事项,并链接至原始在线页面,便于构建可追溯源头的知识增强问答系统。同时,数据集配套提供了Python及Node.js工具包,能够高效地将数据加载为Pandas DataFrame或TypeScript对象,满足不同技术栈下的数据二次开发与集成需求。
背景与挑战
背景概述
在化妆品与科研化合物领域,市面上充斥着大量言过其实的功效宣称,而现有数据库往往仅提供成分的化学信息,缺乏对其证据质量的系统性评估。为填补这一空白,Vallydia团队于2026年发布了名为“ingredient-evidence-register”的数据集,由Jacob Bilenko主导构建,旨在为85种化妆品及研究用成分(涵盖多肽、小分子、蛋白质等)提供按结局分级的A-F证据等级评估。该数据集的发布颠覆了传统成分数据库的认知框架,首次将“证据诚实度”作为核心度量标准,对于推动皮肤科学、化妆品监管科学及循证医学实践具有里程碑式的影响。
当前挑战
该数据集面临的挑战多重且深刻。在领域问题层面,化妆品与科研化合物市场长期受困于“证据缺失”与“夸大宣称”的双重困境——大量成分的功效未被严格验证,或仅有单一、低质量的研究支撑,而消费者与从业者难以从碎片化信息中辨别真伪。数据集需要在不引入医疗建议的前提下,构建一套客观、可复现的评估体系,如实标注“未测试”或“测试失败”的情况。在构建过程中,化学标识符的歧义性是核心难点:对于混合物、专利类似物等无法确定单一结构的成分,数据集选择主动留空而非猜测,其代价是约25%的标识符字段为空白。跨区域法规的时效性追踪、文献偏倚的识别(如工业赞助研究、阳性结果发表偏倚)、以及97个故意不评级的结局行如何与用户清晰沟通其含义,均是亟需攻克的精细挑战。
常用场景
经典使用场景
在护肤与化妆品科学领域,成分功效的宣称往往缺乏透明且可量化的证据支持。该数据集为每个成分提供了按功效维度(如抗皱、保湿、美白)划分的A至F证据等级评分,并附有DOI验证的文献引用。研究者可利用这些结构化评级进行成分功效的文本分类任务,或构建基于证据的问答系统,以回答如“某肽类成分在抗炎效果上拥有何种级别的证据支持”这类问题。数据集还包含化妆品宣称的许可与禁止映射表,支持自动化合规性检查,从而在配方开发或产品宣称审核中实现证据驱动的智能决策。
衍生相关工作
该数据集催生了多项具有启发性的衍生工作。在工具层面,Vallydia官方发布了Python的pandas DataFrame封装包与JavaScript的typed对象npm包,并提供了OpenAPI 3.1接口服务,促进了跨语言的数据调用与自动化工作流构建。在学术探索上,该数据集可作为证据等级分类的基线基准,推动针对化妆品宣称的命名实体识别与关系抽取任务——例如从非结构化文献中自动识别成分-功效-证据等级三元组。此外,其Croissant元数据格式的兼容性使得该数据集能够无缝接入MLCommons生态系统,为未来开展大规模、跨数据集的证据图谱聚合研究奠定了基石。
数据集最近研究
最新研究方向
在化妆品与科研化合物功效评价领域,该数据集开创性地构建了按结局指标分级的A-F证据等级体系,突破了传统成分数据库仅描述化合物属性的局限。其核心价值在于将多肽、小分子等85种成分的456条结局证据与125篇DOI验证文献、246条化妆品宣称合规映射进行结构化关联,为检索增强生成和法规宣称核查提供可信基准。当前前沿方向聚焦于利用该证据分类框架训练文本分类与问答模型,实现自动化证据质量评估;同时,其明确的未评级与无效测试标记机制,为纠正行业夸大宣称、推动循证皮肤学实践提供了可审计的开放数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务