遇见数据集

Hari5115/MoleculeIQ

收藏
Hugging Face2026-05-25 更新2026-05-31 收录
官方服务:

资源简介:

MoleculeIQ包含约5,000个问答对,涵盖人们在食品、化妆品、药品、家居和环境中遇到的6类化合物。每个答案都遵循严格的质量标准:以结论开头,解释机制,提供剂量/背景,以可操作的要点结尾。

语言: - 英语 许可证:MIT 标签: - 化学 - 安全 - 成分 - 问答 - 合成 - MoleculeIQ 样本规模: - 1000 < n < 10000 任务类别: - 问答 - 文本生成 # MoleculeIQ(MoleculeIQ) 这是一款高质量的合成问答数据集,聚焦分子与成分安全领域,专为微调语言模型以解答日常化学与安全相关问题而设计。 ## 数据集描述 MoleculeIQ包含约5000条问答对,覆盖人们在食品、化妆品、药品、家居及环境中接触的6类化合物。所有答案均遵循严格的质量标准:开篇直接给出结论,随后阐释作用机制,提供剂量或相关背景信息,最后给出可落地的实用建议。 ## 类别 | 类别 | 描述 | 条目数 | |----------|-------------|---------| | 食品添加剂 | 甜味剂、防腐剂、着色剂、乳化剂 | 约1000条 | | 化妆品成分 | 防腐剂、紫外线过滤剂、活性成分、表面活性剂 | 约900条 | | 家用化学品 | 清洁剂、溶剂、消毒剂、杀虫剂 | 约800条 | | 药物 | 非处方药(OTC)、补充剂、常见处方化合物 | 约800条 | | 环境化学品 | 双酚A(BPA)、全氟和多氟烷基物质(PFAS)、杀虫剂、重金属、空气污染物 | 约750条 | | 天然化合物 | 咖啡因、多酚、生物碱、植物雌激素 | 约750条 | ## 难度等级 | 难度等级 | 问题风格 | 占比 | |-------|-------|-------| | 入门级 | "X是否安全?"、"我是否应避开X?" | 40% | | 进阶级 | "X的作用机制是什么?"、"X存在哪些风险?" | 40% | | 高级 | "对比X与Y"、"X产生毒性的机制是什么?" | 20% | ## 字段格式 json { "id": "moliq_00001", "question": "每日食用阿斯巴甜是否安全?", "answer": "在典型膳食摄入水平下,是的……", "category": "食品添加剂", "molecule": "阿斯巴甜", "safety_level": "一般安全", "difficulty": "入门级", "tags": ["甜味剂", "E951", "苯丙酮尿症", "每日允许摄入量(ADI)"] } ## 答案质量标准 本数据集的所有答案均需满足以下要求: 1. 首句直接给出结论 2. 阐释对应的作用机制或成因 3. 酌情包含剂量或暴露场景相关背景信息 4. 结尾给出切实可行的实用建议 5. 篇幅控制在80-150词,简洁直白 6. 随文对专业术语进行定义 ## 生成方式 本数据集由**Claude claude-haiku-4-5-20251001**([Anthropic](https://www.anthropic.com))生成,生成过程通过结构化提示严格遵循上述质量标准。随后使用TF-IDF余弦相似度(阈值0.85)进行验证与去重,以移除近似重复的问答对。 > 本数据集为合成生成数据集。尽管生成提示严格要求科学准确性,但本数据集的答案不应被视为权威的医疗或毒理学建议。 ## 适用场景 - 针对成分/化学品安全问答任务微调小型大语言模型(Large Language Model,LLM) - 开展领域特定问答任务的基准测试 - 研究面向大语言模型专业化的合成数据集质量 ## 数据集划分 | 划分集 | 样本数 | |-------|---------| | 训练集 | 约4250条 | | 测试集 | 约750条 | ## 引用方式 如果您使用本数据集,请引用以下文献: @dataset{moleculeiq2026, title = {MoleculeIQ: Synthetic Q&A for Molecular and Ingredient Safety}, author = {Hari5115}, year = {2026}, url = {https://huggingface.co/datasets/Hari5115/MoleculeIQ} } ## 许可证 MIT

提供机构:
Hari5115
二维码
社区交流群
二维码
科研交流群
商业服务