遇见数据集

SINAI/ALIA-es-biomedical-synthetic-instructions

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含使用指令模型生成并经过多步骤质量管道筛选的合成生物医学和医疗保健指令-响应对。生成过程遵循Magpie方法,模型首先生成用户端查询(临床问题、医疗指令或诊断任务),然后生成相应的答案。语料库包括一般提示和基于西班牙语生物医学文档(临床指南、药理学数据、医学文献和官方健康文档)构建的上下文条件提示。它涵盖多种任务类型,如临床诊断、药物信息、药物相互作用、患者教育、文档解释、命名实体识别、摘要以及医疗保健背景下的伦理推理。

--- 许可证:cc-by-sa-4.0 任务类别: - 文本生成 - 问答 - 文本分类 - 填空掩码 语言: - 西班牙语 标签: - 合成数据 - 生物医学 - 医疗保健 - 医学 - Magpie - 西班牙语 - 大语言模型训练 规模类别: - 10万<样本数<100万 配置: - 配置名称:default 数据文件: - 拆分:train 路径:"ALIA-es-biomedical-synthetic-instructions.jsonl" --- # 数据集介绍 **ALIA西班牙语生物医学合成指令语料库**是ALIA项目下基于**Magpie**方法创建的西班牙语合成指令微调资源。该语料库旨在训练与评估面向生物医学及医疗保健任务的语言模型,具备可控格式与大规模监督数据。 本语料库包含: - **639,456 条样本** - **961,073,205 个Token** - **14 种任务模态**:临床诊断、患者教育、伦理推理、文档解读、多知识层级问答、命名实体识别(NER)、摘要生成、简化任务、正误判断等。 ## 数据集细节 ### 数据集描述 本数据集包含通过指令模型生成并经过多阶段质量流程筛选的合成生物医学与医疗保健指令-回复对。生成流程遵循Magpie方法:模型首先生成用户侧查询(临床问题、医疗指令或诊断任务),随后生成对应的回复。 本语料库包含通用提示词与基于西班牙语生物医学文档(临床指南、药理学数据、医学文献、官方医疗文档)构建的带上下文提示词。涵盖多样化任务类型,如临床诊断、用药信息、药物相互作用、患者教育、文档解读、命名实体识别、摘要生成、医疗场景下的伦理推理等。 ### 数据集用途 本数据集适用于: - 西班牙语生物医学大语言模型的指令微调 - 临床与医疗问答 - 命名实体识别与医学术语抽取 - 医疗摘要生成与信息检索 - 医疗专业人员培训与患者教育应用 - 面向领域自适应与检索增强生成的生物医学系统的合成监督数据 ## 数据集结构 ### 数据实例 每条样本遵循以下结构: json { "instance_id": "CIMA_AEMPS-efectos_medicamento1", "question": "Dado el siguiente contexto: FICHA TÉCNICA - 1. NOMBRE DEL MEDICAMENTO Fisiológico B.Braun 0,9% solución para perfusión... Pregunta: ¿Cuáles son los principales efectos adversos asociados a la administración de solución fisiológica?", "response": "Los efectos adversos de la solución fisiológica al 0,9% son generalmente infrecuentes. Los más comunes incluyen: irritación local en el sitio de infusión, reacciones de hipersensibilidad, sobrecarga de volumen en pacientes con insuficiencia cardíaca o renal, e hipernatremia con uso prolongado.", "instruction": "Dado el siguiente contexto: FICHA TÉCNICA... analiza los efectos adversos potenciales.", "task_type": "efectos_medicamento", "question_variation_style": "original", "question_model": "phi-4", "response_model": "phi-4", "tokens": 542 } ### 数据字段 - **instance_id** (string): 样本的唯一标识符。 - **question** (string): 提交给模型的生成式问题或指令提示词。 - **response** (string): 生成的回复内容。 - **instruction** (string): 用于训练的完整指令文本。 - **task_type** (string): 生成模态(问题/指令/测试格式与上下文设置)。 - **question_variation_style** (string): 提示词变体策略的元数据。 - **question_model** (string): 用于生成问题/指令的模型。 - **response_model** (string): 用于生成回复的模型。 - **tokens** (int): 该样本的Token数量。 ### 数据拆分 按`task_type`的分布: | 任务类型 | 样本数量 | 占比 | | :--- | ---: | ---: | | 文档解读 | 65,832 | 10.30% | | 事实型问答 | 65,087 | 10.18% | | 专业伦理推理 | 57,712 | 9.03% | | 临床诊断 | 55,828 | 8.73% | | 知识型问答 | 55,150 | 8.62% | | 命名实体识别 | 53,617 | 8.38% | | 患者教育 | 53,441 | 8.36% | | 多回复任务 | 50,628 | 7.92% | | 正误判断 | 50,455 | 7.89% | | 简化任务 | 47,775 | 7.47% | | 正误判断 | 31,893 | 4.99% | | 定义型问答 | 29,154 | 4.56% | | 摘要生成 | 22,771 | 3.56% | | 流程型问答 | 113 | 0.02% | | **总计** | **639,456** | **100.00%** | 按`question_variation_style`的分布: | 变体样式 | 样本数量 | 占比 | | :--- | ---: | ---: | | 原始样式 | 489,612 | 76.57% | | 口语化质疑式 | 12,196 | 1.91% | | 感叹式对话 | 12,161 | 1.90% | | 带拼写错误的质疑式 | 12,127 | 1.90% | | 非正式对话 | 12,024 | 1.88% | | 质疑式 | 11,980 | 1.87% | | 带拼写错误的感叹式 | 11,861 | 1.85% | | 电报式感叹式 | 11,838 | 1.85% | | 口语化感叹式 | 11,703 | 1.83% | | 电报式 | 11,695 | 1.83% | | 带拼写错误的口语化 | 11,230 | 1.76% | | 口语化 | 10,707 | 1.67% | | 拼写错误式 | 10,377 | 1.62% | | 感叹式 | 9,945 | 1.56% | 按`question_model`的分布: | 模型 | 样本数量 | 占比 | | :--- | ---: | ---: | | phi-4 | 489,612 | 76.57% | | Qwen3.5-35B-A3B | 149,844 | 23.43% | 按`response_model`的分布: | 模型 | 样本数量 | 占比 | | :--- | ---: | ---: | | phi-4 | 313,048 | 48.96% | | qwen3.5 | 109,000 | 17.05% | | kimi-k2.5 | 72,400 | 11.32% | | gemma4 | 62,900 | 9.84% | | qwen3 | 57,404 | 8.98% | | llama-3.3 | 24,704 | 3.86% | ### 示例用法 python from datasets import load_dataset # 加载完整训练拆分数据集 data = load_dataset( "SINAI/ALIA-es-biomedical-synthetic-instructions", split="train", ) # 访问单条样本 example = data[0] print(example["instance_id"]) print(example["task_type"]) print(example["question"][:300]) print(example["response"]) 流式加载(推荐用于大文件): python from datasets import load_dataset stream_data = load_dataset( "SINAI/ALIA-es-biomedical-synthetic-instructions", split="train", streaming=True, ) for i, example in enumerate(stream_data): print(f"[{i}] {example['task_type']}") print(f"Q: {example['question'][:180]}...") print(f"A: {example['response'][:180]}... ") if i >= 2: break ## 数据集创建 ### 筛选依据 本语料库旨在为ALIA项目内的西班牙语生物医学与医疗保健语言任务提供大规模、领域专属的合成监督数据,目标是提升模型在临床问答、诊断推理、用药信息检索、患者教育与医疗文本分析中的表现。 ### 源数据 基于上下文的生成内容依托公开西班牙语生物医学与医疗保健文档(临床指南、药理学数据表、医学文献、医疗协议、官方医疗机构出版物),这些数据源自**ALIA-es-biomedical**语料库。通用生成内容则受限于基于医学知识与临床最佳实践训练的生物医学领域系统提示词。 ### 数据收集与处理 #### Magpie生成流程 生成流程遵循适配生物医学领域的Magpie方法: 1. 提供生物医学**系统提示词**(基于临床知识、医疗指南与药理学专业知识训练)。 2. 多生成模型(Phi-4、Qwen 3.5等)生成用户侧提示词,即生物医学问题/指令(临床诊断、用药效果、药物相互作用、患者教育等)。 3. 多回复模型(Phi-4、Llama-3.3、Qwen、Kimi-K2.5、Gemma4)从各自的专业视角生成对应查询的回复。 4. 对于带上下文的生成模式,会在生成前注入生物医学文档上下文。 5. 任务类型涵盖临床场景、命名实体识别、摘要生成、简化任务、伦理推理与多知识层级问答。 本实现的文档可在GitHub的[sinai-uja/ALIA-UJA/documentation/data/llms/instructions](https://github.com/sinai-uja/ALIA-UJA/tree/dev/documentation/data/llms/instructions)中查看。 #### 质量筛选与重构步骤 最终语料库遵循以下筛选策略: 1. 初始合成生成与诊断审查。 2. 使用**Galtea**基于大语言模型的质量策略,对Magpie生成的原始指令-回复输出进行过滤。 最终的训练文件即为用于下游指令微调的整合产物。 ### 标注信息 本数据集无人工标注,元数据字段均在生成与整合过程中自动生成。 ### 个人与敏感信息 本数据集源自公开生物医学与医疗资源及合成变换,已应用标准筛选流程以减少敏感或个人可识别内容。 ## 数据使用注意事项 ### 数据集的社会影响 本数据集可助力西班牙语生物医学AI系统的开发,提升医疗知识获取、临床决策支持、患者教育与医疗专业人员培训的可及性。但需负责任地使用,绝不可替代专业医疗建议。 ### 偏差讨论 潜在偏差包括: - 源自源生物医学与医疗话语的偏差,可能反映机构视角与既有实践 - 由所用多生成模型引入的偏差 - 合成语料库典型的风格同质化问题 - 源文档中某些医疗状况或治疗方案的潜在过度代表 - 西班牙语医疗术语与医疗体系固有的语言与文化偏差 - 罕见病或新兴医学知识的潜在代表性不足 ### 已知局限性 - 合成医疗回复不可作为临床建议使用,其缺乏医疗专业人员的语境与专业判断 - 部分上下文片段可能包含源自源制药或医疗文档的OCR或格式伪影 - 语料库反映西班牙语医疗术语体系,可能与其他西班牙语地区存在差异 - 任务分布虽较为均衡但并非完全统一 - 生成文本可能无法捕捉真实临床文档的细微差别 - 不同源数据的时间覆盖范围各异,部分医疗信息可能已过时 ### 引用 bibtex @misc{ALIA-es-biomedical-synthetic-instructions, title={ALIA西班牙语生物医学合成指令语料库}, author={SINAI研究组}, year={2026}, publisher={HuggingFace}, howpublished={url{https://huggingface.co/datasets/SINAI/ALIA-es-biomedical-synthetic-instructions}} } --- ## 资助信息 本工作由西班牙数字化与公共职能部资助,依托欧盟下一代欧盟计划,在ALIA项目框架内完成。 ## 致谢 本数据集的生成感谢[SCAYLE](https://www.scayle.es/)(卡斯蒂利亚-莱昂超级计算中心),其通过CALENDULA超级计算集群提供了所需的计算资源。 --- **联系方式:** [ALIA项目](https://www.alia.gob.es/) - [SINAI研究组](https://sinai.ujaen.es) - [哈恩大学](https://www.ujaen.es/) **更多信息:** [SINAI研究组](https://sinai.ujaen.es) | [ALIA-UJA项目](https://github.com/sinai-uja/ALIA-UJA)

提供机构:
SINAI
搜集汇总
数据集介绍
SINAI/ALIA-es-biomedical-synthetic-instructions 数据集图片
构建方式
该数据集依托ALIA项目,采用Magpie方法构建西班牙语生物医学合成指令语料。生成流程以经临床知识、医学指南及药理专业知识训练的生物医学系统提示为起点,由Phi-4、Qwen3.5等多种生成模型补全用户侧查询,涵盖临床诊断、药物效应、药物相互作用与患者教育等主题,再由Phi-4、Llama-3.3、Kimi-K2.5等模型从各自专长视角生成回答;上下文条件模式在生成前注入西班牙语生物医学文献语境,最终输出经Galtea基于LLM的质量策略过滤,并整合为训练文件。
使用方法
该数据集主要服务于西班牙语生物医学大模型的指令微调,亦可用于临床与医学问答、命名实体识别与医学术语抽取、医学摘要与信息检索、医疗从业者培训及患者教育等场景,并为领域自适应与面向RAG的生物医学系统提供合成监督。使用时可通过datasets库的load_dataset接口加载完整训练集,或采用streaming流式模式以应对大文件读取,按instance_id、task_type、question与response等字段访问样本;鉴于其合成属性,生成内容不应作为临床建议使用。
背景与挑战
背景概述
在西班牙语生物医学与医疗健康领域,高质量指令微调数据的匮乏长期制约着大语言模型的领域适配能力。ALIA-es-biomedical-synthetic-instructions数据集由西班牙哈恩大学SINAI研究组于2026年发布,隶属于西班牙政府ALIA项目,旨在为西语生物医学大模型提供大规模合成监督信号。该语料包含约63.9万条指令-响应对、逾9.6亿词元,覆盖临床诊断、患者教育、伦理推理、命名实体识别等14类任务模态。其依托Magpie方法,从公开临床指南、药理数据与医学文献中构建上下文条件化提示,对推动西语医疗人工智能研究与临床应用具有重要基础性意义。
当前挑战
该数据集所应对的领域问题在于,生物医学问答与临床决策支持对模型的准确性、安全性与专业深度要求极为严苛,而西语医疗资源相对稀缺,标注成本高昂。构建过程中的核心挑战包括:合成数据可能继承源文献的机构视角与实践偏好,产生系统性偏倚;多模型生成策略虽提升多样性,却引入风格异质与质量参差;部分药品说明书文本存在OCR与格式残留噪声;罕见病及新兴医学知识覆盖不足;此外,合成回复缺乏真实临床语境与医师判断,若被误用为诊疗建议将带来伦理风险,故须在效用与安全之间审慎权衡。
常用场景
经典使用场景
在西班牙语生物医学与医疗健康领域,指令微调数据的稀缺长期制约着大语言模型的领域适配。该数据集以Magpie方法论为生成框架,构建了涵盖临床诊断、患者教育、药物信息检索、伦理推理、命名实体识别、文本摘要与简化等十四类任务模态的大规模合成指令语料。其经典使用场景聚焦于西班牙语生物医学大模型的指令微调与领域适应,研究者借助六十三万余条指令-响应对,在统一格式下对模型进行多任务监督训练,使其习得临床问答、医学术语提取与医学文本结构化处理等核心能力,从而在生物医学基准任务上取得显著的性能跃升。
解决学术问题
该数据集直面西班牙语医疗领域标注数据匮乏与任务模态单一的双重困境,通过合成生成与多模型协同标注策略,为生物医学自然语言处理研究提供了可复现的大规模监督资源。它有效缓解了低资源语言在临床问答、医学摘要与信息抽取等任务上训练数据不足的问题,使研究者得以系统探究指令微调对模型领域知识注入与推理能力的影响。其意义在于推动西班牙语医疗人工智能从通用能力向专业化、可解释化方向演进,并为跨语言医学知识迁移与领域适应研究提供了重要的实证基础与方法论参照。
实际应用
在实际医疗信息化与健康服务场景中,该数据集支撑的模型可应用于临床决策辅助、患者教育材料自动生成、药品说明书解读与药物相互作用提示等任务。医疗机构与健康科技企业可借助其训练西班牙语医疗问答系统,为医护人员提供快速文献摘要与诊疗参考,为患者生成通俗易懂的健康指导。此外,该数据集亦可用于构建面向医学文献的检索增强生成系统,提升医疗知识获取效率,并在医学教育、远程医疗咨询与公共卫生信息传播等环节发挥辅助作用。
数据集最近研究
最新研究方向
围绕西班牙语生物医学大模型指令微调的前沿探索,该数据集正推动合成数据在临床问答、药物信息抽取、患者教育及医学文本简化等多元任务中的深入应用。伴随大语言模型在医疗领域的快速渗透,基于Magpie方法的大规模合成监督成为缓解专业语料稀缺的重要路径,相关研究聚焦于多模型协同生成、上下文条件化问答以及伦理推理能力的对齐。该资源不仅促进了西班牙语医疗AI系统的公平可及,也为跨语言医学知识迁移与RAG导向的临床决策支持提供了关键数据基础,对提升非英语医疗场景下的模型安全性与专业可靠性具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务