遇见数据集

doctolib-lab/finemed-rephrased-fr

收藏
Hugging Face2026-06-23 更新2026-07-22 收录
官方服务:

资源简介:

FineMed-rephrased-fr是一个法语医学文本数据集,通过大型语言模型(LLM)对FineMed-fr源文档进行重写生成,旨在提高医学术语密度并扩展医学概念的共现上下文。数据集包含三个来源的子配置:FineWeb-2、FinePDFs和FineWiki,总计1360万文档和45亿单词。重写过程采用两阶段流程:首先筛选医学内容并提议多样化的体裁-受众配对,然后进行忠实密度化和表面形式变化,保留医学内容不变,同时调整文本风格和缩写密度。数据集包含重写文本、原始文本、ID、URL、字数统计、重写配置参数、教育质量评分、医学术语密度等字段,适用于掩码填充和文本生成任务。数据集基于ODC-BY和CC BY-SA 4.0许可证,但请注意数据为合成文本,未经过临床验证,不构成医疗建议。

FineMed-rephrased-fr is a French medical text dataset generated by LLM rephrasing of FineMed-fr source documents, designed to increase medical-term density and broaden the co-occurrence context around medical concepts. The dataset includes three sub-configurations from sources: FineWeb-2, FinePDFs, and FineWiki, totaling 13.6 million documents and 4.5 billion words. The rephrasing pipeline involves a two-stage process: medical-content gating with diverse genre-audience pair proposals, followed by faithful densification and surface variation, preserving medical content while adjusting style and abbreviation density. It features fields such as rephrased text, original text, ID, URL, word counts, rewriting configuration, educational quality scores, and medical entity density, suitable for fill-mask and text-generation tasks. Licensed under ODC-BY and CC BY-SA 4.0, but note that the data is synthetic, not clinically validated, and does not constitute medical advice.

提供机构:
doctolib-lab
搜集汇总
数据集介绍
doctolib-lab/finemed-rephrased-fr 数据集图片
构建方式
FineMed-rephrased-fr 是基于 FineMed-fr 法语医疗语料库,通过信号放大式改写策略构建而成。其核心流程采用两阶段的大语言模型改写管线:第一阶段通过医疗内容门控筛选出医学信息充足的文档,并利用多样化的体裁-受众配对策略,为每篇源文档随机分配一对组合;第二阶段则依据所选配对进行忠实性改写,严格保留所有医学事实、数值与实体,同时剔除无关填充内容,并沿三种轴变化表面形式——语域(正式或电报式临床笔记风格)、缩写密度(展开、中等或密集)以及非医疗个人信息的替换。最终,改写文本经语言识别与重复过滤后,重新标注教育质量与医学术语密度,形成含约1360万文档、45亿词的高密度法语医学语料。
特点
本数据集最显著的特点在于其信号放大效应:相较于原始 FineMed-fr 语料,平均医学术语密度从0.079翻倍至0.164,实现了跨医学子域的一致性提升。每个文档均附带丰富的元信息,包括改写配置参数(体裁、受众、语域、缩写密度)、改写后重新计算的医学术语实体及其密度、教育质量评分,以及保留源文档的原始标注字段,便于进行前后对比与质量筛选。此外,改写过程在提升术语密集度的同时,也自然清除了源数据中的脏数据(如网页模板残留、OCR识别错误),使得语料在医学预训练场景中更加干净、聚焦。
使用方法
用户可通过 HuggingFace Datasets 库便捷加载该数据集,支持按来源子集(fineweb-2、finepdfs、finewiki)选择不同配置。每个配置均包含改写后的文本、原始文本、文档标识符及丰富的标注字段,推荐利用教育质量评分与医学术语密度进行质量过滤。数据集适用于法语医学领域的掩码语言模型预训练、文本生成等任务,也可用于研究不同改写策略对下游任务的影响。由于语料源自公共网络,且改写过程中保留了医学信息、替换了非医疗个人数据,用户在涉及隐私保护的应用中仍需自行执行去标识化处理。
背景与挑战
背景概述
FineMed-rephrased-fr 数据集由 Doctolib 实验室于 2026 年创建,旨在应对法语医学领域预训练语料匮乏且质量参差的困境。该研究团队由 Bofeng Huang、Jacques Sun 等成员组成,核心目标是通过大规模语言模型对原始医学文本进行‘信号放大’式改写,提升医学术语密度与上下文共现范围,从而为下游医学编码器(如 DoctoBERT)提供更优质的预训练数据。该数据集基于 FineMed-fr 语料,整合了 FineWeb-2、FinePDFs 和 FineWiki 中的法语健康领域文本,经过两阶段医学适应型 MGA 框架重写,最终产出 1360 万篇文档与 45 亿词的高质量医学文本,在法语自然语言处理与生物医学信息学领域具有重要影响力。
当前挑战
该数据集致力于解决法语医学领域预训练数据质量不足的挑战。原始网络文本中医学信息稀疏、噪声混杂(如网页模板残留、OCR 错误),直接使用会导致模型学习能力受限。为此,研究团队构建了信号放大改写流程,需应对三大挑战:一是确保 LLM 忠实保留原始医学内容,不添加虚构事实或实体,并通过虚构值替换非医学个人身份信息;二是设计多样化的体裁-受众配对策略,以产生丰富的语境变化(如形式语体与电报式临床笔记风格),避免模型过拟合于单一写作范式;三是构建高效的计算预处理机制,通过粗筛跳过低医学内容文档,减少大模型调用开销。最终在提升密度二倍以上的同时,保持了教育质量的稳定性。
常用场景
经典使用场景
FineMed-rephrased-fr 数据集最经典的使用场景在于为法语法模型提供大规模、高质量且经过医学语义强化的预训练语料。在自然语言处理领域,面向法语医学文本的掩码语言建模与文本生成任务长期受限于高质量训练数据的匮乏,该数据集通过将13.6百万篇法语医学文档进行大语言模型重写,显著提升了术语密度与上下文共现广度,从而为构建如DoctoBERT等专用语言模型奠定了坚实的数据基础。研究者可直接利用其三个子配置(fineweb-2、finepdfs、finewiki)进行分布式训练,或依据教育质量评分与医学实体密度等标注信息筛选子集,开展针对特定医学子领域的模型微调与评估。
衍生相关工作
FineMed-rephrased-fr 作为法语医学预训练生态中的关键枢纽,已催生了一系列衍生研究工作。最直接的成果是DoctoBERT系列模型,该系列基于该数据集训练,在法语医学命名实体识别、关系抽取等下游任务上取得了显著进展。数据集构建过程中提出的医学自适体裁-受众重写流水线本身也成为方法论层面的贡献,其中两阶段重写策略(医学内容门控与忠实性稠密化、表面形式多样化)被后续研究借鉴用于其他低资源领域的语料增强。此外,其开源的重写配置参数、教育质量评分标注以及八类UMLS医学实体标签体系,为法语医学信息抽取系统的评测基准建立提供了标准化参照,促进了该领域开源社区的共同进步。
数据集最近研究
最新研究方向
FineMed-rephrased-fr代表了一种前沿的医学文本数据增强路径,通过大规模语言模型对法语医学语料进行信号放大式重述,显著提升医学术语密度与上下文共现广度。该数据集基于FineMed-fr构建,采用双阶段医学适配MGA改写策略,在忠实保留医学内容的前提下,通过体裁-受众配对、语域与缩写密度调控,生成多样化的临床文本变体。这一创新方法不仅有效清除了Web爬取数据中的噪声与OCR错误,更将平均医学术语密度从0.079提升至0.164,为法语医学预训练模型(如DoctoBERT)提供了更高质量的语义信号。该研究呼应了当前自然语言处理领域对高质量医学语料库的迫切需求,尤其在低资源语言场景下,其合成数据生成范式为弥合医学领域数据鸿沟开辟了新路径,对推动法语医疗NLP的临床应用与知识发现具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务