遇见数据集

Texts of HAS publications

收藏
data.europa2024-09-09 更新2024-06-27 收录
官方服务:

资源简介:

# Textes des publications de la HAS ## À propos de cette documentation La documentation de ce jeu de données suit le concept de _fiche technique pour les jeux de données_ (ou _Datasheets for Datasets_) proposé par [Gebru et al.](https://arxiv.org/abs/1803.09010) Spécifiquement, nous reprenons l'adaptation et traduction au français proposée par Samuel Goëta [ici](https://teamopendata.org/t/traduction-et-adaptation-du-modele-de-description-des-donnees-datasheet-for-datasets/1400). Le but de cette fiche technique est de normaliser la documentation à propos de pourquoi un jeu de données a été créé, quelles informations il contient, les tâches pour lesquelles il devrait et ne devrait pas être utilisé, et si cela pourrait soulever des préoccupations d’ordre éthique ou juridique. ## Motivations pour la création du jeu de données **Pourquoi le jeu de données a-t-il été initialement créé ?** Les métadonnées des publications de la HAS sont disponibles [ici](https://www.data.gouv.fr/fr/datasets/627152fbe5cc39edfc691d2c/). Chacune de ces publications contient des ressources liées. Dans le but de faciliter la réutilisation des connaissances produites par la HAS, ce jeu de données propose le fichier PDF ainsi qu'une version semi-structure du texte contenu à l'intérieur pour chaque ressource, pour chaque publication HAS. **Pour quelles autres tâches le jeu de données pourrait-il être utilisé ?** Faciliter la découverte des informations médicales, suivre l'évolution des connaissances en santé… **Quelles sont les utilisations trompeuses du jeu de données ?** Nous incluons tout l'historique des publications de la HAS disponible sur [le site web](www.has-sante.fr). Les informations incluses dans les documents peuvent ne pas être à jour. **Qui a financé ou soutenu la création du jeu de données ?** La HAS. ## Composition du jeu de données **Que contient le jeu de données principalement ?** Les textes bruts (non structurés (PDF) et semi-structurés (XML)) des documents rédigés par les agents de la HAS. Deux types de fichiers semi-structurés sont mis à disposition : 1. Text : fichier XML contenant le texte brut par page, 2. Annotated: fichier XML contenant le mis en forme (en utilisant de [balises type HTML](https://accessible-pdf.info/basics/general/overview-of-the-pdf-tags)) ainsi que le texte. Ce type de fichier existe **que** pour les fichiers PDF qui suivent le standard PDF/A ou [PDF/UA](https://en.wikipedia.org/wiki/PDF/UA). **Dispose-t-on d’un schéma décrivant les variables du jeu de données ?** Pas pour l'instant. **Est-ce que le contenu du jeu de données dépend de ressources externes ?** Oui, ce jeu de données est exploitable en combinaison avec un autre sur les [métadonnées des publications de la HAS](https://www.data.gouv.fr/fr/datasets/627152fbe5cc39edfc691d2c/). En outre, les documents peuvent contenir des informations relatives à des ressources externes. **De quelles garanties dispose-t-on concernant la pérennité de ces ressources ?** Le jeu de données des métadonnées des publications de la HAS est assuré par les agents de la HAS. Pour le reste, cela dépend de chaque ressource externe. ## Processus de collecte des données **Comment les données ont été collectées (avec des capteurs, manuellement par des outils informatiques…) ?** Les publications sont rédigées par des agents de la HAS. Certaines publications sont versées automatiquement sur le site internet de la HAS à partir de systèmes d'information internes, d'autres sont ajoutées manuellement. La collecte depuis le site internet de la HAS se fait par des outils informatiques. **Qui a assuré le processus de collecte de données (des agents, des bénévoles, des étudiants…) ?** Des agents de la HAS. **Quelle a été la période de collecte des données ?** Le jeu de données contient les textes des publications créées à partir de juin 1999. **Les données ont-elles été collectées directement ou inférées à partir d’autres données ?** Collectées directement. **Les données ont-elles été collectées sur un échantillon ? Selon quelles méthodes ?** Oui. Nous n'incluons que les publications de certains types, liées à la production des experts de la HAS. Nous écartons les publications liées au système de gestion de documents du site web. Les publications incluses/exclues sont les suivantes : | **Types inclus** | **Types exclus** | | ------------------------------------------------------------- | -------------------------------------------- | | Avis sur les Médicaments | Médecin accrédité | | Avis sur les dispositifs médicaux et autres produits de santé | Avis et décisions de la HAS | | Évaluation des technologies de santé | Article HAS | | Recommandation de bonne pratique | Médicament | | Outil d'amélioration des pratiques professionnelles | Résultat de certification des établissements | | Guide maladie chronique | Événement de Calendrier | | Guide méthodologique | Lien externe | | Recommandation en santé publique | Article Webzine | | Études et Rapports | Communiqué de presse | | Guide usagers | Synthèse d'avis et Fiche bon usage | | Recommandation vaccinale | Newsletter HAS | | | Sous-éléments | | | Glossaire - Terme | | | Avis sur les Actes | | | Brève | | | Vos interlocuteurs | | | Faq - Entrée | | | Sondage | | | Étude d'évaluation économique | **Quelles sont les erreurs connues, les limites, les sources de bruit ou de redondances associées à ces données ?** 1. La transformation PDF vers texte peut introduire des erreurs orthographiques, voire rendre illisible le contenu. 2. Pour la majorité des fichiers semi-structurés (XML), nous perdons le concept de table ainsi que les images. 3. La création de fichiers XML _annotated_ depend de l'annotation fait par le créateur original du fichier PDF. Par defaut, ce balisage se fait automatiquement (par exemple, par Office 365 lors de la conversion `docx` vers `pdf`). Cette démarche peut contenir des erreurs. ## Pré-traitement des données **Comment les données ont-elles nettoyées ou préparées ?** Aucun prétraitement n'est réalisé sur les fichiers PDF. **Les données « brutes » ont-elles été conservées ? Sont-elles diffusées ?** Oui, les fichiers PDF sont diffusés dans ce jeu de données. **L’outil de prétraitement des données est-il disponible ?** Oui, dans [le dépôt de code](https://gitlab.has-sante.fr/has-sante/public/alpha/has-text-extract/) correspondant à ce jeu de données. ## Diffusion du jeu de données **Les données sont-elles diffusées en ligne ? Selon quelles modalités (sur un portail open data, un site web, une API…)?** Oui, sur cette page data.gouv.fr. **Selon quelle licence les données sont-elles diffusées ?** [License Ouverte version 2.0](https://www.etalab.gouv.fr/wp-content/uploads/2017/04/ETALAB-Licence-Ouverte-v2.0.pdf) **Des redevances ou des restrictions sont-elles appliquées dans l’accès aux données ?** Non. ## Maintenance du jeu de données **Qui assure la maintenance du jeu de données ? Comment peut-on contacter cette personne ? Quel est le service responsable du jeu de données ?** La [Mission Data de la HAS](mailto:open-data@has-sante.fr). **Est-ce que les rôles sont distincts entre la production des données, leur éditorialisation et leur diffusion ?** Oui. Produit par les services HAS. Éditorialisé aussi par les services HAS et le service communication. Diffusé par le service informatique et la Mission Data de la HAS. **Le jeu de données sera-t-il mis à jour ? Si oui, à quelle fréquence ?** Oui, toutes les semaines. Si besoin de mettre à jour plus fréquemment, nous écrire. **Si les données deviennent obsolètes, comment cette information sera-t-elle communiquée ?** Par le biais de cette page. **Est-il possible de contribuer à l’amélioration des données ? Selon quelles modalités ?** Oui, en nous contactant par le biais de commentaires de cette page, ou directement par e-mail. ## Considérations légales et éthiques **Si le jeu de données concerne des individus, ont-ils exprimé leur consentement de manière claire ?** Il ne concerne pas des individus. **Le jeu de données peut-il exposer de manière directe ou indirecte des individus ?** Non à notre connaissance. **Ces données sont-elles conformes au RGPD ?** Oui. **Les données peuvent-elles avantager ou désavantager des groupes sociaux ?** Non à notre connaissance. **Le jeu de données contient-il des informations pouvant être considérées comme inappropriées ou offensantes ?** Non à notre connaissance # Organisation de fichiers Deux fichiers ZIP sont mis à disposition : - Le premier fichier `TextesPublicationsHAS.zip` contient, **pour chaque publication et pour chacune de ses ressources liées**, le fichier PDF ainsi que le fichier XML _text_ et _annotated_. Ce dernier existe uniquement si le fichier PDF traité suit le standard PDF/UA (_tagged PDF_). - Le deuxieme fichier `TextesPublicationsHAS_XML.zip` ne contient **que** les fichiers semi-structurés XML **pour toutes les thématiques**. ## Arborescence des fichiers Les deux fichiers zip de ce jeu de données suivent la hiérarchie de fichiers décrite ci-dessous : ```shell ├── AVISMedicament # Thématique de la publication │ ├── p_3201790 # Id de la publication | | ├── p_3201789 # Id de la ressource | | | ├── 2020-09-16_CT-18742_TAKHZYRO_PIS_INS_AvisDef_CT18742.pdf | | | ├── 2020-09-16_CT-18742_TAKHZYRO_PIS_INS_AvisDef_CT18742_tagged.xml # Fichier XML tagged avec la date de publication comme préfixe | | | ├── 2020-09-16_CT-18742_TAKHZYRO_PIS_INS_AvisDef_CT18742_text.xml # Fichier XML text avec la date de publication comme préfixe │ ├── c_1001256 │ ├── c_1001258 │ ├── c_1001261 | ├── ... ├── AVISMedicament | ├── ... ├── AVISProduitsEtPrestations | ├── ... ├── EtudeEtEnquete | ├── ... ├── EvaluationDesPratiques | ├── ... ├── EvaluationDesProgrammesEtPolitiq | ├── ... ├── EvaluationDesTechnologiesDeSante | ├── ... ├── GuideMedecinALD | ├── ... ├── GuideMethodologique | ├── ... ├── GuidePatient | ├── ... ├── RecommandationsProfessionnelles | ├── ... ├── RecommandationVaccinale | ├── ... ```

# 法国高级卫生总署(Haute Autorité de Santé, HAS)出版物文本数据集 ## 关于本数据集文档 本数据集文档遵循由[Gebru等人](https://arxiv.org/abs/1803.09010)提出的**数据集技术文档(Datasheets for Datasets)**范式。具体而言,本文档采用了Samuel Goëta [针对该范式的法语适配与译介版本](https://teamopendata.org/t/traduction-et-adaptation-du-modele-de-description-des-donnees-datasheet-for-datasets/1400)。 本技术文档的目标是规范数据集相关文档的撰写标准,涵盖数据集的创建初衷、内容构成、适用与禁用场景,以及潜在的伦理与法律风险。 ## 数据集创建动机 **数据集最初的创建目的是什么?** HAS出版物的元数据可通过[此链接](https://www.data.gouv.fr/fr/datasets/627152fbe5cc39edfc691d2c/)获取。每份此类出版物均附带相关关联资源。为推动HAS产出的科研成果的复用,本数据集为每篇HAS出版物的每项关联资源,提供其原始PDF文件与内部文本的半结构化版本。 **本数据集还可用于哪些其他任务?** 助力医疗信息检索、追踪卫生领域知识的演进等。 **本数据集的不当使用场景有哪些?** 本数据集包含[HAS官方网站](www.has-sante.fr)上公开的所有HAS出版物历史版本,文档内的信息可能存在时效性不足的问题。 **本数据集的创建由谁资助或支持?** 法国高级卫生总署(HAS)。 ## 数据集构成 **数据集的核心内容是什么?** HAS工作人员撰写的各类文档的原始文本(非结构化格式为PDF,半结构化格式为XML)。 本次提供两类半结构化文件: 1. 文本型(Text):按页面存储原始文本的XML文件 2. 标注型(Annotated):保留格式信息(采用[HTML类标签](https://accessible-pdf.info/basics/general/overview-of-the-pdf-tags))与原始文本的XML文件。该类文件仅在原始PDF符合PDF/A或[PDF/UA](https://en.wikipedia.org/wiki/PDF/UA)标准时可用。 **是否存在描述数据集变量的Schema?** 目前暂无。 **数据集内容是否依赖外部资源?** 是。本数据集需与另一套[HAS出版物元数据集](https://www.data.gouv.fr/fr/datasets/627152fbe5cc39edfc691d2c/)配合使用。此外,文档本身可能包含指向外部资源的信息。 **针对这些外部资源的可持续性,有哪些保障措施?** HAS出版物元数据集的可持续性由HAS工作人员保障。其余外部资源的可持续性则需视具体情况而定。 ## 数据采集流程 **数据是如何采集的(如通过传感器、人工或自动化工具等)?** HAS出版物由HAS工作人员撰写。部分出版物通过内部信息系统自动上传至HAS官方网站,其余则由人工手动添加。从HAS官网采集数据的过程采用自动化工具完成。 **数据采集工作由谁负责执行(如工作人员、志愿者、学生等)?** HAS工作人员。 **数据采集的时间范围是什么?** 本数据集涵盖1999年6月之后产出的所有出版物文本。 **数据是直接采集的,还是通过其他数据推断得到的?** 直接采集。 **数据是否通过抽样采集?采用了何种抽样方法?** 是。本数据集仅收录与HAS专家产出内容相关的特定类型出版物,排除与HAS官网文档管理系统相关的出版物。收录与排除的出版物类型如下: | **收录类型** | **排除类型** | | ------------------------------------------------------------- | -------------------------------------------- | | 药品审评意见 | 认证医师相关内容 | | 医疗器械及其他健康产品审评意见 | HAS意见与决策相关内容 | | 卫生技术评估 | HAS专栏文章 | | 良好实践推荐 | 药品相关内容 | | 职业实践改进工具 | 医疗机构认证结果 | | 慢性疾病指南 | 日程事件相关内容 | | 方法学指南 | 外部链接 | | 公共卫生推荐 | 网络杂志专栏文章 | | 研究与报告 | 新闻稿 | | 用户指南 | 意见综述与合理使用指南 | | 疫苗接种推荐 | HAS通讯 | | | 子内容 | | | 术语表 - 术语 | | | 操作项目审评意见 | | | 简报 | | | 对接方信息 | | | 常见问题 - 条目 | | | 调研 | | | 经济评估研究 | **数据集存在哪些已知错误、局限性、噪声源或冗余问题?** 1. PDF转文本的过程可能引入拼写错误,甚至导致内容无法识别 2. 多数半结构化XML文件无法保留表格与图像信息 3. 标注型XML文件的生成依赖原始PDF创建者的格式标注。默认情况下,标注由自动化工具完成(如Office 365将docx转换为PDF时的自动标注),该过程可能存在标注错误。 ## 数据预处理 **数据是如何进行清洗与预处理的?** PDF文件未进行任何预处理。 **原始数据是否保留并公开?** 是,本数据集公开了原始PDF文件。 **数据预处理工具是否公开?** 是,可通过本数据集对应的[代码仓库](https://gitlab.has-sante.fr/has-sante/public/alpha/has-text-extract/)获取。 ## 数据集发布 **数据是否在线发布?采用何种发布形式(如开放数据门户、网站、API等)?** 是,发布于本data.gouv.fr页面。 **数据采用何种许可协议发布?** [开放许可2.0版(License Ouverte version 2.0)](https://www.etalab.gouv.fr/wp-content/uploads/2017/04/ETALAB-Licence-Ouverte-v2.0.pdf) **数据访问是否收取费用或存在使用限制?** 否。 ## 数据集维护 **谁负责数据集的维护?如何联系相关负责人?负责本数据集的部门是?** HAS数据任务组(Mission Data de la HAS),邮箱:open-data@has-sante.fr。 **数据产出、编辑加工与发布的职责是否分离?** 是。数据由HAS各部门产出,由HAS部门与沟通部门共同完成编辑加工,由信息技术部门与HAS数据任务组负责发布。 **数据集是否会更新?若更新,更新频率如何?** 是,每周更新一次。如需更频繁的更新,请联系我们。 **若数据过时,将如何告知用户?** 通过本页面发布通知。 **是否可以参与数据集的优化工作?参与方式是什么?** 可以,可通过本页面的评论功能或直接发送邮件联系我们。 ## 法律与伦理考量 **若数据集涉及个人信息,是否已获得明确的知情同意?** 本数据集不涉及个人信息。 **本数据集是否会直接或间接泄露个人身份信息?** 据我们所知,不会。 **本数据集是否符合《通用数据保护条例》(RGPD)?** 是。 **本数据集是否会对特定社会群体产生有利或不利影响?** 据我们所知,不会。 **本数据集是否包含不当或冒犯性内容?** 据我们所知,不包含。 # 文件组织结构 本次提供两个ZIP压缩包: - 第一个压缩包`TextesPublicationsHAS.zip`:为每篇出版物及其每项关联资源提供原始PDF文件,以及对应的文本型(Text)与标注型(Annotated)XML文件。其中标注型XML文件仅在原始PDF符合PDF/UA标准(即带标注PDF)时可用。 - 第二个压缩包`TextesPublicationsHAS_XML.zip`:仅包含全主题类别的半结构化XML文件。 ## 文件目录结构 本数据集的两个ZIP压缩包均遵循以下文件层级结构: shell ├── 药品审评意见 # 出版物主题 │ ├── p_3201790 # 出版物ID | | ├── p_3201789 # 资源ID | | | ├── 2020-09-16_CT-18742_TAKHZYRO_PIS_INS_AvisDef_CT18742.pdf | | | ├── 2020-09-16_CT-18742_TAKHZYRO_PIS_INS_AvisDef_CT18742_tagged.xml # 带标注XML文件,以发布日期为前缀 | | | ├── 2020-09-16_CT-18742_TAKHZYRO_PIS_INS_AvisDef_CT18742_text.xml # 文本型XML文件,以发布日期为前缀 │ ├── c_1001256 │ ├── c_1001258 │ ├── c_1001261 | ├── ... ├── 药品审评意见 | ├── ... ├── 医疗器械及健康产品审评意见 | ├── ... ├── 研究与调研 | ├── ... ├── 实践评估 | ├── ... ├── 项目与政策评估 | ├── ... ├── 卫生技术评估 | ├── ... ├── 慢性疾病指南 | ├── ... ├── 方法学指南 | ├── ... ├── 患者指南指南 | ├── ... ├── 职业实践推荐 | ├── ... ├── 疫苗接种推荐 | ├── ...

创建时间:
2022-05-26
二维码
社区交流群
二维码
科研交流群
商业服务