遇见数据集

CoWeSe (Corpus Web Salud Espanol)

收藏
OpenDataLab2026-07-12 更新2024-05-09 收录
官方服务:

资源简介:

CoWeSe 是一个西班牙生物医学语料库,由 4.5GB(约 7.5 亿个令牌)的干净纯文本组成。 CoWeSe 是 2020 年在 3000 个西班牙域名上执行的大规模爬虫的结果。

CoWeSe is a Spanish biomedical corpus consisting of 4.5 GB (approximately 750 million tokens) of clean plain text. It is the result of a large-scale web crawl conducted across 3000 Spanish domain names in 2020.

提供机构:
OpenDataLab
创建时间:
2022-05-23
搜集汇总
数据集介绍
CoWeSe (Corpus Web Salud Espanol) 数据集图片
背景与挑战
背景概述
CoWeSe 是一个西班牙生物医学语料库,包含4.5GB的干净纯文本,约7.5亿个令牌,基于2020年在3000个西班牙域名上的大规模爬虫构建。该数据集由巴塞罗那超级计算中心于2021年2月25日发布,旨在支持西班牙生物医学语言模型的研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务