Universal Dependencies (UD)|自然语言处理数据集|语法标注数据集
收藏
- Universal Dependencies (UD) 项目正式启动,旨在创建一个跨语言的依存语法标注体系。
- 发布了首个版本的 Universal Dependencies 数据集,包含多种语言的语料库。
- UD 数据集进行了首次大规模更新,增加了更多语言的支持,并改进了标注规范。
- 发布了 UD v2.0,引入了新的标注层级和更详细的语法信息,提升了数据集的实用性。
- UD v2.3 发布,进一步扩展了语言覆盖范围,并优化了标注一致性。
- UD v2.5 发布,引入了更多语言的语料库,并改进了跨语言的标注一致性。
- UD v2.7 发布,继续扩展语言覆盖,并引入了新的标注工具和资源。
- UD v2.8 发布,进一步优化了标注规范,并增加了对低资源语言的支持。
- UD v2.10 发布,继续扩展语言覆盖,并改进了数据集的质量和一致性。
MedDialog
MedDialog数据集(中文)包含了医生和患者之间的对话(中文)。它有110万个对话和400万个话语。数据还在不断增长,会有更多的对话加入。原始对话来自好大夫网。
github 收录
中国近海台风路径集合数据集(1945-2024)
1945-2024年度,中国近海台风路径数据集,包含每个台风的真实路径信息、台风强度、气压、中心风速、移动速度、移动方向。 数据源为获取温州台风网(http://www.wztf121.com/)的真实观测路径数据,经过处理整合后形成文件,如使用csv文件需使用文本编辑器打开浏览,否则会出现乱码,如要使用excel查看数据,请使用xlsx的格式。
国家海洋科学数据中心 收录
Wind Turbine Data
该数据集包含风力涡轮机的运行数据,包括风速、风向、发电量等参数。数据记录了多个风力涡轮机在不同时间点的运行状态,适用于风能研究和风力发电系统的优化分析。
www.kaggle.com 收录
Weibo Dataset
V1版本包含了2023年上半年来自微博平台的2,106条新闻数据。其中包含1,000条假新闻和1,067条真实新闻。数据集包含新闻传播的评论数据,包含用户和评论信息。V2版本包含了来自中国微博社交媒体平台的11,329条新闻。其中包含5,661条假新闻和5,668条真实新闻。与V1版本相比,V2版本在V1的基础上扩大了数据量。同时,V2提供了新闻的多模态数据,包括新闻帖子、评论集合、图片、视频和声音信息。因此,V2提供了更真实的社交网络环境模拟,从而支持下游任务。
github 收录
中国食物成分数据库
食物成分数据比较准确而详细地描述农作物、水产类、畜禽肉类等人类赖以生存的基本食物的品质和营养成分含量。它是一个重要的我国公共卫生数据和营养信息资源,是提供人类基本需求和基本社会保障的先决条件;也是一个国家制定相关法规标准、实施有关营养政策、开展食品贸易和进行营养健康教育的基础,兼具学术、经济、社会等多种价值。 本数据集收录了基于2002年食物成分表的1506条食物的31项营养成分(含胆固醇)数据,657条食物的18种氨基酸数据、441条食物的32种脂肪酸数据、130条食物的碘数据、114条食物的大豆异黄酮数据。
国家人口健康科学数据中心 收录