区生态环境局2022年推进法治政府建设工作情况报告|法治政府数据集|生态环境数据集
收藏MedDialog
MedDialog数据集(中文)包含了医生和患者之间的对话(中文)。它有110万个对话和400万个话语。数据还在不断增长,会有更多的对话加入。原始对话来自好大夫网。
github 收录
Tropicos
Tropicos是一个全球植物名称数据库,包含超过130万种植物的名称、分类信息、分布数据、图像和参考文献。该数据库由密苏里植物园维护,旨在为植物学家、生态学家和相关领域的研究人员提供全面的植物信息。
www.tropicos.org 收录
AISHELL/AISHELL-1
Aishell是一个开源的中文普通话语音语料库,由北京壳壳科技有限公司发布。数据集包含了来自中国不同口音地区的400人的录音,录音在安静的室内环境中使用高保真麦克风进行,并下采样至16kHz。通过专业的语音标注和严格的质量检查,手动转录的准确率超过95%。该数据集免费供学术使用,旨在为语音识别领域的新研究人员提供适量的数据。
hugging_face 收录
TCIA
TCIA(The Cancer Imaging Archive)是一个公开的癌症影像数据集,包含多种癌症类型的医学影像数据,如CT、MRI、PET等。这些数据通常与临床和病理信息相结合,用于癌症研究和临床试验。
www.cancerimagingarchive.net 收录
TSOD10K
TSOD10K是首个大规模的交通显著目标检测数据集,由湖南师范大学信息科学与工程学院、南开大学人工智能学院和湖南大学机器人学院共同创建。该数据集包含13753张车辆捕获的图像,并带有像素级的精确注释。TSOD10K覆盖了各种真实世界交通场景,包括城市交叉口、高速公路、乡村道路和停车场,涵盖了雨、雪、雾、晴、低光等不同的天气/光照组合。数据集旨在支持动态风险分层下游服务,特别编码了视觉显著性和隐含的风险语义。
arXiv 收录