ilaria-oneofftech/ikitracs_mitigation
收藏数据集概述
数据集名称
ikitracs_mitigation
数据特征
- country_code: 字符串
- country: 字符串
- type_of_document: 字符串
- version_number: 字符串
- url: 字符串
- paragraph: 字符串
- lang: 字符串
- parameter: 字符串
- quote: 字符串
- asi: 字符串
- category: 字符串
- high_level_category: 字符串
- indicator: 字符串
- paragraph_translated: 字符串
- index_level_0: 整数(int64)
数据分割
- train:
- 字节数: 48699276
- 示例数: 82524
数据集大小
- 下载大小: 16756391 字节
- 数据集大小: 48699276 字节
China Health and Nutrition Survey (CHNS)
China Health and Nutrition Survey(CHNS)是一项由美国北卡罗来纳大学人口中心与中国疾病预防控制中心营养与健康所合作开展的长期开放性队列研究项目,旨在评估国家和地方政府的健康、营养与家庭计划政策对人群健康和营养状况的影响,以及社会经济转型对居民健康行为和健康结果的作用。该调查覆盖中国15个省份和直辖市的约7200户家庭、超过30000名个体,采用多阶段随机抽样方法,收集了家庭、个体以及社区层面的详细数据,包括饮食、健康、经济和社会因素等信息。自2011年起,CHNS不断扩展,新增多个城市和省份,并持续完善纵向数据链接,为研究中国社会经济变化与健康营养的动态关系提供了重要的数据支持。
www.cpc.unc.edu 收录
波士顿房价数据集
波士顿房价数据集是一个经典的机器学习数据集,通常用于回归任务,尤其是房价预测。下方文档中有所有字段顺序的描述。
阿里云天池 收录
OpenSonarDatasets
OpenSonarDatasets是一个致力于整合开放源代码声纳数据集的仓库,旨在为水下研究和开发提供便利。该仓库鼓励研究人员扩展当前的数据集集合,以增加开放源代码声纳数据集的可见性,并提供一个更容易查找和比较数据集的方式。
github 收录
TeleSpeechPT
TeleSpeechPT数据集包含约30万小时的方言和口音语音数据,用于训练无监督模型,以及包含4万小时的监督数据集。该数据集旨在解决中国方言和口音的语音识别问题,通过结合自监督学习和大型语言模型(LLM)来提升语音识别性能。数据集内容涵盖多个方言和口音,包括安徽、甘肃、河北、山东、山西、天津、广东、河南、四川、重庆、东北、陕西、湖北、福建、贵州、杭州、湖南、江西、上海、苏州、云南和客家等。数据集创建过程涉及对大量语音数据的收集和预处理,以及使用自监督学习方法进行模型训练。该数据集可应用于语音识别、语音合成和语音增强等领域,旨在解决方言和口音语音识别的挑战。
arXiv 收录
SWaT Dataset
SWaT Dataset是一个用于工业控制系统(ICS)安全研究的数据集,包含了模拟的网络攻击和正常操作的数据。该数据集由新加坡科技设计大学(Singapore University of Technology and Design)发布,旨在帮助研究人员开发和测试用于检测工业控制系统中网络攻击的算法和模型。
itrust.sutd.edu.sg 收录
