robench-eval-Time5-c|自然语言处理数据集|文本生成数据集
收藏数据集概述
数据集信息
特征
- text_with_holes: 数据类型为字符串。
- text_candidates: 数据类型为字符串。
- A: 数据类型为字符串。
- B: 数据类型为字符串。
- C: 数据类型为字符串。
- D: 数据类型为字符串。
- label: 数据类型为字符串。
数据分割
- train: 包含2276个样本,占用2583613字节。
数据集大小
- 下载大小: 1453317字节。
- 数据集大小: 2583613字节。
配置
- config_name: default
- data_files:
- split: train
- path: data/train-*
- data_files:

中国食物成分数据库
食物成分数据比较准确而详细地描述农作物、水产类、畜禽肉类等人类赖以生存的基本食物的品质和营养成分含量。它是一个重要的我国公共卫生数据和营养信息资源,是提供人类基本需求和基本社会保障的先决条件;也是一个国家制定相关法规标准、实施有关营养政策、开展食品贸易和进行营养健康教育的基础,兼具学术、经济、社会等多种价值。 本数据集收录了基于2002年食物成分表的1506条食物的31项营养成分(含胆固醇)数据,657条食物的18种氨基酸数据、441条食物的32种脂肪酸数据、130条食物的碘数据、114条食物的大豆异黄酮数据。
国家人口健康科学数据中心 收录
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
Breast Cancer Dataset
该项目专注于清理和转换一个乳腺癌数据集,该数据集最初由卢布尔雅那大学医学中心肿瘤研究所获得。目标是通过应用各种数据转换技术(如分类、编码和二值化)来创建一个可以由数据科学团队用于未来分析的精炼数据集。
github 收录
新能源汽车风险评分数据集
风险评分数据集是基于车辆充电行为和车辆状态数据,结合保司现有的承保理赔数据,打破了传统汽车保险的定价方法,用车辆大数据赋能车辆保险经营。大数据风险评分作为保险公司新型核保工具,与传统车险定价相比,增加模型因子的解释维度,提升模型稳定性和区分度。大数据风险评分可以合理反映车辆的风险概率和风险成本,体现保费的公平,改善驾驶行为,促进安全驾驶等。保险公司在应用时通过输入相关车辆数据以及核保数据,通过隐私计算平台技术,由计算模型调用充电行为和车辆行为特征数据,仅返回车辆风险评分结果给到保险公司,达到数据可用不可见的目的,保险公司依据车辆风险评分结果进行核保定价。
北京市数据知识产权 收录
MIMII数据集
MIMII数据集是由日立有限公司研究与开发集团创建的,专注于工业机器异常声音检测的数据集。该数据集包含26,092个正常操作条件下的声音文件,涵盖阀门、泵、风扇和滑轨四种机器类型。数据集的创建过程中,使用了TAMAGO-03麦克风阵列进行声音采集,并在多个真实工厂环境中混合背景噪声以模拟实际环境。MIMII数据集主要用于机器学习和信号处理社区开发自动化设施维护系统,特别是在无监督学习场景下检测机器异常声音。
arXiv 收录