mteb/scala_da_classification
收藏资源简介:
--- dataset_info: features: - name: text dtype: string - name: corruption_type dtype: string - name: label dtype: string splits: - name: train num_bytes: 139194 num_examples: 1024 - name: test num_bytes: 281517 num_examples: 2048 - name: full_train num_bytes: 733506 num_examples: 5342 - name: val num_bytes: 32942 num_examples: 256 download_size: 700593 dataset_size: 1187159 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - split: full_train path: data/full_train-* - split: val path: data/val-* ---
数据集信息: 特征字段: - 字段名:text(文本),数据类型:字符串 - 字段名:corruption_type(损坏类型),数据类型:字符串 - 字段名:label(标签),数据类型:字符串 数据集拆分: - 拆分名称:train(训练集),字节占用量:139194,样本数量:1024 - 拆分名称:test(测试集),字节占用量:281517,样本数量:2048 - 拆分名称:full_train(完整训练集),字节占用量:733506,样本数量:5342 - 拆分名称:val(验证集),字节占用量:32942,样本数量:256 下载总大小:700593,数据集总存储大小:1187159 配置项: - 配置名称:default,数据文件映射: - 拆分train:对应路径 data/train-* - 拆分test:对应路径 data/test-* - 拆分full_train:对应路径 data/full_train-* - 拆分val:对应路径 data/val-*
数据集概述
数据集特征
- text:数据类型为字符串。
- corruption_type:数据类型为字符串。
- label:数据类型为字符串。
数据集分割
- train:包含1024个样本,总大小为139194字节。
- test:包含2048个样本,总大小为281517字节。
- full_train:包含5342个样本,总大小为733506字节。
- val:包含256个样本,总大小为32942字节。
数据集大小
- 下载大小:700593字节。
- 数据集总大小:1187159字节。
配置文件
- 默认配置:包含训练、测试、完整训练和验证数据的路径配置。



