kpriyanshu256/MultiTabQA-multitable_pretraining-Salesforce-codet5-base_train-html-41000
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: input_ids sequence: sequence: int32 - name: attention_mask sequence: sequence: int8 - name: labels sequence: sequence: int64 splits: - name: train num_bytes: 13336000 num_examples: 1000 download_size: 667090 dataset_size: 13336000 configs: - config_name: default data_files: - split: train path: data/train-* ---
数据集信息: 特征项: - 名称:输入标识符(input_ids),其序列的元素仍为序列,元素数据类型为int32 - 名称:注意力掩码(attention_mask),其序列的元素仍为序列,元素数据类型为int8 - 名称:标签(labels),其序列的元素仍为序列,元素数据类型为int64 数据集划分: - 划分名称:训练集(train),占用字节数为13336000,样本数量为1000 下载大小:667090 数据集总大小:13336000 数据集配置: - 配置名称:默认配置(default),数据文件: - 对应划分:训练集(train),文件路径为 data/train-*
提供机构:
kpriyanshu256原始信息汇总
数据集概述
数据特征
- input_ids: 序列类型,数据类型为int32。
- attention_mask: 序列类型,数据类型为int8。
- labels: 序列类型,数据类型为int64。
数据分割
- train: 包含1000个样本,数据大小为13336000字节。
数据集大小
- 下载大小: 667090字节。
- 数据集大小: 13336000字节。
配置
- default: 包含训练数据文件,路径为
data/train-*。



