kpriyanshu256/MultiTabQA-multitable_pretraining-Salesforce-codet5-base_train-latex-35000
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: input_ids sequence: sequence: int32 - name: attention_mask sequence: sequence: int8 - name: labels sequence: sequence: int64 splits: - name: train num_bytes: 13336000 num_examples: 1000 download_size: 1009703 dataset_size: 13336000 configs: - config_name: default data_files: - split: train path: data/train-* ---
数据集信息(dataset_info)包含以下内容: 1. 特征集(features): - 输入ID(input_ids):嵌套的int32整数序列 - 注意力掩码(attention_mask):嵌套的int8整数序列 - 标签(labels):嵌套的int64整数序列 2. 数据集划分(splits): - 训练集(train):占用存储空间13336000字节,共包含1000个样本 3. 下载大小为1009703字节,数据集总大小为13336000字节 数据集配置(configs)如下: - 默认配置(default):其关联的数据文件划分与路径为:训练划分对应路径为data/train-*
提供机构:
kpriyanshu256原始信息汇总
数据集概述
特征信息
- input_ids: 序列类型,数据类型为int32。
- attention_mask: 序列类型,数据类型为int8。
- labels: 序列类型,数据类型为int64。
数据分割
- train: 包含1000个样本,总字节数为13336000。
数据集大小
- 下载大小: 1009703字节。
- 数据集大小: 13336000字节。
配置信息
- default: 包含训练数据文件,路径为
data/train-*。



