pengold/xlsum-vietnamese
收藏资源简介:
--- configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - split: validation path: data/validation-* dataset_info: features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: summary dtype: string - name: text dtype: string - name: prefix_text dtype: string - name: input_ids sequence: int32 - name: attention_mask sequence: int8 - name: labels sequence: int64 splits: - name: train num_bytes: 528740548 num_examples: 32111 - name: test num_bytes: 40990709 num_examples: 4013 - name: validation num_bytes: 40943030 num_examples: 4013 download_size: 304960271 dataset_size: 610674287 --- # Dataset Card for "xlsum-vietnamese" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
配置
- 默认配置:
- 训练集:路径为
data/train-* - 测试集:路径为
data/test-* - 验证集:路径为
data/validation-*
- 训练集:路径为
数据特征
- id:字符串类型
- url:字符串类型
- title:字符串类型
- summary:字符串类型
- text:字符串类型
- prefix_text:字符串类型
- input_ids:整数序列,类型为 int32
- attention_mask:整数序列,类型为 int8
- labels:整数序列,类型为 int64
数据分割
- 训练集:
- 字节数:528740548
- 样本数:32111
- 测试集:
- 字节数:40990709
- 样本数:4013
- 验证集:
- 字节数:40943030
- 样本数:4013
数据集大小
- 下载大小:304960271 字节
- 数据集大小:610674287 字节



