Arjun4707/cnn-news
收藏资源简介:
--- dataset_info: features: - name: article dtype: string - name: highlights dtype: string - name: id dtype: string - name: input_ids sequence: int32 - name: attention_mask sequence: int8 - name: labels sequence: int64 splits: - name: train num_bytes: 2663163360 num_examples: 287113 - name: validation num_bytes: 122276019 num_examples: 13368 - name: test num_bytes: 105346607 num_examples: 11490 download_size: 1416997977 dataset_size: 2890785986 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---
dataset_info: 数据集信息 features: 特征 - 名称:article(文章),数据类型:字符串 - 名称:highlights(摘要亮点),数据类型:字符串 - 名称:id(标识符),数据类型:字符串 - 名称:input_ids(输入Token序列),数据类型:int32序列 - 名称:attention_mask(注意力掩码),数据类型:int8序列 - 名称:labels(标签序列),数据类型:int64序列 splits: 数据集划分 - 名称:train(训练集),字节数:2663163360,样本数量:287113 - 名称:validation(验证集),字节数:122276019,样本数量:13368 - 名称:test(测试集),字节数:105346607,样本数量:11490 下载大小:1416997977 字节,数据集总大小:2890785986 字节 configs: 配置项 - 配置名称:default(默认配置),数据文件: - 划分:train(训练集),路径:data/train-* - 划分:validation(验证集),路径:data/validation-* - 划分:test(测试集),路径:data/test-*
数据集概述
特征信息
- article: 数据类型为字符串。
- highlights: 数据类型为字符串。
- id: 数据类型为字符串。
- input_ids: 数据类型为整数序列,类型为int32。
- attention_mask: 数据类型为整数序列,类型为int8。
- labels: 数据类型为整数序列,类型为int64。
数据分割
- 训练集 (train): 包含287113个样本,总字节数为2663163360。
- 验证集 (validation): 包含13368个样本,总字节数为122276019。
- 测试集 (test): 包含11490个样本,总字节数为105346607。
数据集大小
- 下载大小: 1416997977字节。
- 数据集总大小: 2890785986字节。
配置信息
- 默认配置 (default):
- 训练集路径:
data/train-* - 验证集路径:
data/validation-* - 测试集路径:
data/test-*
- 训练集路径:




