amitness/logits-mt-ar-512
收藏资源简介:
--- configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* dataset_info: features: - name: input_ids sequence: int32 - name: token_type_ids sequence: int8 - name: attention_mask sequence: int8 - name: labels sequence: int64 - name: teacher_logits sequence: sequence: float64 - name: teacher_indices sequence: sequence: int64 - name: teacher_mask_indices sequence: int64 splits: - name: train num_bytes: 17102298098.701529 num_examples: 940987 - name: test num_bytes: 3018061158.5240602 num_examples: 166057 download_size: 7348415360 dataset_size: 20120359257.22559 --- # Dataset Card for "logits-mt-ar-512" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
--- 配置项: - 配置名称:default(默认) 数据文件: - 数据拆分:训练集(train),路径:data/train-* - 数据拆分:测试集(test),路径:data/test-* 数据集信息: 特征字段: - 名称:输入ID(input_ids),类型:int32序列 - 名称:Token类型ID(token_type_ids),类型:int8序列 - 名称:注意力掩码(attention_mask),类型:int8序列 - 名称:标签(labels),类型:int64序列 - 名称:教师模型对数几率(teacher_logits),类型:二维float64序列 - 名称:教师模型索引(teacher_indices),类型:二维int64序列 - 名称:教师模型掩码索引(teacher_mask_indices),类型:int64序列 数据拆分详情: - 名称:训练集(train),字节数:17102298098.701529,样本数量:940987 - 名称:测试集(test),字节数:3018061158.5240602,样本数量:166057 下载总大小:7348415360,数据集总大小:20120359257.22559 --- # “logits-mt-ar-512”数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
配置
- 默认配置:
- 训练数据:路径为
data/train-* - 测试数据:路径为
data/test-*
- 训练数据:路径为
数据特征
- 输入ID:序列类型为
int32 - 标记类型ID:序列类型为
int8 - 注意力掩码:序列类型为
int8 - 标签:序列类型为
int64 - 教师对数:序列类型为
float64的序列 - 教师索引:序列类型为
int64的序列 - 教师掩码索引:序列类型为
int64
数据分割
- 训练集:
- 字节数:17102298098.701529
- 样本数:940987
- 测试集:
- 字节数:3018061158.5240602
- 样本数:166057
数据大小
- 下载大小:7348415360 字节
- 数据集大小:20120359257.22559 字节



