nqv2291/en-Pile-NER-instruction_format
收藏资源简介:
--- dataset_info: features: - name: id dtype: string - name: input_ids sequence: int32 - name: attention_mask sequence: int8 - name: labels sequence: int64 splits: - name: train num_bytes: 718154559 num_examples: 350974 - name: test num_bytes: 14690939 num_examples: 7208 download_size: 140685783 dataset_size: 732845498 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* ---
数据集信息: 特征列表: - 特征名称:id,数据类型:字符串(string) - 特征名称:输入标识符(input_ids),数据类型:元素为32位有符号整数的序列 - 特征名称:注意力掩码(attention_mask),数据类型:元素为8位有符号整数的序列 - 特征名称:标签(labels),数据类型:元素为64位有符号整数的序列 数据集划分: - 划分名称:训练集(train),占用字节数:718154559,样本总量:350974 - 划分名称:测试集(test),占用字节数:14690939,样本总量:7208 下载总大小:140685783 字节 数据集总占用大小:732845498 字节 配置项: - 配置名称:默认(default),数据文件配置: - 训练集划分:数据路径为 data/train-* - 测试集划分:数据路径为 data/test-*
数据集概述
数据集特征
- id: 字符串类型
- input_ids: 整数序列,类型为 int32
- attention_mask: 整数序列,类型为 int8
- labels: 整数序列,类型为 int64
数据集分割
- 训练集 (train):
- 示例数量: 350974
- 数据大小: 718154559 字节
- 测试集 (test):
- 示例数量: 7208
- 数据大小: 14690939 字节
数据集大小
- 下载大小: 140685783 字节
- 数据集总大小: 732845498 字节
数据文件配置
- 默认配置 (default):
- 训练集路径:
data/train-* - 测试集路径:
data/test-*
- 训练集路径:



