u-10bei/enwiki-20240301-tokenizer
收藏官方服务:
资源简介:
--- language: - en license: cc-by-sa-4.0 dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 1412755404 num_examples: 5380083 download_size: 855323958 dataset_size: 1412755404 configs: - config_name: default data_files: - split: train path: data/train-* ---
语言: - 英语(en) 许可证:CC BY-SA 4.0 数据集信息: 特征字段: - 字段名:文本 数据类型:字符串(string) 数据划分: - 划分名称:训练集(train) 字节大小:1412755404 样本数量:5380083 下载大小:855323958 数据集总大小:1412755404 配置项: - 配置名称:默认配置(default) 数据文件: - 数据划分:训练集(train) 文件路径:data/train-*
提供机构:
u-10bei原始信息汇总
数据集概述
语言
- 英语(en)
许可
- CC BY-SA 4.0
数据集信息
-
特征
- 名称: text
- 数据类型: string
-
分割
- 名称: train
- 字节数: 1412755404
- 样本数: 5380083
-
下载大小
- 855323958 字节
-
数据集大小
- 1412755404 字节
配置
-
配置名称
- default
-
数据文件
- 分割: train
- 路径: data/train-*



