chronbmm/sanskrit-unsandhi-without-rec
收藏官方服务:
资源简介:
--- dataset_info: features: - name: sentence dtype: string - name: unsandhied dtype: string splits: - name: train num_bytes: 20882265 num_examples: 153347 - name: validation num_bytes: 1055410 num_examples: 8190 - name: test num_bytes: 1065484 num_examples: 8398 download_size: 13453451 dataset_size: 23003159 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---
提供机构:
chronbmm原始信息汇总
数据集概述
特征
- sentence: 数据类型为字符串。
- unsandhied: 数据类型为字符串。
数据分割
- 训练集: 包含153,347个样本,总大小为20,882,265字节。
- 验证集: 包含8,190个样本,总大小为10,554,10字节。
- 测试集: 包含8,398个样本,总大小为10,654,84字节。
数据集大小
- 下载大小: 13,453,451字节。
- 数据集总大小: 23,003,159字节。
配置
- 默认配置:
- 训练数据路径:
data/train-* - 验证数据路径:
data/validation-* - 测试数据路径:
data/test-*
- 训练数据路径:



