bot-yaya/undl_ar2en_aligned
收藏资源简介:
--- dataset_info: features: - name: record dtype: string - name: clean_para_index_set_pair dtype: string - name: src dtype: string - name: dst dtype: string - name: src_text dtype: string - name: dst_text dtype: string - name: src_rate dtype: float64 - name: dst_rate dtype: float64 splits: - name: train num_bytes: 12012712129 num_examples: 15217906 download_size: 0 dataset_size: 12012712129 configs: - config_name: default data_files: - split: train path: data/train-* --- # Dataset Card for "undl_ar2en_aligned" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集信息: 特征字段: - 名称:record,数据类型:字符串 - 名称:clean_para_index_set_pair,数据类型:字符串 - 名称:源文本(src),数据类型:字符串 - 名称:目标文本(dst),数据类型:字符串 - 名称:源文本内容(src_text),数据类型:字符串 - 名称:目标文本内容(dst_text),数据类型:字符串 - 名称:源文本评分(src_rate),数据类型:float64 - 名称:目标文本评分(dst_rate),数据类型:float64 数据拆分: - 名称:训练集(train),字节大小:12012712129,样本数量:15217906 下载大小:0 数据集总大小:12012712129 配置项: - 配置名称:默认(default),数据文件: - 数据拆分:训练集(train),文件路径:data/train-* # 「undl_ar2en_aligned」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
数据集信息
-
特征列表:
record:字符串类型clean_para_index_set_pair:字符串类型src:字符串类型dst:字符串类型src_text:字符串类型dst_text:字符串类型src_rate:浮点数类型(float64)dst_rate:浮点数类型(float64)
-
数据分割:
train:- 字节数:12012712129
- 样本数:15217906
-
数据集大小:
- 下载大小:0
- 数据集大小:12012712129
配置信息
- 配置名称:default
- 数据文件:
- 分割:train
- 路径:data/train-*
- 数据文件:



