nc33/CLM_data
收藏资源简介:
--- dataset_info: - config_name: default features: - name: train struct: - name: input dtype: string - name: instruction dtype: string - name: output dtype: string splits: - name: train num_bytes: 438033088 num_examples: 227703 download_size: 117819233 dataset_size: 438033088 - config_name: train features: - name: instruction dtype: string - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 438033088 num_examples: 227703 download_size: 117810940 dataset_size: 438033088 configs: - config_name: default data_files: - split: train path: data/train-* - config_name: train data_files: - split: train path: train/train-* --- # Dataset Card for "CLM_data" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集信息: - 配置名称(config_name):default 样本特征: - 字段名:train 结构: - 字段名:输入(input) 数据类型(dtype):字符串(string) - 字段名:指令(instruction) 数据类型(dtype):字符串(string) - 字段名:输出(output) 数据类型(dtype):字符串(string) 数据集划分: - 划分名称:train 字节数:438033088 样本数量:227703 下载大小:117819233 数据集大小:438033088 - 配置名称(config_name):train 样本特征: - 字段名:指令(instruction) 数据类型(dtype):字符串(string) - 字段名:输入(input) 数据类型(dtype):字符串(string) - 字段名:输出(output) 数据类型(dtype):字符串(string) 数据集划分: - 划分名称:train 字节数:438033088 样本数量:227703 下载大小:117810940 数据集大小:438033088 配置项: - 配置名称(config_name):default 数据文件: - 划分:train 路径:data/train-* - 配置名称(config_name):train 数据文件: - 划分:train 路径:train/train-* --- # “CLM_data”数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
数据集配置
默认配置
- 配置名称: default
- 特征:
- 训练集:
- 输入: 数据类型为字符串
- 指令: 数据类型为字符串
- 输出: 数据类型为字符串
- 训练集:
- 分割:
- 训练集:
- 字节数: 438033088
- 样本数: 227703
- 训练集:
- 下载大小: 117819233
- 数据集大小: 438033088
训练配置
- 配置名称: train
- 特征:
- 指令: 数据类型为字符串
- 输入: 数据类型为字符串
- 输出: 数据类型为字符串
- 分割:
- 训练集:
- 字节数: 438033088
- 样本数: 227703
- 训练集:
- 下载大小: 117810940
- 数据集大小: 438033088
数据文件
默认配置
- 数据文件:
- 分割: 训练集
- 路径: data/train-*
训练配置
- 数据文件:
- 分割: 训练集
- 路径: train/train-*




