SAIFIINDUSTRIES/training_data_3
收藏资源简介:
--- dataset_info: - config_name: cosmopedia_5gb features: - name: text_token_length dtype: int64 - name: prompt dtype: string - name: text dtype: string - name: seed_data dtype: string - name: format dtype: string - name: audience dtype: string splits: - name: train num_bytes: 0 num_examples: 441175 download_size: 1359424270 dataset_size: 0 - config_name: dense_clean_pajama features: - name: text dtype: string - name: meta struct: - name: redpajama_set_name dtype: string - name: __index_level_0__ dtype: int64 splits: - name: train num_bytes: 0 num_examples: 1129030 download_size: 2846795537 dataset_size: 0 - config_name: dense_knowledge_edu features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype: string - name: file_path dtype: string - name: language dtype: string - name: language_score dtype: float64 - name: token_count dtype: int64 - name: score dtype: float64 - name: int_score dtype: int64 splits: - name: train num_bytes: 0 num_examples: 1666663 download_size: 4793067380 dataset_size: 0 - config_name: dense_reasoning_hermes features: - name: custom_instruction dtype: bool - name: topic dtype: string - name: model_name dtype: string - name: model dtype: string - name: skip_prompt_formatting dtype: bool - name: category dtype: string - name: conversations list: - name: from dtype: string - name: value dtype: string - name: weight dtype: float64 - name: views dtype: int64 - name: language dtype: string - name: id dtype: string - name: title dtype: string - name: idx dtype: string - name: hash list: int64 - name: avatarUrl dtype: string - name: system_prompt dtype: string - name: source dtype: string splits: - name: train num_bytes: 0 num_examples: 250387 download_size: 463172121 dataset_size: 0 - config_name: multi_hindi features: - name: text dtype: string - name: timestamp dtype: string - name: url dtype: string - name: source dtype: string splits: - name: train num_bytes: 0 num_examples: 180000 download_size: 511562468 dataset_size: 0 - config_name: openthoughts_cot features: - name: text dtype: string splits: - name: train num_bytes: 0 num_examples: 37985 download_size: 320154015 dataset_size: 0 - config_name: smollm_cosmo_v2 features: - name: prompt dtype: string - name: text dtype: string - name: token_length dtype: int64 - name: audience dtype: string - name: format dtype: string - name: seed_data dtype: string splits: - name: train num_bytes: 0 num_examples: 1166659 download_size: 3582416300 dataset_size: 0 - config_name: ultrachat_logic features: - name: prompt dtype: string - name: prompt_id dtype: string - name: messages list: - name: content dtype: string - name: role dtype: string splits: - name: train num_bytes: 0 num_examples: 69288 download_size: 442545428 dataset_size: 0 configs: - config_name: cosmopedia_5gb data_files: - split: train path: cosmopedia_5gb/train-* - config_name: dense_clean_pajama data_files: - split: train path: dense_clean_pajama/train-* - config_name: dense_knowledge_edu data_files: - split: train path: dense_knowledge_edu/train-* - config_name: dense_reasoning_hermes data_files: - split: train path: dense_reasoning_hermes/train-* - config_name: multi_hindi data_files: - split: train path: multi_hindi/train-* - config_name: openthoughts_cot data_files: - split: train path: openthoughts_cot/train-* - config_name: smollm_cosmo_v2 data_files: - split: train path: smollm_cosmo_v2/train-* - config_name: ultrachat_logic data_files: - split: train path: ultrachat_logic/train-* ---
数据集信息: - 配置名称:cosmopedia_5gb 特征: - 字段名称:text_token_length,数据类型:int64(64位整数) - 字段名称:prompt(提示词),数据类型:string(字符串) - 字段名称:text,数据类型:string(字符串) - 字段名称:seed_data,数据类型:string(字符串) - 字段名称:format,数据类型:string(字符串) - 字段名称:audience,数据类型:string(字符串) 数据集划分: - 名称:train(训练集),字节数:0,样本数:441175 下载体积:1359424270,数据集体积:0 - 配置名称:dense_clean_pajama 特征: - 字段名称:text,数据类型:string(字符串) - 字段名称:meta(元数据),结构体: - 字段名称:redpajama_set_name,数据类型:string(字符串) - 字段名称:__index_level_0__,数据类型:int64(64位整数) 数据集划分: - 名称:train(训练集),字节数:0,样本数:1129030 下载体积:2846795537,数据集体积:0 - 配置名称:dense_knowledge_edu 特征: - 字段名称:text,数据类型:string(字符串) - 字段名称:id,数据类型:string(字符串) - 字段名称:dump,数据类型:string(字符串) - 字段名称:url(统一资源定位符),数据类型:string(字符串) - 字段名称:file_path,数据类型:string(字符串) - 字段名称:language,数据类型:string(字符串) - 字段名称:language_score,数据类型:float64(64位浮点数) - 字段名称:token_count(Token计数),数据类型:int64(64位整数) - 字段名称:score,数据类型:float64(64位浮点数) - 字段名称:int_score,数据类型:int64(64位整数) 数据集划分: - 名称:train(训练集),字节数:0,样本数:1666663 下载体积:4793067380,数据集体积:0 - 配置名称:dense_reasoning_hermes 特征: - 字段名称:custom_instruction,数据类型:bool(布尔型) - 字段名称:topic,数据类型:string(字符串) - 字段名称:model_name,数据类型:string(字符串) - 字段名称:model,数据类型:string(字符串) - 字段名称:skip_prompt_formatting,数据类型:bool(布尔型) - 字段名称:category,数据类型:string(字符串) - 字段名称:conversations(对话列表),列表类型,元素包含: - 字段名称:from,数据类型:string(字符串) - 字段名称:value,数据类型:string(字符串) - 字段名称:weight,数据类型:float64(64位浮点数) - 字段名称:views,数据类型:int64(64位整数) - 字段名称:language,数据类型:string(字符串) - 字段名称:id,数据类型:string(字符串) - 字段名称:title,数据类型:string(字符串) - 字段名称:idx,数据类型:string(字符串) - 字段名称:hash(哈希值列表),列表类型,元素为int64(64位整数) - 字段名称:avatarUrl(头像URL),数据类型:string(字符串) - 字段名称:system_prompt(系统提示词),数据类型:string(字符串) - 字段名称:source,数据类型:string(字符串) 数据集划分: - 名称:train(训练集),字节数:0,样本数:250387 下载体积:463172121,数据集体积:0 - 配置名称:multi_hindi 特征: - 字段名称:text,数据类型:string(字符串) - 字段名称:timestamp(时间戳),数据类型:string(字符串) - 字段名称:url(统一资源定位符),数据类型:string(字符串) - 字段名称:source,数据类型:string(字符串) 数据集划分: - 名称:train(训练集),字节数:0,样本数:180000 下载体积:511562468,数据集体积:0 - 配置名称:openthoughts_cot 特征: - 字段名称:text,数据类型:string(字符串) 数据集划分: - 名称:train(训练集),字节数:0,样本数:37985 下载体积:320154015,数据集体积:0 - 配置名称:smollm_cosmo_v2 特征: - 字段名称:prompt(提示词),数据类型:string(字符串) - 字段名称:text,数据类型:string(字符串) - 字段名称:token_length(Token长度),数据类型:int64(64位整数) - 字段名称:audience,数据类型:string(字符串) - 字段名称:format,数据类型:string(字符串) - 字段名称:seed_data,数据类型:string(字符串) 数据集划分: - 名称:train(训练集),字节数:0,样本数:1166659 下载体积:3582416300,数据集体积:0 - 配置名称:ultrachat_logic 特征: - 字段名称:prompt(提示词),数据类型:string(字符串) - 字段名称:prompt_id(提示词ID),数据类型:string(字符串) - 字段名称:messages(消息列表),列表类型,元素包含: - 字段名称:content(内容),数据类型:string(字符串) - 字段名称:role(角色),数据类型:string(字符串) 数据集划分: - 名称:train(训练集),字节数:0,样本数:69288 下载体积:442545428,数据集体积:0 配置列表: - 配置名称:cosmopedia_5gb,数据文件: - 划分:train(训练集),路径:cosmopedia_5gb/train-* - 配置名称:dense_clean_pajama,数据文件: - 划分:train(训练集),路径:dense_clean_pajama/train-* - 配置名称:dense_knowledge_edu,数据文件: - 划分:train(训练集),路径:dense_knowledge_edu/train-* - 配置名称:dense_reasoning_hermes,数据文件: - 划分:train(训练集),路径:dense_reasoning_hermes/train-* - 配置名称:multi_hindi,数据文件: - 划分:train(训练集),路径:multi_hindi/train-* - 配置名称:openthoughts_cot,数据文件: - 划分:train(训练集),路径:openthoughts_cot/train-* - 配置名称:smollm_cosmo_v2,数据文件: - 划分:train(训练集),路径:smollm_cosmo_v2/train-* - 配置名称:ultrachat_logic,数据文件: - 划分:train(训练集),路径:ultrachat_logic/train-*



