SAIFIINDUSTRIES/training_data_2
收藏资源简介:
--- dataset_info: - config_name: cosmopedia_5gb features: - name: text_token_length dtype: int64 - name: prompt dtype: string - name: text dtype: string - name: seed_data dtype: string - name: format dtype: string - name: audience dtype: string splits: - name: train num_bytes: 0 num_examples: 529410 download_size: 1632209671 dataset_size: 0 - config_name: dense_clean_pajama features: - name: text dtype: string - name: meta struct: - name: redpajama_set_name dtype: string - name: __index_level_0__ dtype: int64 splits: - name: train num_bytes: 0 num_examples: 1129030 download_size: 2861365836 dataset_size: 0 - config_name: dense_knowledge_edu features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype: string - name: file_path dtype: string - name: language dtype: string - name: language_score dtype: float64 - name: token_count dtype: int64 - name: score dtype: float64 - name: int_score dtype: int64 splits: - name: train num_bytes: 0 num_examples: 1666663 download_size: 4809242032 dataset_size: 0 - config_name: dense_reasoning_hermes features: - name: custom_instruction dtype: bool - name: topic dtype: string - name: model_name dtype: string - name: model dtype: string - name: skip_prompt_formatting dtype: bool - name: category dtype: string - name: conversations list: - name: from dtype: string - name: value dtype: string - name: weight dtype: float64 - name: views dtype: int64 - name: language dtype: string - name: id dtype: string - name: title dtype: string - name: idx dtype: string - name: hash list: int64 - name: avatarUrl dtype: string - name: system_prompt dtype: string - name: source dtype: string splits: - name: train num_bytes: 0 num_examples: 250388 download_size: 406401718 dataset_size: 0 - config_name: multi_hindi features: - name: text dtype: string - name: timestamp dtype: string - name: url dtype: string - name: source dtype: string splits: - name: train num_bytes: 0 num_examples: 180000 download_size: 513070836 dataset_size: 0 - config_name: numinamath_cot features: - name: text dtype: string splits: - name: train num_bytes: 0 num_examples: 200000 download_size: 136997494 dataset_size: 0 - config_name: openthoughts_cot features: - name: text dtype: string splits: - name: train num_bytes: 0 num_examples: 37986 download_size: 362775053 dataset_size: 0 - config_name: smollm_cosmo_v2 features: - name: prompt dtype: string - name: text dtype: string - name: token_length dtype: int64 - name: audience dtype: string - name: format dtype: string - name: seed_data dtype: string splits: - name: train num_bytes: 0 num_examples: 1166669 download_size: 3582341033 dataset_size: 0 - config_name: ultrachat_logic features: - name: prompt dtype: string - name: prompt_id dtype: string - name: messages list: - name: content dtype: string - name: role dtype: string splits: - name: train num_bytes: 0 num_examples: 69288 download_size: 441963673 dataset_size: 0 configs: - config_name: cosmopedia_5gb data_files: - split: train path: cosmopedia_5gb/train-* - config_name: dense_clean_pajama data_files: - split: train path: dense_clean_pajama/train-* - config_name: dense_knowledge_edu data_files: - split: train path: dense_knowledge_edu/train-* - config_name: dense_reasoning_hermes data_files: - split: train path: dense_reasoning_hermes/train-* - config_name: multi_hindi data_files: - split: train path: multi_hindi/train-* - config_name: numinamath_cot data_files: - split: train path: numinamath_cot/train-* - config_name: openthoughts_cot data_files: - split: train path: openthoughts_cot/train-* - config_name: smollm_cosmo_v2 data_files: - split: train path: smollm_cosmo_v2/train-* - config_name: ultrachat_logic data_files: - split: train path: ultrachat_logic/train-* ---
数据集信息: - 配置名称:cosmopedia_5gb 特征: - 文本Token (Token)长度:数据类型为64位整数 - 提示词 (Prompt):数据类型为字符串 - 文本:数据类型为字符串 - 种子数据:数据类型为字符串 - 格式:数据类型为字符串 - 受众群体:数据类型为字符串 数据集划分: - 划分名称:训练集,字节数:0,样本数:529410 下载大小:1632209671,数据集大小:0 - 配置名称:dense_clean_pajama 特征: - 文本:数据类型为字符串 - 元数据:结构体类型,包含字段: - redpajama数据集集合名称:数据类型为字符串 - __index_level_0__:数据类型为64位整数 数据集划分: - 划分名称:训练集,字节数:0,样本数:1129030 下载大小:2861365836,数据集大小:0 - 配置名称:dense_knowledge_edu 特征: - 文本:数据类型为字符串 - 标识符:数据类型为字符串 - 转储数据:数据类型为字符串 - 统一资源定位符 (URL):数据类型为字符串 - 文件路径:数据类型为字符串 - 语言:数据类型为字符串 - 语言评分:数据类型为双精度浮点数 - Token (Token)计数:数据类型为64位整数 - 评分:数据类型为双精度浮点数 - 整数评分:数据类型为64位整数 数据集划分: - 划分名称:训练集,字节数:0,样本数:1666663 下载大小:4809242032,数据集大小:0 - 配置名称:dense_reasoning_hermes 特征: - 自定义指令:数据类型为布尔值 - 主题:数据类型为字符串 - 模型名称:数据类型为字符串 - 模型:数据类型为字符串 - 跳过提示词格式化:数据类型为布尔值 - 类别:数据类型为字符串 - 对话历史:列表类型,包含字段: - 来源角色:数据类型为字符串 - 内容值:数据类型为字符串 - 权重:数据类型为双精度浮点数 - 浏览量:数据类型为64位整数 - 语言:数据类型为字符串 - 标识符:数据类型为字符串 - 标题:数据类型为字符串 - 索引标识符:数据类型为字符串 - 哈希值:列表类型,元素为64位整数 - 头像URL:数据类型为字符串 - 系统提示词:数据类型为字符串 - 来源:数据类型为字符串 数据集划分: - 划分名称:训练集,字节数:0,样本数:250388 下载大小:406401718,数据集大小:0 - 配置名称:multi_hindi 特征: - 文本:数据类型为字符串 - 时间戳:数据类型为字符串 - 统一资源定位符 (URL):数据类型为字符串 - 来源:数据类型为字符串 数据集划分: - 划分名称:训练集,字节数:0,样本数:180000 下载大小:513070836,数据集大小:0 - 配置名称:numinamath_cot(思维链,Chain of Thought) 特征: - 文本:数据类型为字符串 数据集划分: - 划分名称:训练集,字节数:0,样本数:200000 下载大小:136997494,数据集大小:0 - 配置名称:openthoughts_cot(思维链,Chain of Thought) 特征: - 文本:数据类型为字符串 数据集划分: - 划分名称:训练集,字节数:0,样本数:37986 下载大小:362775053,数据集大小:0 - 配置名称:smollm_cosmo_v2 特征: - 提示词 (Prompt):数据类型为字符串 - 文本:数据类型为字符串 - Token (Token)长度:数据类型为64位整数 - 受众群体:数据类型为字符串 - 格式:数据类型为字符串 - 种子数据:数据类型为字符串 数据集划分: - 划分名称:训练集,字节数:0,样本数:1166669 下载大小:3582341033,数据集大小:0 - 配置名称:ultrachat_logic 特征: - 提示词 (Prompt):数据类型为字符串 - 提示词标识符:数据类型为字符串 - 消息列表:列表类型,包含字段: - 内容:数据类型为字符串 - 角色:数据类型为字符串 数据集划分: - 划分名称:训练集,字节数:0,样本数:69288 下载大小:441963673,数据集大小:0 配置项: - 配置名称:cosmopedia_5gb 数据文件: - 划分:训练集,路径:cosmopedia_5gb/train-* - 配置名称:dense_clean_pajama 数据文件: - 划分:训练集,路径:dense_clean_pajama/train-* - 配置名称:dense_knowledge_edu 数据文件: - 划分:训练集,路径:dense_knowledge_edu/train-* - 配置名称:dense_reasoning_hermes 数据文件: - 划分:训练集,路径:dense_reasoning_hermes/train-* - 配置名称:multi_hindi 数据文件: - 划分:训练集,路径:multi_hindi/train-* - 配置名称:numinamath_cot 数据文件: - 划分:训练集,路径:numinamath_cot/train-* - 配置名称:openthoughts_cot 数据文件: - 划分:训练集,路径:openthoughts_cot/train-* - 配置名称:smollm_cosmo_v2 数据文件: - 划分:训练集,路径:smollm_cosmo_v2/train-* - 配置名称:ultrachat_logic 数据文件: - 划分:训练集,路径:ultrachat_logic/train-*



