lihaoxin2020/ki-llama3.1-instruct-synthetic_1-sft-on-mmlu_pro-0shot_cot-scillm-55b80990ce
收藏资源简介:
--- dataset_info: - config_name: biology features: - name: data list: - name: content dtype: string - name: role dtype: string - name: raw_response struct: - name: text dtype: string - name: raw_text dtype: string - name: knowledge_pieces list: string - name: doc_id dtype: int64 - name: native_id dtype: int64 splits: - name: train num_bytes: 2593900 num_examples: 200 download_size: 2502077 dataset_size: 2593900 - config_name: chemistry features: - name: data list: - name: content dtype: string - name: role dtype: string - name: raw_response struct: - name: text dtype: string - name: raw_text dtype: string - name: knowledge_pieces list: string - name: doc_id dtype: int64 - name: native_id dtype: int64 splits: - name: train num_bytes: 4374925 num_examples: 200 download_size: 4256235 dataset_size: 4374925 - config_name: computer science features: - name: data list: - name: content dtype: string - name: role dtype: string - name: raw_response struct: - name: text dtype: string - name: raw_text dtype: string - name: knowledge_pieces list: string - name: doc_id dtype: int64 - name: native_id dtype: int64 splits: - name: train num_bytes: 3143282 num_examples: 200 download_size: 3052822 dataset_size: 3143282 - config_name: engineering features: - name: data list: - name: content dtype: string - name: role dtype: string - name: raw_response struct: - name: text dtype: string - name: raw_text dtype: string - name: knowledge_pieces list: string - name: doc_id dtype: int64 - name: native_id dtype: int64 splits: - name: train num_bytes: 6434410 num_examples: 200 download_size: 6293177 dataset_size: 6434410 - config_name: health features: - name: data list: - name: content dtype: string - name: role dtype: string - name: raw_response struct: - name: text dtype: string - name: raw_text dtype: string - name: knowledge_pieces list: string - name: doc_id dtype: int64 - name: native_id dtype: int64 splits: - name: train num_bytes: 2814898 num_examples: 200 download_size: 2710695 dataset_size: 2814898 - config_name: math features: - name: data list: - name: content dtype: string - name: role dtype: string - name: raw_response struct: - name: text dtype: string - name: raw_text dtype: string - name: knowledge_pieces list: string - name: doc_id dtype: int64 - name: native_id dtype: int64 splits: - name: train num_bytes: 3156629 num_examples: 200 download_size: 3061043 dataset_size: 3156629 - config_name: physics features: - name: data list: - name: content dtype: string - name: role dtype: string - name: raw_response struct: - name: text dtype: string - name: raw_text dtype: string - name: knowledge_pieces list: string - name: doc_id dtype: int64 - name: native_id dtype: int64 splits: - name: train num_bytes: 4599020 num_examples: 200 download_size: 4487964 dataset_size: 4599020 configs: - config_name: biology data_files: - split: train path: biology/train-* - config_name: chemistry data_files: - split: train path: chemistry/train-* - config_name: computer science data_files: - split: train path: computer science/train-* - config_name: engineering data_files: - split: train path: engineering/train-* - config_name: health data_files: - split: train path: health/train-* - config_name: math data_files: - split: train path: math/train-* - config_name: physics data_files: - split: train path: physics/train-* ---
数据集信息: - 配置名称:生物学 特征: - 字段`data`:对话数据列表,包含以下子字段: - `content`:内容文本,数据类型为字符串 - `role`:角色标识,数据类型为字符串 - 字段`raw_response`:原始响应结构体,包含子字段: - `text`:响应文本,数据类型为字符串 - 字段`raw_text`:原始文本,数据类型为字符串 - 字段`knowledge_pieces`:存储知识片段的字符串列表 - 字段`doc_id`:64位整型文档标识 - 字段`native_id`:64位整型原生标识 数据拆分: - 拆分名称:train(训练集),占用字节数:2593900,样本总数:200 下载大小:2502077,数据集总大小:2593900 - 配置名称:化学 特征: - 字段`data`:对话数据列表,包含以下子字段: - `content`:内容文本,数据类型为字符串 - `role`:角色标识,数据类型为字符串 - 字段`raw_response`:原始响应结构体,包含子字段: - `text`:响应文本,数据类型为字符串 - 字段`raw_text`:原始文本,数据类型为字符串 - 字段`knowledge_pieces`:存储知识片段的字符串列表 - 字段`doc_id`:64位整型文档标识 - 字段`native_id`:64位整型原生标识 数据拆分: - 拆分名称:train(训练集),占用字节数:4374925,样本总数:200 下载大小:4256235,数据集总大小:4374925 - 配置名称:计算机科学 特征: - 字段`data`:对话数据列表,包含以下子字段: - `content`:内容文本,数据类型为字符串 - `role`:角色标识,数据类型为字符串 - 字段`raw_response`:原始响应结构体,包含子字段: - `text`:响应文本,数据类型为字符串 - 字段`raw_text`:原始文本,数据类型为字符串 - 字段`knowledge_pieces`:存储知识片段的字符串列表 - 字段`doc_id`:64位整型文档标识 - 字段`native_id`:64位整型原生标识 数据拆分: - 拆分名称:train(训练集),占用字节数:3143282,样本总数:200 下载大小:3052822,数据集总大小:3143282 - 配置名称:工程学 特征: - 字段`data`:对话数据列表,包含以下子字段: - `content`:内容文本,数据类型为字符串 - `role`:角色标识,数据类型为字符串 - 字段`raw_response`:原始响应结构体,包含子字段: - `text`:响应文本,数据类型为字符串 - 字段`raw_text`:原始文本,数据类型为字符串 - 字段`knowledge_pieces`:存储知识片段的字符串列表 - 字段`doc_id`:64位整型文档标识 - 字段`native_id`:64位整型原生标识 数据拆分: - 拆分名称:train(训练集),占用字节数:6434410,样本总数:200 下载大小:6293177,数据集总大小:6434410 - 配置名称:健康科学 特征: - 字段`data`:对话数据列表,包含以下子字段: - `content`:内容文本,数据类型为字符串 - `role`:角色标识,数据类型为字符串 - 字段`raw_response`:原始响应结构体,包含子字段: - `text`:响应文本,数据类型为字符串 - 字段`raw_text`:原始文本,数据类型为字符串 - 字段`knowledge_pieces`:存储知识片段的字符串列表 - 字段`doc_id`:64位整型文档标识 - 字段`native_id`:64位整型原生标识 数据拆分: - 拆分名称:train(训练集),占用字节数:2814898,样本总数:200 下载大小:2710695,数据集总大小:2814898 - 配置名称:数学 特征: - 字段`data`:对话数据列表,包含以下子字段: - `content`:内容文本,数据类型为字符串 - `role`:角色标识,数据类型为字符串 - 字段`raw_response`:原始响应结构体,包含子字段: - `text`:响应文本,数据类型为字符串 - 字段`raw_text`:原始文本,数据类型为字符串 - 字段`knowledge_pieces`:存储知识片段的字符串列表 - 字段`doc_id`:64位整型文档标识 - 字段`native_id`:64位整型原生标识 数据拆分: - 拆分名称:train(训练集),占用字节数:3156629,样本总数:200 下载大小:3061043,数据集总大小:3156629 - 配置名称:物理学 特征: - 字段`data`:对话数据列表,包含以下子字段: - `content`:内容文本,数据类型为字符串 - `role`:角色标识,数据类型为字符串 - 字段`raw_response`:原始响应结构体,包含子字段: - `text`:响应文本,数据类型为字符串 - 字段`raw_text`:原始文本,数据类型为字符串 - 字段`knowledge_pieces`:存储知识片段的字符串列表 - 字段`doc_id`:64位整型文档标识 - 字段`native_id`:64位整型原生标识 数据拆分: - 拆分名称:train(训练集),占用字节数:4599020,样本总数:200 下载大小:4487964,数据集总大小:4599020 配置列表: - 配置名称:生物学,数据文件: - 拆分:train(训练集),路径:biology/train-* - 配置名称:化学,数据文件: - 拆分:train(训练集),路径:chemistry/train-* - 配置名称:计算机科学,数据文件: - 拆分:train(训练集),路径:computer science/train-* - 配置名称:工程学,数据文件: - 拆分:train(训练集),路径:engineering/train-* - 配置名称:健康科学,数据文件: - 拆分:train(训练集),路径:health/train-* - 配置名称:数学,数据文件: - 拆分:train(训练集),路径:math/train-* - 配置名称:物理学,数据文件: - 拆分:train(训练集),路径:physics/train-*



