wh-y-j-lee/day1-sample-training-v2
收藏资源简介:
--- dataset_info: features: - name: id dtype: string - name: version dtype: string - name: generator dtype: string - name: document_type dtype: string - name: question_type dtype: string - name: answer_type dtype: string - name: difficulty dtype: string - name: system_prompt dtype: string - name: instruction dtype: string - name: ocr_text dtype: string - name: question dtype: string - name: response dtype: string - name: messages list: - name: content dtype: string - name: role dtype: string splits: - name: train num_bytes: 1532468 num_examples: 1000 download_size: 892324 dataset_size: 1532468 configs: - config_name: default data_files: - split: train path: data/train-* ---
数据集信息: 特征字段: - 属性名:样本标识符(id),数据类型:字符串 - 属性名:版本号(version),数据类型:字符串 - 属性名:数据生成器(generator),数据类型:字符串 - 属性名:文档类型(document_type),数据类型:字符串 - 属性名:问题类型(question_type),数据类型:字符串 - 属性名:答案类型(answer_type),数据类型:字符串 - 属性名:难度等级(difficulty),数据类型:字符串 - 属性名:系统提示词(system_prompt),数据类型:字符串 - 属性名:指令(instruction),数据类型:字符串 - 属性名:OCR(Optical Character Recognition)文本(ocr_text),数据类型:字符串 - 属性名:问题(question),数据类型:字符串 - 属性名:回复(response),数据类型:字符串 - 属性名:对话消息列表(messages),数据类型:列表,其子字段为: - 子属性名:内容(content),数据类型:字符串 - 子属性名:角色(role),数据类型:字符串 数据集划分: - 划分名称:训练集(train),字节占用量:1532468,样本数量:1000 下载大小:892324 数据集存储大小:1532468 配置项: - 配置名称:默认配置(default),数据文件: - 划分:训练集(train),路径:data/train-*



