Self-GRIT/tulu-v2-sft-mixture-llama3-inference-retrieval-tokens-10k-outputs-v1
收藏资源简介:
--- dataset_info: features: - name: dataset dtype: string - name: id dtype: string - name: messages list: - name: content dtype: string - name: role dtype: string - name: instruction dtype: string - name: output dtype: string - name: prompt_insert_retrieval_tokens dtype: string - name: completion dtype: string - name: token_length dtype: int64 - name: failed dtype: int64 splits: - name: train num_bytes: 167545040 num_examples: 10000 download_size: 57418184 dataset_size: 167545040 configs: - config_name: default data_files: - split: train path: data/train-* ---
数据集信息: 特征列表: - 特征名:dataset,数据类型:字符串(string) - 特征名:id,数据类型:字符串(string) - 特征名:messages,类型为列表,其包含的子特征项为: - 子特征名:content,数据类型:字符串(string) - 子特征名:role,数据类型:字符串(string) - 特征名:instruction,数据类型:字符串(string) - 特征名:output,数据类型:字符串(string) - 特征名:prompt_insert_retrieval_tokens,数据类型:字符串(string),译为提示插入检索Token - 特征名:completion,数据类型:字符串(string),译为补全文本(completion) - 特征名:token_length,数据类型:64位整数(int64),译为Token长度 - 特征名:failed,数据类型:64位整数(int64),译为失败标记 数据集划分: - 划分名称:train(训练集),字节占用量:167545040,样本总数:10000 下载大小:57418184 数据集总大小:167545040 配置项: - 配置名称:default(默认配置),对应数据文件: - 划分:train(训练集),文件路径:data/train-*



