遇见数据集

GitBag/amazon_movie_tv_gemma_mxbai

收藏
Hugging Face2024-06-09 更新2024-06-29 收录
官方服务:

资源简介:

--- dataset_info: features: - name: in_sess_item_idxs sequence: int64 - name: out_sess_item_idxs sequence: int64 - name: dense_in_sesses sequence: float64 - name: sess_descriptions dtype: string - name: sess_description_gemma sequence: int64 - name: ref_responses dtype: string - name: ref_response_mxbai sequence: int64 splits: - name: train num_bytes: 7479569113 num_examples: 36480 - name: test num_bytes: 1540723706 num_examples: 7513 download_size: 210556567 dataset_size: 9020292819 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* ---

数据集信息: 特征列表: - 会话内项目索引(in_sess_item_idxs):序列类型为int64 - 会话外项目索引(out_sess_item_idxs):序列类型为int64 - 稠密会话输入(dense_in_sesses):序列类型为float64 - 会话描述(sess_descriptions):数据类型为字符串型 - Gemma模型会话描述编码(sess_description_gemma):序列类型为int64 - 参考回复(ref_responses):数据类型为字符串型 - Mxbai模型参考回复编码(ref_response_mxbai):序列类型为int64 数据集划分: - 训练集(train):占用字节数7479569113,样本总量36480 - 测试集(test):占用字节数1540723706,样本总量7513 下载总规模:210556567字节,数据集总存储规模:9020292819字节 数据集配置: - 默认配置(default): 数据文件: - 训练划分对应路径:data/train-* - 测试划分对应路径:data/test-*

提供机构:
GitBag
二维码
社区交流群
二维码
科研交流群
商业服务