raymondzmc/tweet_topic_Qwen3.5-0.8B_vocab_2000_last
收藏资源简介:
--- dataset_info: features: - name: id dtype: int64 - name: context dtype: string - name: next_word dtype: string - name: next_word_logits sequence: float64 - name: input_embeddings sequence: float64 - name: bow dtype: string - name: label dtype: int64 splits: - name: train num_bytes: 539482459 num_examples: 21996 download_size: 104101472 dataset_size: 539482459 configs: - config_name: default data_files: - split: train path: data/train-* ---
数据集信息: 特征: - 特征名:id,数据类型:64位整数(int64) - 特征名:context(上下文),数据类型:字符串 - 特征名:next_word(下一词),数据类型:字符串 - 特征名:next_word_logits(下一词对数几率),数据类型:64位浮点数序列 - 特征名:input_embeddings(输入嵌入),数据类型:64位浮点数序列 - 特征名:bow(词袋模型,Bag of Words),数据类型:字符串 - 特征名:label(标签),数据类型:64位整数(int64) 数据集划分: - 划分名称:训练集(train),占用字节数:539482459,样本数量:21996 下载总大小:104101472 数据集总占用字节数:539482459 数据集配置: - 配置名称:默认(default),数据文件: - 对应划分:训练集,文件路径:data/train-*



