JuniorThanh/vietnamese_news_human_ai_knn
收藏资源简介:
--- dataset_info: features: - name: sentence_count dtype: int64 - name: ttr dtype: float64 - name: special_char_ratio dtype: float64 - name: caps_ratio dtype: float64 - name: stopwords_ratio dtype: float64 - name: entropy dtype: float64 - name: adj_ratio dtype: float64 - name: pronoun_ratio dtype: float64 - name: conjunction_ratio dtype: float64 - name: burstiness dtype: float64 - name: number_ratio dtype: float64 - name: Label dtype: int64 splits: - name: train num_bytes: 672000 num_examples: 7000 - name: validation num_bytes: 192000 num_examples: 2000 - name: test num_bytes: 96000 num_examples: 1000 download_size: 835610 dataset_size: 960000 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---
数据集信息: 特征列表: - 名称:句子数量,数据类型:int64(64位整数) - 名称:类型-令牌比(Type-Token Ratio, TTR),数据类型:float64(64位浮点数) - 名称:特殊字符占比,数据类型:float64 - 名称:大写字符占比,数据类型:float64 - 名称:停用词占比,数据类型:float64 - 名称:熵(Entropy),数据类型:float64 - 名称:形容词占比,数据类型:float64 - 名称:代词占比,数据类型:float64 - 名称:连词占比,数据类型:float64 - 名称:突发度(Burstiness),数据类型:float64 - 名称:数字占比,数据类型:float64 - 名称:标签(Label),数据类型:int64 数据集划分: - 划分名称:训练集,占用字节数:672000,样本数量:7000 - 划分名称:验证集,占用字节数:192000,样本数量:2000 - 划分名称:测试集,占用字节数:96000,样本数量:1000 下载大小:835610 字节 数据集总大小:960000 字节 配置项: - 配置名称:默认配置,数据文件映射: - 训练集:对应路径为 data/train-* - 验证集:对应路径为 data/validation-* - 测试集:对应路径为 data/test-*



