官方服务:
资源简介:
Aprox. 2 mil words, txt
约200万词,TXT格式
应用场景:
相关数据集
multi-train/nq-train-multikilt_1107
--- configs: - config_name: default data_files: - split: train path: data/train-* dataset_info: features: - name: query dtype: string - name: pos sequence: string - name: neg
Hugging Face2023-11-10 更新140
mehdie/fine_tune_dataset_new_format
--- dataset_info: features: - name: text dtype: string - name: labels dtype: int64 splits: - name: train num_bytes: 106945 num_examples: 3010 download_size: 32296 dataset
Hugging Face2024-05-15 更新90
nafisneehal/trialbrain_baseline_measures_instruct_v1
该数据集包含62,270个训练样本,每个样本包含instruction、input和output三个字符串类型的特征。数据集总大小为211,029,841字节,下载大小为96,199,241字节。数据文件路径为data/train-*。
Hugging Face2024-12-19 更新60
ParaDeHate
PARADEHATE是一个并行数据集,专为仇恨言论脱毒任务设计,包含8276对有毒(仇恨言论)和非有毒(非仇恨言论)的文本样本。这些样本通过一个包含GPT-4o-mini模型的语言模型循环管道自动生成,将仇恨言论转换为语义上等效的非有毒文本。数据集来源于四个现有的仇恨言论数据集,主要针对英语社交媒体内容,如Twitter和Reddit。
Hugging Face2025-05-28 更新100
joaosanches/cleaned_tedtalks_total
--- dataset_info: features: - name: pt dtype: string - name: pt-br dtype: string splits: - name: train num_bytes: 66045930 num_examples: 314702 download_size: 41381774 da
Hugging Face2024-01-30 更新80



