资源简介:
--- task_categories: - text-classification - token-classification size_categories: - 10K<n<100K dataset_info: - config_name: yelp features: - name: text dtype: string - name: label dtype: int8 - name: weak_labels sequence: int8 splits: - name: train num_bytes: 22618599 num_examples: 30400 - name: validation num_bytes: 2824249 num_examples: 3800 - name: test num_bytes: 2709033 num_examples: 3800 download_size: 37356054 dataset_size: 28151881 - config_name: imdb features: - name: text dtype: string - name: label dtype: int8 - name: weak_labels sequence: int8 splits: - name: train num_bytes: 25515241 num_examples: 20000 - name: validation num_bytes: 3269130 num_examples: 2500 - name: test num_bytes: 3151954 num_examples: 2500 download_size: 33910706 dataset_size: 31936325 - config_name: agnews features: - name: text dtype: string - name: label dtype: int8 - name: weak_labels sequence: int8 splits: - name: train num_bytes: 20357121 num_examples: 96000 - name: validation num_bytes: 2487983 num_examples: 12000 - name: test num_bytes: 2521518 num_examples: 12000 download_size: 39149014 dataset_size: 25366622 - config_name: cdr features: - name: text dtype: string - name: label dtype: int8 - name: entity1 dtype: string - name: entity2 dtype: string - name: weak_labels sequence: int8 splits: - name: train num_bytes: 2318545 num_examples: 8430 - name: validation num_bytes: 246252 num_examples: 920 - name: test num_bytes: 1229627 num_examples: 4673 download_size: 11036213 dataset_size: 3794424 - config_name: chemprot features: - name: text dtype: string - name: label dtype: int8 - name: entity1 dtype: string - name: entity2 dtype: string - name: weak_labels sequence: int8 splits: - name: train num_bytes: 3474637 num_examples: 12861 - name: validation num_bytes: 435850 num_examples: 1607 - name: test num_bytes: 434031 num_examples: 1607 download_size: 15743249 dataset_size: 4344518 - config_name: semeval features: - name: text dtype: string - name: label dtype: int8 - name: entity1 dtype: string - name: entity2 dtype: string - name: weak_labels sequence: int8 splits: - name: train num_bytes: 532785 num_examples: 1749 - name: validation num_bytes: 54373 num_examples: 178 - name: test num_bytes: 184826 num_examples: 600 download_size: 2295058 dataset_size: 771984 - config_name: sms features: - name: text dtype: string - name: label dtype: int8 - name: weak_labels sequence: int8 splits: - name: train num_bytes: 741520 num_examples: 4571 - name: validation num_bytes: 81747 num_examples: 500 - name: test num_bytes: 80152 num_examples: 500 download_size: 6715435 dataset_size: 903419 - config_name: spouse features: - name: text dtype: string - name: label dtype: int8 - name: entity1 dtype: string - name: entity2 dtype: string - name: weak_labels sequence: int8 splits: - name: train num_bytes: 7550613 num_examples: 22254 - name: validation num_bytes: 952523 num_examples: 2811 - name: test num_bytes: 876804 num_examples: 2701 download_size: 22017644 dataset_size: 9379940 - config_name: trec features: - name: text dtype: string - name: label dtype: int8 - name: weak_labels sequence: int8 splits: - name: train num_bytes: 610244 num_examples: 4965 - name: validation num_bytes: 61048 num_examples: 500 - name: test num_bytes: 56479 num_examples: 500 download_size: 2277067 dataset_size: 727771 - config_name: youtube features: - name: text dtype: string - name: label dtype: int8 - name: weak_labels sequence: int8 splits: - name: train num_bytes: 180736 num_examples: 1586 - name: validation num_bytes: 14659 num_examples: 120 - name: test num_bytes: 33347 num_examples: 250 download_size: 759494 dataset_size: 228742 ---