joshuapsa/gpt-generated-news-paragraphs-v1.1
收藏资源简介:
--- configs: - config_name: default data_files: - split: train path: data/train-* - split: valid path: data/valid-* - split: test path: data/test-* dataset_info: features: - name: class_name dtype: string - name: text dtype: string - name: aviation dtype: class_label: names: '0': '0' '1': '1' - name: cybersecurity dtype: class_label: names: '0': '0' '1': '1' - name: domestic_unrest_violence dtype: class_label: names: '0': '0' '1': '1' - name: extreme_weather dtype: class_label: names: '0': '0' '1': '1' - name: forced_labor dtype: class_label: names: '0': '0' '1': '1' - name: general_biz_trend dtype: class_label: names: '0': '0' '1': '1' - name: individual_accidents_tragedies dtype: class_label: names: '0': '0' '1': '1' - name: later_report dtype: class_label: names: '0': '0' '1': '1' - name: lawsuit_legal_insurance dtype: class_label: names: '0': '0' '1': '1' - name: leisure_other_news dtype: class_label: names: '0': '0' '1': '1' - name: maritime dtype: class_label: names: '0': '0' '1': '1' - name: pandemics_large_scale_diseases dtype: class_label: names: '0': '0' '1': '1' - name: railway dtype: class_label: names: '0': '0' '1': '1' - name: strike dtype: class_label: names: '0': '0' '1': '1' - name: trade_war_embargos_bans dtype: class_label: names: '0': '0' '1': '1' - name: transportation_trends_projects dtype: class_label: names: '0': '0' '1': '1' - name: war_conflict dtype: class_label: names: '0': '0' '1': '1' - name: warehouse_fire dtype: class_label: names: '0': '0' '1': '1' - name: class_index dtype: class_label: names: '0': '0' '1': '1' - name: label sequence: int64 splits: - name: train num_bytes: 419816 num_examples: 720 - name: valid num_bytes: 52468 num_examples: 90 - name: test num_bytes: 52223 num_examples: 90 download_size: 179362 dataset_size: 524507 --- # Dataset Card for "gpt-generated-news-paragraphs-v1.1" - This dataset was created solely for the purpose of code testing. - This dataset was generated from prompting chatGPT to create sample pieces of news setences according to a topic. - Sample prompt: "generate 50 paragraphs on the topic of "very recent breaking news on wars and conflicts events" with some sample location names. One example: "a missile struck near a residential building in Kiev last night. Russia denied Ukraine's accusations of attacking non-military targets"" - The output paragraphs were then used to construct huggingface dataset. - Changes from v1.0: added column `class_name` for ease of use in downstream tasks [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
数据集配置
- 默认配置:
- 训练集:路径为
data/train-* - 验证集:路径为
data/valid-* - 测试集:路径为
data/test-*
- 训练集:路径为
数据集信息
-
特征:
class_name:类别名称,数据类型为字符串text:文本内容,数据类型为字符串aviation:航空,数据类型为类别标签,取值为0或1cybersecurity:网络安全,数据类型为类别标签,取值为0或1domestic_unrest_violence:国内动荡暴力,数据类型为类别标签,取值为0或1extreme_weather:极端天气,数据类型为类别标签,取值为0或1forced_labor:强迫劳动,数据类型为类别标签,取值为0或1general_biz_trend:一般商业趋势,数据类型为类别标签,取值为0或1individual_accidents_tragedies:个人事故悲剧,数据类型为类别标签,取值为0或1later_report:后续报道,数据类型为类别标签,取值为0或1lawsuit_legal_insurance:诉讼法律保险,数据类型为类别标签,取值为0或1leisure_other_news:休闲其他新闻,数据类型为类别标签,取值为0或1maritime:海事,数据类型为类别标签,取值为0或1pandemics_large_scale_diseases:大流行病大规模疾病,数据类型为类别标签,取值为0或1railway:铁路,数据类型为类别标签,取值为0或1strike:罢工,数据类型为类别标签,取值为0或1trade_war_embargos_bans:贸易战禁运禁令,数据类型为类别标签,取值为0或1transportation_trends_projects:交通趋势项目,数据类型为类别标签,取值为0或1war_conflict:战争冲突,数据类型为类别标签,取值为0或1warehouse_fire:仓库火灾,数据类型为类别标签,取值为0或1class_index:类别索引,数据类型为类别标签,取值为0或1label:标签,数据类型为整数
-
数据集划分:
- 训练集:字节数为 419816,样本数为 720
- 验证集:字节数为 52468,样本数为 90
- 测试集:字节数为 52223,样本数为 90
-
数据集大小:
- 下载大小:179362 字节
- 数据集大小:524507 字节



