遇见数据集

joshuapsa/gpt-generated-news-paragraphs-v1.1

收藏
Hugging Face2023-11-21 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: train path: data/train-* - split: valid path: data/valid-* - split: test path: data/test-* dataset_info: features: - name: class_name dtype: string - name: text dtype: string - name: aviation dtype: class_label: names: '0': '0' '1': '1' - name: cybersecurity dtype: class_label: names: '0': '0' '1': '1' - name: domestic_unrest_violence dtype: class_label: names: '0': '0' '1': '1' - name: extreme_weather dtype: class_label: names: '0': '0' '1': '1' - name: forced_labor dtype: class_label: names: '0': '0' '1': '1' - name: general_biz_trend dtype: class_label: names: '0': '0' '1': '1' - name: individual_accidents_tragedies dtype: class_label: names: '0': '0' '1': '1' - name: later_report dtype: class_label: names: '0': '0' '1': '1' - name: lawsuit_legal_insurance dtype: class_label: names: '0': '0' '1': '1' - name: leisure_other_news dtype: class_label: names: '0': '0' '1': '1' - name: maritime dtype: class_label: names: '0': '0' '1': '1' - name: pandemics_large_scale_diseases dtype: class_label: names: '0': '0' '1': '1' - name: railway dtype: class_label: names: '0': '0' '1': '1' - name: strike dtype: class_label: names: '0': '0' '1': '1' - name: trade_war_embargos_bans dtype: class_label: names: '0': '0' '1': '1' - name: transportation_trends_projects dtype: class_label: names: '0': '0' '1': '1' - name: war_conflict dtype: class_label: names: '0': '0' '1': '1' - name: warehouse_fire dtype: class_label: names: '0': '0' '1': '1' - name: class_index dtype: class_label: names: '0': '0' '1': '1' - name: label sequence: int64 splits: - name: train num_bytes: 419816 num_examples: 720 - name: valid num_bytes: 52468 num_examples: 90 - name: test num_bytes: 52223 num_examples: 90 download_size: 179362 dataset_size: 524507 --- # Dataset Card for "gpt-generated-news-paragraphs-v1.1" - This dataset was created solely for the purpose of code testing. - This dataset was generated from prompting chatGPT to create sample pieces of news setences according to a topic. - Sample prompt: "generate 50 paragraphs on the topic of "very recent breaking news on wars and conflicts events" with some sample location names. One example: "a missile struck near a residential building in Kiev last night. Russia denied Ukraine's accusations of attacking non-military targets"" - The output paragraphs were then used to construct huggingface dataset. - Changes from v1.0: added column `class_name` for ease of use in downstream tasks [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
joshuapsa
原始信息汇总

数据集概述

数据集配置

  • 默认配置
    • 训练集:路径为 data/train-*
    • 验证集:路径为 data/valid-*
    • 测试集:路径为 data/test-*

数据集信息

  • 特征

    • class_name:类别名称,数据类型为字符串
    • text:文本内容,数据类型为字符串
    • aviation:航空,数据类型为类别标签,取值为 01
    • cybersecurity:网络安全,数据类型为类别标签,取值为 01
    • domestic_unrest_violence:国内动荡暴力,数据类型为类别标签,取值为 01
    • extreme_weather:极端天气,数据类型为类别标签,取值为 01
    • forced_labor:强迫劳动,数据类型为类别标签,取值为 01
    • general_biz_trend:一般商业趋势,数据类型为类别标签,取值为 01
    • individual_accidents_tragedies:个人事故悲剧,数据类型为类别标签,取值为 01
    • later_report:后续报道,数据类型为类别标签,取值为 01
    • lawsuit_legal_insurance:诉讼法律保险,数据类型为类别标签,取值为 01
    • leisure_other_news:休闲其他新闻,数据类型为类别标签,取值为 01
    • maritime:海事,数据类型为类别标签,取值为 01
    • pandemics_large_scale_diseases:大流行病大规模疾病,数据类型为类别标签,取值为 01
    • railway:铁路,数据类型为类别标签,取值为 01
    • strike:罢工,数据类型为类别标签,取值为 01
    • trade_war_embargos_bans:贸易战禁运禁令,数据类型为类别标签,取值为 01
    • transportation_trends_projects:交通趋势项目,数据类型为类别标签,取值为 01
    • war_conflict:战争冲突,数据类型为类别标签,取值为 01
    • warehouse_fire:仓库火灾,数据类型为类别标签,取值为 01
    • class_index:类别索引,数据类型为类别标签,取值为 01
    • label:标签,数据类型为整数
  • 数据集划分

    • 训练集:字节数为 419816,样本数为 720
    • 验证集:字节数为 52468,样本数为 90
    • 测试集:字节数为 52223,样本数为 90
  • 数据集大小

    • 下载大小:179362 字节
    • 数据集大小:524507 字节
二维码
社区交流群
二维码
科研交流群
商业服务