遇见数据集

jganzabalseenka/news_2024-01-06_24hs

收藏
Hugging Face2024-07-03 更新2024-07-06 收录
官方服务:

资源简介:

该数据集包含多个特征,如资产ID、中文标题、资产目的地、媒体、影响、开始时间(UTC和本地时间)、实体、预测时间、文本、关键词等。数据集主要用于训练模型,包含4261个示例,总大小为51842269字节。

The dataset contains multiple features such as asset ID, Chinese title, asset destination, media, impact, start time (UTC and local time), entities, prediction time, text, keywords, etc. The dataset is primarily used for training models and includes 4261 examples with a total size of 51842269 bytes.

提供机构:
jganzabalseenka
原始信息汇总

数据集概述

数据集特征

  • asset_id: 数据类型为 int64
  • title_ch: 数据类型为 string
  • Asset Destination: 数据类型为 string
  • media: 数据类型为 string
  • impact: 数据类型为 int64
  • start_time_utc: 数据类型为 timestamp[ns]
  • start_time_local: 数据类型为 timestamp[ns]
  • entities_curated: 数据类型为 sequence: string
  • entities: 数据类型为 sequence: string
  • predicted_at_entities: 数据类型为 timestamp[ns]
  • entities_raw_transformers: 数据类型为 list,包含以下子特征:
    • entities: 数据类型为 list,包含以下子特征:
      • end: 数据类型为 int64
      • entity_group: 数据类型为 string
      • score: 数据类型为 float64
      • start: 数据类型为 int64
      • word: 数据类型为 string
    • text: 数据类型为 string
  • entities_transformers: 数据类型为 sequence: string
  • title: 数据类型为 string
  • text: 数据类型为 string
  • keywords: 数据类型为 sequence: string
  • predicted_at_keywords: 数据类型为 timestamp[ns]
  • truncated_text: 数据类型为 string
  • title_and_text: 数据类型为 string
  • prediction_delay_predictions: 数据类型为 float64
  • prediction_delay: 数据类型为 float64

数据集分割

  • train: 包含 4261 个样本,占用 51842269 字节

数据集大小

  • 下载大小: 27655649 字节
  • 数据集大小: 51842269 字节

配置

  • config_name: default
    • data_files:
      • split: train
      • path: data/train-*
搜集汇总
数据集介绍
jganzabalseenka/news_2024-01-06_24hs 数据集图片
构建方式
该数据集聚焦于2024年1月6日及前后24小时的新闻资讯,通过系统化采集与多维度标注构建而成。原始数据经过实体识别、关键词提取及时间戳对齐等预处理流程,形成包含资产编号、标题、媒体来源、影响评分及启止时间等结构化字段的语料库。数据集中还嵌入了基于Transformer模型的命名实体识别结果,以列表形式记录实体起止位置、类型及置信度,并附加了预测延迟指标以评估时效性。最终以单一训练集形式存储,总计4261条样本,规模适中。
特点
该数据集的核心特色在于其丰富的语义标注层次与时间敏感性。除基础文本与元数据外,每条记录均包含经过人工与自动方法联合校验的实体列表(entities_curated与entities),以及经由深度学习模型生成的细粒度实体标注(entities_raw_transformers),支持多粒度实体分析。同时,数据集提供了标题与文本的拼接字段(title_and_text),便于下游模型直接利用完整信息。时间戳字段覆盖UTC与本地时间,并记录预测延迟,为新闻时效性研究提供量化依据。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,指定config_name为'default'并读取训练集分割。数据以Parquet格式存储,支持直接转换为DataFrame进行探索性分析。推荐用途包括新闻文本的实体识别与关系抽取模型训练、新闻影响预测任务、以及多语言新闻数据的时序分析。由于数据集已提供预提取的关键词与实体,用户可直接进行零样本或少样本学习实验,或将其作为微调预训练语言模型的基准语料。
背景与挑战
背景概述
在新闻传播与自然语言处理交叉领域,结构化新闻数据的构建对于事件分析与舆情监测至关重要。该数据集由研究人员于2024年1月创建,聚焦于24小时内新闻事件的精细化标注,涵盖标题、文本、实体识别结果及关键词预测等多元特征。其核心研究问题在于如何通过多维度信息(如媒体来源、影响评分、时间戳)提升新闻事件的时效性分析与语义理解能力。作为面向短周期新闻流的数据资源,该数据集为事件检测、实体链接及影响力预测等任务提供了标准化基准,推动了新闻文本的自动化处理研究。
当前挑战
该数据集面临的核心挑战包括:首先,新闻事件固有的时效性要求模型具备快速适应动态语义变化的能力,但当前数据仅覆盖24小时,难以捕捉长期趋势与周期性模式。其次,实体识别与关键词预测依赖预训练模型(如Transformers),其在多语言、多领域新闻中的泛化能力受限,导致标注噪声与歧义问题。此外,数据构建过程中需平衡特征丰富性与标注成本,例如“entities_curated”与“entities_raw_transformers”的差异反映了人工与自动标注之间的质量鸿沟,而时间戳对齐(如start_time_utc与本地时间)的精度不足可能影响事件时序分析的可靠性。
常用场景
经典使用场景
在新闻事件分析与自然语言处理交叉领域中,jganzabalseenka/news_2024-01-06_24hs 数据集以其丰富的结构化信息脱颖而出,成为研究新闻文本多维度特征的理想素材。该数据集不仅包含标题与正文,还整合了实体识别结果、关键词提取、预测延迟等标注信息,为构建事件抽取、情感分析、影响力预测等经典任务提供了坚实的数据基础。研究者可借助其中的时间戳与媒体来源字段,追溯新闻传播的时序模式与渠道差异,从而深入剖析突发事件在特定时间窗口内的演化规律。
解决学术问题
该数据集有效回应了新闻文本中实体与事件关联性建模的学术难题。通过提供经过预处理的实体列表与基于Transformer模型的命名实体识别结果,它降低了从原始文本中提取结构化知识的门槛,使研究者能够专注于实体间关系推理与事件因果链挖掘。此外,数据集中包含的impact字段与预测延迟信息,为量化新闻影响力的时序动态提供了可操作的指标,助力学术界探索新闻内容特征如何影响其传播速度与受众反应,从而推动新闻传播学与计算语言学的交叉创新。
衍生相关工作
该数据集催生了一系列聚焦于新闻事件预测与实体共现模式的前沿工作。例如,研究者基于其时间序列特性,开发了融合注意力机制的事件影响力预测模型,通过捕捉实体共现网络的动态变化来预判新闻的扩散趋势。另有工作利用entities_transformers字段中的多层次实体标注,设计了跨媒体的事件对齐算法,解决了多源新闻中同一事件的识别与归并问题。这些衍生研究不仅验证了数据集在复现经典实验中的可靠性,也为未来融合多模态信息的新闻分析框架奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务