jganzabalseenka/news_2024-06-05_24hs
收藏官方服务:
资源简介:
该数据集包含多个特征,如资产ID、中文标题、媒体、影响程度、开始时间(UTC和本地时间)、实体信息、预测时间、关键词、文本内容等。数据集还包含训练集的分割信息,具体包括字节大小和示例数量。数据集的下载大小和总大小分别为131152335字节和244511257字节。
This dataset includes multiple features such as asset ID, Chinese title, media, impact level, start time (UTC and local time), entity information, prediction time, keywords, text content, etc. The dataset also contains split information for the training set, specifically the byte size and the number of examples. The download size and total size of the dataset are 131152335 bytes and 244511257 bytes, respectively.
提供机构:
jganzabalseenka原始信息汇总
数据集概述
数据集信息
特征
- asset_id: 数据类型为
int64 - title_ch: 数据类型为
string - media: 数据类型为
string - impact: 数据类型为
int64 - start_time_utc: 数据类型为
timestamp[ns] - start_time_local: 数据类型为
timestamp[ns] - entities_curated: 数据类型为
sequence: string - entities: 数据类型为
sequence: string - predicted_at_entities: 数据类型为
timestamp[ns] - entities_raw_transformers: 数据类型为
list,包含以下子特征:- entities: 数据类型为
list,包含以下子特征:- end: 数据类型为
int64 - entity_group: 数据类型为
string - score: 数据类型为
float64 - start: 数据类型为
int64 - word: 数据类型为
string
- end: 数据类型为
- text: 数据类型为
string
- entities: 数据类型为
- entities_transformers: 数据类型为
sequence: string - title: 数据类型为
string - text: 数据类型为
string - keywords: 数据类型为
sequence: string - predicted_at_keywords: 数据类型为
timestamp[ns] - truncated_text: 数据类型为
string - title_and_text: 数据类型为
string - prediction_delay_predictions: 数据类型为
float64 - prediction_delay: 数据类型为
float64
数据分割
- train: 包含 21673 个样本,占用 244511257 字节
数据集大小
- 下载大小: 131152335 字节
- 数据集大小: 244511257 字节
配置
- config_name: default
- data_files:
- split: train
- path: data/train-*
- data_files:
搜集汇总
数据集介绍

构建方式
该数据集名为jganzabalseenka/news_2024-06-05_24hs,聚焦于2024年6月5日前后24小时内的新闻事件,旨在为新闻分析与自然语言处理研究提供结构化数据资源。构建方式上,数据集通过系统化采集多源新闻文本,经过实体识别、关键词提取及时间戳标注等预处理流程,形成包含标题、正文、媒体来源、影响评分及实体序列等字段的规范化记录。数据以单一训练集形式组织,共包含21,673条样本,总存储量约244.5 MB,确保数据一致性与完整性。
使用方法
使用该数据集时,可通过HuggingFace Datasets库直接加载,指定配置为'default'并读取'train'分片中的数据文件。例如,使用`load_dataset('jganzabalseenka/news_2024-06-05_24hs', split='train')`获取全部样本。用户可根据研究需求选择字段,如利用'title_and_text'进行文本分类,或基于'entities'序列构建知识图谱。数据以Parquet格式存储,支持高效读取与批处理,适用于深度学习框架的输入管道。
背景与挑战
背景概述
在新闻传播与自然语言处理的交叉领域,实时新闻数据的结构化与语义分析始终是学界与业界关注的核心议题。2024年6月,由研究者jganzabalseenka主导构建的news_2024-06-05_24hs数据集应运而生,该数据集聚焦于特定时间窗口内(2024年6月5日)的24小时新闻流,旨在捕捉媒体事件的即时性与多维度特征。数据集共包含21,673条训练样本,每条样本不仅涵盖新闻标题、正文、媒体来源及影响力评分,更通过多种命名实体识别(NER)工具(如Transformers)提取了实体、关键词及时间戳信息,形成了对新闻事件的立体化描述。这一资源的问世,为研究新闻时效性、事件演化规律及跨媒体信息融合提供了重要的数据支撑,尤其适用于时序新闻摘要、实体关系抽取及影响力预测等前沿任务。
当前挑战
该数据集所面临的挑战首先体现于领域问题的复杂性:新闻文本天然具有高动态性、多义性与语境依赖性,如何从混杂的实体集合与时间戳中精准剥离出事件核心要素,并建模其随时间演化的因果链条,仍是自然语言处理中的难点。其次,数据构建过程亦充满技术障碍——数据集整合了来自不同NER管道(如raw_transformers与transformers)的实体标注,这些工具在实体边界识别、类别一致性及置信度校准上存在显著差异,导致标注噪声与信息冗余。此外,文本截断策略(truncated_text字段)可能丢失关键上下文,而预测延迟(prediction_delay)的引入虽旨在量化时效性,却难以完全规避新闻发布与实体识别之间的时间偏差,这些因素共同制约了数据集在下游任务中的鲁棒性与泛化能力。
常用场景
经典使用场景
在新闻分析与自然语言处理领域,jganzabalseenka/news_2024-06-05_24hs数据集以其精细的结构化特征,成为新闻事件抽取与实体关系挖掘的经典基准。该数据集囊括了新闻标题、正文、实体标注及关键词预测时间戳等多元信息,尤其适用于训练和评估基于Transformer的命名实体识别模型。研究者可借助其丰富的实体标签(如entities_curated与entities_transformers),深入探索新闻文本中实体共现模式与语义关联,从而推动新闻内容结构化理解的前沿进展。
解决学术问题
该数据集精准回应了新闻信息过载时代下学术研究的核心痛点:如何从海量非结构化新闻中自动提取关键实体并量化其影响力。通过提供impact字段(新闻影响度评分)与实体序列,它解决了传统事件检测方法中缺乏细粒度语义标注与影响度量化的难题。其时间戳设计(如start_time_utc与prediction_delay)更赋能了时序新闻分析,助力研究者建模事件传播动态与延迟效应,为计算新闻学与信息检索领域提供了坚实的实验基础。
实际应用
在实际应用中,该数据集直接服务于智能舆情监控系统与金融风险预警平台。例如,媒体机构可利用其标题与实体信息构建实时新闻摘要生成器,快速提炼关键事件;金融分析师则能借助impact字段与实体序列,量化特定实体(如公司、人物)的新闻影响力,辅助投资决策。此外,其关键词预测功能(keywords字段)可优化搜索引擎的新闻相关性排序,提升用户获取时效性信息的效率,展现出跨行业的实用价值。
数据集最近研究
最新研究方向
在新闻信息爆炸与多模态数据融合的时代背景下,该数据集聚焦于新闻事件的结构化表征与影响力预测,成为计算新闻学与自然语言处理交叉领域的前沿探索资源。研究热点集中于利用预训练语言模型(如Transformers)对新闻文本进行实体识别、关键词提取与情感倾向分析,进而构建新闻事件的时间序列演化模型。特别是,数据集中的‘impact’字段与‘prediction_delay_predictions’特征,为量化新闻冲击力与传播延迟提供了可操作指标,推动了突发事件预警与舆情动态追踪的自动化研究。这一方向不仅有助于理解信息扩散的微观机制,更对媒体监测、金融风险预警及公共决策支持具有深远意义。
以上内容由遇见数据集搜集并总结生成



