遇见数据集

ebtopicality-combined-llm-manual-train

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集由两个子数据集合并而成:JPPOL-AI/ebtopicality-train(人工标注)和JPPOL-AI/ebtopicality-llm-annotated-reviewed(LLM标注并经过审核)。数据集包含文本(text)、标签(label)、数据来源(source)和标注时间戳(annotation_timestamp)四个字段。标签表示话题的时效性程度,共分为7个类别:2小时、12小时、3天、7天、30天、365天、1000天。根据标签分布统计,不同类别样本数量分别为43、100、267、297、293、46、37。数据集中训练集(train split)包含5个样本(根据YAML配置),但标签分布统计显示总样本数可能更多。该数据集可用于话题时效性分类、新闻时效性分析等任务。

This dataset is a merge of two sub-datasets: JPPOL-AI/ebtopicality-train (human-annotated) and JPPOL-AI/ebtopicality-llm-annotated-reviewed (LLM-annotated and reviewed). It contains four fields: text, label, source, and annotation_timestamp. The label indicates the timeliness of the topic, with 7 categories: 2 hours, 12 hours, 3 days, 7 days, 30 days, 365 days, and 1000 days. According to label distribution statistics, the sample counts for each category are 43, 100, 267, 297, 293, 46, and 37 respectively. The training split contains 5 samples (based on YAML configuration), but the label distribution statistics suggest a larger total number of samples. This dataset can be used for tasks such as topic timeliness classification and news timeliness analysis.

创建时间:
2026-08-19
原始信息汇总

数据集概述:ebtopicality-combined-llm-manual-train

该数据集是 两个数据集的合并版本,用于训练或评估与“时效性”(topicality)相关的模型。它结合了人工标注数据与经审核的大语言模型(LLM)标注数据。

基本信息

  • 数据集名称: JPPOL-AI/ebtopicality-combined-llm-manual-train
  • 来源数据集:
    • JPPOL-AI/ebtopicality-train(人工标注)
    • JPPOL-AI/ebtopicality-llm-annotated-reviewed(LLM标注并经过审核)
  • 数据规模:
    • 总大小(dataset_size): 10,245 字节
    • 下载大小(download_size): 17,106 字节
    • 训练集(train split): 5 个样本

数据特征(Features)

每个样本包含以下字段:

字段名 数据类型 说明
text string 文本内容,待分类或分析的原始文本
label string 标注的标签,表示文本的时效性类别
source string 标注来源(人工或LLM审核后的标注)
annotation_timestamp string 标注的时间戳

数据划分

  • 训练集(train split): 包含 5 个样本,总字节数为 10,245。

标签分布

该数据集包含 7 个时效性类别标签,具体分布如下(按时间跨度从小到大):

标签(时间跨度) 样本数量
2小时 43
12小时 100
3天 267
7天 297
30天 293
365天 46
1000天 37

:该标签分布显示的是合并前两个源数据集的总样本分布情况(总计 1,083 个样本),而当前合并后的训练集仅有 5 个样本,可能为合并后经筛选或抽样的子集。


数据集用途

该数据集适用于以下任务:

  • 时效性分类(Topicality Classification):判断文本内容在时间维度上的相关性或有效期限。
  • 模型评估:结合人工和LLM标注,可用于比较不同标注来源的一致性,或作为基准测试集。
  • 训练数据补充:可作为小样本训练集,用于微调模型或进行少样本学习实验。
搜集汇总
数据集介绍
ebtopicality-combined-llm-manual-train 数据集图片
构建方式
该数据集系由两个既有数据集融合而成,其一为‘ebtopicality-train’之人工标注版本,其二为‘ebtopicality-llm-annotated-reviewed’之经人工复核的模型标注版本。两源数据经过整合,构建了此联合训练集,旨在结合人类判断与机器学习的互补优势,提升标注的准确性与覆盖度。数据集包含文本、标签、来源及标注时间戳等字段,共设一个训练分割,内含5条样本,规模虽小,却兼顾了标注的严谨性与多样性。
使用方法
使用者可将此数据集作为训练语料,输入至基于Transformer的话题时序分类模型,通过监督学习方式让模型习得内容文本与其热度持续时间之间的映射关系。鉴于数据集规模较小,建议采用交叉验证或数据增强策略以优化模型泛化能力。此外,该数据集亦可作为基准测试集,用于评估不同模型在热度预测任务上的性能差异,其标签的层次化设计也支持多粒度评估需求。
背景与挑战
背景概述
该数据集由JPPOL-AI机构创建,旨在支持在线内容时效性(ebtopicality)的分类研究,核心问题在于如何准确预测信息在特定时间窗口内的重要性。数据集整合了人工标注与大型语言模型(LLM)审核标注,包含从2小时至1000天的多级时效标签,覆盖了短期热点与长期价值的广泛时间尺度。其规模虽小(5个样本),但结合了高质量的人工标注与LLM的扩展能力,为时效性预测模型的训练与评估提供了独特资源。该数据集在信息检索、新闻推荐及社交媒体验证等领域具有潜在影响力,推动了内容生命周期与用户关注度动态关系的研究。
当前挑战
该数据集面临的挑战首要在于领域问题层面:时效性分类需捕捉内容随时间衰减的复杂规律,样本类别分布不均衡(如30天和7天样本居多,而2小时与1000天较少)易导致模型偏向多数类,且LLM标注虽提升效率,却可能引入噪声,需人工审核校准。构建过程中,整合不同来源的标注数据(人工与LLM)需确保标注一致性,并处理时间戳与来源信息的标准化;小样本规模(5条)限制了模型的泛化能力,数据量不足以支撑深度学习方法的有效训练,同时需防范过拟合风险。这些挑战对数据集的扩展与跨领域应用构成显著障碍。
常用场景
经典使用场景
该数据集汇聚了由人工标注与经大语言模型辅助并复核的标注结果,为社交网络平台中内容时效性预测研究提供了高质量的训练语料。经典使用场景聚焦于构建文本分类模型,以预测信息传播的持久性,即依据文本内容将帖子归类至从数小时至数年的多个时效性层级,从而赋能平台对热点话题的生命周期进行前瞻性研判。
解决学术问题
该数据集有效解决了信息扩散研究中内容持久性预测缺乏系统性标注样本的难题。通过整合多源标注并明确时间粒度,为模型训练提供了可靠的监督信号,推动了从静态内容分析向动态生命周期建模的学术转向,为理解网络舆论演化和信息衰减规律提供了量化研究基础,对计算社会学与传播学交叉领域具有重要理论价值。
实际应用
在实际应用中,该数据集可用于构建内容推荐系统中的时效性感知模块,指导个性化信息流排序,优先展示长期有效内容。亦可用于舆情监控平台,实现热点预警与衰减预测,辅助运营策略调整。在数字营销领域,能够指导品牌决策内容投放周期,优化资源分配,提升传播效能。
数据集最近研究
最新研究方向
该数据集融合了人工精细标注与大型语言模型自动标注的双重优势,为事件拓扑性(topicality)研究提供了高质量的训练样本。当前前沿研究方向聚焦于利用此类精标注数据优化事件时效性预测模型,探讨不同时间跨度下(从数小时至千日)信息传播的拓扑特征演变。结合大模型在文本语义理解上的突破,该数据集支持开发更精准的时序事件分类算法,进而推动舆情监测、危机预警及知识图谱动态更新等应用领域的智能化进程。其多源标注融合策略亦为半监督学习及标注质量校准研究提供了宝贵基准,对未来构建自适应、高泛化能力的事件理解系统具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务