遇见数据集

tg-ru-engagement

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

该数据集收录了来自俄语Telegram频道的帖子,每条帖子附带参与度指标(浏览量、转发量)。数据集包含70,448条记录,时间跨度从2021年10月至2026年7月,平均文本长度为274个字符。数据通过解析Telegram频道获得。字段包括:帖子ID(id)、发布日期(date,ISO 8601格式)、文本内容(text)、链接列表(links)、是否含链接(has_links)、是否含媒体(has_media)、媒体类型(media_type,可为photo/video/document/other或null)、浏览量(views)、转发量(forwards)、回复目标帖子ID(reply_to,可为null)。该数据集可用于:俄语语言模型的微调、基于文本的病毒性预测(回归浏览量/转发量)、Telegram内容风格与体裁分类、媒体消费与趋势分析。注意事项:数据集中包含未标注的广告帖子;文本中的链接未被展开;媒体文件本身未包含,仅提供元数据。

This dataset collects posts from Russian-language Telegram channels, with each post accompanied by engagement metrics including views and forwards. It contains 70,448 records spanning from October 2021 to July 2026, with an average text length of 274 characters. The data was obtained by scraping Telegram channels. The dataset includes the following fields: post ID (id), publication date (date, ISO 8601 format), text content (text), list of links (links), has_links (whether the post contains links), has_media (whether the post contains media), media_type (can be photo/video/document/other or null), views, forwards, and reply_to (the target post ID for replies, which can be null). This dataset can be used for fine-tuning Russian-language LLMs, text-based virality prediction via regression of views or forwards, classification of Telegram content styles and genres, and analysis of media consumption and trends. Notes: The dataset contains unlabeled advertising posts; links in the text have not been expanded; the actual media files are not included, only their metadata is provided.

创建时间:
2026-07-31
原始信息汇总

数据集概述

基本信息

  • 名称: Telegram Russian Posts with Engagement Metrics
  • 语言: 俄语
  • 许可证: Apache-2.0
  • 任务类型: 文本生成、文本分类
  • 数据规模: 70,448 条记录(10K<n<100K)
  • 数据来源: Telegram 频道(通过解析获取)
  • 时间范围: 2021年10月 — 2026年7月

数据内容

  • 数据集包含俄语 Telegram 频道的帖子及其参与度指标(浏览量、转发量)。
  • 平均文本长度为 274 个字符。
  • 浏览量中位数为 145,109,最大浏览量达 6,933,562。

数据字段

字段 类型 描述
id int 频道内帖子 ID
date string 发布时间(ISO 8601)
text string 帖子文本
links list 文本中的链接列表
has_links bool 是否包含链接
has_media bool 是否包含媒体文件
media_type string/null 媒体类型:photo、video、document、other
views int 浏览量
forwards int 转发量
reply_to int/null 所回复的帖子 ID

数据处理

  • 数据集包含一个默认配置 default,训练数据文件为 channel_data_clean.json
  • 提供 Python 示例代码,支持使用 datasets 库加载数据、按浏览量排序、按媒体类型过滤等操作。

预期用途

  • 俄语语言模型的微调
  • 基于文本的病毒性预测(浏览量/转发量回归)
  • Telegram 内容的风格与流派分类
  • 媒体消费与趋势分析

局限性

  • 数据集中包含未单独标注的广告帖子。
  • 文本内链接未被展开。
  • 不包含媒体文件本身,仅提供其元数据。
搜集汇总
数据集介绍
tg-ru-engagement 数据集图片
构建方式
在社交媒体计算传播学研究中,Telegram 俄语频道的内容动态与互动数据长期缺乏公开可用的结构化语料。该数据集通过系统化爬取公开 Telegram 频道,采集 2021 年 10 月至 2026 年 7 月间共 70,448 条俄语帖子,并抽取帖文标识、发布时间、正文、链接、媒体类型、浏览量、转发量及回复关系等字段,经清洗后以 JSON 格式组织为单一训练集,配套提供 HuggingFace datasets 加载配置。
特点
该数据集以俄语 Telegram 帖子为核心,涵盖文本、元数据与互动指标三类信息,文本平均长度约 274 字符,浏览量中位数达 145,109 次,最高逾 693 万次,呈现出显著的长尾传播分布。数据包含链接与媒体标记、回复关系等上下文特征,体量介于一万至十万条之间,适用于文本生成、文本分类与病毒式传播预测等任务,且以 Apache-2.0 协议开放。
使用方法
研究者可借助 HuggingFace datasets 库直接加载默认训练集,将数据转为 Pandas 或 Arrow 格式以便分析。典型流程包括按浏览量或转发量排序以识别高传播内容,按媒体类型或链接存在性筛选子集,以及提取文本与互动指标构建回归或分类模型。该数据集可用于俄语语言模型微调、病毒式传播预测、Telegram 内容风格分类及媒体消费趋势分析。
背景与挑战
背景概述
随着社交媒体在信息传播中的角色日益凸显,Telegram作为俄语区重要的即时通讯与内容分发平台,其帖文传播规律成为计算社会科学与自然语言处理交叉领域的研究热点。tg-ru-engagement数据集于2024年前后由研究者构建并发布于HuggingFace平台,收录了2021年10月至2026年7月间逾七万条俄语频道帖文,并附带浏览量、转发量等参与度指标。该数据集旨在为俄语语言模型的微调、内容病毒式传播预测及帖文风格分类提供实证基础,弥合了俄语社交媒体参与度分析资源匮乏的缺口,对舆情监测与媒介消费研究具有潜在的推动意义。
当前挑战
该数据集所应对的核心领域问题在于如何从文本及元数据中有效预测社交媒体帖文的传播规模,即病毒式传播预测,其难度源于传播动态受用户网络结构、发布时间、外部事件等多重混杂因素影响,单一文本特征难以充分解释。构建层面亦面临系列挑战:数据跨度较长导致平台算法与用户行为随时间漂移,削弱模型泛化能力;广告帖文缺乏独立标注,可能引入噪声干扰分类与回归任务;文本内嵌链接与媒体文件未予展开,限制了对多模态传播机制的完整刻画。上述局限要求研究者在建模时审慎处理时间敏感性、标签噪声与特征缺失问题。
常用场景
经典使用场景
在社交媒体计算与俄语自然语言处理的交叉领域中,tg-ru-engagement数据集凭借其逾七万条真实Telegram频道帖子及浏览量、转发量等参与度指标,成为探究内容传播动力学的典型语料。其最经典的使用场景聚焦于预测帖文的病毒式传播潜力:研究者以帖文文本、媒体类型、链接存在性等特征为输入,以浏览量或转发量为回归目标,构建端到端的传播效果预测模型;同时,该数据集亦被广泛用于俄语文本生成与风格分类任务,通过微调预训练语言模型以捕捉Telegram平台特有的简洁表达与话题倾向,从而系统揭示信息扩散的文本驱动机制。
解决学术问题
该数据集在学术层面回应了社交媒体传播研究中长期存在的若干难题。其一是小语种参与度数据的稀缺,俄语Telegram生态的高质量标注语料此前较为匮乏,该数据集以七万余条记录填补了这一空白,为跨语言传播理论的检验提供了实证基础。其二是内容特征与传播效果之间因果关系的量化,数据集同时涵盖文本、媒体、链接与时间戳等多模态元数据,使研究者得以控制混杂因素并分离文本语义对浏览量与转发量的独立贡献。其三是病毒式传播的可预测性边界,通过大规模真实数据检验既有传播模型,推动了计算传播学从描述性分析向预测性建模的范式转型,对理解信息扩散规律具有方法论意义。
衍生相关工作
围绕该数据集已衍生出多条研究脉络。在模型层面,研究者基于其微调了多种俄语预训练语言模型,比较不同架构在参与度回归与内容分类任务上的表现,推动了俄语领域适配模型的迭代。在传播学层面,后续工作利用该数据集检验了情绪极性、话题标签与媒体类型对病毒传播的交互影响,拓展了经典传播理论在即时通讯平台上的适用性。在方法层面,有研究将该数据集与图神经网络结合,通过建模频道间转发网络以提升传播预测精度。此外,该数据集亦被用于构建俄语Telegram内容的多标签分类基准,促进了低资源语言社交媒体分析工具的发展与共享。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务