遇见数据集

Usenet-Corpus-1980-2013-Threaded-Samples

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Usenet Corpus 1980–2013 — Threaded (Samples) 是一个专为展示和评估而设计的Usenet帖子样本数据集。该数据集源自完整的 Usenet Corpus 1980–2013 — Threaded 语料库(包含约4.079亿条帖子、1.917亿个线程、1030亿个token),本样本仅提供少量可浏览的示例,旨在让用户直观了解完整数据集的线程化结构。数据集共包含11个gzip压缩的JSON Lines文件:每个新闻组层级对应一个文件(每条约5000条帖子,ALT层级约2000条),另外包含一个Big 8合并文件和一个所有层级合并文件(各约9000条帖子)。样本中的帖子被有意选取为至少包含3条帖子的完整线程,以突出展示真实的对话交互,但这一分布并不代表完整语料库的特征(完整语料库中约82%为单帖线程)。每个文件内帖子按线程分组,并按thread_position字段排序,便于阅读重构后的对话。跨帖子重复项已在样本中移除。每条记录包含以下字段:id(稳定的帖子标识符)、group(帖子存档的新闻组)、date(帖子原始日期,RFC 2822格式)、author(作者显示名称,电子邮件地址已编辑)、subject(主题行)、text(帖子正文)、thread_id(会话标识符)、thread_position(帖子在线程中的位置,从0开始)、thread_depth(回复深度,根节点为0)。数据集适用于文本生成(如对话生成)和文本分类(如主题分类、语言识别)等任务。数据经过清理:移除了二进制附件、alt.binaries.* 新闻组、成人内容组,作者电子邮件地址已编辑,Message-ID已替换为哈希,并通过ClamAV恶意软件扫描且未检出。内容保持原始发布状态,未经过滤,可能包含冒犯性、偏见或错误信息,应作为历史原始资料对待。许可证为专有,本样本仅用于评估,不授予任何使用、复制、重新分发或基于数据训练的权利。如需商业许可,需联系OwnedByDanes LLC。

Usenet Corpus 1980–2013 — Threaded (Samples) is a dataset of Usenet post samples designed for demonstration and evaluation. It is derived from the full Usenet Corpus 1980–2013 — Threaded (approximately 407.9 million posts, 191.7 million threads, 103 billion tokens). This sample provides a small set of browsable examples to give users an intuitive understanding of the threaded structure of the full corpus. The dataset consists of 11 gzip-compressed JSON Lines files: one file per newsgroup hierarchy (about 5000 posts each, ALT hierarchy about 2000 posts), plus a Big 8 combined file and an all-hierarchy combined file (about 9000 posts each). Posts are intentionally selected as complete threads containing at least 3 posts to highlight real conversational interactions, but this distribution does not represent the full corpus (where about 82% of threads are single-post). Within each file, posts are grouped by thread and sorted by the thread_position field for easy reading of reconstructed conversations. Cross-post duplicates have been removed. Each record contains the following fields: id (stable post identifier), group (newsgroup where the post was archived), date (original post date, RFC 2822 format), author (display name, email address redacted), subject (subject line), text (post body), thread_id (conversation identifier), thread_position (position of the post within the thread, starting from 0), thread_depth (reply depth, root is 0). The dataset is suitable for text generation (e.g., dialogue generation) and text classification (e.g., topic classification, language identification). Data has been cleaned: binary attachments, alt.binaries.* newsgroups, and adult content groups removed; author email addresses redacted; Message-IDs replaced with hashes; scanned with ClamAV with no detections. Content is kept as originally posted, unfiltered, and may contain offensive, biased, or inaccurate information, and should be treated as historical raw material. License is proprietary; this sample is for evaluation only, and no rights to use, copy, redistribute, or train models are granted. For commercial licensing, contact OwnedByDanes LLC.

创建时间:
2026-09-08
搜集汇总
数据集介绍
Usenet-Corpus-1980-2013-Threaded-Samples 数据集图片
构建方式
该数据集源自1980至2013年间Usenet讨论组的归档文本,其核心构建思路在于将离散的帖子重建为具有层级关系的对话线程。具体而言,通过对清洗去重后的原始语料施加线程标识、线程内位置及回复深度三个维度的元数据标注,使每一篇帖子得以归位至其所属的对话脉络之中。样本文件均以完整线程为单位抽取,要求线程至少包含三篇帖子,从而确保每个样本能够呈现真实往复的交流结构。各层级新闻组及组合样本之间相互独立抽取,允许重叠,交叉重复张贴内容在样本范围内予以剔除,最终形成可直观检视线程形态的展示性子集。
特点
此数据集以浓缩呈现Usenet对话的往复特征为首要旨趣,其样本刻意选取多帖线程,与全量语料中单帖线程占压倒性多数的分布形成鲜明对照,因而更便于观察回复关系与讨论脉络。数据结构以JSON Lines格式组织,字段涵盖稳定标识符、新闻组归属、原始日期、作者显示名、主题、正文以及线程编号、位置与深度,兼顾可读性与可解析性。内容经过去除二进制附件、剔除成人组、脱敏电子邮件、哈希化消息标识及恶意签名过滤等处理,同时保留未经审核的历史文本原貌,在安全性与史料真实性之间取得平衡。
使用方法
使用该数据集时,研究者可将各压缩的JSON Lines文件载入内存,借助线程标识与线程内位置对记录进行分组排序,从而还原一段段完整的讨论序列,用于对话生成、线程结构分析或文本分类等任务。由于样本按新闻组层级独立划分,使用者既可针对特定组别单独检视,亦可利用大八组或全层级组合样本获得跨组视野。需要留意的是,此展示样本并非全量语料的代表性抽样,其线程形态偏向多帖对话,因此不宜直接以样本统计推断整体分布。此外,该数据以专有许可发布,仅限评估用途,任何复制、再分发或训练行为均须另行取得书面商业授权。
背景与挑战
背景概述
Usenet作为互联网早期分布式讨论系统的代表,自1980年投入运行以来积累了海量跨越三十余年的口语化对话文本,构成研究网络社群语言演化、信息传播与历史社会语境的宝贵语料。该数据集由OwnedByDanes LLC于2026年发布,以线程重构方式呈现407.9百万帖子、191.7百万线程及1030亿词元的完整语料,样本版本旨在为文本生成与分类等任务提供可读性强的会话样本。其核心研究问题在于如何从非结构化历史存档中恢复对话结构,并据此探究长时段多语言在线交互的规律,对计算语言学和互联网历史研究具有重要参考价值。
当前挑战
该数据集所应对的领域问题在于从缺乏显式回复链接的原始帖子中重建可靠的对话线程结构,并保持跨语言与跨新闻组的语义连贯性,这对对话建模和上下文理解提出了严苛要求。构建过程中,语料历经二进制附件剔除、成人组过滤、作者邮箱脱敏及恶意内容扫描等多重净化步骤,同时需在约82%单帖线程的原始分布与样本强调多轮对话的选取策略之间取得平衡,避免样本偏差。此外,历史文本固有的冒犯性、偏见及事实错误,要求使用者以原始史料视角审慎解读。
常用场景
经典使用场景
在计算语言学与互联网历史研究交叉领域,Usenet作为1980至2013年间最具规模的分布式讨论系统,为对话结构建模提供了不可多得的原始素材。该数据集以thread_id、thread_position与thread_depth三重建构维度,将散布于各新闻组的独立帖子还原为层级分明的多轮对话链。其最经典的使用场景聚焦于线程化对话建模与回复关系预测,研究者可借助完整的树状回复结构,训练模型识别帖间指代、追踪话题漂移,并剖析在线社区中信息扩散的层级规律。样本以至少三轮往复的完整线程为筛选标准,为对话连贯性分析提供了清晰可辨的语料切片。
实际应用
在工程实践中,该数据集的线程化样本可直接服务于检索增强生成中的上下文组织、多轮对话系统的回复策略训练以及社区问答平台的线程推荐算法优化。产品团队可利用其层级结构构建对话摘要与观点演化可视化工具,帮助用户快速把握长线程中的核心争点与立场分布。在内容审核与社区治理场景中,基于thread_depth与thread_position的传播路径分析可用于识别高风险讨论的升级模式,辅助平台制定差异化的干预策略。此外,该样本亦适用于跨语言对话模型的迁移学习验证,其涵盖英、波、荷、西、法、意、德、俄、日等多语种内容,为多语言环境下的对话理解与生成提供了贴近真实论坛分布的评测素材。
衍生相关工作
围绕该数据集及其完整版本,已衍生出一系列面向长程对话理解与互联网历史分析的经典工作。在对话结构学习方向,研究者提出了基于线程深度与位置编码的回复关系预测模型,显著提升了嵌套对话中的指代消解与参与者角色识别效果。在计算社会科学领域,基于该语料的研究揭示了Usenet社区讨论主题的兴衰周期与跨组交叉传播机制,为理解早期在线公共领域的形成提供了量化证据。在自然语言处理基础任务层面,该数据被用于训练和评估长文本摘要、主题分割与立场检测模型,推动了面向非正式、多作者、异步交互文本的方法创新。其线程化组织方式亦启发了后续论坛与邮件列表语料的构建规范,成为对话语料库设计的重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务