遇见数据集

x65617379/xjmr_260511

收藏
Hugging Face2026-05-11 更新2026-05-31 收录
官方服务:

资源简介:

xjmr_260511数据集是从Econ Job Rumors(一个专注于经济学学术界、经济学就业市场、研究、金融、政治经济学以及大量离题讨论的讨论网站)公开论坛帖子中结构化爬取的数据集。数据集包含910,133个帖子记录和8,863,628个提取的帖子,每一行代表一个(forum_slug, thread_slug)列表记录,保存了帖子元数据、论坛/源页面元数据、快照投票和查看次数、相对年龄/新鲜度字符串、爬取时间戳以及帖子的扁平posts列表。爬取目标是无需认证即可查看的公开页面,文本内容从HTML提取并规范化为纯文本。数据集主要用于学术研究,如匿名论坛动态、计算社会科学分析、非正式和对抗性网络话语研究,以及信息检索等。数据集结构包括帖子记录和帖子结构字段,并提供了详细的统计数据,如帖子数量、论坛分区、爬取时间范围等。数据集创建于2026年5月1日至11日,基于公共网页爬取,未进行系统性的内容过滤或PII检测。数据集存在内容风险,如包含骚扰、冒犯性材料,且未识别许可证。

语言: - 英语 许可协议:未知 数据规模类别: - 10万 < 数据条目数 < 100万 配置项: - 配置名称:原始(raw) 数据文件: - 拆分方式:训练集(train) 路径:"data/*.parquet" --- > **Codex 数据集卡片** > 由 Codex 生成 # xjmr_260511 数据集卡片 ## 数据集概述 本数据集为针对[经济求职论坛(Econ Job Rumors,https://www.econjobrumors.com)]公开论坛帖子的结构化爬取结果。该论坛是一个围绕经济学学术圈、经济学求职市场、学术研究、金融、政治经济学展开讨论,并包含大量偏离主题内容的交流平台。数据集包含910,133条帖子记录与8,863,628条提取得到的帖子内容。每条数据行对应一个`(forum_slug, thread_slug)`形式的列表记录,保留了帖子元数据、论坛/源页面元数据、爬取时刻的投票与浏览量快照、相对时效/新鲜度字符串、爬取时间戳,以及该帖子的扁平化`posts`列表。 本次爬取仅针对无需身份验证即可访问的公开页面,将帖子正文从主题页面的HTML中提取并转换为标准化纯文本格式。 --- ## 数据集详情 ### 数据集说明 - **使用语言:** 以英语为主 - **爬取时间:** 2026年5月1日至2026年5月11日 - **数据行单元:** 论坛帖子列表记录 - **帖子存储方式:** 每条帖子行对应一个包含提取得到的帖子的扁平化列表 - **Parquet分片:** 2个采用Zstandard压缩的训练集分片 ### 数据来源 - **来源网站:** https://www.econjobrumors.com - **源页面范围:** 对应`https://www.econjobrumors.com/forum/...`与`https://www.econjobrumors.com/topic/...`路径下的论坛列表页面与主题页面 --- ## 用途 ### 直接可用场景 本数据集适用于: - 针对匿名论坛动态与谣言社区的学术研究 - 围绕经济学学术圈与求职市场话语的计算社会科学研究 - 针对非正式、对抗性、匿名性专业社区网络话语的语言学分析 - 研究帖子活动、发布量、浏览量与好评/差评投票模式 - 针对经济求职论坛帖子的信息检索与语义搜索任务 - 结合伦理审查的内容审核、毒性检测与安全相关研究 ### 禁止使用场景 本数据集不适合用于: - 对具名或可识别的个人、院系、大学、期刊或雇主做出决策 - 将帖子中的言论视为已验证事实 - 对论坛参与者进行骚扰、人肉搜索、去匿名化或定向画像 - 通过`author_handle`字段推断稳定的用户身份 --- ## 数据集结构 ### 数据 schema | 列名 | 数据类型 | 描述 | |--------|------|-------------| | `thread_slug` | 字符串 | 从帖子URL解析得到的主题slug | | `thread_url` | 字符串 | 爬取过程中使用的已解析帖子URL | | `canonical_thread_url` | 字符串 | 该帖子的规范主题URL | | `title` | 字符串 | 从主题页面解析得到的帖子标题,若失败则回退使用列表页面标题 | | `listing_title` | 字符串 | 论坛列表页面显示的帖子标题 | | `forum_section` | 字符串 | 高级论坛分区,例如经济学、求职市场或非主题讨论 | | `forum_name` | 字符串 | 人类可读的论坛名称 | | `forum_slug` | 字符串 | 从论坛URL解析得到的论坛slug | | `forum_url` | 字符串 | 规范论坛URL | | `source_page` | 整数(int64) | 发现该帖子的论坛列表页面编号 | | `source_page_url` | 字符串 | 发现该帖子的论坛列表页面URL | | `listed_post_count` | 整数(int64) | 论坛列表页面显示的帖子数量 | | `thread_post_count` | 整数(int64) | 从主题页面元数据解析得到的帖子数量(若存在) | | `view_count` | 整数(int64) | 爬取时刻论坛列表页面显示的浏览量 | | `listed_votes_good` | 整数(int64) | 爬取时刻论坛列表页面显示的好评投票数 | | `listed_votes_no_good` | 整数(int64) | 爬取时刻论坛列表页面显示的差评投票数 | | `thread_votes_good` | 整数(int64) | 爬取时刻从主题页面解析得到的好评投票数 | | `thread_votes_no_good` | 整数(int64) | 爬取时刻从主题页面解析得到的差评投票数 | | `freshness_text` | 字符串 | 论坛列表页面显示的相对新鲜度文本 | | `thread_age` | 字符串 | 从主题页面元数据解析得到的相对时效文本(若存在) | | `latest_post_url` | 字符串 | 从列表或帖子元数据获取的最新帖子URL | | `latest_post_id` | 整数(int64) | 从`latest_post_url`解析得到的数字型最新帖子ID | | `thread_pages_crawled` | 整数(int64) | 为该帖子爬取的主题页面数量 | | `post_count_extracted` | 整数(int64) | 提取至`posts`列表中的帖子数量 | | `crawled_at` | 字符串 | 写入该帖子记录时的ISO-8601格式时间戳 | | `crawl_error` | 字符串或空值 | 该帖子的爬取/获取错误记录(若存在) | | `posts` | 结构体列表 | 从该帖子提取得到的扁平化帖子列表 | #### 帖子结构体 | 字段名 | 数据类型 | 描述 | |-------|------|-------------| | `thread_slug` | 字符串 | 所属帖子的主题slug | | `post_id` | 整数(int64) | 从帖子锚点解析得到的数字型帖子标识符 | | `post_url` | 字符串 | 指向该帖子锚点的直接URL | | `position` | 整数(int64) | 提取帖子中从1开始计数的位置 | | `author_role` | 字符串 | 帖子作者区块显示的角色或显示标签 | | `author_handle` | 字符串 | 网站为该帖子显示的账号名;可能为匿名或网站分配的假名 | | `author_extra` | 字符串 | 网站显示的额外作者元数据(若存在) | | `posted_at_relative` | 字符串 | 网站显示的相对帖子时效文本,例如`2年前` | | `good_votes` | 整数(int64) | 爬取时刻该帖子的好评投票数 | | `no_good_votes` | 整数(int64) | 爬取时刻该帖子的差评投票数 | | `body` | 字符串 | 从HTML提取的纯文本帖子正文,已完成空白字符标准化处理 | ### 统计指标 | 指标 | 数值 | |--------|-------| | 帖子记录行数 | 910,133 | | 唯一规范帖子URL数 | 910,108 | | 提取的帖子总数 | 8,863,628 | | 论坛分区数 | 33 | | 论坛板块数 | 6 | | Parquet分片数 | 2 | | 分片总压缩大小 | 828.2 MiB | | 行组数量 | 41 | | 最大未压缩行组大小 | 139.7 MiB | | 爬取时间戳范围 | 2026-05-01T03:11:46Z 至 2026-05-11T09:27:29Z | | 来源论坛页面范围 | 1 至 15,072 | | 单帖子行平均帖子数 | 9.7 | | 单帖子行帖子数中位数 | 5 | | 未提取到帖子的帖子数 | 1,943(占比0.2%) | | 存在爬取错误的数据行 | 1 | | 最长提取帖子的帖子数 | 53,387条 | | 单帖子正文平均字符数 | 212 | | 单帖子正文字符数中位数 | 102 | | 空白帖子正文数 | 2,303(占比0.03%) | | 总帖子列表浏览量 | 878,540,813 | | 单帖子列表浏览量中位数 | 388 | | 提取帖子的总好评投票数 | 10,953,215 | | 提取帖子的总差评投票数 | 4,713,693 | 按帖子记录行数统计的最大论坛依次为:**非主题讨论区(Off Topic)**(526,675条)、**经济学讨论区(Economics Discussion)**(109,045条)、**经济学求职市场综合讨论区(General Economics Job Market Discussion)**(56,541条)、**金融求职谣言区(Finance Job Rumors)**(30,847条)、**政治经济学与经济政策区(Political Economy & Economic Policy)**(22,310条)、**科技区(Technology)**(20,907条)、**研究/期刊区(Research / Journals)**(19,728条)、**经济学休闲区(Econ Lounge)**(18,963条)、**博客精选区(From the blogs)**(17,916条)与**最新研究讨论区(Latest Research Discussion)**(14,030条)。 出现频率最高的`author_role`值依次为**经济学家(Economist)**(8,772,659条帖子)、**Marginal Revolution**(12,879条)、**Research**(11,534条)、**EJMRBear**(5,430条)与**Karl**(5,350条)。`author_handle`字段的值不应被视为已验证或稳定的用户身份标识。 --- ## 数据集构建 ### 筛选依据 经济求职论坛是一个规模庞大、历史悠久的匿名论坛,与经济学学术圈、金融、公共政策以及学术劳动力市场讨论密切相关。构建结构化归档数据集,可支持针对匿名专业社区、谣言传播、敌对性非正式网络话语以及经济学求职市场讨论的公开网络记录的相关研究。 ### 源数据 #### 数据收集与处理流程 - **工具:** 基于公开经济求职论坛网页的自定义Scrapy爬虫 - **覆盖范围:** 无需身份验证即可访问的公开论坛与主题页面 - 爬虫从网站索引中发现论坛,遍历论坛列表分页,并针对发现的帖子爬取主题页面 - 每条数据集行以`(forum_slug, thread_slug)`作为键,分片内未发现重复键 - 少量规范主题URL对应多个不同的forum_slug,因此规范URL的数量略低于数据行总数 - 帖子正文从HTML中提取为纯文本,并完成段落、块引用与换行符的标准化处理 - 评分、投票、浏览量、帖子数、时效与年龄字段均为爬取时刻的快照值 - 相对时间戳保留来源网站显示的原始格式,爬取页面中未获取到单个帖子的绝对创建时间 - 未对爬取内容进行系统性内容过滤、个人可识别信息(PII)检测或隐去处理 #### 源数据生产者是谁? 经济求职论坛的用户,他们以匿名、假名、角色类或网站显示的账号名发布内容,同时也包含从关联博客/论坛来源导入或显示的帖子。 --- ## 偏差、风险与局限性 ### 内容风险 - 本数据集包含匿名谣言论坛的内容,应被视为存在噪声、具有对抗性且未经验证的内容 - 帖子可能包含骚扰、侮辱、亵渎性语言、蔑称、色情内容、种族主义、性别歧视、仇外心理、反犹主义、政治极端主义以及其他冒犯性或有害内容 - 讨论内容可能涉及真实人物、大学、院系、期刊、雇主、招聘委员会、学生与求职者 - 关于个人、机构与事件的言论可能存在虚假、诽谤、过时或故意误导的情况 - 该来源论坛具有强烈的社区特定规范与选择效应,无法代表全体经济学家、学术圈人士或求职市场参与者 ### 结构性局限性 - 本次爬取的时间范围为2026年5月1日至2026年5月11日,未包含该时间节点之外的内容 - 爬取时刻的投票数、浏览量、新鲜度文本、帖子年龄文本、最新帖子元数据以及帖子可用性可能在爬取后发生变化 - 数据集仅存储相对时间字符串,未包含单个帖子的绝对创建时间戳 - 数据集仅涵盖无需特权访问即可通过公开网页发现的内容 - 部分数据行未提取到任何帖子,且有一条数据行记录了爬取错误 - `author_handle`字段为页面显示的字符串,不应被视为可靠的用户标识符 - 文本提取将HTML转换为纯文本,可能丢失格式、链接、图片、表格或其他页面结构信息 ### 个人与敏感信息 - 未对数据进行系统性的个人可识别信息(PII)检测或隐去处理 - 数据集可能包含真实人物的姓名、所属机构、就业声明、个人指控以及其他潜在敏感信息 - 许多帖子为匿名或假名形式,但内容仍可能涉及可识别的个人或组织 - 本数据集的使用者在进行分析或重新分发前,应考虑伦理审查、数据最小化、访问控制以及潜在的下游危害 --- ## 许可协议与重新分发 未识别到来源论坛内容的许可协议,因此本数据集标记为`license: unknown`(未知许可)。

提供机构:
x65617379
二维码
社区交流群
二维码
科研交流群
商业服务