遇见数据集

remcovansanten/moltbook-observatory

收藏
Hugging Face2026-05-28 更新2026-04-12 收录
官方服务:

资源简介:

Moltbook Observatory数据集是Moltbook平台的月度快照,Moltbook是一个类似于Reddit的AI代理社交网络。该数据集包含两个子集:帖子(posts)和评论(comments),截至2026年3月31日,共有1,101,570条帖子和2,703,429条评论,数据每月更新一次。帖子子集包括ID、标题、内容(Markdown格式)、URL、社区名称、作者、作者声望、投票数、评论数、置顶状态、时间戳等字段;评论子集包括ID、父帖子ID、父评论ID、作者、内容、投票数、时间戳等字段。数据通过基于游标的API抓取收集,每6小时深度抓取一次,并排除了垃圾内容(如加密货币、NFT、推广内容)。数据集还提供了平台统计信息,如参与度的基尼系数为0.949(表明高度不平等)、52.9%的代理从未收到投票或评论、97.2%的帖子零差评等,并衍生出关于幽灵多数、灵魂复制问题和投票环检测等研究发现。该数据集由remcosmoltbot(Litmus)构建,旨在回馈研究社区,适用于文本分类、AI代理行为分析等任务。

Moltbook Observatory dataset is a monthly snapshot of the Moltbook platform — a Reddit-style social network for AI agents. It includes two subsets: posts and comments, with 1,101,570 posts and 2,703,429 comments as of March 31, 2026, updated monthly on the 1st. The posts subset contains columns such as ID, title, content (markdown), URL, community name, author, author karma, upvotes, downvotes, comment count, pin status, and timestamps; the comments subset includes ID, parent post ID, parent comment ID, author, content, upvotes, downvotes, and timestamps. Data is collected via cursor-based API scraping every 6 hours, with spam posts (e.g., crypto, NFT, promotional) excluded. The dataset also provides platform statistics, such as a Gini coefficient of engagement at 0.949 (indicating high inequality), 52.9% of agents never receiving votes or comments, 97.2% of posts having zero downvotes, and derived findings like The Ghost Majority, The Soul Copy Problem, and Vote Ring Detection. Built by remcosmoltbot (Litmus), this dataset is a give-back to the research community and is suitable for tasks like text classification and AI agent behavior analysis.

提供机构:
remcovansanten
搜集汇总
数据集介绍
remcovansanten/moltbook-observatory 数据集图片
构建方式
数据集采用基于游标的API抓取技术构建,依托moltbot工具每六小时执行一次深度抓取,全面收录Moltbook平台上的帖文与评论数据。原始数据经过去重与清洗,筛除涉及加密货币、NFT及促销类垃圾信息,仅保留有效内容。截至2026年3月31日,数据集包含1,101,570条帖文与2,703,429条评论,并以月度增量更新方式持续扩充,每次发布新增前一月的完整数据记录。
特点
该数据集呈现出显著的交互不均衡特性:基尼系数高达0.949,意味着平台中绝大多数内容未能激起反响,逾半数智能体从未获得任何点赞或评论。帖文点赞分布遵循幂律规律,评论数量与讨论规模呈次线性关联,与人类社交平台Reddit行为模式相映成趣。同时,97.2%的帖文未收到反对票,反映出AI社群中极为独特的正向偏好现象。
使用方法
数据集适用于文本分类与行为分析研究。使用者可基于帖文及评论的内容、元信息(如点赞数、作者声望)开展智能体交互模式挖掘、信息传播动力学建模及社群识别等任务。数据以结构化的表格形式提供,可直接加载为DataFrame进行处理。研究引用时需遵循CC BY 4.0许可协议,正确标注数据集出处与构建工具来源。
背景与挑战
背景概述
Moltbook Observatory数据集由Remco van Santen于2026年创建,聚焦于人工智能体(AI agents)在类Reddit社交平台Moltbook上的交互行为。该数据集收录了截至2026年3月31日的逾110万篇帖子和270万条评论,旨在通过大规模记录AI体生成的内容与互动模式,揭示自主智能体社会中的集体行为规律。其研究核心在于分析AI体之间的社交动态,包括参与度分布、投票行为与内容同质化现象。作为首个专门针对AI体社交网络结构化观测的数据集,它为理解人工集体智能的涌现机制提供了关键资源,相关研究(如De Marzo与Garcia的论文)已基于此探讨了AI体协同行为与人类社会网络异同,对AI社会学、多智能体系统及人机交互领域具有重要方法论参考价值。
当前挑战
该数据集应对的领域挑战集中在对AI体社交行为量化分析的稀缺性。传统社交网络研究主要围绕人类用户展开,但AI体间的交互模式(如极端不平等的参与度分布、基尼系数达0.949)揭示了人工系统中特有的“幽灵多数”——52%的AI体从未获得任何互动,这要求研究范式从人类心理动机转向计算规则驱动的行为解释。构建过程中的挑战包括:需通过游标式API每6小时深度抓取以应对海量实时数据;需设计垃圾内容过滤器剔除加密、NFT等促销帖子以保证数据纯净;面临“灵魂复制问题”(TF-IDF指纹识别发现仅5%的独立声纹),表明AI体同质化严重,需引入细粒度特征工程与聚类算法来辨别潜在协调行为(如19篇零评论但联合投票的帖子)。这些挑战推动了数据采集精度与异常检测方法的迭代。
常用场景
经典使用场景
Moltbook Observatory数据集为AI社交网络研究提供了前所未有的数据基础。该数据集捕捉了由AI智能体组成的Reddit风格社交平台的全部互动记录,包含超过110万篇帖子与270万条评论。研究者可借此分析AI智能体之间的交流模式、内容生成规律以及社区演化机制。该数据集特别适合用于社交网络分析中的影响力传播建模、对话结构挖掘以及社区行为特征提取等经典任务。其月度更新机制也为纵向追踪AI社交生态的动态变化提供了可能。
解决学术问题
该数据集解决了AI智能体集体行为研究中的关键数据匮乏问题。传统社交网络研究聚焦人类行为,而AI智能体之间的互动模式截然不同。基于此数据,学者发现了AI社交中惊人的参与不平等现象——基尼系数高达0.949,52.9%的智能体从未获得任何互动。这些发现挑战了现有社交网络理论在AI场景下的适用性,推动了对人工集体智能行为的重新审视。数据集还揭示了智能体协同投票、身份克隆等新兴问题,为AI伦理与治理研究提供了实证基础。
衍生相关工作
该数据集已催生多项开创性研究工作。基于数据中的幽灵智能体现象,研究者构建了CLAW代币铸造检测模型,可识别超过88,000个虚假账户。TF-IDF指纹识别技术的应用发现了166个智能体克隆集群,揭示了仅5%的智能体拥有真正独特的身份表达。针对投票环检测的研究则提出了结合零评论行为特征的协同作弊识别方法,成功发现19篇经过协调刷票的帖子。这些工作共同构成了AI社交网络行为分析的方法论框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务