遇见数据集

MoltSafe-10K

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

MoltSafe-10K 是一个面向代理社交网络 Moltbook 的安全注释数据集,包含 10,000 条帖子和评论的安全标注。每条数据提供了二进制安全判定(safe/unsafe)、严重级别(0 到 5 级,基于对自主代理环境的操作影响定义)、恶意意图分类(最多 3 个,涵盖提示注入、越狱或安全绕过、敏感信息提取或泄露、参与操纵、行为或记忆毒化、社会工程攻击、有害或滥用内容、金融诈骗或欺诈、错误信息或幻觉级联、不安全执行指令等类别)以及 OWASP GenAI 十大风险代码(LLM01 至 LLM10)。数据集仅发布注释和节点标识符,不包含原始文本;用户需根据 node_id 从原始数据集 AIcell/moltbook-data 中获取恶意文本。构建过程包括哈希去重、语言检测(保留英语占比超过 50% 的节点)、无放回采样 10,000 条,并使用 GPT-5.5 在高推理模式下进行注释。该数据集适用于文本分类、AI 安全检测、提示注入防御、自主代理威胁分析等研究场景。

MoltSafe-10K is a safety-annotated dataset for the agent-based social network Moltbook, containing 10,000 annotated posts and comments. Each entry provides a binary safety label (safe/unsafe), a severity level (0 to 5, defined based on the operational impact on autonomous agent environments), malicious intent classification (up to 3 categories, covering prompt injection, jailbreak or security bypass, sensitive information extraction or leakage, participation manipulation, behavior or memory poisoning, social engineering attacks, harmful or abusive content, financial scams or fraud, misinformation or hallucination cascades, unsafe execution instructions, etc.), and OWASP GenAI top 10 risk codes (LLM01 to LLM10). The dataset only releases annotations and node identifiers, without original text; users need to retrieve the malicious text from the original dataset AIcell/moltbook-data based on node_id. The construction process includes hash deduplication, language detection (retaining nodes with English proportion exceeding 50%), sampling 10,000 entries without replacement, and annotation using GPT-5.5 in high-reasoning mode. The dataset is suitable for research scenarios such as text classification, AI safety detection, prompt injection defense, and autonomous agent threat analysis.

创建时间:
2026-08-11
原始信息汇总

MoltSafe-10K 数据集概述

基本信息

  • 数据集名称:MoltSafe-10K
  • 许可证:MIT
  • 语言:英语
  • 任务类型:文本分类
  • 标签:AI安全、LLM安全、提示注入、智能体社交网络、OWASP LLM Top 10、Moltbook
  • 数据规模:1K-10K 条样本(共10,000条)
  • 来源:基于 Hugging Face 上的 AIcell/moltbook-data 语料库构建

数据内容

该数据集包含 Moltbook(一个自主智能体相互通信的智能体社交网络)中 10,000 条帖子和评论的安全标注。每条样本(节点)包含以下字段:

字段 说明
node_id 节点标识符,格式为 post:<uuid>comment:<uuid>
node_type 节点类型:post(帖子)或 comment(评论)
verdict 安全判定:safe(安全)或 unsafe(不安全)
severity 严重程度等级,范围 0-5
risk_taxonomies 恶意意图分类,每个节点最多3个(仅不安全节点)
owasp_risk_codes OWASP GenAI 风险代码,每个节点最多3个

注意:数据集仅发布标注和来源标识符,不包含恶意文本本身。用户需下载原始数据集,并根据帖子/评论ID获取对应文本。

严重程度分级

等级 标签 描述
0 Safe 无有害意图或影响
1 Weak signal 可见但微弱的危险信号,影响有限
2 Low operational impact 有害、辱骂或欺骗性,直接操作影响低
3 Plausible operational risk 操控性或协调性有害影响,存在合理操作风险但无明确破坏
4 Localized compromise 未授权执行、敏感数据泄露或单智能体劫持
5 Systemic compromise 自传播或级联式多智能体破坏,或无限资源滥用

风险分类(仅限不安全节点)

恶意意图分类包括(类别不互斥):

  • prompt_injection(提示注入)
  • jailbreak_or_safety_bypass(越狱或安全绕过)
  • sensitive_information_extraction_or_leakage(敏感信息提取或泄露)
  • engagement_manipulation(参与度操控)
  • behavior_or_memory_poisoning(行为或记忆投毒)
  • social_engineering_attacks(社会工程攻击)
  • harmful_or_abusive_content(有害或辱骂内容)
  • financial_scams_or_fraud(金融诈骗)
  • misinformation_or_hallucination_cascade(错误信息或幻觉级联)
  • unsafe_execution_directive(不安全的执行指令)
  • other(其他)

同时,还分配了 OWASP GenAI Top-10 代码 LLM01LLM10

构建方法

  1. 对原始语料进行哈希去重
  2. 使用 Lingua 库进行语言标记(高精度模式),仅保留英语占主导的内容(超过50%字符为英语的节点)
  3. 去除空白记录后,无放回抽样 10,000 个节点
  4. 使用 GPT-5.5(高推理强度)进行标注

数据来源与许可

  • 数据归属:仅发布标注和源标识符,不重新分发 Moltbook 原文;原文需从原始数据集通过 ID 检索获取
  • 许可范围:MoltSafe-10K 许可证仅适用于发布的标注和配套材料,不适用于原始源文本;用户需遵守源数据集的相关条款和数据保护要求

相关资源

  • 用于开发数据集和重现实验的代码公开在 GitHub
  • 论文目前正在评审中,引用信息待补充
搜集汇总
数据集介绍
MoltSafe-10K 数据集图片
构建方式
MoltSafe-10K数据集源于自主智能体社交网络Moltbook中的一万条帖子与评论的安全标注。构建流程起始于对原始语料进行哈希去重,随后利用Lingua库以高精度模式进行语言检测,保留英语内容占比超过50%的节点。在剔除空白记录后,无放回地随机抽取一万个节点,最终由GPT-5.5在高层级推理设置下完成安全标注。该数据集仅发布标注信息与源标识符,不包含原始文本,研究者需结合原始数据集按ID关联获取内容。
使用方法
使用MoltSafe-10K进行安全研究时,研究者需先从Hugging Face下载原始Moltbook数据集(AIcell/moltbook-data),随后依据本数据集中的节点ID(帖子或评论的UUID)关联获取对应的文本内容。由于数据仅包含标注,需自行加载原始文本。该数据集适用于文本分类任务,可用于训练智能体安全检测模型,或评估现有LLM安全防护机制在自主社交网络场景下的有效性。相关复现代码已在GitHub公开,便于实验再现。
背景与挑战
背景概述
MoltSafe-10K数据集诞生于人工智能安全与自主智能体系统交叉研究的前沿,由德国帕德博恩大学自然语言处理研究团队于2024年创建。该数据集针对Moltbook这一自主智能体社交网络中的10,000条帖子和评论进行了精细的安全标注,涵盖二分类安全判定、严重程度分级、恶意意图分类和OWASP GenAI风险代码。其核心研究问题在于系统性地理解和防御多智能体环境中涌现的安全威胁,为检测和缓解智能体间传播的恶意行为提供了基准数据。该数据集的发布填补了自主智能体社交网络安全标注数据的空白,对推动LLM安全、提示注入攻击检测以及智能体通信安全等研究领域具有重要影响,成为该方向首个公开的细粒度安全标注资源。
当前挑战
该数据集所应对的领域挑战包括:多智能体系统高度复杂且自主,传统网络安全方法难以直接适用,恶意行为如提示注入、数据泄漏、系统性级联攻击等难以预测和识别;Moltbook中智能体间自由交互,使安全事件具有隐蔽性、动态性和复合性。在构建过程中,研究人员面临数据清洗与去重的难度,需过滤非英语内容并确保样本代表性;标注工作依赖高级大模型(GPT-5.5)进行,但模型可能对某些安全威胁产生误判或遗漏,且严重程度和风险分类需要专家级定义,协调多个标注维度存在挑战。此外,数据集的发布仅包含标注而不含原始文本,用户需自行匹配原数据集,增加了使用的门槛,同时原始数据可能涉及隐私,获取和处理需遵循合规要求。
常用场景
经典使用场景
MoltSafe-10K数据集为自主智能体社交网络的安全研究提供了关键的标注资源。在生成式AI与多智能体系统蓬勃发展的当下,该数据集聚焦于Moltbook平台中智能体间的交互内容,通过二分类安全判定、严重性分级、恶意意图分类以及OWASP GenAI风险代码的多维度标注,为研究者提供了细粒度的威胁情报。其经典使用场景在于训练和评估针对智能体通信内容的文本分类模型,以实现对提示注入、越狱攻击、敏感信息窃取等恶意行为的自动识别,从而支撑安全防护机制的设计与验证。
解决学术问题
该数据集填补了针对智能体社交网络这一新兴领域的公开安全标注数据空白。在学术研究中,它助力解决多个关键问题:一是构建多粒度安全评估基准,涵盖从微弱信号到系统性危害的分级标注,为模型性能提供层次化度量;二是探究恶意意图的语义特征,通过风险分类学与OWASP风险代码的映射,深化对智能体攻击模式的理解;三是支持安全检测模型的鲁棒性研究,促进对未知或变种攻击的泛化能力提升。其发布推动了LLM安全领域从被动防御向主动监测的范式转变。
实际应用
在实际应用中,MoltSafe-10K可用于开发智能体社交平台的安全监控系统,实时识别和拦截不安全内容,防范社会工程攻击、金融诈骗及有害信息传播。同时,它支持安全审计工具的开发,帮助平台运营者评估现有安全策略的有效性。此外,数据集可集成至红队测试框架,用于模拟对抗性攻击,强化智能体的安全韧性。通过标注OWASP风险代码,它还可助力企业合规性检查,确保生成式AI应用符合行业安全标准。
数据集最近研究
最新研究方向
针对自主智能体社交网络(如Moltbook)中涌现的安全威胁,MoltSafe-10K数据集为多智能体通信环境下的内容安全检测提供了精细化的标注资源。该数据集引入了严重性等级与恶意意图分类体系,并映射至OWASP GenAI Top-10风险框架,推动了从单点提示注入防御向系统性、级联性攻击识别的范式转变。其研究的核心方向包括:利用大语言模型进行高一致性安全标注与自动化风险评分,探索在分布式智能体交互中跨节点传播的操纵、欺诈及信息污染模式,以及构建面向真实世界智能体生态的鲁棒威胁检测与缓解基准。该数据集不仅是首个聚焦于自主智能体社交网络安全的开源标注集,更为评估智能体间通信的多跳影响与不可逆损害提供了可复现的实验基石,预示着AI安全研究正从命令级防护迈向生态级韧性评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务