grokset
收藏资源简介:
@GrokSet是首个从公开社交媒体收集的大规模多方人类-LLM交互数据集。不同于现有的私人、一对一用户-助手交互语料库(如WildChat、LMSYS-Chat-1M),@GrokSet捕捉了Grok大型语言模型在X(前Twitter)多用户线程中作为公开参与者的行为。数据集时间跨度为2025年3月至10月,涵盖超过100万条推文和18.2万+对话线程,旨在研究LLM在对抗性、社会嵌入和“公共广场”环境中的行为。数据集以脱水格式(推文ID + 注释 + 结构元数据)发布,以符合平台服务条款,并提供了专门的再水合工具包来重建文本和元数据。关键特性包括多方动态、真实世界上下文和丰富注释。数据集结构围绕对话线程分层组织,包含详细的统计信息。数据集创建旨在填补LLM从私人聊天机器人转向公共社交代理时的数据空白,提供了LLM在实时响应突发新闻、政治极化和多用户挑衅行为方面的首次观察。
@GrokSet is the first large-scale multi-party human-LLM interaction dataset collected from public social media. Unlike existing private, one-on-one user-assistant interaction corpora (e.g., WildChat, LMSYS-Chat-1M), @GrokSet captures the behavior of the Grok large language model as a public participant in multi-user threads on X (formerly Twitter). The dataset spans from March to October 2025, covering over 1 million tweets and 182,000+ conversation threads, aiming to study LLM behavior in adversarial, socially embedded, and public square environments. The dataset is released in a dehydrated format (tweet IDs + annotations + structural metadata) to comply with platform terms of service and includes a specialized rehydration toolkit to reconstruct text and metadata. Key features include multi-party dynamics, real-world context, and rich annotations. The dataset is hierarchically organized around conversation threads and includes detailed statistics. The dataset creation aims to fill the data gap as LLMs transition from private chatbots to public social agents, providing the first observations of LLMs responding to breaking news, political polarization, and multi-user provocation behaviors in real-time.
数据集概述:@GrokSet
@GrokSet 是一个大规模、多轮次的人机交互数据集,专注于收集公开社交媒体上的人类与大型语言模型(LLM)之间的多对多互动。该数据集捕捉了 Grok 语言模型在 X(原 Twitter)平台上作为公共参与者,在多用户线程中的行为。
核心特点
- 多轮次动态交互:包含复杂的交互图结构,超越简单的线性问答。
- 真实世界语境:包含点赞、转发、回复等交互数据,用于衡量社交认可度。
- 丰富注释:预计算了毒性、主题、网络指标等标签。
数据集规模
- 时间范围:2025年3月 至 2025年10月
- 线程数量:182,707 条
- 推文总数:1,098,394 条
- 平均每线程轮次:约 6.01 次
数据集结构
数据集以对话线程为核心进行分层组织。其 JSON 结构按时间顺序排列线程内的推文。主要字段包含:
- conversationId:根线程的唯一标识符。
- annotations:包含主题、讨论与挑事行为分析、网络指标等注释。
- threads:包含线程内所有推文列表的数组。每条推文包含其文本、交互数据、作者信息以及毒性评分等详细信息。
注释与标签
该数据集包含大量由机器生成的注释,具体包括:
- 主题分析:使用 BERTopic 识别出1,112个多语言主题。
- 安全/毒性:使用 Detoxify 多语言模型对所有推文进行评分,以检测攻击性、威胁和仇恨言论。
- 对话动态:使用 Gemini 2.0 Flash 作为评判模型,检测讨论、挑事行为、辅助语气等。
偏差、风险与局限性
- 幸存者偏差:仅包含在收集时仍可访问的推文,可能缺少在被平台删除的极端有害内容。
- 西方中心:虽支持多语言,但数据严重偏向于英语和西方政治语境。
- 平台特异性:交互受X平台特性影响(如字符限制、蓝V认证文化),可能不适用于其他平台。
许可与合规
- 数据集注释与结构:采用 CC BY-NC 4.0 许可。
- 推文内容:遵守 X 的服务条款,原始内容归原始创作者所有。
- 格式:数据集以脱水格式(仅提供推文ID、注释和结构元数据)发布,并提供专门的重水化工具包用于重构文本数据。





