遇见数据集

AI时代关注点图谱数据集

收藏
github2026-08-01 更新2026-08-05 收录
官方服务:

资源简介:

包含518条真实评论的AI时代关注点知识图谱,涵盖职业选择、AI替代、读博价值、生活成本、学历贬值、变现难等话题,节点包括关注点、人群、视频、隐喻、应对策略,边包括引出、担心、被说成、缓解、共现等关系,每条边附带评论原文作为证据。

This knowledge graph of concerns in the AI era comprises 518 authentic user reviews, covering topics including career choice, AI replacement, value of PhD study, cost of living, devaluation of academic credentials, difficulty in monetization, and other related themes. Its nodes include concerns, demographic groups, videos, metaphors, and coping strategies, while its edges represent relationships such as introduction, worry, being referred to as, mitigation, and co-occurrence. Each edge is accompanied by the original review as supporting evidence.

创建时间:
2026-08-01
原始信息汇总

数据集概述

cheat-on-audience 是一个将短视频评论区转化为可交互、可追溯知识图谱的项目,包含一个 Agent Skill(用于处理用户自己的评论数据)和一份 公开数据集(518 条真实评论构成的 AI 时代关注点图谱)。

核心内容

  • 知识图谱:将评论区中的“谁在关心什么”“什么内容引出什么讨论”“哪些关注点总是一起出现”“哪些提问从来没被回答过”等关系连成网络,揭示评论区结构。
  • 公开数据:包含 518 条真实评论,聚焦 AI 时代公众关注点,如职业选择(43次)、不会用工具(30次)、AI替代人(27次)、读博价值(15次)、生活成本(12次)、学历贬值(11次)、变现难(8次)等。

图谱结构

  • 五类节点:关注点、人群、视频、隐喻、应对策略。
  • 五类边:引出(视频→关注点)、担心(人群→关注点)、被说成(关注点→隐喻)、缓解(应对→关注点)、共现(关注点↔关注点)。
  • 每一条边都挂有评论原文作为证据,确保结论可追溯到具体的评论。

数据特点

  • 数据来源为创作者后台导出、iGrowth 插件采集或手动复制,不使用爬虫。
  • 包含三个中文评论区特供信号:is_sarcasm(阴阳怪气)、is_ask(提问)、is_win(成果汇报)。
  • 隐私保护:仅包含评论正文、点赞数、排序来源,不含用户昵称、UID 等个人标识。

使用方式

  • 直接查看:在线交互版(GitHub Pages)或仓库中的 Mermaid 图。
  • Agent 读取:data/graph.json(结构化图谱数据)或 data/digest.md(纯文本摘要)。
  • 跑自己的数据:克隆仓库并作为 Skill 安装,在 Claude Code 中运行“分析我的评论区”。

技术实现

  • 渲染产出为 atlas.html,零依赖单文件,不引用任何 CDN,可双击打开、直接作为 Artifact 或部署到 GitHub Pages。
  • 力导向布局为手写实现,无需 d3.js。

已知限制

  • 平台后台不提供单条评论的时间戳和回复链,因此无法实现评论级精确时间轴及「情绪升级链」「被安抚链」等分析。
  • 真实评论区中约 40% 的评论带有信息量,图谱反映的是这部分内容。

许可

MIT License。

搜集汇总
数据集介绍
AI时代关注点图谱数据集 数据集图片
构建方式
该数据集源自对短视频评论区真实评论的深度挖掘,依托创作者后台导出的官方数据、授权插件采集或手动复制等合规渠道,严格规避爬虫手段,确保了数据来源的合法性与真实性。构建过程中,将518条蕴含信息量的评论进行系统化解析,依据预设的抽取规范,提炼出关注点、人群、视频、隐喻与应对策略五类核心节点,并构建引出、担心、被说成、缓解、共现五类语义关系,形成结构化知识图谱。尤为关键的是,图谱中的每一条边均挂接评论原文作为不可篡改的证据链,杜绝无依据的抽象连接,从根本上防范了LLM在抽取过程中的幻觉问题,保障了数据构建的严谨性与可追溯性。
使用方法
数据集的使用灵活多元,适配不同用户需求。对于普通研究者,可直接浏览GitHub渲染的Mermaid交互图或访问在线版本,进行可视化探索;对于智能体应用,可通过`data/graph.json`获取完整结构化图谱,或通过`data/digest.md`获取纯文本摘要,便于Agent直接fetch并融入分析流程。处于创作者角色的用户,更可将仓库克隆为Claude Code的Skill,通过指令“分析我的评论区”对自有数据进行处理,运行脚本即可生成可视化图谱。数据集遵循数据视图分离原则,`graph.json`支持增量追加,既可即时呈现,亦可积累长期价值。
背景与挑战
背景概述
在人工智能技术迅猛发展的当下,公众对AI的认知与态度呈现出复杂多变的态势,社交媒体评论区成为洞察这一社会心理的宝贵窗口。该数据集由XBuilderLAB团队于2025年构建,基于518条真实短视频评论,通过知识图谱技术,系统性地描绘了AI时代公众关注的焦点图谱。其核心研究问题在于揭示不同人群(如职场人、大学生、留学生等)对AI的担忧、应对策略及热点话题(如职业选择、AI替代、学历贬值等)之间的内在关联。数据集创新性地将评论关系(如‘引出’、‘担心’、‘缓解’)与原始评论证据相结合,构建了可追溯、可交互的图谱结构,为理解AI社会影响提供了独特的数据视角与分析方法。该成果不仅推动了计算社会学与自然语言处理交叉领域的研究,也为内容创作者、政策制定者及AI产品开发者提供了宝贵的数据支持。
当前挑战
该数据集在构建与应用中面临多重挑战。在领域问题层面,首要挑战在于准确捕捉并结构化中文评论中的复杂情感与语义,尤其是‘阴阳怪气’等反讽表达,需专门信号(is_sarcasm)加以甄别,否则会导致图谱语义偏向。其次,如何从大量低信息量评论(仅约40%含有效内容)中提炼关键关注点,并处理多话题共现与人群-话题关联,对信息抽取精度提出高要求。在构建过程中,数据来源受限,平台后台缺乏评论时间戳与回复链,阻碍了情绪演变与交互影响分析;同时,为确保图谱可信度,每条边必须附有评论原文证据,严格防范LLM抽取过程中的事实幻觉,这增加了数据治理的复杂度。此外,图谱的持续更新与扩展,以及跨领域迁移时的schema适配,亦是维持其时效性与通用性的长期挑战。
常用场景
经典使用场景
该数据集以短视频评论区为切入点,将离散的评论内容结构化,构建出反映社会大众心理与行为倾向的知识图谱。其核心使用场景在于,通过图谱中的节点与边,直观呈现不同人群对特定议题的关切焦点、情感倾向及应对策略,为内容创作者和研究者提供一种可视化、可交互的洞察工具。例如,从图谱中可清晰识别出“职业选择”、“AI替代人”等高频关注点,以及“担心”、“缓解”等情感连接,从而揭示评论数据背后隐藏的深层社会心理结构。
解决学术问题
该数据集解决了计算社会科学中非结构化文本数据难以量化分析的问题,特别是针对短视频评论区这一信息密度高且嘈杂的数据源。它通过定义五类节点和五类关系边,并附带评论原文作为证据,有效规避了LLM抽取中的幻觉风险,为基于真实数据的公众关注点建模提供了新范式。这一工作推动了知识图谱技术在舆情分析、社会心态研究等领域的应用,使得从海量评论中提取系统性、可验证的群体认知模式成为可能,对理解数字时代的公共话语结构具有重要学术价值。
实际应用
在实际应用中,该数据集可作为内容创作策略的辅助工具,帮助创作者通过图谱识别出观众真正关心但尚未被充分回应的议题(如提问信号密集的区域),从而指导选题和内容优化。同时,图谱中标注的“阴阳怪气”等中文评论特供信号,为情感分析和舆情监测提供了更精细的维度,有助于品牌方或平台方及时把握公众情绪和潜在风险。此外,其知识图谱的交互式可视化形式,亦可应用于教学演示或行业报告,提升数据呈现的直观性和说服力。
数据集最近研究
最新研究方向
当前,AI时代关注点图谱数据集正引领着社交媒体内容分析的新范式,其核心研究方向聚焦于将非结构化的短视频评论区转化为可交互、可追溯的知识图谱,以揭示群体关注点的深层关联与演变趋势。该数据集通过融合‘阴阳怪气’、‘提问’和‘成果汇报’等中文语境特供信号,为情感分析、需求挖掘及内容策划提供了创新性的数据支撑。其前沿探索包括利用大模型代理实现自动化图谱构建与增量更新,以及通过零依赖的交互式可视化技术,实现数据证据的实时回溯。这一方向不仅为内容创作者提供了洞察受众需求的精准工具,也为计算社会科学中的舆论动力学、群体心理及知识传播研究开辟了新的实证路径,彰显了数据驱动决策在数字化内容生态中的重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务