遇见数据集

GPTS-Crawler-Dataset

收藏
github2026-04-09 更新2026-06-04 收录
官方服务:

资源简介:

该数据集包含10000多个GPTs的详细元数据,通过从互联网多个来源(如Google搜索、Github)爬取获得。数据集以gizmos.jsonl文件形式提供,每行包含一个完整GPTs的元数据,如ID、作者信息、显示名称、描述、类别、标签等。仓库支持爬取、去重和持续更新数据集,旨在构建公开的GPTS数据集资源。

This dataset contains detailed metadata for over 10,000 GPTs, collected via web crawling from multiple online sources including Google Search and GitHub. The dataset is provided in the format of a gizmos.jsonl file, where each line stores the complete metadata of a single GPT, such as ID, author information, display name, description, category, tags and other relevant attributes. The associated repository supports dataset crawling, deduplication and continuous updates, aiming to build a publicly available GPTs dataset resource.

创建时间:
2023-11-19
原始信息汇总

数据集概述

数据集名称:GPTS-Crawler-Dataset

数据规模:包含超过10000个GPTs的元数据。

数据格式:文件 gizmos.jsonl,每一行是一个完整的GPTs元数据,采用JSON格式。

关键字段说明

  • id:GPTs的唯一标识符。
  • organization_id:所属组织ID。
  • short_url:短链接。
  • author:作者信息,包括用户ID、显示名称、链接、验证状态等。
  • display:显示信息,包括名称、描述、欢迎消息、提示启动词、头像URL、分类等。
  • share_recipient:分享接收方(如 marketplace)。
  • updated_at:更新时间。
  • tags:标签(如 public, reportable)。

数据来源

  • 通过互联网多来源爬取。
  • 支持通过Google搜索和GitHub获取GPTs数据。

更新方式

  • 新获取的GPTs元数据会追加到 gizmos.jsonl 文件中。
  • 支持断点续传和异常重试。

辅助功能

  • 提供去重脚本(deduplicate-urlsdeduplicate-gpts)。
  • 支持从Google和GitHub批量获取GPTs URL。

相关资源

贡献方式

  • 在GitHub Issue中提交GPTs URL。
  • 直接更新 gpts-url-listgizmos.jsonl 文件。
  • 添加Google搜索关键词。

致谢数据源

搜集汇总
数据集介绍
GPTS-Crawler-Dataset 数据集图片
构建方式
在人工智能与自然语言处理领域,定制化GPT模型(GPTs)的涌现催生了海量元数据资源。GPTS-Crawler-Dataset的构建依托于一个高效的数据采集框架,该框架整合了多源信息获取渠道。具体而言,研究者通过互联网公开资源、Google搜索引擎以及GitHub平台,利用爬虫技术系统性地抓取每个GPTs的详细元数据。爬虫设计支持异常重试与断点续传机制,确保了大规模数据采集的鲁棒性。最终,所有采集到的元数据以JSON Lines格式组织,每行对应一个完整的GPTs实体,涵盖标识符、作者信息、显示属性及时间戳等关键字段,形成了一个结构化的数据集。
特点
该数据集的核心优势在于其全面性与可扩展性。其包含超过一万条GPTs记录,每条记录均具备高完整度的元数据,从基本的名称、描述到复杂的作者验证状态与类别标签,一应俱全。数据集的构建过程采用了灵活的爬取策略,不仅支持从网页直接抓取,还能通过关键词搜索动态扩展数据源,从而持续追踪GPTs生态的最新动态。此外,内置的去重功能保证了数据质量,避免了冗余信息的干扰,为大规模分析提供了可靠基础。
使用方法
使用该数据集时,用户需确保Node.js环境版本不低于16。首先通过Git克隆项目仓库,随后安装项目依赖并配置Playwright浏览器驱动。数据集的初始URL列表存储于gpts-url-list文件中,用户可自定义更新此列表以定向采集特定GPTs。执行npm start命令即可启动爬取流程,新获取的元数据将自动追加至gizmos.jsonl文件。若需补充数据来源,可通过npm run google或npm run github命令分别从搜索引擎或代码仓库获取新的GPTs链接,并利用npm run deduplicate-urls与npm run deduplicate-gpts命令进行去重处理,从而维护数据集的整洁与高效。
背景与挑战
背景概述
随着大型语言模型(LLMs)的蓬勃发展,OpenAI于2023年11月推出了GPTs(Generative Pre-trained Transformers)定制化应用商店,允许用户无需编程即可创建和分享基于GPT-4的专属智能体。这一创新迅速催生了数以万计的GPTs应用,覆盖教育、编程、娱乐等多个领域。在此背景下,GPTS-Crawler-Dataset数据集应运而生,由开发者ahaapple于2023年底创建,旨在系统性地从互联网多源(包括Google搜索和GitHub)爬取并汇总GPTs的元数据。该数据集以JSONL格式存储,每条记录包含GPTs的唯一标识、作者信息、展示名称、描述及类别等关键属性,为研究GPTs生态系统的演化、应用分布及用户行为提供了宝贵的基础资源。其开放性和持续更新的特性,对推动AI应用市场分析、个性化推荐系统及跨领域迁移学习等研究具有重要支撑作用。
当前挑战
该数据集面临的核心挑战包括:其一,所解决的领域问题——GPTs应用作为新兴的LLM交互范式,其元数据分散且缺乏统一标准,导致难以全面追踪和分析这一快速演进的生态系统。GPTS-Crawler-Dataset通过多源爬取填补了这一空白,但数据完整性与时效性仍是持续难题。其二,构建过程中的技术挑战:爬虫需应对反爬机制、动态加载内容及频繁的API接口变更,尤其在处理Google搜索和GitHub数据时,需设计高效的异常重试与断点续传机制,确保高成功率。此外,随着GPTs数量激增(已超10,000个),元数据文件的规模膨胀(如gizmos.jsonl)对存储、去重及后续处理提出了可扩展性要求。数据去重策略需平衡精度与效率,避免相同GPTs因不同来源产生冗余记录。最后,多语言支持(如中文README)与社区协作(如用户贡献URL)增加了数据质量控制与格式统一的复杂度。
常用场景
经典使用场景
在人工智能与自然语言处理领域,随着GPTs(Generative Pre-trained Transformers)生态的蓬勃兴起,研究者亟需一个系统化、结构化的数据集来深入剖析GPTs的元数据特征与行为模式。GPTS-Crawler-Dataset应运而生,其经典使用场景聚焦于大规模GPTs元数据的采集与标准化存储。该数据集通过高效爬虫技术,从互联网多源渠道(如Google搜索、GitHub仓库)抓取超过10,000个GPTs的详尽元数据,涵盖标识符、作者信息、显示名称、描述、欢迎消息及类别标签等关键字段。这一过程不仅实现了数据的高可用性与可复现性,还为后续的GPTs生态分析、模型行为对比以及个性化推荐系统的构建奠定了坚实的数据基础。研究者可基于此数据集开展GPTs功能聚类、流行趋势预测及质量评估等前沿探索,从而推动GPTs应用的科学化发展。
衍生相关工作
围绕GPTS-Crawler-Dataset,学术界与工业界已衍生出一系列具有影响力的经典工作。在数据采集层面,该数据集推动了Hybird AI搜索(如Memfree项目)与GPTs元数据增强技术的成熟,通过融合多种检索策略提升了爬虫的鲁棒性与覆盖度。在分析工具方面,gpts-works等开源项目基于此数据集开发了GPTs可视化仪表盘与质量评分模型,实现了对GPTs功能的自动化分类与异常检测。此外,GPTsHunter与GPTHub等社区项目借鉴该数据集的元数据格式,构建了众包式的GPTs分享与评价平台,进一步丰富了数据生态。这些衍生工作不仅验证了数据集的基础性价值,还拓展了其在GPTs安全审计、跨模型迁移学习以及用户行为模拟等前沿方向的应用边界,形成了一个不断演进的学术-工业协同创新网络。
数据集最近研究
最新研究方向
随着生成式预训练模型(GPT)的广泛应用,GPTs(自定义GPT应用)生态迅速扩张,如何高效获取、聚合和分析海量GPTs元数据成为前沿热点。GPTS-Crawler-Dataset数据集应运而生,其通过多源爬取(Google搜索、GitHub等)构建了包含超过一万条GPTs详细元数据的结构化资源库,涵盖标识符、作者信息、交互时间戳及功能描述等关键字段。该数据集直接服务于大模型应用市场的生态研究,为开发者社区提供了标准化数据支撑,助力分析GPTs的功能分布、流行趋势及用户行为模式。在AI应用爆发式增长的当下,该资源不仅推动了GPTs的可发现性与互操作性研究,还为个性化AI助手推荐系统、跨平台应用迁移等热点方向奠定了数据基础,其开源性更促进了社区协作与知识共享,对理解AI应用生态演化具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务