6w.json dataset
收藏数据链接:
官方服务:
资源简介:
一个开放数据集,精选的MCP服务器、AI代理和开发工具注册表。
An open dataset comprising curated MCP servers, AI Agents, and development tool registries.
创建时间:
2026-08-03
原始信息汇总
数据集概述
6w.json 是一个用于描述开发者工具的微型数据模式(schema),同时此仓库本身也是一个开放数据集,收录了 MCP 服务器、AI 代理和开发者工具的精选注册表。
数据结构
该模式定义了一个 JSON 对象,包含以下字段:
- 必需字段:
name(名称)、category(类别)、tags(标签)、six_word_summary(六词摘要),以及六个 W 字段(who、what、where、when、why、with)。 - 可选字段:
watch(第七个 W,安装风险与来源)、github_url、docs_url。
其中,six_word_summary 必须严格为六个单词(连字符复合词计为一个词)。category 为 11 个预定义类别之一,包括:
- MCP Server
- Agent Framework
- Orchestration & Automation
- Autonomous Agent
- Coding Assistant
- Inference & Serving
- Fine-tuning
- Vector & Retrieval
- AI Apps & UIs
- Observability & Evaluation
- Guardrails & Structure
数据内容
数据集存储于 registry/ 目录下,每个工具对应一个 <slug>.json 文件,当前共收录 208 个条目(且持续增长中),所有文件均通过上述模式验证。此外,完整的数据库(包含 Proof Scores)还以单个 gzip 压缩文件形式提供,可于 https://6wdb.com/static/snapshots/6wdb-latest.json.gz 获取。
数据贡献方式
用户可通过两种方式贡献工具:
- 从代码仓库提交:在仓库根目录添加
6w.json,然后通过 API(POST https://6wdb.com/api/v1/submit)或在线表单(https://6wdb.com/submit)提交,提交内容经人工审核后发布。 - 直接在本仓库中提交 Pull Request,添加
registry/<your-slug>.json文件。
许可协议
本仓库采用双重许可:
- 代码部分:Apache License 2.0
- 数据集部分(
registry/目录下所有内容):知识共享 CC0 1.0 通用许可(公有领域),无需署名,但欢迎对 6wdb.com 进行来源标注。
搜集汇总
数据集介绍

构建方式
6w.json数据集以极简的JSON模式为核心,旨在用六词与七个W(who、what、where、when、why、with及watch)精准勾勒开发者工具的全貌。仓库中的registry/目录按slug存放每个工具的独立文件,共计208项,每项均严格遵循公开的JSON Schema校验。数据源自6wdb.com平台,用户可通过仓库内pull request或API提交新工具,经人工审核后纳入,确保数据质量与可靠性。
特点
该数据集兼具结构化和高度可扩展性,每个条目以六词摘要凝练工具本质,十一个预设类别覆盖MCP服务器、智能体框架等多元领域。第七个W(watch)引入安装风险与来源追踪,为工具选择提供决策支撑。整体数据以CC0协议释出至公共领域,促进无壁垒的学术研究与产业应用,同时支持批量下载快照,便于全量分析。
使用方法
使用者可直接访问仓库中registry/目录下的JSON文件,或通过提供的gzip快照获取全量数据并开展研究。对于工具开发者,可在项目根目录添加6w.json文件,并通过API或Web表单提交至6wdb.com,经审核后即纳入索引。数据集遵循Apache 2.0与CC0双许可,允许自由使用、修改与再分发,仅需按需保留归属声明。
背景与挑战
背景概述
6w.json数据集于2025年由6wdb.com团队创建,旨在为开发者工具提供一种极简的、基于‘六个词与七个W’的结构化描述规范。该规范要求每个工具以JSON格式记录其名称、类别、标签及六词摘要,并涵盖who、what、where、when、why、with六个维度,以及可选的‘watch’维度以评估安装风险与来源可信度。这一创新性的元数据框架不仅统一了AI代理、MCP服务器等工具的描述方式,而且通过开源注册表的形式,汇集了超过200个经过人工审核的条目,形成了一个不断增长的、面向开发者工具领域的知识图谱。该数据集的核心研究问题在于如何以高度简洁且标准化的方式捕捉工具的本质属性,从而促进工具的可发现性、可比较性与可信度评估。其影响力已初步显现,为开发者社区提供了一种轻量级、可互操作的工具描述与索引机制,有望成为该领域的事实标准之一。
当前挑战
6w.json数据集在解决开发者工具描述碎片化问题的同时,也面临着多重挑战。首先,在领域层面,开发者工具生态种类繁多、演进迅速,现有十一大类别可能难以覆盖新兴工具类型,且六词摘要的严格限制虽促进了简洁性,却可能牺牲关键信息的完整性,导致代表性不足。其次,在构建过程中,数据集的维护面临着质量控制与可扩展性的双重压力。尽管采取人工审核机制以保障数据质量,但随着工具数量的增长,审核流程可能成为瓶颈,影响数据集的及时更新。此外,如何处理‘watch’维度的风险量化,确保评估的客观性和公平性,也是一项艰巨任务。最后,双许可模式虽利于数据集传播,但在实际应用中,如何平衡代码的Apache许可与数据的CC0公有领域奉献,避免潜在的合规争议,同样对数据集的长期可用性构成挑战。
常用场景
经典使用场景
数据集以六词摘要与七何元素(谁、何事、何地、何时、何故、何伴、何察)为骨架,构建了一套极简且严谨的开发者工具元数据模式。其经典使用场景在于,为MCP服务器、AI代理及各类开发者工具提供一个统一、可机读的索引规范。借助该数据集,开发者能够高效地对工具进行归类、检索与比较,尤其在AI工具生态迅速膨胀的当下,为工具发现与选型提供了结构化的依据,促进了工具生态的透明化与标准化。
实际应用
在实际应用层面,该数据集作为6wdb.com的公开注册中心,直接赋能开发者快速定位适配的MCP服务器或AI代理。无论是构建定制化开发环境、选择部署AI工作流,还是进行DevOps工具链的选型评估,开发者都能借助其中的Proof Scores与详尽标签进行精准决策。它为自动化工具编排、智能推荐系统及安全审计等实际场景提供了即时可查的权威数据源,有效降低了新工具引入的评估成本与风险。
衍生相关工作
该数据集衍生出一系列有关AI工具生态的元数据治理与信息检索工作。围绕其提出的六词摘要和七W模式,后续研究可深入探索工具语义相似度度量、类别边界模糊性处理及跨语言工具匹配等议题。其开放的双许可模式(代码Apache-2.0,数据CC0)催生了社区驱动的工具数据库衍生项目、可视化分析平台以及基于快照文件的生态演化追踪研究,为构建更广泛的开发者智能助手及自动化运维知识库奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成




