遇见数据集

shadow-ai-list-top100

收藏
Hugging Face2026-06-22 更新2026-06-23 收录
官方服务:

资源简介:

Shadow AI List - Top 100数据集是一个专注于AI治理与安全的专业数据集,收录了来自Shadow AI List注册表的100个最高风险AI工具。该数据集旨在帮助安全、合规、风险和管理团队识别和管理组织内可能存在的影子AI(未经批准使用的AI工具)。数据集包含四个核心字段:工具的风险排名(1表示最高风险)、主检测域名、供应商名称以及工具类别(如聊天机器人、编码工具、会议机器人、代理工具等)。数据规模为100条记录,每周通过公共API更新,确保信息的时效性。免费版本仅包含工具名称和域名,完整版注册表则包含670多个工具、详细风险评分、所有检测域名变体以及可直接用于安全运营中心(SOC)的格式(如Sigma、STIX 2.1、MISP等)。主要应用场景包括:构建初始AI工具阻止列表,与网络日志(DNS、代理、SIEM)进行交叉比对以检测影子AI使用,以及支持AI安全风险评估工作。数据集需在署名引用AIList(Aeon AI Risk Management)的条件下使用。

Shadow AI List - Top 100 Dataset is a professional dataset focused on AI governance and security, which collects 100 highest-risk AI tools from the Shadow AI List registry. This dataset aims to assist security, compliance, risk and management teams in identifying and managing Shadow AI (unauthorized AI tools) that may exist within an organization. The dataset includes four core fields: tool risk ranking (1 represents the highest risk), primary detection domain, vendor name, and tool category such as chatbots, coding tools, meeting bots, AI agents, etc. It has a total of 100 records and is updated weekly via public APIs to ensure the timeliness of the information. The free version only contains tool names and domains, while the full registry includes over 670 tools, detailed risk scores, all detection domain variants, and formats directly applicable to Security Operations Centers (SOCs) including Sigma, STIX 2.1, MISP, etc. Its main application scenarios include: building initial AI tool blocklists, cross-referencing with network logs (DNS, proxy, SIEM) to detect Shadow AI usage, and supporting AI security risk assessment work. The dataset must be used under the condition of proper attribution to AIList (Aeon AI Risk Management).

创建时间:
2026-06-21
原始信息汇总

数据集概述

数据集名称:Shadow AI List - Top 100(最高风险前100名AI工具列表)

来源与管理方:由 Aeon AI Risk Management Corporation 维护,数据来源于 Shadow AI List 完整注册库(包含670+个AI工具,按风险排序)。

数据规模:少于1000条记录(n<1K),公开版本为前100个最高暴露风险的AI工具。

语言:英语

标签:shadow-ai, ai-governance, ai-security, cybersecurity, shadow-it

许可证:需遵守 AIList Attribution 条款,免费使用并注明出处(标注来源为 AIList (Aeon AI Risk Management) 并链接回 https://ailist.airiskmanagement.ca)。

数据内容

  • rank:排名(1为最高暴露风险)
  • domain:工具的主要检测域名
  • vendor:工具所属公司
  • category:工具类别(如聊天机器人 chatbot、编程辅助 coding、会议机器人 meeting_bot、代理工具 agent_tooling 等)

用途

可用于建立初始的阻止列表,或与企业的 DNS、代理、SIEM 日志进行交叉比对,识别公司网络中最可能存在的AI工具。

数据更新

每周重新验证并更新,可通过公开API获取最新版本:https://ailist.airiskmanagement.ca/api/v1/top100

付费版本

完整注册库(670+工具)包含每项工具的风险评分、所有检测域名(API/CDN变体)及 SOC 格式(Sigma、STIX 2.1、MISP、hosts、Palo Alto EDL),需在 https://ailist.airiskmanagement.ca 购买。

搜集汇总
数据集介绍
shadow-ai-list-top100 数据集图片
构建方式
本数据集源自Shadow AI List项目,该项目构建了一个涵盖超过670种人工智能工具的权威风险注册表,并依据AI暴露指数进行排序。数据集精选其中风险暴露程度最高的前100个工具,通过公开API定期更新,确保数据的时效性与准确性。每条记录包含排名、主检测域名、所属供应商及工具类别(如聊天机器人、编码辅助、会议机器人等)等关键字段,为用户提供简洁但核心的威胁情报基线。
特点
该数据集聚焦于企业环境中高风险的“影子AI”工具,即未经正式审批而私自使用的AI服务,具有显著的安全治理价值。其特点在于不仅提供名称和域名清单,还通过排名机制直观反映各工具的相对风险等级,便于安全团队快速识别最紧迫的威胁。此外,数据集每周重新验证并更新,保持与动态变化的AI生态同步,是构建初步拦截列表或交叉验证DNS、代理日志的理想起点。
使用方法
用户可直接从公开API(https://ailist.airiskmanagement.ca/api/v1/top100)获取最新JSON格式数据,或下载预编译的CSV文件。该数据集适合安全团队将其导入SIEM系统、防火墙规则或DNS过滤器中,形成对高风险AI工具的主动阻断。若需更全面的风险评分、多检测域名及SOC兼容格式(如Sigma、STIX 2.1等),可访问同网站获取完整付费注册表,但Top 100免费子集已足以支撑多数初级影子AI治理需求。
背景与挑战
背景概述
随着企业数字化转型的深入推进,生成式人工智能工具在组织内部迅速普及,但此类工具往往绕过传统IT治理流程,形成所谓的“影子AI”(Shadow AI)现象,给企业安全、合规与治理带来严峻挑战。为此,Aeon AI Risk Management Corporation于近期维护并发布了Shadow AI List - Top 100数据集,聚焦于曝光风险最高的前100款AI工具。该数据集由专业风险治理团队构建,旨在帮助安全、合规与风险管理人员识别和管控网络中潜在的高风险AI应用,是当前影子AI治理领域首个公开的风险排名清单。其核心研究问题是如何量化AI工具的曝光风险并构建可操作的阻断清单,为领域内的风险缓解策略提供了重要参考基准。
当前挑战
该数据集所面临的挑战主要体现在两个层面。首先,在领域问题层面,影子AI工具种类繁多、更新频繁,且往往通过加密流量或伪装域名进行通信,传统安全监控手段难以全面识别,如何从海量网络流量中精确检测和排序高风险AI工具是核心难题。其次,在构建过程中,数据集的维护依赖于持续的网络情报收集与风险评分引擎,需每周重新验证700余个工具域名的活跃度与风险特征,同时要兼顾数据来源的时效性与覆盖完整性,加之免费版本仅提供域名与类别信息,无法充分满足企业对于细粒度风险评分和整合SOC格式的需求,这使得平衡开放共享与商业可持续性成为实践中的重大挑战。
常用场景
经典使用场景
在人工智能治理与网络安全领域,Shadow AI List - Top 100 数据集作为一份聚焦高暴露风险的AI工具风险排名清单,其经典应用场景在于为企业安全团队提供快速识别和阻断影子AI活动的基线阻却列表。通过整合排名、域名、供应商及类别等核心字段,该数据集可被无缝导入DNS、代理或SIEM日志系统中,助力安全运维人员实时对比网络流量,精准定位那些最可能出现在企业网络中的高风险AI工具。这为组织在缺乏完整资产清单的情况下,构建轻量级却高效的影子AI检测能力奠定了坚实基础。
实际应用
在实际应用层面,该数据集主要服务于企业的安全运营中心和合规审计部门,用于快速部署影子AI监控体系。安全团队可将其作为起始阻却列表导入防火墙或云安全网关,自动阻断被标记的高风险AI工具域名访问,从而降低数据泄露和合规违规的可能性。同时,该数据集也适用于风险评估报告的生成,辅助首席信息安全官(CISO)向管理层可视化工具体用情况。对于托管安全服务提供商(MSSP)而言,它还能成为多租户环境中统一管理客户端影子AI风险的重要参照。
衍生相关工作
围绕Shadow AI List - Top 100数据集,已衍生出多项推动AI安全生态发展的相关工作。例如,安全社区利用其域名信息开发了集成化检测插件,使SIEM系统能够自动关联影子AI活动并生成告警。开源项目借鉴其风险排名逻辑,扩展出针对不同行业特性的影子AI风险评估框架。此外,部分研究机构以此为基准,对比了付费版本包含的完整风险评分体系(含Sigma、STIX 2.1等SOC格式),探讨了免费子集与全量注册表在检测覆盖率上的差异,进而催生出关于影子AI检测数据质量与效用优化的一系列研讨与成果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务