遇见数据集

frodo

收藏
github2026-05-28 更新2026-06-13 收录
数据链接:
官方服务:

资源简介:

一个包含904个条目的开放数据集,其中669个是来自Frida CodeShare的真实Frida脚本(每个脚本通过LLM增强,包含详细摘要、技术类别、用例、调用的确切Frida API、难度评级和质量评分),以及235个条目覆盖完整的Frida JavaScript API参考。适用于检索增强的Frida脚本生成、在动态检测任务上微调或评估代码模型,以及研究常见的移动安全技术。提供三种配置(完整/增强/原始)。

An open dataset containing 904 total entries. Of these, 669 are real Frida scripts sourced from Frida CodeShare; each script is enhanced via Large Language Model (LLM) and attached with detailed annotations including summaries, technical categories, use cases, exact invoked Frida APIs, difficulty ratings, and quality scores. The remaining 235 entries cover the complete Frida JavaScript API reference. This dataset is suitable for retrieval-augmented Frida script generation, fine-tuning or evaluating code models on dynamic detection tasks, as well as researching common mobile security techniques. Three configurations (full/enhanced/raw) are provided.

创建时间:
2026-05-26
原始信息汇总

数据集概述

数据集名称: frodo
发布平台: Hugging Face
数据集地址: 🤗 ichioda/frodo
许可证: MIT (数据集自身代码);收录脚本保留原作者许可证

数据集构成

配置名称 文件 条目数 内容
full (默认) frodo-enriched-dataset.parquet 904 包含增强后的 CodeShare 脚本 + 完整 Frida API 参考
codeshare-enriched frida-codeshare-enriched.parquet 669 CodeShare 脚本(已增强,有 LLM 生成元数据)
codeshare-raw frida-codeshare-dataset.parquet 669 原始 CodeShare 脚本(未增强)

数据来源

  • Frida CodeShare: 约 669 份社区贡献的 Frida 脚本,通过官方 REST API 抓取
  • Frida JavaScript API: 共计 235 条,从官方 TypeScript 定义文件(frida-gumfrida-java-bridgefrida-objc-bridge)解析,包含精确签名和 JSDoc
  • GitHub: 通过代码搜索索引已知 Frida API 模式的仓库

数据增强

每条 CodeShare 脚本通过 LLM(Gemini 3.1 Flash Lite,经 OpenRouter)进行增强,添加:

  • 详细摘要
  • 技术类别
  • 用例
  • 所调用的精确 Frida API
  • 难度评级
  • 质量评分

数据模式

每条记录包含以下字段:

字段 描述
id, title, author 标识信息
description 原始作者描述
code 完整脚本源码 / TypeScript API 定义
source 来源:codeshare / github / docs
source_url, platform, tags, indexed_at 元数据
summary LLM 生成的详细描述
category 主要技术类别(如 ssl-pinning-bypass、root-detection-bypass)
use_cases, api_calls LLM 提取
difficulty, quality LLM 评级

注:列表字段(tags、use_cases、api_calls、enriched_tags)以 JSON 数组字符串存储,需用 json.loads 解析。

加载方式

python from datasets import load_dataset

加载完整数据集

ds = load_dataset("ichioda/frodo", split="train")

加载增强版 CodeShare 脚本

ds = load_dataset("ichioda/frodo", "codeshare-enriched", split="train")

加载原始 CodeShare 脚本

ds = load_dataset("ichioda/frodo", "codeshare-raw", split="train")

用途

  • 检索增强的 Frida 脚本生成
  • 在动态插桩任务上微调或评估代码模型
  • 研究常见的移动安全技术

存储与格式

  • 数据以 Parquet 格式存储,使用 Snappy 压缩
  • 本地存储基于 SQLite 数据库,配备 FTS5 全文索引
  • 导出为 Parquet 文件后发布至 Hugging Face
搜集汇总
数据集介绍
frodo 数据集图片
构建方式
frodo数据集基于Frida CodeShare官方API及GitHub代码搜索,系统性地收集了约670个社区脚本与完整的Frida JavaScript API参考手册。每个脚本经大型语言模型(Gemini 3.1 Flash Lite)进行结构化增强,生成包含详细摘要、技术类别、用例、调用的Frida API、难度评级及质量分数的元数据。API参考部分则通过解析官方TypeScript定义文件(frida-gum、frida-java-bridge、frida-objc-bridge)获得精确签名与JSDoc文档,最终全部存入含FTS5全文索引的单一SQLite数据库,并导出为Parquet格式发布于Hugging Face。
使用方法
用户可通过三种方式利用该数据集:一是直接访问托管于Hugging Face的数据集页面(ichioda/frodo),使用Python datasets库加载三种配置(full/codeshare-enriched/codeshare-raw);二是通过部署的MCP服务器(https://frodo.udp.re/mcp)调用search_scripts、get_api_doc等搜索工具进行交互式查询;三是本地运行Go语言编写的frodo CLI工具,执行索引构建、LLM富化、MCP服务启动及Parquet导出等完整工作流,支持stdio与HTTP两种传输模式。
背景与挑战
背景概述
Frodo数据集诞生于2024年,由ichioda主导研发,旨在缓解大型语言模型(LLM)在生成Frida动态插桩脚本时频繁出现的API幻觉与重复造轮子问题。Frida作为安全研究、逆向工程与调试领域的重要动态插桩工具,其脚本编写高度依赖对真实世界API签名与成熟技术模式的精准把握。Frodo通过索引Frida CodeShare平台的669个社区脚本以及完整的Frida JavaScript API参考文档,构建了包含904条条目的结构化语料库,每条记录均经由LLM(如Gemini)进行摘要、技术类别、用例及质量评分等语义增强。这一数据集为检索增强生成、代码模型微调及移动安全技术研究提供了坚实的数据基础,在动态插桩领域开辟了数据驱动的新范式。
当前挑战
Frodo所面临的核心挑战在于双维度:其一,在领域问题层面,LLM以往生成的Frida脚本常因缺乏对实际API签名与已解决问题脚本的准确引用而产出不可执行的假代码,Frodo需通过将真实脚本与精确API文档索引化为可搜索工具,从根本上抑制幻觉并提升脚本质量。其二,在数据集构建过程中,挑战体现在多源异构数据的清洗与结构化整合:从Frida CodeShare抓取的社区脚本需经LLM元数据增强后得到一致性标注,同时需将官方TypeScript定义文件(含frida-gum、frida-java-bridge等)经由括号感知扫描器解析为精确签名,并统一存入支持FTS5全文索引的SQLite数据库,确保毫秒级查询性能与离线可用性,此外还需维护离散脚本的原始许可证归属与版本去重问题。
常用场景
经典使用场景
frodo数据集深度融合了Frida CodeShare社区中669个真实世界脚本与完整的Frida JavaScript API参考文档,构建起一座连接实践与规范的桥梁。其经典使用场景在于为大型语言模型提供检索增强的Frida脚本生成能力,当模型需要编写动态插桩代码时,可通过语义搜索召回高度相关的示例脚本与精确的API签名。这一流程有效消除了模型对虚构API的幻觉风险,使生成的脚本根植于经过社区验证的成功实践,尤其适用于Android和iOS平台的安全研究场景,如绕过SSL Pinning、Root检测等复杂反调试机制。
解决学术问题
该数据集系统性地解决了动态插桩领域长期存在的知识碎片化问题。在学术研究中,自动化的Frida脚本生成常因公共API与真实使用模式之间存在语义鸿沟而效果不佳。frodo通过LLM对每个脚本进行技术类别标注、使用场景提取、质量评分与难度分级,将原始代码转化为结构化的知识图谱,为研究者提供了可大规模复用的语料资源。它降低了编写高质量插桩脚本的认知门槛,使学生和学者能够快速介入移动安全分析、逆向工程等前沿课题,促进了动态分析方法的标准化与可复现性。
实际应用
在实际应用中,frodo作为MCP服务器提供了完整的工具链,允许安全工程师在Claude Code等智能编程环境中直接调用。通过search_scripts与get_api_doc等工具,分析师可以快速定位针对特定反调试技术的对抗方案,并获取官方API的精确TypeScript签名,从而大幅缩短从需求分析到脚本落地的周期。该数据集还支撑了Android端通用Root检测与SSL证书固定绕过脚本的生成,这些脚本可直接应用于渗透测试、恶意软件分析和企业移动安全合规检测等真实工业场景,显著提升了安全运维效率。
数据集最近研究
最新研究方向
frodo数据集聚焦于动态 instrumentation 领域,通过索引 Frida CodeShare 社区的真实脚本与官方 JavaScript API 参考,构建了一个结构化的检索增强生成(RAG)语料库。其最新研究方向包括利用大语言模型对脚本进行自动摘要、技术分类、API 调用提取与质量评估,从而支撑 LLM 生成高可靠性、无幻觉的 Frida 插桩代码。该工作紧密结合移动安全、逆向工程与漏洞分析等热点,特别是在 Android root 检测绕过、SSL Pinning 绕过等典型场景中,frodo 提供的精准 API 签名与已验证范例显著降低了自动化脚本编写的门槛。作为首个将社区脚本库与官方 API 文档统一索引并发布为开源数据集的项目,frodo 不仅推动了安全工具与 LLM 的深度融合,更为动态插桩任务的模型微调与评估设立了基础基准,具有重要的学术与应用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务